单一目标允许单线流水线
早期 Post-Training 以人类示范、偏好奖励和单次 RL 为主,一个小团队可以理解并操作完整流程。
Nathan Lambert 与 Finbarr Timbers 复盘 InstructGPT、Tülu 3、OLMo 3、DeepSeek R1 与 2026 年 MOPD,并讨论组织能力、RL 环境和训练 API 的经济学
前沿 Post-Training 的真正瓶颈,正在从“有没有算法”转向“能否让组织、教师模型与基础设施保持同一分布”
整期最值得带走的并不是某个固定 recipe,而是 recipe 与组织结构之间的耦合:小团队可以稳定执行 SFT→偏好调优→RL 的清晰流水线,但模型一旦扩展到数学、代码、Agent、安全等多个专长域,就需要并行训练教师、协调数据和算力,再把专长可靠地收敛到一个学生模型。MOPD 看似只是对现有 RL learner 的一组改动,真正困难的却是让教师与学生共享足够接近的训练轨迹、SFT 数据和推理行为。换言之,2026 年的竞争优势不只在 loss function,而在能否把 org chart 变成可复现、可对齐、可持续迭代的训练系统。这是本文基于整期对话的编辑性综合,并非嘉宾原话。
TL;DR
这期节目更像一张动态的训练系统地图,而不是一份可以照抄的 recipe 清单。
Post-Training 已从一条可由单团队完成的流水线,演化为多专长教师、在线蒸馏、复杂数据与算力编排共同构成的组织级系统工程。
THE ARGUMENT
对话中的历史线索可以整理为一条从算法阶段化到组织级蒸馏的因果链。
早期 Post-Training 以人类示范、偏好奖励和单次 RL 为主,一个小团队可以理解并操作完整流程。
DeepSeek R1 展示大规模 RL 与合成轨迹可以成为核心能力来源,SFT 转向冷启动、蒸馏和行为整形。
数学、代码、Agent、安全等任务在同一 RL run 中会争夺容量和梯度,单一通用训练流程开始变得昂贵且难协调。
各领域团队可并行训练教师,再把专长汇入一个通用学生;recipe 的扩张方式因此越来越像 org chart。
当教师和学生的 SFT 数据、推理习惯或训练进度差异过大,学生轨迹会落到教师分布之外,监督质量随之下降。
DEEP DIVE
以下九个主题覆盖 recipe 的历史演进、当前技术分歧,以及环境和训练服务的产业层。
两位嘉宾把 OLMo 3 做成 reasoning model 视为重要成就,同时承认项目逼近 AI2 协调算力、数据和人员的上限。旧 recipe 上移植 reasoning 较容易执行,却可能比重建 R1 式流程更早触顶。
评审训练计划时,应把跨团队依赖、数据交付和算力排程当作 recipe 的一部分,而不是项目管理附录。
InstructGPT 的三阶段范式可由较小团队完成;Llama 3 把更多专门数据、拒绝采样和多轮训练纳入流程;Tülu 3 则用清晰的 SFT、DPO、RLVR 阶段追求开放与可操作性。
“开源了 recipe”不等于他人可复现;还需要公开阶段接口、数据来源、失败分支和组织依赖。
R1 路线先用 RL-Zero 激发 reasoning,再从轨迹中筛选冷启动 SFT 数据,随后以多轮 RL、采样和再训练塑造行为;合成数据不再只是补充,而成为迭代流程的主要输入。
设计 SFT 数据时,先明确它要冷启动哪种 RL 行为,而不是笼统追求覆盖更多指令。
Nathan 的假设是:工业化 recipe 已把分布逐步整理干净,DPO 的边际收益下降;在开放模型用强模型输出做 SFT、分布仍粗糙时,DPO 仍可继续清理。Finbarr 则用 Nemotron 的 RLHF 增益提醒,流行趋势并不能替代消融实验。
是否移除 DPO 应以同数据、同算力的消融决定,而不是用“前沿实验室不用了”代替证据。
DeepSeek 的 recipe 从 R1 继续演化到更多领域专家;MiMo Flash V2 清晰命名了 Multi-Teacher On-Policy Distillation。学生按自身策略生成轨迹,再由相应领域教师提供 token-level 分布监督,用于把数学、代码、搜索、安全等专长汇入统一模型。
实施 MOPD 前先定义教师域、路由规则、学生采样策略和每个域的独立恢复率。
Nemotron 3 Ultra 披露,训练管线差异很大的教师无法直接有效合并。若教师和学生使用不同 SFT 数据,会形成不同推理行为,学生生成的轨迹对教师而言可能属于分布外输入。
不要只比教师最终 benchmark;还要测学生轨迹在教师下的似然、推理格式和 SFT 数据重叠。
微软 MAI 用较少教师、SFT 合并和较长 RL run,路线较保守但执行扎实;GLM 与 Kimi 等论文则披露温度调度、难度课程等更细节的决定。公开文本既反映真实差异,也反映团队选择展示什么。
从最少可行 recipe 开始,一次只引入一类结构变化,并为每次复杂化保留消融和回退点。
Finbarr 询价得到的复杂 Web 环境报价约为 10 万美元前期成本、每年约 5 万美元维护,但可能只含应用克隆和假数据,不含已证实有效的 prompts。环境能否同时卖给多家实验室、能否公开,也显著改变价格。
采购环境时拆分报价:软件、状态数据、任务 prompts、reward/eval、维护 SLA、独占权和公开权分别验收。
训练 API 能隐藏 VLM inference、集群和权重传输复杂度,让学术团队或新 Post-Training 实验室先验证想法。Nathan 判断卖算力毛利最弱、卖推理最好,训练 API 位于中间;若训练后的模型自然留在同一推理引擎,平台才能形成更强经济闭环。后半段把资源分配延伸到职业与新实验室:高薪和学习机会可能重合,但巨额融资也会迫使团队快速证明结果并趋同。
训练服务的技术评估应同时覆盖可移植性、权重归属、推理兼容、利用率和退出成本。
OPEN QUESTIONS
对话提供了强烈的方向性判断,但这些问题仍缺少足够公开的对照实验和经济数据。
MOPD 的 learner 改动可能不大,但端到端系统远比单个算法复杂。节目没有给出不同组织规模下 recipe 复杂度与收益的定量边界。
两位嘉宾提供了合理假设和 Nemotron 反例,但缺少同模型、同数据、同预算的系统消融,不能把“消失于论文”当作失效证明。
专长强度和分布兼容之间存在未知最优点;跨教师 alignment 会不会抵消并行训练的组织收益,仍待公开 checkpoint 验证。
平台、企业和开放实验室的激励并不一致。节目提出可行市场机制,却没有解决谁承担维护、滥用和 benchmark 污染成本。
更低的进入门槛不自动等于更开放的生态;需要看权重可导出、日志可审计、结果可复现和跨平台迁移成本。
SO WHAT
把节目观点转化为训练评审、研究设计和采购决策中的具体检查项。
CHAPTERS
时间轴采用 Nathan Lambert 官方视频的五个章节,并补充关键技术节点。
OLMo 3 复盘:recipe 与组织容量
从 InstructGPT 到开放三阶段配方
DeepSeek R1 与 reasoning RL
DPO 为何从前沿配方中淡出
2026 年 recipe 与 MOPD
教师—学生分布不一致
保守 recipe、温度与难度课程
RL 环境的成本、开放与独占
Tinker 风格训练 API
算力分配与职业选择
一句话带走
前沿 recipe 的护城河,不是多画几层训练框,而是让每一层的数据、模型、组织和验证信号真正对齐。
方法与限制:本页基于 Interconnects 官方节目页发布的完整英文 transcript 整理,并使用该页绑定的 creator-hosted sentence transcript 保留真实时间戳和说话人,再以 Nathan Lambert 官方 YouTube 的标题、时长和章节交叉核验。共打包 162 个英文段落,未对小宇宙 AI 中文译制音频二次 ASR;ArkCLI prompt、completion 与 total Token 用量均为 0。官方 transcript 的人工审校状态未知,仍可能存在 OLMo/Tülu、MiMo/Kimi、模型版本、标点和说话人识别错误;精确引语、论文名、价格和技术数字在公开引用前应回听对应时间并核对原论文。Insight、TL;DR、themes、tensions、actions 与因果链为中文编辑性综合,不是嘉宾原话或逐句翻译;关于行业收敛、商业模式、实验室效率和职业路径的判断包含个人观点与预测。
查看逐字稿