返回播客目录

前沿 Post-Training 配方:从单线流水线走向多教师蒸馏

Nathan Lambert 与 Finbarr Timbers 复盘 InstructGPT、Tülu 3、OLMo 3、DeepSeek R1 与 2026 年 MOPD,并讨论组织能力、RL 环境和训练 API 的经济学

00:56:36 Post-TrainingRLVR 与 DPOMulti-Teacher On-Policy DistillationOLMo 与 DeepSeekRL EnvironmentsTraining API Economics
前沿 Post-Training 的真正瓶颈,正在从“有没有算法”转向“能否让组织、教师模型与基础设施保持同一分布”

整期最值得带走的并不是某个固定 recipe,而是 recipe 与组织结构之间的耦合:小团队可以稳定执行 SFT→偏好调优→RL 的清晰流水线,但模型一旦扩展到数学、代码、Agent、安全等多个专长域,就需要并行训练教师、协调数据和算力,再把专长可靠地收敛到一个学生模型。MOPD 看似只是对现有 RL learner 的一组改动,真正困难的却是让教师与学生共享足够接近的训练轨迹、SFT 数据和推理行为。换言之,2026 年的竞争优势不只在 loss function,而在能否把 org chart 变成可复现、可对齐、可持续迭代的训练系统。这是本文基于整期对话的编辑性综合,并非嘉宾原话。

TL;DR

两分钟读完

这期节目更像一张动态的训练系统地图,而不是一份可以照抄的 recipe 清单。

一句话

Post-Training 已从一条可由单团队完成的流水线,演化为多专长教师、在线蒸馏、复杂数据与算力编排共同构成的组织级系统工程。

  1. InstructGPT 的 SFT→奖励模型→RL 奠定了早期范式;Tülu 3/OLMo 3 把开放配方整理为清晰阶段,但组织规模限制了它们继续横向扩张的速度。
  2. DeepSeek R1 把大规模 reasoning RL 放到中心,并用冷启动 SFT、采样、筛选和多轮训练把合成数据变成工业化流程;这条路线的上限被两位嘉宾认为高于把 reasoning 直接移植进旧配方。
  3. DPO 从许多前沿 recipe 中淡出,不等于偏好学习失效:在分布粗糙、资源有限的开放配方里,它仍可能是便宜而有效的清理和能力增益阶段。
  4. 2026 年的 MOPD 让学生按自身策略采样,再接受相应领域教师的 token-level 监督;算法改动并非最大难点,教师—学生分布不一致和并行开发才是主要风险。
  5. 论文披露的 recipe 不是完整事实:不同实验室可能以不同方式描述相近流程,中国实验室往往分享更多温度、难度课程等细节,但公开材料仍不足以支持简单的效率排名。
  6. RL 环境与 Tinker 风格训练 API 能降低研究门槛,却同时把开放科学、基础设施集中、商业毛利和推理锁定拉进同一个问题。

THE ARGUMENT

整期内容的一条主线

对话中的历史线索可以整理为一条从算法阶段化到组织级蒸馏的因果链。

STEP 01

单一目标允许单线流水线

早期 Post-Training 以人类示范、偏好奖励和单次 RL 为主,一个小团队可以理解并操作完整流程。

STEP 02

Reasoning RL 抬高训练上限

DeepSeek R1 展示大规模 RL 与合成轨迹可以成为核心能力来源,SFT 转向冷启动、蒸馏和行为整形。

STEP 03

多领域目标引发能力冲突

数学、代码、Agent、安全等任务在同一 RL run 中会争夺容量和梯度,单一通用训练流程开始变得昂贵且难协调。

STEP 04

组织拆分出专长教师

各领域团队可并行训练教师,再把专长汇入一个通用学生;recipe 的扩张方式因此越来越像 org chart。

STEP 05

蒸馏把问题变成分布对齐

当教师和学生的 SFT 数据、推理习惯或训练进度差异过大,学生轨迹会落到教师分布之外,监督质量随之下降。

DEEP DIVE

内容提炼

以下九个主题覆盖 recipe 的历史演进、当前技术分歧,以及环境和训练服务的产业层。

0100:00:06–00:06:28

OLMo 3 的速度问题,本质上也是组织容量问题

观察组织解释

两位嘉宾把 OLMo 3 做成 reasoning model 视为重要成就,同时承认项目逼近 AI2 协调算力、数据和人员的上限。旧 recipe 上移植 reasoning 较容易执行,却可能比重建 R1 式流程更早触顶。

  • Nathan 认为现代 Post-Training 的关键能力之一,是把 compute 与 data 编排成工作流;这直接映射到组织协调能力(约 00:02:06–00:03:56)。
  • Finbarr 指出九个月的模型周转并非异常缓慢;Nathan 的反驳是,如果只是移植旧 recipe,这个速度对应的能力上限仍偏低(约 00:03:56–00:05:52)。
  • 对于 7B–30B 级模型,是否值得完整复刻 DeepSeek 式 RL-first 路线仍未得到证据充分的答案(约 00:05:22–00:06:11)。

评审训练计划时,应把跨团队依赖、数据交付和算力排程当作 recipe 的一部分,而不是项目管理附录。

0200:06:28–00:13:23

从 InstructGPT 到 Tülu 3:配方阶段越来越多,透明度却没有同步提高

历史解释观察

InstructGPT 的三阶段范式可由较小团队完成;Llama 3 把更多专门数据、拒绝采样和多轮训练纳入流程;Tülu 3 则用清晰的 SFT、DPO、RLVR 阶段追求开放与可操作性。

  • 随着训练阶段和专门数据增加,即使论文公开,外部顾问也很难在不了解完整分布与流程时给出一句话建议(约 00:09:01–00:12:00)。
  • AI2 的简化流程既是研究设计,也是组织无法像工业实验室一样横向扩张的结果(约 00:12:02–00:12:56)。
  • OLMo 3 延续与 Tülu 3 相近的组织形态,限制了 recipe 出现结构性重建(约 00:12:56–00:13:23)。

“开源了 recipe”不等于他人可复现;还需要公开阶段接口、数据来源、失败分支和组织依赖。

0300:13:23–00:15:27

DeepSeek R1 把 SFT 从主角改造成 RL 的冷启动和蒸馏工具

技术解释历史变化

R1 路线先用 RL-Zero 激发 reasoning,再从轨迹中筛选冷启动 SFT 数据,随后以多轮 RL、采样和再训练塑造行为;合成数据不再只是补充,而成为迭代流程的主要输入。

  • 这套流程不追求一条优雅的研究公式,而是反复训练、采样、筛选和再投入的工业过程(约 00:13:23–00:14:50)。
  • SFT 的功能从一般能力灌输转向为 RL 提供稳定起点,并吸收较强模型已经形成的行为(约 00:14:11–00:15:27)。

设计 SFT 数据时,先明确它要冷启动哪种 RL 行为,而不是笼统追求覆盖更多指令。

0400:15:27–00:19:18

DPO 的退潮可能来自流程变干净,而不是偏好损失失去价值

假设反例

Nathan 的假设是:工业化 recipe 已把分布逐步整理干净,DPO 的边际收益下降;在开放模型用强模型输出做 SFT、分布仍粗糙时,DPO 仍可继续清理。Finbarr 则用 Nemotron 的 RLHF 增益提醒,流行趋势并不能替代消融实验。

  • 偏好损失仅依赖对比信号,却能改变数学、代码和 reasoning strategy,说明模型内部仍有大量可被重新排序的潜力(约 00:17:41–00:18:19)。
  • DPO on verifiable rewards 或同家族强弱模型构造偏好的做法仍值得研究,只是学术审美上不如在线 RL 热门(约 00:17:41–00:19:18)。

是否移除 DPO 应以同数据、同算力的消融决定,而不是用“前沿实验室不用了”代替证据。

0500:19:18–00:27:03

MOPD 把多个专长模型合并成一个学生

技术解释趋势

DeepSeek 的 recipe 从 R1 继续演化到更多领域专家;MiMo Flash V2 清晰命名了 Multi-Teacher On-Policy Distillation。学生按自身策略生成轨迹,再由相应领域教师提供 token-level 分布监督,用于把数学、代码、搜索、安全等专长汇入统一模型。

  • MOPD 并不是从闭源旗舰模型抄答案的泛化“蒸馏”,而是先训练领域教师,再合并内部专长(约 00:07:42–00:09:01)。
  • Finbarr 认为实现层相对直接:保留现有 RL setup,对 learner 做有限改动;难处更多在教师训练和整条链路(约 00:23:00–00:25:57)。
  • 专长团队可并行推进,使复杂 recipe 更容易按组织边界扩展,但重建完整历史依然困难(约 00:25:02–00:25:57)。

实施 MOPD 前先定义教师域、路由规则、学生采样策略和每个域的独立恢复率。

0600:27:03–00:31:10

教师—学生分布不一致,是多教师蒸馏的核心失效模式

观察证据缺口

Nemotron 3 Ultra 披露,训练管线差异很大的教师无法直接有效合并。若教师和学生使用不同 SFT 数据,会形成不同推理行为,学生生成的轨迹对教师而言可能属于分布外输入。

  • 该问题并非抽象风险:NVIDIA 因教师与学生并行开发而在实践中遇到,需要额外 cross-teacher alignment(约 00:28:10–00:30:29)。
  • 两位嘉宾希望发布教师和中间 checkpoint,以便研究者从同一起点研究训练动态;目前公开证据仍有限(约 00:30:29–00:31:04)。

不要只比教师最终 benchmark;还要测学生轨迹在教师下的似然、推理格式和 SFT 数据重叠。

0700:31:10–00:39:05

保守 recipe 与论文细节:可执行性往往比看上去更重要

比较方法论

微软 MAI 用较少教师、SFT 合并和较长 RL run,路线较保守但执行扎实;GLM 与 Kimi 等论文则披露温度调度、难度课程等更细节的决定。公开文本既反映真实差异,也反映团队选择展示什么。

  • 同时改变太多环节会让 recipe 因自身复杂度崩溃,因此保守方案可能是新团队更合理的第一步(约 00:31:10–00:32:41)。
  • 不同论文甚至对温度调度方向给出相反结论,提醒这些规则依赖模型、数据和阶段,不能脱离上下文照抄(约 00:35:43–00:36:40)。
  • 中国实验室常披露更细的训练技巧,但仅凭论文仍无法可靠判断中美实验室谁更高效(约 00:36:40–00:39:05)。

从最少可行 recipe 开始,一次只引入一类结构变化,并为每次复杂化保留消融和回退点。

0800:39:05–00:43:54

RL 环境既是软件资产,也是提示词、评测与独占权的定价问题

市场观察开放问题

Finbarr 询价得到的复杂 Web 环境报价约为 10 万美元前期成本、每年约 5 万美元维护,但可能只含应用克隆和假数据,不含已证实有效的 prompts。环境能否同时卖给多家实验室、能否公开,也显著改变价格。

  • 真正高溢价的部分可能不是软件外壳,而是能提升具体 benchmark 或能力的任务和 prompts(约 00:40:10–00:41:29)。
  • 开放侧的机会在于环境较可并行:小团队可专攻一个高质量 environment/eval,由开放训练实验室组合使用(约 00:41:29–00:42:04)。
  • 企业在 Agent 开始使用自身服务后,也可能有动力发布官方环境或 benchmark;但独占采购会进一步把资产推离开放研究(约 00:42:04–00:43:51)。

采购环境时拆分报价:软件、状态数据、任务 prompts、reward/eval、维护 SLA、独占权和公开权分别验收。

0900:43:54–00:56:36

Tinker 风格 API 降低门槛,但长期商业价值仍取决于推理

商业判断职业判断

训练 API 能隐藏 VLM inference、集群和权重传输复杂度,让学术团队或新 Post-Training 实验室先验证想法。Nathan 判断卖算力毛利最弱、卖推理最好,训练 API 位于中间;若训练后的模型自然留在同一推理引擎,平台才能形成更强经济闭环。后半段把资源分配延伸到职业与新实验室:高薪和学习机会可能重合,但巨额融资也会迫使团队快速证明结果并趋同。

  • 大量研究可能迁移到训练 API,因为规模采购能提供比学术自建集群更好的价格和 MOE 能力;代价是开放科学对少数接口收敛(约 00:43:54–00:45:21)。
  • 训练—推理完全匹配可以改善利用率和部署体验,也可能形成基础设施锁定;API 生意最终仍需连接 token 收入(约 00:45:51–00:48:14)。
  • 实验室在 pre-training 与 post-training 之间的算力分配最敏感,因为它直接暴露对下一阶段进展来源的判断(约 00:48:22–00:50:18)。
  • 两位嘉宾建议区分短期套利与长期有价值的工作;大型新实验室的高估值和融资节奏可能压缩路线多样性(约 00:50:18–00:56:04)。

训练服务的技术评估应同时覆盖可移植性、权重归属、推理兼容、利用率和退出成本。

OPEN QUESTIONS

尚未解决的张力

对话提供了强烈的方向性判断,但这些问题仍缺少足够公开的对照实验和经济数据。

前沿复杂度与可执行性

更多教师、阶段与领域能提高能力上限VS每增加一个并行环节,组织协调、数据漂移和失败面都会扩大

MOPD 的 learner 改动可能不大,但端到端系统远比单个算法复杂。节目没有给出不同组织规模下 recipe 复杂度与收益的定量边界。

DPO 的真实边际价值

干净的工业化流程让 DPO 变得多余VS开放或资源受限团队仍可用偏好损失低成本整理分布

两位嘉宾提供了合理假设和 Nemotron 反例,但缺少同模型、同数据、同预算的系统消融,不能把“消失于论文”当作失效证明。

教师专长与学生可吸收性

更强、更分化的教师提供更多领域能力VS差异过大的教师会让学生轨迹落入教师分布之外

专长强度和分布兼容之间存在未知最优点;跨教师 alignment 会不会抵消并行训练的组织收益,仍待公开 checkpoint 验证。

开放环境与商业独占

共享 environment/eval 能扩大研究参与和可复现性VS独占的 prompts、reward 与任务数据才可能支撑高价格

平台、企业和开放实验室的激励并不一致。节目提出可行市场机制,却没有解决谁承担维护、滥用和 benchmark 污染成本。

训练 API 的民主化与基础设施集中

标准 API 让小团队无需自建大规模集群VS研究路线、模型权重和推理部署可能被少数平台接口锁定

更低的进入门槛不自动等于更开放的生态;需要看权重可导出、日志可审计、结果可复现和跨平台迁移成本。

SO WHAT

可执行启示

把节目观点转化为训练评审、研究设计和采购决策中的具体检查项。

PT

Post-Training 负责人

  • 把 recipe 画成依赖图:每个阶段标出 owner、输入 checkpoint、数据版本、算力预算、验收指标和可回退点。
  • 先运行最小保守基线,再逐项加入 reasoning RL、领域教师和 MOPD;每次只改变一类结构变量。
  • 为教师与学生记录 SFT 数据重叠、输出分布距离、轨迹似然和推理格式差异,超过阈值时先做对齐。
OM

开放模型研究者

  • 对 DPO、RLHF 与 RLVR 做同数据同算力消融,并报告失败 run,而不是按论文流行度删除阶段。
  • 发布可复现 recipe 时同时提供中间 checkpoint、教师模型、数据清单和组织/算力约束。
  • 遇到论文中的温度或难度课程规则时,在自身分布上验证方向,不把单一实验室结论当通用定律。
EV

RL 环境采购与平台团队

  • 把环境合同拆成软件、数据、prompts、reward/eval、维护、独占和公开授权七项分别定价。
  • 要求供应商用保留 benchmark 证明任务能带来能力提升,并检查 benchmark 是否泄漏进训练 prompts。
  • 为环境设计版本化、状态重置、确定性回放和长期维护 SLA,避免一次性 demo 进入正式 RL。
AP

训练 API 使用者

  • 在选平台前验证权重导出、训练日志、随机种子、推理一致性和跨平台迁移路径。
  • 把 API 单价与自建集群利用率、权重传输、推理 token 成本一起建模,不只比较每 GPU 小时价格。
  • 先用 API 验证 research loop,再根据稳定负载决定是否投资自有训练基础设施。
RC

研究管理者与求职者

  • 询问团队资源如何在 pre-training、post-training、eval 和 inference 之间分配,以及这一比例背后的进展假设。
  • 区分短期热门技能和可迁移能力:优先积累实验设计、分布诊断、系统实现和评估方法。
  • 评估高融资实验室时,检查个人责任范围和路线独特性,而不只看薪酬与总算力。

CHAPTERS

节目时间轴

时间轴采用 Nathan Lambert 官方视频的五个章节,并补充关键技术节点。

OLMo 3 复盘:recipe 与组织容量

从 InstructGPT 到开放三阶段配方

DeepSeek R1 与 reasoning RL

DPO 为何从前沿配方中淡出

2026 年 recipe 与 MOPD

教师—学生分布不一致

保守 recipe、温度与难度课程

RL 环境的成本、开放与独占

Tinker 风格训练 API

算力分配与职业选择

一句话带走

前沿 recipe 的护城河,不是多画几层训练框,而是让每一层的数据、模型、组织和验证信号真正对齐。

方法与限制:本页基于 Interconnects 官方节目页发布的完整英文 transcript 整理,并使用该页绑定的 creator-hosted sentence transcript 保留真实时间戳和说话人,再以 Nathan Lambert 官方 YouTube 的标题、时长和章节交叉核验。共打包 162 个英文段落,未对小宇宙 AI 中文译制音频二次 ASR;ArkCLI prompt、completion 与 total Token 用量均为 0。官方 transcript 的人工审校状态未知,仍可能存在 OLMo/Tülu、MiMo/Kimi、模型版本、标点和说话人识别错误;精确引语、论文名、价格和技术数字在公开引用前应回听对应时间并核对原论文。Insight、TL;DR、themes、tensions、actions 与因果链为中文编辑性综合,不是嘉宾原话或逐句翻译;关于行业收敛、商业模式、实验室效率和职业路径的判断包含个人观点与预测。

查看逐字稿