返回播客目录

深度总结 · 基于完整逐字稿

AI 极乐末世蒋炎岩谈 AGI、教育、科研与 reward hacking

这是一场从“大学老师还该教什么”出发,最终抵达“人类还为何存在”的访谈。页面把 118 分钟内容重组为一条因果主线,并区分嘉宾观点、本文综合与尚未解决的争议。

01:58:27 AI × 教育 科研制度 Test-time Scaling Auto Research
ONE INSIGHT · 本文综合判断
AI 的第一轮冲击,可能不是让人失业,而是让衡量人的尺子先失效。

论文、代码、考试答案和课程讲授,过去之所以能代表能力,是因为它们生产成本高、过程难以伪造。当 AI 把“从意图到成品”的执行成本压低,同样的产出便不再能稳定反映人的能力。旧制度若继续奖励数量,就会放大 reward hacking。真正稀缺的价值将转向:选什么问题、如何验证、是否有 taste、能否设计可靠系统,以及一个人长期行动轨迹所呈现的判断力。

说明:这是对整期访谈的综合推论,不是嘉宾原句;它连接了技术、制度与教育三组讨论。

TL;DR

两分钟读完

访谈的表层是“绿导师退休、退圈、退所”;深层是在讨论:当 AI 接管执行型智力劳动,人的角色和制度的评价方式要怎样重写。

一句话

AI 让产出变便宜之后,人类最重要的能力将从“亲手做出答案”转向“选择问题、判断答案并建立验证闭环”。

  1. 技术判断:许多复杂问题可能存在短解释;LLM 能更柔性地搜索解释空间,Agent 能执行与验证,Test-time Scaling 则用更多时间和算力扩大探索。
  2. 制度判断:论文、经费、职称、408 与竞赛规则仍在奖励旧时代的可量化动作,参与者理性地优化指标,结果却越来越偏离真实价值。
  3. 教育判断:死记命令和手工处理细节的重要性下降;原理、抽象、系统设计、测试、故障恢复与判断 AI 产出的能力上升。
  4. 人的位置:自我驱动、taste 和长期行动轨迹会比统一简历模板更有区分度;但过度依赖 AI 也可能带来基础能力、隐私与公平问题。
  5. 关键赌注:未来三到五年最值得观察的,不是模型能否再多答几道题,而是能否在没有人提供关键思路时真正完成 Auto Research。

THE ARGUMENT

整期内容的一条主线

把访谈里的多个跳跃话题连起来,会得到一条清晰的因果链:AI 改变生产成本,生产成本改变证据效力,证据效力再迫使评价制度与人的角色重构。

STEP 01

执行能力商品化

写代码、查资料、生成课程与完成实验的部分环节被 Agent 接管。

STEP 02

产出快速增殖

同样时间内,论文、代码、方案和解释的数量大幅增加。

STEP 03

旧指标失真

“做出了什么”不再足以证明“会什么、为何做、能否判断”。

STEP 04

Reward hacking 加剧

当制度仍按数量分配机会,最优策略就是制造更多可计数结果。

STEP 05

稀缺性重新分配

问题选择、taste、验证设计、责任承担和长期轨迹成为新信号。

1

技术层:智能如何扩展

Small Explanation Hypothesis 提供搜索对象,LLM 提供柔性生成,Agent 提供执行与验证,Test-time Scaling 提供更长的探索预算。

2

制度层:为什么大家都在优化指标

论文、经费、职称和考试构成可被利用的奖励函数。问题不只在个人,而在机制持续奖励容易量化、未必有价值的行为。

3

人的层:AI 之后为何行动

如果 AI 能预判并满足欲望,竞争带来的动力与意义可能消失。技术乐观与存在主义悲观因此同时成立。

DEEP DIVE

八个主题,逐层提炼

标签用于区分内容性质:观察是对现实的描述,主张是价值判断或方案,预测是尚未被验证的未来判断,综合是本文据此做出的归纳。

观察 主张 预测 本文综合
01 00:04–00:08

所谓“末日”,也是从无意义劳动中解脱

预测主张

嘉宾把编程、科研和教学中的大量工作理解为“从高级意图翻译到具体实现”。当模型能够完成这段链路,大学培养、论文生产乃至教师角色都可能失去原来的意义。

  • 悲观面:多年训练和大量论文,在更强智能面前可能显得徒劳。
  • 乐观面:博士生和教师不必继续承受为制度产出的痛苦劳动。
  • 更深问题:如果 AI 能替人发现知识、满足欲望,人类行动的内在动力从哪里来?

关键不是“工作少了”,而是工作曾经承载的身份、竞争和意义一起被抽空。

02 00:08–00:16

通向 AGI 的设想:短解释 × 搜索 × 验证

预测

核心假设是:很多看似复杂的问题,背后存在一段相对简短的解释。过去只能机械枚举;LLM 让自然语言空间的搜索更柔性,Agent 则像研究生一样把想法实现、实验并汇报证据。

生成短解释
筛掉低价值候选
Agent 实现
实验与反证
沉淀新知识
成立前提

候选解释能被有效排序,结果能被可靠验证,而且搜索与实验的成本没有先于收益失控。

Test-time Scaling 的价值,不只是把同一道题多想几步,而是让整个“提想法—做验证”的循环运行更久。

03 00:16–00:29

科研制度的问题:奖励函数比初心更有力量

观察主张

当论文、经费、职称和人脉决定生存,研究者自然会优化这些指标。认真教学、长期问题和不易发表的基础工作,反而可能成为个人职业上的负收益。

  • 退出软件工程圈,源于对低价值论文增多、有效阅读成本上升的判断。
  • 选择独立 PI,是为了减少行政与组织 overhead,把时间留给学生、课程和问题。
  • 代价是真实的:缺少项目就可能缺少经费,这是一种个人退出策略,不是制度改革方案。
软工圈退出了软工

Reward hacking 不是人格缺陷的集合,而是激励机制稳定生产出来的行为。

04 00:29–00:52

选拔失真:考试仍公平,却未必还测得到能力

观察本文综合

访谈用 408、机试和系统竞赛说明“可排序”与“有意义”并不相同。死记教材可以稳定区分成绩,却可能挤掉编程实践;封闭环境能保证公平,却可能把已经习惯 AI 协作的人为地捆住。

  • 真实工程应允许使用最强工具;否则测到的是手工细节熟练度,而不是系统能力。
  • OI 更像有边界规则的竞技运动,限制工具本身可以成立,但不宜被当作全部现实能力。
  • 新评价信号可以来自“行动 trace”:看一个人长期如何选择、沟通、失败、修正和完成。

未来的难题不是出一道更难的题,而是如何在隐私、公平和成本可控的前提下评价过程。

05 00:52–01:12

比简历更重要的是自我驱动,比生成更稀缺的是 taste

主张本文综合

理想学生不是把项目、奖项和论文排列得最整齐的人,而是做过一件自己真正关心、愿意解释其意义的事。作品未必完美,但动机、所有权和持续投入能够被看见。

  • 自我驱动意味着:即使没有外部评价,也愿意把问题向前推进。
  • Taste 可理解为对巨大想法空间的压缩器:什么被过滤,什么被保留。
  • 好 taste 会保留“意料之外、情理之中”的高价值方向;它目前仍难以标准化培养。
眼睛里有光

AI 越擅长生成候选,人越需要知道哪些候选不值得继续。

06 01:12–01:31

教育重写:从平均授课转向按需搭脚手架

观察预测

专家容易受“知识诅咒”影响:手册高度压缩,每句话都依赖前置知识;初学者更需要冗余、重复和不同角度的 Tutorial。LLM 恰好适合按学习者状态调节解释密度。

  • 教师的表演性,本质是调动动机、共情困惑并控制知识节奏。
  • 课程可以被视作代码:讲稿是主线,幻灯片、演示、视频与交互组件对齐其时间轴。
  • 如果课程能自动更新与个性化,教师从重复讲授转向设计目标、体验和质量标准。

这里不是“基础知识不重要”,而是基础知识的获得方式从统一灌输转向按需构建。

07 01:20–01:31

生成式软件工程:让需求增长逼出真正的工程能力

主张

新课程设想不是教更多 Prompt 技巧,而是让学生用 Coding Agent 持续维护一个不断变复杂的 Personal Assistant。每次新增需求,都有意让原架构失效。

  • 起点:能处理邮件、多轮对话和大容量 Memory 的小型 Assistant。
  • 扩展:处理数百篇论文、并发任务、硬件接入与此前未预见的接口变化。
  • 被迫学习:模块拆分、接口设计、CI/CD、测试、可恢复性与架构演进。
  • 关键风险:Coding Agent 容易过度设计;人必须判断何时抽象、何时保持简单。

课程评价的不是代码由谁敲出,而是系统面对变化时能否继续工作。

08 01:31–01:58

真正的三到五年赌注:Auto Research 能否发生

预测本文综合

衡量 Auto Research 的标准不应是复现已知答案,而应是把 knowledge cutoff 放在发现之前,系统仍能独立提出关键表示、完成验证并产生新知识。

  • 当前模型也许已有潜在能力,但仍常需要人找到那句很短、很关键的初始提示。
  • 若搜索与验证闭环成立,科研可能从“人提出洞见、机器执行”进一步走向机器自主发现。
  • 但物理实验、错误验证器、目标设定与组合爆炸,都是不能用 Scaling 一句话略过的瓶颈。

最值得观察的跨越,是从“能完成研究任务”到“能自己找到值得研究的未知问题”。

OPEN QUESTIONS

访谈没有完全解决的四组张力

这些不是反驳嘉宾,而是把论证推进到需要额外证据的位置。它们决定了观点能否从个人经验变成可普遍实施的制度方案。

低质量论文,还是必要探索?

减少指标产出VS保留研究生态

访谈承认,黑天鹅式成果可能需要大量失败和普通探索作为土壤。问题在于:怎样区分必要的试错、多样性与纯粹为发表而包装的 contribution。

真实能力,还是统一公平?

过程化评价VS标准化考试

长期 trace 更接近真实能力,却带来隐私、家庭资源差异、审查成本和不可比性;统一考试粗糙,但仍提供低成本、可解释的最低公平。

AI 解放,还是能力空心化?

高层抽象VS底层掌握

不必记命令并不等于不必懂系统。若基础不足,使用者可能无法识别错误假设、定位故障或在工具失效时接管。边界应按责任和风险而非怀旧划定。

个人退出,还是改变系统?

减少 overheadVS争取制度权力

退圈、退所、退委员会能保护个人时间和原则,却也减少影响规则的机会。它是一种诚实的个人选择,但无法自动成为集体层面的改革路径。

最关键的证据缺口:Small Explanation 路线需要的不只是强生成器,还需要可信验证器。数学定理、代码测试相对容易形成闭环;开放世界科研、社会制度与教学效果往往没有即时、无歧义的真值信号。Auto Research 是否成立,很大程度取决于验证问题能否被解决。

SO WHAT

把观点转成可执行动作

下面不是逐字稿中的原始建议,而是基于访谈逻辑推导出的实践清单。它们的共同点是:不再只交付结果,也交付选择、证据和演进过程。

ST

学生 / 求职者

  • 做一个真正想完成的端到端项目,记录需求变化、失败、决策与复盘,不只展示最终截图。
  • 把 AI 用在执行和探索上,但保留自己的问题定义、验收标准和关键取舍。
  • 基础学习以“能建立模型、解释错误、接管高风险环节”为目标,而不是机械背诵所有细节。
ED

教师 / 导师

  • 把作业设计成会演进的系统,让新增约束暴露架构、测试与判断问题。
  • 评分从答案正确率扩展到决策记录、验证质量、故障恢复和对 AI 结果的审查。
  • 用 AI 生成不同冗余度的解释,教师负责学习目标、体验设计和质量抽检。
RS

研究者

  • 在开题时写清:为什么这个问题值得做、什么证据会推翻它、验证器可能错在哪里。
  • 让 Agent 扩大候选和实验覆盖,人把时间移到问题选择、反证与跨领域连接。
  • 区分“必要探索的失败”与“为满足发表模板而制造的工作量”。
OR

学校 / 组织

  • 逐步降低单一数量指标权重,引入可审计的过程证据、长期作品和同伴协作记录。
  • 明确哪些场景允许 AI、允许到什么程度,并使规则与真实工作场景保持一致。
  • 保留标准化评价作为底线,同时用小规模试点验证过程化评价的公平与成本。

CHAPTERS

原播客时间轴

适合回听时定位。时间点来自节目章节;正文总结按论证关系重组,因此顺序略有合并。

绿导师要退休了吗?

AI 末劫将至,大学教育、科研论文和导师制度是否都成徒劳?

AI 末日给学生和老师带来的是“一种解脱”?

Test-time Scaling 与 Small Explanation Hypothesis:通向 AGI 的路径。

退出软工圈:是人离开领域,还是领域离开软件工程?

论文、经费、职称如何把老师和学生推向 reward hacking。

面对旧评价体系,为什么选择不再参与。

学生选拔、408、编程能力与评价机制失真。

《劝退信》之后,想要什么样的学生,如何理解 taste。

不再教《操作系统》之后,生成式软件工程课程要教什么。

审稿、包装 contribution 与黑天鹅式研究的矛盾。

一路在“退”:失望、避险,还是把时间移向更长期的目标。

未来三到五年:真正的 Auto Research 能否发生。

ONE LINE TO KEEP

当答案变得廉价,真正昂贵的将是:提出值得回答的问题,并为答案建立可信的证据。

方法与限制:本页基于 AI 生成逐字稿整理,已按主题重组并加入批判性分析,不等同于逐句忠实摘要。人名、英文术语和个别断句仍可能有识别误差;需要引用原话时,请回到对应时间点复核音频。

打开完整逐字稿