返回播客目录

长时程智能体的工程学:结果正确,还要过程可信

Basis 如何用行为规范、智能体评审、运行时上下文与知识本体,让 AI 连续工作数小时乃至数天

01:22:59 Long-horizon AgentsBehavior SpecsAgent EvalsContext EngineeringOntology
长时程智能体不是一个更长的 Prompt,而是一家由失忆、非确定性员工组成的微型组织

本文综合:模型拥有很大的工作记忆,却没有天然、稳定的短期与长期记忆;任务跨越上下文后,它必须给未来的自己留下注释、分派子智能体并重建状态。与此同时,税务等现实工作不能只看最终数字是否命中,因为错误来源、证据质量与复核成本同样决定能否交付。Basis 因此借鉴人类组织:把少量关键流程写成行为规范,让独立评审智能体检查完整轨迹,再用清晰的知识本体和权威文档为每次推理提供高质量“运行时训练数据”。

TL;DR

两分钟读完

Basis 如何用行为规范、智能体评审、运行时上下文与知识本体,让 AI 连续工作数小时乃至数天

一句话

可靠的长时程系统要同时设计记忆、工具、环境、过程标准、结果验证和人类复核,而不是只选择更强模型。

  1. “长时程”是跨出单个上下文后仍要维持目标与状态;智能体需像《记忆碎片》主角一样为未来的自己留下高信息密度记录。
  2. 推理模型通过把更多计算分配给困难步骤并自我修复,显著降低了早期 agent 的误差累积,但尚未达到人类跨周工作的连贯性。
  3. 代码智能体率先成功不仅因为测试可验证,也因为运行反馈便宜、环境文本化、训练数据丰富且工程质量受到持续关注。
  4. 税务等领域数据稀缺、轨迹数千步、反馈要几十小时,且最终答案通过不代表证据和流程合格。
  5. Behavior spec 是人类可对齐、评审智能体可执行的 Markdown 规范;应只覆盖少量高价值、能泛化的行为。
  6. 上下文直接影响推理表现,因此英文文档、权威来源和知识结构要像生产代码一样评审、维护和版本化。

THE ARGUMENT

整期内容的一条主线

可靠的长时程系统要同时设计记忆、工具、环境、过程标准、结果验证和人类复核,而不是只选择更强模型。

STEP 01

模型跨出工作记忆

任务从分钟延长到小时或天后,当前上下文无法容纳全部历史,必须外化状态并规划下一次推理需要什么。

STEP 02

结果评测变得稀疏

现实任务步骤多、反馈慢、答案包含判断,少量终局 Evals 无法定位错误或证明能泛化到生产。

STEP 03

关键流程被编码成行为

领域专家与 ML 工程师共同选择少量决定信任的动作,例如引用一手税法或交付前渲染幻灯片。

STEP 04

独立评审读取完整轨迹

Judge 判断行为触发条件是否出现、哪个子智能体负责以及是否真正执行,为系统提供更密集信号。

STEP 05

信号反哺上下文、工具和模型

近期优先修改 Harness 与运行时数据,未来可能把同一信号用于过程奖励和模型后训练。

DEEP DIVE

内容提炼

Basis 如何用行为规范、智能体评审、运行时上下文与知识本体,让 AI 连续工作数小时乃至数天

0100:00:00–00:11:16

从语音输入到端到端税表

工作方式产品定义

Basis 员工用低声口述把未经压缩的上下文快速交给 AI;其产品则让会计智能体从材料出发,连续完成一份税表的首轮工作。

  • 口述比书写快,也减少人在写作时无意删去模型可能需要的背景。
  • 自主完成不等于无人查看:交付要列出重大决定、假设和复核点。
  • 好的输出会优化审阅成本,类似拆分清晰、附解释的代码提交,而不是一份难以检查的巨大结果。

设计自主任务时,把“可被下一位人快速复核”写进完成定义。

0200:11:16–00:22:12

长时程的本质是主动管理记忆

模型机制历史演进

当轨迹超出上下文或发生 context rot,模型必须决定写什么、压缩什么、何时拆给子智能体,并让未来推理恢复状态。

  • 早期 BabyAGI 受小上下文、弱注意力和弱推理限制,错误容易沿步骤复合。
  • Claude 3 Opus、o1 与 o3 被嘉宾视为长上下文理解和推理效率的关键台阶;这是其个人技术史划分。
  • 现代模型开始被训练去理解未来自己的信息需求,从而更好地写笔记与编排子智能体。

为每次压缩或交接定义状态摘要、未决事项、证据链接和下一动作。

0300:22:12–00:25:17

为什么代码智能体先跑通

可验证性训练数据

代码既能用测试获得便宜的运行时反馈,又以文本形式存在于本地环境;但“测试通过”仍不等于架构和工程品味良好。

  • 可验证奖励帮助模型判断是否完成,却只覆盖可以形式化的结果。
  • 编译、运行和单测让智能体在轨迹中及时发现语法与行为错误。
  • 高质量代码训练数据与实验室自身的工程投入,补足了测试无法表达的主观质量。

迁移代码 agent 经验时,要同时寻找领域运行反馈和领域质量数据。

0400:25:17–00:36:32

现实工作为何不能只看终局 Evals

评测会计案例

复杂税表可能涉及数百上千份材料、数千次推理和二十多小时人工工作;数据又受隐私限制,难以靠大规模结果样本覆盖。

  • 部分规则可确定性检查,例如试算平衡或表格错误,其他问题需专业判断或模型评审。
  • 100 个终局测试全过,仍可能依赖博客或记忆得出答案,而非引用权威税法来源。
  • 人类行业数百年形成的复核与证据流程,是当下稀缺数据条件下的重要先验。

Evals 要同时覆盖结果、证据、路径和审阅体验,并保留独立人工抽查。

0500:36:32–00:43:30

Behavior specs:把关键过程写成可评审协议

行为规范产品决策

行为规范既是团队对产品应如何工作的共识,也是评审器检查轨迹的 Rubric;领域知识和智能体机制需要共同翻译。

  • 规范可要求引用一手来源、在交付前渲染视觉结果,或在特定复杂条件下分派子智能体。
  • 它不必直接展示给执行智能体,可用于评价不同 Prompt、工具和 Harness 是否诱发期望行为。
  • 规范越多,状态和维护成本越高;应选择影响最大、生产泛化最强的少量行为。

从线上失败中选出 3–5 个高影响行为,用触发条件、期望动作和证据写成自包含规范。

0600:43:30–00:54:41

上下文是运行时训练数据,Judge 也是智能体

Context EngineeringJudge

系统在推理时从上下文学习,因此少量高质量信息可以像训练数据一样改变行为;复杂轨迹的评审器也需要规划、搜索和定位。

  • Harness、工具、环境、模型和逐步披露的上下文共同构成 agent system,不能只优化 Prompt 文案。
  • 多层子智能体轨迹要求 Judge 先建立地图,再判断条件、责任主体和行为证据。
  • 全轨迹评审成本很高,未来需要标注和筛选潜在相关片段,不能对所有生产运行无差别执行。

先验证 Judge 与专家判断的一致性,再把它用于回归门禁或线上监控。

0700:54:41–01:11:16

Ontology 与公司 Canon 决定智能体看到的世界

知识架构组织设计

文件、概念、关系和权威来源构成智能体的世界模型;同一个代码 agent 在清晰与混乱仓库中的表现差异,说明运行时数据质量会直接改变能力。

  • 长达数月的有状态智能体需要组织自己的经历,让新上下文能恢复完整心智状态。
  • 企业里的通话、工单和旧文档会互相矛盾,必须标出当前销售策略等唯一权威来源。
  • 语言架构师、agent manager 和 deployed intelligence 等角色把领域流程、系统抽象与客户变革连接起来。

为智能体建立可检索、版本化、有 Owner 和失效日期的 Canon,而不是默认所有文档同等可信。

0801:11:16–01:22:59

闭环改进、Bitter Lesson 与真正的护城河

研究方向商业战略

Basis 希望把轨迹信号自动转成 Context、工具和 Harness 改进,并探索行为奖励;但嘉宾预计许多工程最终会被基础模型吸收。

  • 模型当前更擅长写普通软件,仍不擅长设计 agent system,因此全自动闭环尚易过拟合。
  • 行为与结果信号未来既可修改系统,也可能用于强化学习;难点是定义奖励并正确归因。
  • 短期技术优势用于抢占市场,长期壁垒来自工作流嵌入、客户关系和业务分发,而非秘密 RL 技巧。

把可替代的技术领先转化为生产数据、工作流所有权和客户信任。

OPEN QUESTIONS

尚未解决的张力

Codex 完整审阅了 The MAD Podcast 官方 01:22:59 视频的英文自动字幕,共 186 个合并段落;该版本比小宇宙译制版包含更完整内容,未使用 ASR,Token 使用为 0。自动字幕没有可靠说话人标签,专名与模型名可能存在识别误差;本文依据问答语义区分主持人与嘉宾观点,并把模型演进时间、基础模型吞噬 Harness 的“两到五年”窗口及自我改进进度视为 Mitch Troyanovsky 的预测,而非已验证事实。税务示例不构成专业税务建议。

过程约束与 Move 37

行业最佳实践能提供可靠、可审计的默认路径VS过度规定步骤可能阻止 AI 找到更好、更短的新方法

只规范少量决定信任的行为,并评价原则而非枚举每个动作,可保留探索空间;高风险交付仍应优先一致性。

更密集信号与评审成本

全轨迹行为评审能定位终局分数看不到的问题VS智能体式 Judge 本身昂贵、会出错,也难覆盖所有线上轨迹

需要分层策略:确定性检查全量运行,高风险行为抽样评审,Judge 再由专家校准。

自主完成与人类责任

智能体可以数小时独立完成税表首稿VS税务判断、证据与最终签字仍需要专业人员复核

节目把自主定义为从开始到可审阅交付,而非取消监督;权限和法律责任边界仍需由具体机构定义。

Harness 工程与基础模型吞噬

当前可靠性依赖大量上下文、工具、行为和知识架构VS更强模型可能在数年内原生学会许多同类能力

嘉宾给出的“不少于两年、少于五年”只是推测;合理策略是让架构可替换,并把临时优势转成业务资产。

SO WHAT

可执行启示

可靠的长时程系统要同时设计记忆、工具、环境、过程标准、结果验证和人类复核,而不是只选择更强模型。

AE

Agent 工程团队

  • 为长任务设计状态交接格式:目标、已验证事实、假设、失败尝试、未决项和下一步。
  • 把结果 Evals、确定性校验、行为 Evals 和人工审阅做成分层测试矩阵。
  • 对 Context 与工具说明执行代码式评审、版本控制和回归测试。
DE

领域专家

  • 挑出人类流程中最能降低重大风险的少量动作,而不是复制全部 SOP。
  • 为每项行为写清触发条件、期望证据与不适用场景。
  • 定期抽查 Judge 的误判,并把新型失败反馈给系统团队。
KM

企业知识负责人

  • 指定当前政策与流程的唯一权威文档、Owner、版本和失效日期。
  • 把旧通话和历史文件标为背景资料,避免与当前 Canon 同权。
  • 记录关键概念、对象和关系,减少智能体跨系统混淆术语。
PM

AI 产品负责人

  • 把完成定义为可复核的工作包,而非单一答案或“Agent stopped”。
  • 按风险决定速度、视觉检查、独立复核和人类批准的取舍。
  • 让模型与 Harness 可替换,同时积累工作流、反馈数据和客户信任。

CHAPTERS

节目时间轴

Basis 如何用行为规范、智能体评审、运行时上下文与知识本体,让 AI 连续工作数小时乃至数天

为什么英语上下文比代码更珍贵

Basis、会计与长时程定义

端到端税表与可审阅交付

从 ReAct、BabyAGI 到推理模型

可验证奖励与代码 agent

现实任务的数据与反馈困境

为什么结果通过仍不足够

Behavior specs

Context 作为运行时训练数据

谁来评审 Judge

行为规范开源与可观测性

Ontology、记忆与公司 Canon

新角色与部署智能团队

闭环自我改进

Bitter Lesson、RL 与商业护城河

一句话带走

当智能体开始工作数天,真正的产品不再是一次推理,而是它赖以记忆、行动、被审阅和持续改进的整个组织。

方法与限制:Codex 完整审阅了 The MAD Podcast 官方 01:22:59 视频的英文自动字幕,共 186 个合并段落;该版本比小宇宙译制版包含更完整内容,未使用 ASR,Token 使用为 0。自动字幕没有可靠说话人标签,专名与模型名可能存在识别误差;本文依据问答语义区分主持人与嘉宾观点,并把模型演进时间、基础模型吞噬 Harness 的“两到五年”窗口及自我改进进度视为 Mitch Troyanovsky 的预测,而非已验证事实。税务示例不构成专业税务建议。

查看逐字稿