模型跨出工作记忆
任务从分钟延长到小时或天后,当前上下文无法容纳全部历史,必须外化状态并规划下一次推理需要什么。
Basis 如何用行为规范、智能体评审、运行时上下文与知识本体,让 AI 连续工作数小时乃至数天
长时程智能体不是一个更长的 Prompt,而是一家由失忆、非确定性员工组成的微型组织
本文综合:模型拥有很大的工作记忆,却没有天然、稳定的短期与长期记忆;任务跨越上下文后,它必须给未来的自己留下注释、分派子智能体并重建状态。与此同时,税务等现实工作不能只看最终数字是否命中,因为错误来源、证据质量与复核成本同样决定能否交付。Basis 因此借鉴人类组织:把少量关键流程写成行为规范,让独立评审智能体检查完整轨迹,再用清晰的知识本体和权威文档为每次推理提供高质量“运行时训练数据”。
TL;DR
Basis 如何用行为规范、智能体评审、运行时上下文与知识本体,让 AI 连续工作数小时乃至数天
可靠的长时程系统要同时设计记忆、工具、环境、过程标准、结果验证和人类复核,而不是只选择更强模型。
THE ARGUMENT
可靠的长时程系统要同时设计记忆、工具、环境、过程标准、结果验证和人类复核,而不是只选择更强模型。
任务从分钟延长到小时或天后,当前上下文无法容纳全部历史,必须外化状态并规划下一次推理需要什么。
现实任务步骤多、反馈慢、答案包含判断,少量终局 Evals 无法定位错误或证明能泛化到生产。
领域专家与 ML 工程师共同选择少量决定信任的动作,例如引用一手税法或交付前渲染幻灯片。
Judge 判断行为触发条件是否出现、哪个子智能体负责以及是否真正执行,为系统提供更密集信号。
近期优先修改 Harness 与运行时数据,未来可能把同一信号用于过程奖励和模型后训练。
DEEP DIVE
Basis 如何用行为规范、智能体评审、运行时上下文与知识本体,让 AI 连续工作数小时乃至数天
Basis 员工用低声口述把未经压缩的上下文快速交给 AI;其产品则让会计智能体从材料出发,连续完成一份税表的首轮工作。
设计自主任务时,把“可被下一位人快速复核”写进完成定义。
当轨迹超出上下文或发生 context rot,模型必须决定写什么、压缩什么、何时拆给子智能体,并让未来推理恢复状态。
为每次压缩或交接定义状态摘要、未决事项、证据链接和下一动作。
代码既能用测试获得便宜的运行时反馈,又以文本形式存在于本地环境;但“测试通过”仍不等于架构和工程品味良好。
迁移代码 agent 经验时,要同时寻找领域运行反馈和领域质量数据。
复杂税表可能涉及数百上千份材料、数千次推理和二十多小时人工工作;数据又受隐私限制,难以靠大规模结果样本覆盖。
Evals 要同时覆盖结果、证据、路径和审阅体验,并保留独立人工抽查。
行为规范既是团队对产品应如何工作的共识,也是评审器检查轨迹的 Rubric;领域知识和智能体机制需要共同翻译。
从线上失败中选出 3–5 个高影响行为,用触发条件、期望动作和证据写成自包含规范。
系统在推理时从上下文学习,因此少量高质量信息可以像训练数据一样改变行为;复杂轨迹的评审器也需要规划、搜索和定位。
先验证 Judge 与专家判断的一致性,再把它用于回归门禁或线上监控。
文件、概念、关系和权威来源构成智能体的世界模型;同一个代码 agent 在清晰与混乱仓库中的表现差异,说明运行时数据质量会直接改变能力。
为智能体建立可检索、版本化、有 Owner 和失效日期的 Canon,而不是默认所有文档同等可信。
Basis 希望把轨迹信号自动转成 Context、工具和 Harness 改进,并探索行为奖励;但嘉宾预计许多工程最终会被基础模型吸收。
把可替代的技术领先转化为生产数据、工作流所有权和客户信任。
OPEN QUESTIONS
Codex 完整审阅了 The MAD Podcast 官方 01:22:59 视频的英文自动字幕,共 186 个合并段落;该版本比小宇宙译制版包含更完整内容,未使用 ASR,Token 使用为 0。自动字幕没有可靠说话人标签,专名与模型名可能存在识别误差;本文依据问答语义区分主持人与嘉宾观点,并把模型演进时间、基础模型吞噬 Harness 的“两到五年”窗口及自我改进进度视为 Mitch Troyanovsky 的预测,而非已验证事实。税务示例不构成专业税务建议。
只规范少量决定信任的行为,并评价原则而非枚举每个动作,可保留探索空间;高风险交付仍应优先一致性。
需要分层策略:确定性检查全量运行,高风险行为抽样评审,Judge 再由专家校准。
节目把自主定义为从开始到可审阅交付,而非取消监督;权限和法律责任边界仍需由具体机构定义。
嘉宾给出的“不少于两年、少于五年”只是推测;合理策略是让架构可替换,并把临时优势转成业务资产。
SO WHAT
可靠的长时程系统要同时设计记忆、工具、环境、过程标准、结果验证和人类复核,而不是只选择更强模型。
CHAPTERS
Basis 如何用行为规范、智能体评审、运行时上下文与知识本体,让 AI 连续工作数小时乃至数天
为什么英语上下文比代码更珍贵
Basis、会计与长时程定义
端到端税表与可审阅交付
从 ReAct、BabyAGI 到推理模型
可验证奖励与代码 agent
现实任务的数据与反馈困境
为什么结果通过仍不足够
Behavior specs
Context 作为运行时训练数据
谁来评审 Judge
行为规范开源与可观测性
Ontology、记忆与公司 Canon
新角色与部署智能团队
闭环自我改进
Bitter Lesson、RL 与商业护城河
一句话带走
当智能体开始工作数天,真正的产品不再是一次推理,而是它赖以记忆、行动、被审阅和持续改进的整个组织。
方法与限制:Codex 完整审阅了 The MAD Podcast 官方 01:22:59 视频的英文自动字幕,共 186 个合并段落;该版本比小宇宙译制版包含更完整内容,未使用 ASR,Token 使用为 0。自动字幕没有可靠说话人标签,专名与模型名可能存在识别误差;本文依据问答语义区分主持人与嘉宾观点,并把模型演进时间、基础模型吞噬 Harness 的“两到五年”窗口及自我改进进度视为 Mitch Troyanovsky 的预测,而非已验证事实。税务示例不构成专业税务建议。
查看逐字稿