把多 session 认知负担交给 coordinator
FirstMate 维护 project context、选择 crewmate 与 model,并保持自己不被长任务阻塞;用户只面对一个持续可用入口(00:08:00–00:16:02)。
深度总结 · 基于完整逐字稿
Kun Chen 展示 FirstMate、Herder、No Mistakes 与 AXI:从多 session 调度、模型路由到对抗式代码验证,以及为什么未来软件首先要为 agents 设计
规模化 agent 工作的关键不是启动更多 agent,而是设计“何时必须回到人”的控制面
本文综合:Kun 的系统把执行规模分成三层——FirstMate 负责把自然语言意图路由给 crewmates;scripts 与 AXI 压缩确定性步骤和 token 开销;No Mistakes 用原始 session intent、对抗式 review、testing 与 CI evidence 约束代码质量。人的主要工作因此不再是切换 20–30 个 tabs 或逐行审查 diff,而是定义 escalation rules,并处理会改变 product、需要真实 judgment 的 ambiguous decisions(00:08:00–00:25:36;00:37:13–00:46:41)。这也解释了 setup 本身何时有价值:它必须来自真实 delivery bottleneck,并把时间重新释放给产品,而不是只证明能并行运行多少 agents。
TL;DR
节目不是一份工具清单,而是一次把个人 agent system 当作小型工程组织来设计的现场演示。
Kun 用一个可持续修改自身的 coordinator、可观察的 terminal sessions 和分层验证 pipeline,把大量 agent 并行工作压缩成一个对话入口,并让人只介入高风险、含产品判断的节点。
THE ARGUMENT
Kun 的工作流可以归纳成一条从并行执行到可信交付的链路:
FirstMate 维护 project context、选择 crewmate 与 model,并保持自己不被长任务阻塞;用户只面对一个持续可用入口(00:08:00–00:16:02)。
早期直接查看 sub-agent sessions、检查 context transfer 与 routing;成熟后只在异常耗时或 escalation 时深入(00:11:32–00:18:54)。
No Mistakes 以 original intent 为 requirements,使用 reviewer model、tests 和 visible evidence,而不是让生成代码的 agent 自证正确(00:37:13–00:46:41)。
当确定性步骤脚本化、输出 token-efficient、schema 默认最小化,系统才能用更少 turns 与 tokens 获得更高 success rate(00:51:47–00:59:46)。
DEEP DIVE
以下主题按演示顺序组织,并保留广告段之外的主要技术论证。
Kun 用无边框 WezTerm 与 Herder 管理 sessions。Herder 完全运行在 terminal 中,可通过 SSH 在 Mac Mini 与手机之间恢复同一状态,并理解 agent 是否仍在 working。
agent 工作台的基础需求是状态持久、可远程恢复和可观察,而非 GUI 或 terminal 之间的审美选择。
FirstMate 知道 20–30 个 public repos 与历史 work context,但自己不执行长任务;它把 App Store 状态、PR review 等工作委派出去,使用户可以继续 brain dump。
主 agent 最宝贵的资源不是 execution throughput,而是持续保持可沟通和维护全局 context。
Kun 从 prototype 开始逐渐扩大委派,修复错误 routing 和 crewmate 冲突;平时不再查看 sub-agents,但保留跳入具体 session 的能力,并明确何时必须 escalate。
好的 autonomy 不是减少所有人工介入,而是把介入精确安排在不可逆或含产品取舍的地方。
FirstMate 按 task complexity、model quality、reasoning effort 和剩余 quota 选择 crewmate。Kun 认为 Ultra 的核心行为是积极 fan-out sub-agents,因此可能比 x-high 大幅增加消耗。
agent router 应优化单位任务的总成功成本,而不是把最高 reasoning setting 当成默认最优。
Baby Menu 从空壳通过对话逐渐加入 GitHub、CPU、memory 与 quota 等个人组件;FirstMate 的 AGENTS.md 和 Bash scripts 也位于其可修改目录,遇到 bug 时能够绕过。
self-healing 的前提应是修复路径和变更记录可检查,否则“继续工作”不等于“行为正确”。
面对大型 AI-generated diff,Kun 不再逐行 review,而是让独立 pipeline 恢复 intent、隔离执行、对抗审查并产出可见证据。
生成速度越快,越需要把“可以 merge”定义为独立证据,而不是生成 agent 的信心。
Kun 也曾连续一两周只修 tooling 而没有做 product。FirstMate 接管 mundane maintenance 后,人的时间自然回到 Highbit、iOS app 等新产品和 ambiguous work。
衡量 agent infrastructure 的标准,应是它是否提高真实产品交付,而不是 setup 本身有多复杂。
Kun 预测大量 SaaS human interface 会被 headless agent interface 重建。他用 AXI benchmarks 论证,同一功能只改变 interface,就会显著影响 token、turns、latency 与 success rate。
未来 software 的可用性不只由 API 是否存在决定,还取决于 agent 为完成任务需要读取多少无关信息、走多少 turns。
OPEN QUESTIONS
这套个人系统展示了高上限,也留下若干必须独立验证的边界。
节目展示了早期重复任务和错误 crewmate routing,也展示了逐渐修复后的信任;但未提供灾难恢复、权限隔离、审计日志和 coordinator failure 的完整机制(00:11:32–00:16:02)。
Kun 将其视为 intelligent software 的 resilience,但节目没有说明系统何时必须修复而非绕过,也未展示变更批准和 rollback(00:36:33–00:39:19)。
当前答案是按 project risk 和 change complexity 分级,但具体阈值依赖 Kun 的 judgment;63% 问题命中也没有给出 severity、false-positive 或人工复核基线(00:42:55–00:49:20)。
“99.9% software 由 agents 使用”是主持人与嘉宾的方向性判断,而不是已验证比例。节目没有区分金融、医疗、创意和协作等领域的监管与交互差异(00:54:27–01:01:49)。
SO WHAT
复刻工具前,应先复制这套系统背后的边界设计。
CHAPTERS
节目从桌面 setup 逐步推进到 coordinator、质量系统和 agent-native 软件预测。
预告:Herder、FirstMate 与多 agent 认知负担
从 code completion 到几乎不手写代码
WezTerm 与 Herder 的 terminal 工作台
FirstMate 作为唯一主入口
跨 20–30 个 repos 的 routing 与渐进信任
Lavish visual artifact 辅助复杂设计
模型、reasoning effort 与 quota routing
只让 ambiguous decisions 返回给人
额度、Ultra fan-out 与 model benchmark
Pi、Claude Code、Grok Build 与 OpenCode
Baby Menu 与 self-modifiable software
No Mistakes 代码验证 pipeline
1,000 次 changes 的问题发现统计
避免只做 setup、不做 product
SaaS 向 headless agent interface 重建
CLI、MCP 与 AXI benchmark
技术扩散、early adopters 与采用时机
一句话带走
不要用 agent 数量衡量系统先进程度;真正的杠杆,是让机器承担可验证的执行,让人把有限注意力留给不可替代的判断。
方法与限制:本页基于 David Ondrej 官方 YouTube 视频的英文 automatic captions,覆盖 01:01:49 完整内容,并以小宇宙条目核对节目身份;未对中文 AI 译制音频做二次 ASR。automatic captions 存在产品名、人名和技术词误识别,例如 WezTerm/tmux/cmux/Claude/Codex/CLI 可能被写作 western、T-Max、CMAX、cloud、codeex、COI;中英逐字稿保留英文 caption 原文不变,中文由 Codex 按 140 个 segment 一一对齐翻译,并仅对语境明确的常见产品与术语做规范化,未调用外部翻译服务,也未经过独立人工审校。节目中的 quota、模型速度、benchmark、63% 命中率与“99.9% 软件由 agents 使用”等均来自嘉宾现场展示或个人判断,缺少外部复现条件;摘要把它们作为案例证据而非行业普遍事实。精确引用、产品名称、定价和性能结论应回看官方视频及对应公开仓库复核。
查看逐字稿