返回播客目录

深度总结 · 基于完整逐字稿

L8 工程师的 Agentic Engineering 系统:只把判断留给人

Kun Chen 展示 FirstMate、Herder、No Mistakes 与 AXI:从多 session 调度、模型路由到对抗式代码验证,以及为什么未来软件首先要为 agents 设计

01:01:49 agentic engineeringFirstMateHerderNo MistakesAI code reviewAXICLI versus MCPagent-native software
核心洞见 · 本文综合判断,不是嘉宾原句
规模化 agent 工作的关键不是启动更多 agent,而是设计“何时必须回到人”的控制面

本文综合:Kun 的系统把执行规模分成三层——FirstMate 负责把自然语言意图路由给 crewmates;scripts 与 AXI 压缩确定性步骤和 token 开销;No Mistakes 用原始 session intent、对抗式 review、testing 与 CI evidence 约束代码质量。人的主要工作因此不再是切换 20–30 个 tabs 或逐行审查 diff,而是定义 escalation rules,并处理会改变 product、需要真实 judgment 的 ambiguous decisions(00:08:00–00:25:36;00:37:13–00:46:41)。这也解释了 setup 本身何时有价值:它必须来自真实 delivery bottleneck,并把时间重新释放给产品,而不是只证明能并行运行多少 agents。

TL;DR

两分钟读完

节目不是一份工具清单,而是一次把个人 agent system 当作小型工程组织来设计的现场演示。

一句话

Kun 用一个可持续修改自身的 coordinator、可观察的 terminal sessions 和分层验证 pipeline,把大量 agent 并行工作压缩成一个对话入口,并让人只介入高风险、含产品判断的节点。

  1. FirstMate 作为唯一主入口,把 tasks 委派给 crewmates,并保持自身可继续接收新的 brain dump;Herder 提供跨设备 session 状态与按 agent 显示的可观察性(00:05:45–00:16:02)。
  2. 信任不是预设,而是通过观察 routing、消除重复任务和编写 escalation rules 逐步建立;sweet spot 因人而异(00:11:32–00:23:08)。
  3. 模型选择同时受 intelligence、latency、quota 与 reasoning mode 影响;Ultra 的 sub-agent fan-out 可能比 x-high 更烧额度(00:23:08–00:31:39)。
  4. No Mistakes 从生成代码的 agent session 恢复 intent,再执行 rebase、adversarial review、testing、documentation、lint 和 CI babysitting(00:37:13–00:46:41)。
  5. 过去约三个月、59 个 repos 的 1,000 次 changes 中,63% 被发现问题;但验证深度必须按 demo 与 production 风险分级(00:46:41–00:49:20)。
  6. AXI benchmark 显示 interface alone 会显著影响 agent 成本和成功率;同功能 Chrome DevTools wrapper 将平均成本降低超过 20%(00:51:47–00:59:46)。

THE ARGUMENT

整期内容的一条主线

Kun 的工作流可以归纳成一条从并行执行到可信交付的链路:

STEP 01

把多 session 认知负担交给 coordinator

FirstMate 维护 project context、选择 crewmate 与 model,并保持自己不被长任务阻塞;用户只面对一个持续可用入口(00:08:00–00:16:02)。

STEP 02

用规则和可观察性建立渐进信任

早期直接查看 sub-agent sessions、检查 context transfer 与 routing;成熟后只在异常耗时或 escalation 时深入(00:11:32–00:18:54)。

STEP 03

把代码交付放入独立验证 pipeline

No Mistakes 以 original intent 为 requirements,使用 reviewer model、tests 和 visible evidence,而不是让生成代码的 agent 自证正确(00:37:13–00:46:41)。

STEP 04

最终优化 agent 与软件之间的 interface

当确定性步骤脚本化、输出 token-efficient、schema 默认最小化,系统才能用更少 turns 与 tokens 获得更高 success rate(00:51:47–00:59:46)。

DEEP DIVE

内容提炼

以下主题按演示顺序组织,并保留广告段之外的主要技术论证。

0100:05:45–00:10:55

Terminal 不只是偏好,而是可迁移的 agent control surface

观察主张

Kun 用无边框 WezTerm 与 Herder 管理 sessions。Herder 完全运行在 terminal 中,可通过 SSH 在 Mac Mini 与手机之间恢复同一状态,并理解 agent 是否仍在 working。

  • terminal workflow 的初期 learning curve 会造成短期 productivity loss,但 keyboard-first 操作帮助维持 flow。
  • 与传统 tmux/Zellij 只理解 panes 不同,Herder 显式展示 agent session 和等待状态。
  • 跨设备访问的价值来自 session continuity,而不是单纯追求复古工具。

agent 工作台的基础需求是状态持久、可远程恢复和可观察,而非 GUI 或 terminal 之间的审美选择。

0200:08:00–00:16:02

FirstMate:让 coordinator 保持空闲,让 crewmates 执行

观察主张

FirstMate 知道 20–30 个 public repos 与历史 work context,但自己不执行长任务;它把 App Store 状态、PR review 等工作委派出去,使用户可以继续 brain dump。

  • 单一入口降低记忆每个 tab、session 与 project 状态的认知成本。
  • coordinator 不被 block,意味着新意图随时可进入系统。
  • 结果只有两种:自动完成,或以需要人做决定的问题返回。

主 agent 最宝贵的资源不是 execution throughput,而是持续保持可沟通和维护全局 context。

0300:11:32–00:25:36

信任、可观察性与 ambiguous decision

主张观察

Kun 从 prototype 开始逐渐扩大委派,修复错误 routing 和 crewmate 冲突;平时不再查看 sub-agents,但保留跳入具体 session 的能力,并明确何时必须 escalate。

  • 成熟信任来自历史表现与规则调优,不是一次性全自动授权。
  • Lavish HTML/Excalidraw artifact 把复杂设计从一墙文字转成可移动、可反馈的 visual decision surface。
  • deep work 的重新定义,是只处理真正需要 human judgment 的 ambiguity。

好的 autonomy 不是减少所有人工介入,而是把介入精确安排在不可逆或含产品取舍的地方。

0400:15:58–00:35:04

模型与额度路由:reasoning effort 并不等于更高效率

观察主张

FirstMate 按 task complexity、model quality、reasoning effort 和剩余 quota 选择 crewmate。Kun 认为 Ultra 的核心行为是积极 fan-out sub-agents,因此可能比 x-high 大幅增加消耗。

  • 复杂 design 偏向具有 depth 与 creativity 的 Fable,日常 tasks 则因 quota 更多使用 5.6 Sol。
  • 不够 intelligent 的 model 在 max reasoning 下可能浪费更多 cycles,反而慢且昂贵。
  • Kun 希望订阅提供更高 tier,以及面向 background task 的“更慢但更便宜”模式。
  • 对模型 benchmark、定价与产品名的判断均来自个人现场经验,不能视为普遍测量。

agent router 应优化单位任务的总成功成本,而不是把最高 reasoning setting 当成默认最优。

0500:35:04–00:39:19

自修改软件:从 Baby Menu 到 FirstMate 的绕错能力

观察预测

Baby Menu 从空壳通过对话逐渐加入 GitHub、CPU、memory 与 quota 等个人组件;FirstMate 的 AGENTS.md 和 Bash scripts 也位于其可修改目录,遇到 bug 时能够绕过。

  • 未来 software 可以先提供合理默认值,再由每个人的 agent 按偏好持续定制。
  • deterministic steps 脚本化可减少 agent 重复推理和 token 消耗。
  • agent 能绕过脚本 bug 提高 resilience,但也可能让潜在错误更难显式暴露。

self-healing 的前提应是修复路径和变更记录可检查,否则“继续工作”不等于“行为正确”。

0600:37:13–00:49:20

No Mistakes:把 AI code review 上限改成验证 pipeline

观察主张

面对大型 AI-generated diff,Kun 不再逐行 review,而是让独立 pipeline 恢复 intent、隔离执行、对抗审查并产出可见证据。

  • pipeline 从 original agent session 提取 requirements,并先对 latest main 做 rebase。
  • 明显 bug 可 autofix;涉及 product implications 的修复必须 escalate。
  • review 后继续 testing、documentation、lint 和 CI,直到 PR green 才通知人。
  • 约三个月的内部统计显示,1,000 次 changes 中 63% 至少被一个步骤发现问题,review 与 documentation 是主要来源。

生成速度越快,越需要把“可以 merge”定义为独立证据,而不是生成 agent 的信心。

0700:49:20–00:54:27

避免 setup 陷阱:工具必须来自真实 friction

观察主张

Kun 也曾连续一两周只修 tooling 而没有做 product。FirstMate 接管 mundane maintenance 后,人的时间自然回到 Highbit、iOS app 等新产品和 ambiguous work。

  • FirstMate、Lavish、No Mistakes 都来自 solo builder 的实际 bottleneck,而非并行 agent 数量展示。
  • 大公司中的 coordination bottleneck 消失后,个人判断和 review throughput 会变成新瓶颈。
  • open-source maintenance 又会生成新的时间竞争,需要持续取舍。

衡量 agent infrastructure 的标准,应是它是否提高真实产品交付,而不是 setup 本身有多复杂。

0800:54:27–01:01:49

Agent-native 软件与 AXI:interface 是成本的一部分

主张观察预测

Kun 预测大量 SaaS human interface 会被 headless agent interface 重建。他用 AXI benchmarks 论证,同一功能只改变 interface,就会显著影响 token、turns、latency 与 success rate。

  • GitHub CLI 因成熟、training data 示例丰富,在测试中优于 GitHub MCP server。
  • Chrome DevTools AXI 只是 MCP wrapper,却通过 interface 改造把平均成本降低超过 20%。
  • token-efficient output 与 minimal default schema 是 AXI 十项原则中的两项。
  • 技术扩散不会一夜完成;legacy constraints 与个人情境决定每个人跨过 inflection point 的时间。

未来 software 的可用性不只由 API 是否存在决定,还取决于 agent 为完成任务需要读取多少无关信息、走多少 turns。

OPEN QUESTIONS

尚未解决的张力

这套个人系统展示了高上限,也留下若干必须独立验证的边界。

单点 coordinator 与系统韧性

FirstMate 统一 context 和 routing,大幅降低认知负担VS错误全局 context、routing rule 或权限可能同时影响多个 repos

节目展示了早期重复任务和错误 crewmate routing,也展示了逐渐修复后的信任;但未提供灾难恢复、权限隔离、审计日志和 coordinator failure 的完整机制(00:11:32–00:16:02)。

自动绕过 bug 与错误可见性

FirstMate 遇到 script bug 仍能继续执行,减少停机VSworkaround 可能隐藏 root cause、累积行为漂移或绕过安全约束

Kun 将其视为 intelligent software 的 resilience,但节目没有说明系统何时必须修复而非绕过,也未展示变更批准和 rollback(00:36:33–00:39:19)。

验证深度与 token 经济性

对抗 review、tests 和 CI evidence 能避免 production quality debtVSlarge codebase 深度验证可能消耗大量额度并降低吞吐

当前答案是按 project risk 和 change complexity 分级,但具体阈值依赖 Kun 的 judgment;63% 问题命中也没有给出 severity、false-positive 或人工复核基线(00:42:55–00:49:20)。

Agent-native 预测与 human interface 的持续价值

大量 routine SaaS 操作会转向 headless interfaces 和 main agentVS高风险确认、探索、可访问性和共享理解仍可能需要 human-centered UI

“99.9% software 由 agents 使用”是主持人与嘉宾的方向性判断,而不是已验证比例。节目没有区分金融、医疗、创意和协作等领域的监管与交互差异(00:54:27–01:01:49)。

SO WHAT

可执行启示

复刻工具前,应先复制这套系统背后的边界设计。

ID

个人开发者

  • 记录一周内反复切换 session、等待 agent 和人工 review 的具体时间,先确定最大 bottleneck。
  • 为 coordinator 写三类规则:可自动执行、必须提供 evidence、必须由人批准;从只读任务开始扩大授权。
  • 每周检查 tooling 是否减少真实 product cycle time;若只增加 setup maintenance,就停止扩展。
ET

工程团队

  • 在 AI code pipeline 中保留 original intent,并将 reviewer model 与生成 model 分离。
  • 按 demo、internal tool、production service 划分验证级别,明确各级 tests、security、documentation 与 CI 要求。
  • 统计自动发现问题的 severity、false positives、修复来源和人工遗漏,而不只统计总命中率。
TP

工具与 API 产品团队

  • 对同一组真实 tasks 比较 CLI、MCP 和 API 的 success rate、tokens、turns 与 latency。
  • 默认只返回 agent 完成当前 task 所需字段,并提供 token-efficient human-readable output。
  • 保留 human approval 与 audit surface,不把 headless 等同于不可检查。

CHAPTERS

节目时间轴

节目从桌面 setup 逐步推进到 coordinator、质量系统和 agent-native 软件预测。

预告:Herder、FirstMate 与多 agent 认知负担

从 code completion 到几乎不手写代码

WezTerm 与 Herder 的 terminal 工作台

FirstMate 作为唯一主入口

跨 20–30 个 repos 的 routing 与渐进信任

Lavish visual artifact 辅助复杂设计

模型、reasoning effort 与 quota routing

只让 ambiguous decisions 返回给人

额度、Ultra fan-out 与 model benchmark

Pi、Claude Code、Grok Build 与 OpenCode

Baby Menu 与 self-modifiable software

No Mistakes 代码验证 pipeline

1,000 次 changes 的问题发现统计

避免只做 setup、不做 product

SaaS 向 headless agent interface 重建

CLI、MCP 与 AXI benchmark

技术扩散、early adopters 与采用时机

一句话带走

不要用 agent 数量衡量系统先进程度;真正的杠杆,是让机器承担可验证的执行,让人把有限注意力留给不可替代的判断。

方法与限制:本页基于 David Ondrej 官方 YouTube 视频的英文 automatic captions,覆盖 01:01:49 完整内容,并以小宇宙条目核对节目身份;未对中文 AI 译制音频做二次 ASR。automatic captions 存在产品名、人名和技术词误识别,例如 WezTerm/tmux/cmux/Claude/Codex/CLI 可能被写作 western、T-Max、CMAX、cloud、codeex、COI;中英逐字稿保留英文 caption 原文不变,中文由 Codex 按 140 个 segment 一一对齐翻译,并仅对语境明确的常见产品与术语做规范化,未调用外部翻译服务,也未经过独立人工审校。节目中的 quota、模型速度、benchmark、63% 命中率与“99.9% 软件由 agents 使用”等均来自嘉宾现场展示或个人判断,缺少外部复现条件;摘要把它们作为案例证据而非行业普遍事实。精确引用、产品名称、定价和性能结论应回看官方视频及对应公开仓库复核。

查看逐字稿