Tibo:Codex 的 harness 总比模型快一步
Tibo 把 Codex 从 OpenAI 内部的研究工具做成开源 coding harness:用 Rust 把 agent 和产品切开,harness 总比模型快一步,再把同一套能力并进 ChatGPT Work。
K.K 的播客笔记
共 42 期
Tibo 把 Codex 从 OpenAI 内部的研究工具做成开源 coding harness:用 Rust 把 agent 和产品切开,harness 总比模型快一步,再把同一套能力并进 ChatGPT Work。
Grok Bot 用大约一个月从零做出 knowledge work 产品:云端电脑、具名 bot、人工 onboarding,目标是一支能把活做完的 AI 同事团队,而不是带一堆连接器的聊天框。
陶哲轩把数学收成六件直观的事:数、代数、几何、概率、分析、动力学;它们从计数和量地长成精密语言,并能抢在科学前面给出描述世界的词汇。
YC Paper Club 认为 harness 长期被当成套壳,但同一份模型换脚手架就能让 Arc AGI 从约 30% 到 95% 以上;静态 harness 之后,下一截是会改自己的 harness。
James Clear 把习惯收成到场、身份和环境:先缩小到两分钟,用行动给想成为的那种人投票,再把空间设计成阻力最小的路。
World Labs 的 Atlas 把生成和重建做进同一个 world model,核心原语是 new view prediction:几张带位姿的图就能重建、飞穿和仿真,采集量比稠密重建少约 50 到 100 倍。
星辰把仓位从 AI 基建砍到约 10%,把消费、红利、出口机械和化工当成十年一遇的高质量落水狗,并说这套策略必须和自己的心性匹配,听众不要轻易照抄。
曾鸣认为大模型窗口已经关闭,接下来要比的是谁先把 Agent 的标准和用户入口立住;现有巨头 All in AI 是必要条件,几乎不是成为下一代时代企业的充分条件。
豆包工作是字节把 To C 豆包和 To B 飞书收成一条 work 主线的产品,功能在追 WorkBuddy,差距主要在 Harness 细节、连接器和谁来付 token。
Anthropic 把 SDLC 从线性交接改成由版本化 artifact 驱动的闭环;intent.md 是这个闭环的入口,Rob Shocks 用 16 分钟说明普通团队可以从哪几段先落地。
YouTube 原视频 · Rob ShocksBilibili 中文转载入口Anthropic 官方博客 · The AI-Native SDLC playbook
先看见模型实际读到的整条上下文,把意图写成可验证条件,再把长程开放问题切成可验证的搜索;模型擅长通过明确的 verify,不擅长在不确定中替你决定方向。
蒋炎岩主张:古法编程已经死了,Agent 在单任务上无人能敌,但软件工程暂时还没死,因为 Intention、Specification、Implementation 之间的缺口不会被更多 token 自动补上。
Tara Seshan 认为 AI 产品正从对话、智能体进入持久同事:人负责掌舵与抬高野心,模型负责执行;ChatGPT Work 与 Codex 共享能力,但知识工作还需要看见过程,而不能只验收输出。
Lenny's Podcast 官方视频Lenny's Newsletter 节目录音与文字稿小宇宙中文 AI 译制版入口
即使模型能写 Lisp 方言,Patrick 仍主张把关键知识放进自己的认知 cache,并在创业前问清:成功以后你是否还愿意长期做这件事。
DHH 认为编程已从亲手凿 Ruby 变成用自然语言驾驶 agent:实现成本塌缩之后,瓶颈变成愿景、品味、组织带宽和人在回路中的判断。
Tibo 认为下一波 AI 取决于能否做出懂你的 personal agent、把 ChatGPT 与 Codex 收成同一套 harness,以及持续把模型能力变成更便宜、更快、更广的使用体验。
Matthew Berman 官方 YouTube 与英文 automatic captions小宇宙中文 AI 译制版入口
Greer 认为好小说来自先倾倒素材、再让意象和笑话彼此押韵,并用旧书、观察和诚实的痛苦,而不是机智或方法派人物小传,把故事写得像真的发生过。
How I Write / David Perell 官方 YouTube 与英文 automatic captions小宇宙中文 AI 译制版入口
Altman 认为 AGI 已经足够接近,下一步的约束是经济惯性、产品尚未出现 iPhone 时刻,以及 OpenAI 必须把算力和研究集中在通用智能平台,而不是自己做完所有产品。
强哥从装修 QQ 空间走到苹果设计大奖,靠的不是科班训练,而是抓住生活里细微的不舒服,反复做到自己问不出问题,再用体验把识别、等待和 AI 藏起来。
Cosmos 3 展示了一条“研究即基础设施”的路线:统一理解、生成、仿真和 action,开源给 Physical AI 开发者,并用 mission、快速迭代与长期投入把数百人的研究组织聚合起来。
张小珺Jùn|商业访谈录原始中文节目NVIDIA Research · Ming-Yu LiuNVIDIA Cosmos 3 官方技术页
Post-Training 已从一条可由单团队完成的流水线,演化为多专长教师、在线蒸馏、复杂数据与算力编排共同构成的组织级系统工程。
原始节目与官方英文 Transcript · InterconnectsNathan Lambert 官方 YouTube 视频小宇宙 AI 中文译制版 #677
Dalio 的核心判断不是简单预测“AI 泡沫何时破”,而是要求把技术上升、金融去杠杆、社会分配和世界秩序四个不同速度的周期放进同一张图。
这是一场由美国需求点火、全球供应链传导、资本市场放大的 AI 行情,但它尚未形成覆盖就业、消费和多数行业的宏观复苏。
这套课程用九个切面说明,AI 超级周期既是一次巨额工业建设,也是一次缓慢而艰难的组织与产品重构。
若人才真是公司第一优先级,就应像做关键产品一样定义目标、配置负责人、测量进展,并为少数关键候选人提供定制体验。
Lenny’s Newsletter 官方节目与文字稿Lenny’s Podcast 官方 YouTube小宇宙 AI 中文译制版 #673
可靠的长时程系统要同时设计记忆、工具、环境、过程标准、结果验证和人类复核,而不是只选择更强模型。
AI 创业和工程的可持续优势,来自找到通用模型成功率仅 0%–1% 的高价值问题,再用清晰规格、专有数据、skills、工具与快速验证器把它变成可反复改进的完整系统。
原始视频 · Y Combinator 官方 YouTube官方英文 Transcript · Root Access小宇宙 AI 中文译制版 #662
李飞飞主张把 AI 视为由大规模人类数据驱动的增强工具:它能扩展科学、医疗、教育与创造力,但价值取决于人是否保有学习动机、选择权、专业判断和共同治理权。
Russ 判断 LLM 会逐步商品化,下一阶段的竞争将集中在 agent 可靠性、数据与工程、可校准的未来预测,以及进入物理世界所需的 robotics 数据和 manipulation 能力。
Heitor Lessa 主张用人主导的产品发现、可定制的 OpenSpec、分层模型、确定性 guardrails 与 session 复盘,构建能在企业规模运行的 agentic software development life cycle。
ChatGPT Work 的产品命题,是把从 Codex 验证过的 agent 能力扩展到所有知识工作者,并用共享 harness、持久上下文和可验证 artifact,把生产力衡量从活动量转回目标进展。
Anthropic 的产品方法,是让小团队公开实验、尽早发现模型的非连续能力,再用 evals 和 hands-on judgment 把这些能力转化为可验证、可扩展的用户价值。
Lenny's Podcast 官方节目页官方 YouTube 视频与英文 automatic captions小宇宙中文 AI 译制版入口
节目多数意见反对美国禁止中国 open-weight models,认为这会抬高本国 AI 成本并伤害开发者,但对 frontier labs 是否会迅速 commoditize、distillation 是否构成侵权,以及训练数据怎样付费存在明显分歧。
AI model 的能力趋势仍在上升,但 long context、provider accuracy、benchmark integrity 与 reward hacking 说明,未来瓶颈正在从单纯扩大模型转向系统级软件优化和可验证的激励设计。
Kun 用一个可持续修改自身的 coordinator、可观察的 terminal sessions 和分层验证 pipeline,把大量 agent 并行工作压缩成一个对话入口,并让人只介入高风险、含产品判断的节点。
Tommy Wood 主张把学习理解为对挑战的适应:选择略高于当前能力、允许犯错且能恢复的复杂任务,并用有氧、抗阻训练、睡眠与整体健康降低长期认知衰退风险。
Netflix 不认为 AI 会消灭 PM、design、engineering 与 data science,而是要求各专业保留 craft excellence,同时培养跨域 systems thinking、AI fluency 和对最终 outcome 的责任。
把 context 当作有限的信息与指令预算、把 agent 工作拆成可验证的小循环,并在实现前让人审查 architecture 与 program design,才能获得速度而不把长期维护成本隐藏到未来。
The Pragmatic Engineer 官方节目页The Pragmatic Engineer 官方 YouTube 视频小宇宙中文 AI 译制版入口
这项约 6,000 名科技从业者的年度调查显示,AI 带来的兴奋与疲惫同时上升:一半人感觉能力被放大,另一半感到岗位被重写、失稳或被削弱。
OpenCode 押注 model-agnostic、开源 coding agent 会在模型快速轮换与成本优化中获得长期位置,但 Dax 同时警告:AI coding 的主观效率感远未证明它能替代工程纪律、基本功和长期系统判断。
Kent Beck 的方法不是一套固定仪式,而是一种反复出现的工作节奏:做一个小而可逆的动作,获得反馈,更新理解,再决定下一步。
The Pragmatic Engineer 官方节目页The Pragmatic Engineer 官方 YouTube 视频小宇宙中文 AI 译制版入口
AI 让产出变便宜之后,人类的重要能力将从亲手做出答案转向选择问题、判断答案并建立验证闭环。
没有匹配的期。换个词,或清空搜索。