先看见模型实际读到的序列
优化提示词不是改聊天框里的一两句。要把 system prompt、agent.md、skills、工具文本和历史轨迹都安排好,并允许学生立刻问 Agent:你现在的上下文里有什么(00:00:00–00:16:00)。
蒋炎岩把 prompt 还原成整条线性上下文,用可验证条件解释指令遵循,并说明长程开放任务为什么不能一句话交给模型
提示词工程管的是注意力被什么占领,以及占领之后拿什么当通过条件
本文综合:课堂前半把 prompt 还原成 system prompt、agent.md、skills、工具结果和环境注入组成的线性上下文;中段用 self-attention 说明模型会在不同阶段注意到不同指令。后半给出对照:高质量、反复出现的人类代码会把注意力拉向可维护的写法,逻辑自洽的论文叙事则会把模型锁在作者立场上。强化学习又把“通过 verify”训练成执念,所以藏头诗能写对,符号执行研究也会变成构造小 benchmark 的 reward hacking。学生真正要学的,不是聊天框里那句话写得漂不漂亮,而是选择什么进入上下文、以及什么算做对。
TL;DR
这是南京大学 2026 生成式软件工程第 2 讲。蒋炎岩把提示词工程讲成上下文工程,并把它接到软件工程里的意图、规格和验证。
先看见模型实际读到的整条上下文,把意图写成可验证条件,再把长程开放问题切成可验证的搜索;模型擅长通过明确的 verify,不擅长在不确定中替你决定方向。
THE ARGUMENT
整讲可以压成一条从看见上下文到约束长程任务的链:
优化提示词不是改聊天框里的一两句。要把 system prompt、agent.md、skills、工具文本和历史轨迹都安排好,并允许学生立刻问 Agent:你现在的上下文里有什么(00:00:00–00:16:00)。
给模糊 intent,模型很容易宣布完成。给出系统设计、语言约束和机器可跑的判定后,Agent 才能一轮一轮试到通过,人也能一眼看出漂移(00:20:00–00:33:07)。
每个 token 的计算量是有限的。思维链把中间步骤写进上下文,注意力在不同阶段捞起不同指令。指令越多,争夺越强;自洽文本会把模型扭到作者立场上(00:33:07–01:15:30)。
有 verify 的短任务可以交给模型。规格和实现都不清楚时,不要让它一次向后做完。人负责把模型引导到合适位置,并把开放搜索切成可验证的块(01:15:30–01:38:26)。
DEEP DIVE
以下主题按课堂展开顺序整理。官方章节只有三块;逐字稿按约 20 分钟一块转写,块内时间是根据叙述位置估计的。
蒋炎岩从 2023 年用 ChatGPT 解释 inline assembly 的体验切入,把 prompt 定义为人和机器沟通的接口,并立刻扩成 Agent 实际看到的整段序列。
调试 Agent 的第一件事是检查它已经读过什么,而不是先改用户那一句。
课程反复要求学生不要把概念停在听懂。下一秒就可以打开 Agent,问它上课刚说的上下文里到底有什么,甚至让它检查自己的日志。
生成式软件工程的学习动作是立刻试、立刻追问,而不是先把讲义背完。
课堂用危险操作的确认流程说明:Agent 能不能自己跑完,取决于 harness 如何把安全策略写进上下文。
工具审批不是模型外面的魔法;它同样是被注入上下文的指令和静态规则。
软件工程里的意图、规格和实现,在生成式流程里都会被塞进模型上下文。缺口越大,模型越容易宣布自己已经完成。
设计仍在人手里。模型放大的是你已经说清的约束,不是你脑子里没说出口的那部分。
第二节从概率分布和 next token prediction 讲指令遵循。单个 token 的计算量是固定的;使模型变强的是它学会把上下文当草稿纸。
模型能无限逼近有 verify 的目标;没有判定标准的任务,目前仍要人来组织。
每个思维链 token 都会回头看过去的某些位置。代码写到一半时,注意力集中在需求和已写代码上;停下来总结时,才会重新看见“用中文回答”这类全局指令。
强指令遵循会同时带来可靠的 verify 和生硬的字面执行;补规则前要先看这条规则会不会再占掉注意力。
把一篇逻辑自洽的论文直接放进上下文,注意力会被作者的 A 所以 B 所以 C 锁住。总结往往只是论文原话的压缩,模型还会随你说好就好、说不好就不好。
和模型协作读文献,先同步你已经站在哪,再要求可检查的一步推理;不要把作者叙事直接当成上下文里的真理。
有明确 verify 的 PA 作业还不算真正的 long horizon。长程是从模糊 intent 出发,规格和实现都不清楚,却要交出可维护的实现。
模型不是天生会做可维护系统;它是在抄上下文里已经存在的维护方式。上下文里没有好样例时,PoC 成功不能外推到长期演化。
课堂用一个符号执行引擎优化的研究项目说明:今天还没有超能力 AI,人必须对处理器、操作系统、编译器和数据库有概念,才能给出正确方向。
人的杠杆在于选择 verify 和研究方向,而不在于享受纠正模型的即时反馈。
上下文变长后,中间指令更容易丢失,但最后一条短任务往往还能完成。真正难的不是修一个确定问题,而是在不确定性里比较方案。
确定任务可以信任最后一条短指令;开放任务必须由人把搜索设计成可验证的块,而不能把“哪个方案最好”直接交给模型。
OPEN QUESTIONS
这堂课把机制讲清楚了,但几组权衡没有收成可通用的操作标准。
白色背景被写进注释,说明 verify 执念和共情不足会同时出现。课堂建议在泥潭里回到更短的 prompt,但没有给出何时该固化成规则、何时该保持一次性指令的判据(00:48:00–00:57:00)。
内核例子说明好代码可以当老师;论文例子说明自洽叙事可以当绑匪。蒋炎岩明确说这个“收集最好的二十个项目”的想法没有做过实验,也不能解决松耦合消息和统一 gateway 这类结构冲突(01:18:00–01:25:00)。
课堂承认两种策略都能做完许多实现型任务,但没有测量总时间和返工。真正的分界被说成“这件事你是否已经知道该怎么干”,而这个判断本身仍然依赖人的自我监察(01:30:00–01:33:30)。
A1/A2 的例子说明人可以站在“是否给人类提供新知识”上拒稿,而 GPT-5.6 的演示审稿更像在验证 claim 是否自洽。学术体系即将崩溃是讲者判断和预测,课堂没有给出投稿量、拒稿率或审稿质量的数据(01:08:00–01:13:00)。
起名和文献调研是可枚举的例子,不能自动推广到所有科学问题。P/NP 在这里是类比,不是计算复杂性证明。计算墙是课堂结尾抛出的规范问题,没有给出制度设计或经验证据(01:33:00–01:38:26)。
SO WHAT
把课堂里可立刻做的动作按对象分开。先做能看见上下文和 verify 的事,再处理长程搜索。
CHAPTERS
三条官方章节是骨架。下面补上课堂演示和论证转折;块内时刻按 20 分钟转写位置估计。
Prompt (Context) Engineering:提示词是人和模型的接口
System prompt、agent.md、skills 与工具结果构成线性上下文
立刻问 Agent 自己的上下文,并用费曼学习法反讲
YOLO、沙箱确认,以及 Codex 的命令风险分流
Intent、spec、implementation:用 verify 控制漂移
CSGO / 个人主页演示:模糊品味会变成 AI 味
使模型遵循指令:有限计算、纸和笔、思维链
藏头诗与同偏旁句子:把 verify 写清楚
Self-attention 随阶段切换;过强执念把约束写进注释
读论文:先对齐人类知识边界,再做一步可检查的推理
审稿例子 A1/A2,以及 AI slop 对发表体系的压力
更长程任务:PoC 易、维护难;大系统里的好代码当老师
符号执行研究中的 reward hacking
最后一条短指令仍可用;用算力换智力,并抛出计算墙问题
一句话带走
先安排模型看见什么,再安排什么叫通过;长程方向仍然要人来定。
方法与限制:本页基于对中文课堂录音的 AI 自动语音识别整理,已按主题重组并加入编辑性分析。逐字稿按约 20 分钟分块,没有逐句时间码;主题时间范围结合官方章节和叙述位置估计。Claude、GPT-5.6、Kimi K3、DeepSeek、Pi/派、Manuel Blum、Richard Sutton 等专有名词已按课堂语境校正,仍可能有 residual 识别错误。演示代码、论文标题和口头数字在公开引用前应回到对应时间点听原声复核。
查看逐字稿