懒人包:美军新战略要求在公开发布后 30 天内部署最新模型,并断言动作太慢的危险已大过模型不够完美对齐的风险。为了应对不完美状态,OpenAI 官方指南做出了少写步骤、写清交付的类似转向,而我们在生产端也能通过每天问 100 个无聊问题来低成本搭建 API 温度计。今天发布了三篇文章,如果你正在头疼 agent 落地,建议最先点开第一篇关于部署护栏的拆解。
1 月 9 日,美军 Secretary of War Hegseth 签发了一份战略备忘录(Nextgov 分析)。文件要求 CDAO 建立交付节奏,确保最新模型在发布后 30 天内可部署上线,并把此项设为未来的首要采购标准。备忘录写道:动作太慢的危险已经大过模型不够完美对齐的风险。每一次决策失误都可能付出生命代价的军方,选择用具体的机制来管理不完美模型,而不是无限期等待完美对齐。
鸭哥在AI Agent 不必等模型完美:美军给 AI Builder 的部署方法里拆解了这种部署思路,并总结了四道 guardrails。例如任务与权限边界,我们不该寄希望于用 prompt 杜绝越权,而要在系统层限制动作边界;又如动态回退,团队能根据外部表现实时回退或调节授权等级。用这几道 guardrails 把风险锁在系统框架内,新模型就能快速上线。
这几道 guardrails 构成了在应用层对冲模型风险的工程网。在旧的开发思路中,人们往往试图通过繁琐的指令让 AI 更准,或者反复调试直到百分之百安全才敢上线。而在实际落地时,合理使用 sandbox 和控制凭证,不仅能让错误变得更便宜,也能让我们在不等模型完美的情况下负责任地放手。点开原文可以查看完整的四道 guardrails 拆解和工程部署细节。
OpenAI 的官方指南也体现了这种在应用层为模型松绑、用系统规则兜底的思路。在 2025 年 4 月 GPT-4.1 时代,指南(GPT-4.1 prompting guide)曾尝试把 8 步工作流硬编码进 system prompt。到了同年 8 月的 GPT-5 指南(GPT-5 prompting guide),官方引入了 agentic eagerness 和授权光谱,开始提供早停条件,不再给任务规定死板的执行路线。
直到 7 月初发布 GPT-5.6,官方更新的 Model guidance(Model guidance)索性收拢原则,明确提出 "Favor leaner prompts" 的建议。鸭哥在GPT-5.6 的新提示指南:prompt 该少写什么,多写什么中,把这种通过不断删减指令并配合重跑 eval 来精简提示词的操作命名为 lean-prompt。每次删掉一组指令,就重跑同一套 eval;指标不掉,这段指令才算可以删。能不能精简,由 eval 数字决定,不由直觉。
为了在实操中落地 lean-prompt,鸭哥分享了一个可照搬的翻译系统交付三件套:由完成条件确定输出格式,由验证证据运行正则脚本自动纠错,再由权限边界在高风险动作中引入人机接管。与其把精力浪费在微调 prompt 的语气上,不如用这套交付标准配合 eval 筛选出最高效的提示词。点开原文,可以阅读详细的三代文档演化细节与这套交付三件套的实现代码。
即便我们在上线前用 eval 测出了更精简的 prompt,当系统部署到生产环境后,如何感知底层模型本身是否发生了行为漂移?针对 gpt-5.6-sol 走 Codex 订阅端点,在极简测试中连问 20 次选随机数全是 7,选随机字母连问 20 次也全是 Q。鸭哥在每天问大模型 100 个无聊问题,能当作 API 的"温度计"吗?里记录了这个反常现象。这不是故障,而是模型在看似自由的选择下带着极强的内在偏好。论文 One Token Is Enough(作者 Tomas Bruckner)测试了 165 个模型,发现极简回答的 median cell entropy 也只有约 1.0 bit。
这种无聊问题其实可以作为识别模型行为的探针。通过对比 40 组问题的回答分布并计算 JSD,识别模型身份的 EER 就能低至 7.3%。
鸭哥开源了一个轻量化看板(看板,代码见 GitHub),通过在本地 SQLite 记录原始回答,每天自动向端点跑 100 个问题并汇总 JSD 曲线。需要诚实指出这一工具的边界:它只能感应概率分布的变化,不能进行故障归因,也无法验证模型的真实身份。由于目前只积累了 1 天的基线,我们需要等待 7 到 14 天的连续观测,才能判断它能否成为生产环境的可靠温度计。点开原文可以查看实时看板与完整的本地轻量化检测架构。
[Anduril]:据报在进行一轮估值达 $100B 的融资,较去年涨了 3 倍以上。(TechCrunch)
[Anthropic]:发布了更强且更便宜的新模型 Opus 5,价格约为 Fable 5 的一半,主打 coding 与 agent 任务。(CNBC)
[Google]:一次发布了三款 Gemini 新模型,包括 3.6 Flash、3.5 Flash-Lite 和 3.5 Flash-Cyber,但 3.5 Pro 还没有准备好。(TechCrunch)
本期由 AI 基于鸭哥已发布文章和公开资料整理生成,请注意甄别幻觉。
订阅本 newsletter:daily.yage.ai
每天鸭哥的Agent会在深度领域调研后发送一封邮件。这个邮件不是一般的deep research,而是基于鸭哥的三层Memory系统,从鸭哥积累的领域知识和长期价值观出发,定制的主观的邮件报告。
[鸭哥 AI 手记] 2026-07-25: OpenAI发布Presence与Netflix用AI的300个title 懒人包:OpenAI Presence 把退款工单卡住转人工后的后半段改进做成了产品。此外,Netflix 披露了 300 个 title 接入 GenAI 的工作流,而智能音箱加入大模型后仍需重做三道交互关卡。昨天我们共发布了 3 篇 AI 文章。 OpenAI Presence 尝试把 FDE 的现场经验回流做成产品 7 月 22 日,OpenAI 发布了面向企业的 OpenAI Presence:把 FDE 的经验回流做成产品。一个用户提交退款工单,Agent 算不清金额卡住,自动转给人工客服。换在以前,人工处理完并在 CRM 里标记完成,事情就结束了。Presence 想收进产品的,是这之后的事:系统保存这次失败的完整运行上下文,团队在模拟环境里重现,补上规则并跑回归测试,最后用 Codex 改代码,让 Agent 下次能自己跑通。 OpenAI 自己用 Presence 运行英文支持热线 1-888-GPT-0090,在 10 天内通过 Codex...
[鸭哥 AI 手记] 2026-07-23: 72小时造热词,4小时跑实验:分辨AI虚与实 懒人包:Peter Steinheimer 12 个单词的推文在 72 小时内变成了全网热词。从概念包装的 Graph Engineering,到 Cursor 用 Swarm Harness 跑完 SQLite 实验,再到汽车与 CMOS 的工业史,这三篇文章指出了 AI 从叙事幻觉走向工程落地的临界点,今天最该关注 Graph Engineering 的虚实之争。 一条 12 个单词的推文怎么变成全网热词 鸭哥在 为什么你必须立刻开始学习 Graph Engineering? 中指出,7 月 17 日,曾加入 OpenAI 专注 Agent 技术的 PSPDFKit 创始人 Peter Steinheimer 在 X 上发了一句 12 个单词的调侃(Pragmatic Engineer)。他没有给任何定义,没有写一行代码。72 小时后,这句话变成了全网热词 Graph Engineering。控制流派忙着用它包装 DAG,平台商用它宣传校验,自媒体则借此兜售虚拟公司概念。甚至...
[鸭哥 AI 手记] 2026-07-21: 训练算合理使用,Anthropic 还是赔了 15 亿美元 懒人包:Anthropic 赔了 15 亿美元,但法院其实倾向认定训练符合 fair use,钱买的是硬盘上留存盗版书的诉讼风险。另外两篇文章指出,Sandbox 选型同名不同质,需要厘清运行状态与写操作控制;数学 Agent 协议则通过双循环严格隔离探索草稿与前提。 15 亿美元买的是什么 7 月 20 日,加州北区联邦法院批准了 Anthropic 与作家的 15 亿美元和解(Bloomberg Law)。这是美国史上最大的版权集体诉讼和解。但拿到这笔钱之前,法庭已经倾向于认定一件事:把书读进显存训练模型,属于 fair use。训练本身符合规范,问题出在同一份数字副本在硬盘里存了太久。 鸭哥在 同一本书,训练可算合理使用,盗版流程为何要赔 15 亿美元 中指出,Anthropic 联合创始人 Ben Mann 在 2021 至 2022 年间,明知是盗版仍从 LibGen 和 PiLiMi 下载了最高 700 万册图书(The...