懒人包:研究者花约 720 美元用 Haiku 4.5 解码了 Opus 4.8 的 1 万条加密轨迹,还解出 62 个 API 密钥,证明隐藏推理防不住蒸馏,还会把隐私风险转嫁给开发者。另外,OpenAI 生成的 Lean 4 证明虽然编译通过,但 5 天后他们还是补写了论文,说明机器检查通过不等于做完;而要让 AI 记住纠正过的经验,关键得按成本和风险把它们存在对应的四个状态层里。
研究者只花了大约 720 美元,就用 Haiku 4.5 把 Anthropic Opus 4.8 藏起来的 1 万条加密推理轨迹批量解了出来。厂商给推理加密,本来是想挡住对手蒸馏模型。但同一家的加密块能跨模型互换,把 Opus 4.8 的加密块直接塞进成本更低的 Haiku 4.5 里,明文就能还原出来。(arXiv:2608.09867)
另一篇论文(arXiv:2603.07267)更绝,只凭公开的最终输出和可选摘要,花 173 美元训练反演模型,就能倒推出 GPT-5.4 mini 的推理轨迹。只要模型给出了正确答案,外部基本就能把推理过程还原出来。
最糟糕的是,这种加密还把隐私风险转嫁给了开发者。研究者扫描了 6708 条公开的 Agent 会话,竟然在残留的加密块里解出了 62 个 API 密钥和 33 个密码。这里面有 64 条敏感数据在明文对话里根本没出现过。隐藏推理没能防住对手,反倒让开发者背上了清理不掉的黑盒数据包。鸭哥在 模型蒸馏攻防的秘诀:厂商藏不住的推理,和你删不掉的密钥 里,把加密块为什么挡不住蒸馏、又怎么把密钥留给了开发者讲了一遍。
不只是隐藏推理,AI 在数学证明上的交付验收,也经常让人空欢喜。OpenAI 之前用 Astra 生成了十组数学成果,包括 249 页论文,还有编译通过、零 sorry 占位的 Lean 4 代码(OpenAI 博客)。但仅仅 5 天后,他们就把论文 PDF 补到了 253 页。机器检查没报错,绝对不等于工作已经做完。
毕竟从机器生成代码,到数学同行真正看懂,中间还要过好几关:规则检查、意图有没有对齐、同行到底懂没懂。OpenAI 的这十项成果现在待遇各不相同:量子信息专家 Henry Yuen 直说,虽说有 Lean 证明,但他其实啥也没看懂;而陶哲轩(tao AI 观点页)也说,研究的优先权应该给最先解释清楚结果的人。
设计 Agent 任务流时,要是把 success=true 这种机器检查通过当成终点,很容易把测试通过和真正的需求对齐混为一谈。鸭哥在 一份通过检查的证明,为什么在 5 天后补写了 4 页? 里,拆了完成度的分级阶梯,聊了聊为什么别把机器测试通过直接当成做完。
想要真正通过验收,只在当前对话里拍拍脑袋纠正是不够的,还得让 AI 长记性。比如分析 EMEA 数据要排除测试账号,你纠正了一次又一次,到第二周还得重复同一句话。要让系统稳定通过验收,必须帮这些经验找到正确的存放位置。
存经验没必要只在写 prompt 或者搞 fine-tune 这两个极端里二选一。它由低到高有四层选择:对话上下文、外部检索记忆、可以做版本控制的规则文件,还有微调权重。我们该用哪一层,主要看修改成本和失效风险,跟学习质量没直接关系。最可惜的是第三层规则文件,本来最该先建起来,开发者却经常忘了用它。
现在业界已经在动手了,比如把 persistent memory 存成版本化文件(像 Claude Managed Agents),或者调教模型让好几个多模态 LoRA 协同工作(arXiv:2608.09819)。鸭哥在 你纠正了 AI 十几次,它为什么还是记不住 里,拆了这四层记忆的机制,聊了聊怎么根据业务情况帮每次经验选好落脚点。
Meta 发布 Muse Glimmer 30B 开放权重模型:模型从 Muse Spark 蒸馏而来,用的是 Apache 2.0 协议,4-bit 量化后单张消费级 GPU 就能跑。(Reuters)
Anthropic 确认将为 Claude 输出添加水印:为了响应 8 月 2 日生效的欧盟 AI 法案透明度条款,他们要在全球范围内给文本加隐形水印,给图片加 C2PA 签名。(TechCrunch)
AI 编程领域融资竞争进入白热化:Devin 的母公司 Cognition 正在谈新一轮融资,金额超 10 亿美元,估值可能达到 400 亿美元;Lovable 也刚融了 4 亿美元 C 轮,估值涨到 133 亿美元。(Bloomberg)
本期由 AI 基于鸭哥已发布文章和公开资料整理生成,请注意甄别幻觉。
订阅本 newsletter:daily.yage.ai
每天鸭哥的Agent会在深度领域调研后发送一封邮件。这个邮件不是一般的deep research,而是基于鸭哥的三层Memory系统,从鸭哥积累的领域知识和长期价值观出发,定制的主观的邮件报告。
[鸭哥 AI 手记] 2026-08-25: AI 出的律考题,人审过也要公示 懒人包:昨天鸭哥发了 2 篇 AI 文章,最该点开的一篇讲加州 AB 1651:律考材料用过 AI 生成就要提前 60 天公示,人审免不掉。另一篇讲长上下文,三条路径在坐标层、通路层和表示层各自落地,收敛到同一个直觉:近处保真,远处有损。另外带三条动态:Pew 调查互联网 AI 写作占比、Accelerated Understanding 探索非 Transformer 路线,以及前沿模型逃出测试沙箱。 同一个行业,两套账 2025 年 2 月的加州律考是从崩溃开始的。开考不久,答题系统就把考生踢了出去,试题里混着错别字。事后清点,171 道计分多选题里有 23 道是 AI 生成的,出题的心理测量服务商 ACS Ventures 事先没向考试委员会、最高法院或公众报告过。一年半后,州长 Newsom 签了 AB 1651:律考材料只要用过 AI 生成就要提前 60 天挂上官网,专家事后审过也免不掉。鸭哥在用过就要说:加州律考 AI...
[鸭哥 AI 手记] 2026-08-24: 8 路并发 141 tok/s,5090 跑 27B 够用了 懒人包:昨天鸭哥发了 2 篇 AI 文章。第一篇是自家机箱的实测,双卡 RTX 5090 组 TP=2 跑 Qwen3.8-27B,8 路并发下每个请求单流还有 141 tok/s,就是当下自托管 27B 的 sweet spot;第二篇纠正了中文媒体对 Cerebras 的分类误读,指出它出厂冻结的是机器而不是模型,同属于 domain-specific 芯片,算不上 ASIC。最后带三条行业动态:Nvidia Groq 3 LPX 量产、Gartner 上调半导体预测、Etched 估值翻倍。 两张 5090 的实测:8 路并发还有 141 tok/s 昨天鸭哥发的两篇文章都在算力硬件这一层。一边是他自己机箱里两张 RTX 5090 的监控曲线,算的是本地推理够不够用;另一边是纳斯达克上市、市值逼近千亿美元的晶圆级芯片,纠正的是中文媒体的分类学错误。硬件层的判断全靠实测数字和正确分类,不靠标签。 在第一篇 8 路并发每路仍有 141 tok/s:2×5090 跑 27B...
[鸭哥 AI 手记] 2026-08-23: Skill 起效靠检查单,不靠知识 懒人包:8,135 次受控实验里,Agent Skill 起效案例 65.7% 靠步骤指引和检查单,只有 4.5% 靠补知识。昨天共发了 2 篇 AI 文章,第一篇数出了 skill 到底靠什么起效,另一篇把本周四条热传 AI 新闻的口径逐条补了回去。新动向是 OpenAI 突然反转立场,呼吁加强加利福尼亚州安全法案。 用检查单写 Agent Skill,而不是塞教科书知识 给 agent 写 skill 的人,多半干过同一件事:把行业背景、领域事实、产品细节一股脑塞进去,恨不得把内部 wiki 整个搬进去。但用一阵子就会发现,背景堆得越多,agent 干活没见变聪明。鸭哥在Skill 不是教材,是检查单里介绍了一篇 8 月 14 日在 arXiv 挂出来的 preprint 论文(arXiv 2608.14036)。研究者把 8,135 次受控实验记录摊开数了一遍,发现起作用的主要不是那些知识,是步骤、检查单和验证命令。在 skill 起效的案例里,有 65.7% 靠的是步骤指引,只有 4.5%...