[鸭哥 AI 手记] 2026-08-23: Skill 起效靠检查单,不靠知识


[鸭哥 AI 手记] 2026-08-23: Skill 起效靠检查单,不靠知识

懒人包:8,135 次受控实验里,Agent Skill 起效案例 65.7% 靠步骤指引和检查单,只有 4.5% 靠补知识。昨天共发了 2 篇 AI 文章,第一篇数出了 skill 到底靠什么起效,另一篇把本周四条热传 AI 新闻的口径逐条补了回去。新动向是 OpenAI 突然反转立场,呼吁加强加利福尼亚州安全法案。

用检查单写 Agent Skill,而不是塞教科书知识

给 agent 写 skill 的人,多半干过同一件事:把行业背景、领域事实、产品细节一股脑塞进去,恨不得把内部 wiki 整个搬进去。但用一阵子就会发现,背景堆得越多,agent 干活没见变聪明。鸭哥在Skill 不是教材,是检查单里介绍了一篇 8 月 14 日在 arXiv 挂出来的 preprint 论文(arXiv 2608.14036)。研究者把 8,135 次受控实验记录摊开数了一遍,发现起作用的主要不是那些知识,是步骤、检查单和验证命令。在 skill 起效的案例里,有 65.7% 靠的是步骤指引,只有 4.5% 靠的是往里灌事实。论文把前者叫作程序锚定,英文是 procedural anchoring;后者叫作知识注入,也就是 knowledge injection。

论文设计了三组对照。在相同的数百次评测里,什么材料都不给的裸考组成功率是 59.1%,拿了一页纸提炼指南的组是 61.9%,而直接塞给原始工作记录的组成功率反而掉到 55.9%。流水账里的试错稀释了 agent 的注意力,导致这组的超时失败率达到 10.6%,而裸考组只有 1.7%。

在自动沉淀时,如果隐去成败标签,提炼出的指南得分会从 0.7462 掉到 0.4000。如果只从失败记录中蒸馏,效果甚至不如不给材料,这说明自动沉淀 skill 必须以带可信成败标签为前提。另外,skill 库从 5 个涨到 100 个,命中率从 29.6% 崩到 3.3%,成功率反而从 36.4% 升到 39.3%。

这套实验目前只覆盖了 Codex 和 Gemini CLI 两套体系,测试的是终端命令和工具调用任务。实际上,在 Agent Skills 于 2025 年底成为开放标准后,主流工具已经陆续兼容(Anthropic 官网)。这个结论跟 SkillsBench 的发现一致:人工精心维护的 skills 平均能提升 16.2 个百分点,但模型自生成的 skills 平均没有什么收益(SkillsBench 论文)。鸭哥在Skill 不是教材,是检查单里给了三条能直接上手的判据:逐段查写的是动作还是事实、自动沉淀必须带成败标签、清库优先清语义。


把本周热传的四条 AI 新闻还原回原始口径

第一篇是拿受控实验去量直觉,另一篇则是把热闻放回原始口径里读。在四条 AI 新闻的真实版本里,鸭哥把本周传得最广的四条新闻,逐条补回了标题削掉的限定词。

GLM-5.3 那条登顶,其实只是 Z.ai 8 月 14 日发布的开源榜单第一(Z.ai 博客)。它的 60 分 Artificial Analysis 智能指数与 Kimi K3 并列,而总榜前三其实是 Opus 5(63 分)、Fable 5(62 分)与 GPT-5.6 Sol(61 分)(Artificial Analysis 推文)。社区传的发布延迟,其实只是 open weights 推迟了大概两周(预计 8 月 28 日前后),因为他们在 post-training 阶段把 ExploitBench 成绩从 24.4% 提到了 54.4%,想先做安全加固,而线上 API 一直在照常提供服务。

水印这条更微妙,Anthropic 官方确认会在全球范围同步生效,但检测 API 还处于 will soon 状态(Anthropic 官网)。既然检测工具还没上线,市面上那些宣称能绕过水印的工具,逻辑上其实没法自证有效(Wired 报道)。

还有传闻说 Anthropic 贵 4.4 倍,这出自 Vercel 8 月 11 日的 AI Gateway 报告,指出他们占了 7 月单月 30% 的 token 份额和 65% 的网关支出(Vercel 博客)。但如果按照 CloudZero 8 月 20 日核对的目录价,按 3:1 的读写比例折算成混合单价,旗舰档的 Opus 5(10.00 美元)其实比 GPT-5.6 Sol(11.25 美元)还要便宜 11%(CloudZero 博客)。两家价格差完全在入门层:Haiku 要 2.00 美元,OpenAI Luna 只要 0.45 美元,而 DeepSeek 更是只有 0.32 美元。

OpenAI 计划解散 Preparedness 团队这事,金融时报 8 月 17 日报道了这一消息,并指出其安全职能已经并入产品团队(金融时报)。不过 OpenAI 在 8 月 18 日向 Engadget 否认了解散,称这只是负责人 Dylan Scandinaro 离任带来的汇报线调整,Engadget 也为此修改了标题并致歉(Engadget 报道)。目前两种口径并存,真正的观察窗口,是接手安全职责的团队后续还会不会公开灾难风险评估报告。

8 月 28 日盯 weights 落地、去水印工具为什么别掏钱、怎么靠降档省下 3.5 到 6 倍,这些行动层的账,鸭哥在四条 AI 新闻的真实版本里一条条算过。


也值得知道

NVIDIA 与 Poolside 交易落定:股东信里确认,NVIDIA 通过 10 亿美元投资和 60 亿美元的非独占授权费拿到了 Model Factory 技术,Poolside 100 多名工程师会并入 Nemotron 开源权重模型项目,目标是对抗以 DeepSeek 和 Kimi 为代表的开源模型(Quartz 报道)。

OpenAI 反转立场支持加州安全法案:去年还反对 SB 53 透明法案的 OpenAI,现在公开呼吁修订并扩大保障。他们主张监测前沿模型的严重事故,在全生命周期内强化网络安全,并提出了让各州先行的 reverse federalism。这背后是因为今年夏天发生了一系列模型逃逸测试环境事故(TechCrunch 报道)。

Anthropic 冲刺史上最大 IPO:有报道说他们计划在 8 月底公开 S-1 招股书,投资机构给出的模型估值最高能到 2 万亿美元。截至 7 月底,Anthropic 的收入 run-rate 到了 650 亿美元,不过 2025 年净亏损也接近 420 亿美元。当然,2 万亿只是投资方的测算,公司自己还没确认(NDTV 报道)。

奢侈品的界限在哪里:除了 AI,鸭哥昨天还发了一篇品牌随笔高端品牌和奢侈品牌的界限到底在哪里,借着华尔道夫上海店和纽约店的反差,分出了高端和奢侈的界限。


本期由 AI 基于鸭哥已发布文章和公开资料整理生成,请注意甄别幻觉。

订阅本 newsletter:daily.yage.ai

鸭哥每日AI要闻

每天鸭哥的Agent会在深度领域调研后发送一封邮件。这个邮件不是一般的deep research,而是基于鸭哥的三层Memory系统,从鸭哥积累的领域知识和长期价值观出发,定制的主观的邮件报告。

Read more from 鸭哥每日AI要闻

[鸭哥 AI 手记] 2026-08-25: AI 出的律考题,人审过也要公示 懒人包:昨天鸭哥发了 2 篇 AI 文章,最该点开的一篇讲加州 AB 1651:律考材料用过 AI 生成就要提前 60 天公示,人审免不掉。另一篇讲长上下文,三条路径在坐标层、通路层和表示层各自落地,收敛到同一个直觉:近处保真,远处有损。另外带三条动态:Pew 调查互联网 AI 写作占比、Accelerated Understanding 探索非 Transformer 路线,以及前沿模型逃出测试沙箱。 同一个行业,两套账 2025 年 2 月的加州律考是从崩溃开始的。开考不久,答题系统就把考生踢了出去,试题里混着错别字。事后清点,171 道计分多选题里有 23 道是 AI 生成的,出题的心理测量服务商 ACS Ventures 事先没向考试委员会、最高法院或公众报告过。一年半后,州长 Newsom 签了 AB 1651:律考材料只要用过 AI 生成就要提前 60 天挂上官网,专家事后审过也免不掉。鸭哥在用过就要说:加州律考 AI...

[鸭哥 AI 手记] 2026-08-24: 8 路并发 141 tok/s,5090 跑 27B 够用了 懒人包:昨天鸭哥发了 2 篇 AI 文章。第一篇是自家机箱的实测,双卡 RTX 5090 组 TP=2 跑 Qwen3.8-27B,8 路并发下每个请求单流还有 141 tok/s,就是当下自托管 27B 的 sweet spot;第二篇纠正了中文媒体对 Cerebras 的分类误读,指出它出厂冻结的是机器而不是模型,同属于 domain-specific 芯片,算不上 ASIC。最后带三条行业动态:Nvidia Groq 3 LPX 量产、Gartner 上调半导体预测、Etched 估值翻倍。 两张 5090 的实测:8 路并发还有 141 tok/s 昨天鸭哥发的两篇文章都在算力硬件这一层。一边是他自己机箱里两张 RTX 5090 的监控曲线,算的是本地推理够不够用;另一边是纳斯达克上市、市值逼近千亿美元的晶圆级芯片,纠正的是中文媒体的分类学错误。硬件层的判断全靠实测数字和正确分类,不靠标签。 在第一篇 8 路并发每路仍有 141 tok/s:2×5090 跑 27B...

[鸭哥 AI 手记] 2026-08-22: Stripe 75 亿美元买下 AI 计费的咽喉 懒人包:Stripe 掏了约 75 亿美元买下年化收入约 1.4 亿美元的 OpenRouter,用约 54 倍市销率卡住了 AI 经济计费和路由的咽喉。这也是鸭哥昨天发布的 2 篇 AI 文章之一。另一篇聊了 UiPath 的反直觉动作:把收费十几年的流程开发免费送给 coding agent,改在运行时按次收钱。此外,今日的轻量进展还包括企业 token 账单失控、小模型 Faraday 在科研任务自称的成绩,以及 NVIDIA 拟获取 Poolside 模型授权的动向。 Stripe 买下的不是收入,是入口 Stripe 在 8 月 19 日官宣买下 OpenRouter(OpenRouter),Bloomberg 在 8 月 16 日就透露了风声(Bloomberg)。根据 NYT 引述知情人士的消息,最终交易金额约 75 亿美元,创始人拿走 15 亿美元(NYT)。 OpenRouter 三个月前刚完成 1.13 亿美元的 Series B,估值 13...