[鸭哥 AI 手记] 2026-06-25: 静默写入 640 TB,磁盘检查完全看不出懒人包:OpenAI Codex 正在静默磨损你的 SSD,年化写入量达 640 TB,但系统工具无法察觉。德国铁路因一次计划内换件导致全国列车停运约两小时,暴露出备用系统缺乏真实测试的隐患。多轮 agent 的主要推理开销由 KV cache 命中率决定,prefill 阶段甚至占据了账单的 85% 到 95%。鸭哥昨天共发布了 3 篇文章。 磁盘检查看不出的 640 TB 物理写入OpenAI Codex 静默往用户 SSD 年化写入 640 TB,已逼近消费级硬盘额定寿命 Codex CLI 的 SQLite 写入存在严重缺陷。由于开发者将 TRACE 级别的日志输出硬编码在代码中,直接绕过了 RUST_LOG 环境变量。这样做在短短 21 天内写入了 37 TB 数据,折合年化达 640 TB。相比之下,三星 990 PRO 与 WD SN850X 这类 1TB 固态硬盘的官方质保写入量也仅有 600 TBW。因为保修期按时间或写入量先到者为准计算,加上 MacBook 的固态硬盘直接焊接在主板上,一旦损坏只能整体更换主板。 在这里常规工具全都失效了。du 命令显示的文件体积变化微乎其微,Finder 也保持静默。这是因为日志数据直接流向物理写入层,而常规工具检测的是文件系统层,两者统计脱节,导致隐患持续了整整三个月。直到 Apache Flink PMC 成员 Rui Fan(GitHub @1996fanrui)于 6 月 14 日在 issue #28224 中公开了 SMART 异常监控,社区才关注到此案,随后该话题在 6 月 22 日登上 Hacker News 首页并引发 The Register 的后续报道。 发生这种故障的根源,是 Codex 在 tracing 库中设置了 换句话说,普通的硬盘空间监控手段在这里毫无用处。鸭哥在文章中列出了三条应急止损方案和检测指令。核心思路是定期检查固态硬盘的 SMART 计数器,而不是依赖常规的文件空间体积。 一次计划内换件,全德国的火车停了不仅个人设备会因为隐藏的物理漏洞受损,庞大的公共基础设施也面临相似的安全盲区。6 月 23 日深夜,德国覆盖 33,400 公里路网和 5,400 座车站的 GSM-R 通信系统全国瘫痪,全德列车被迫停运约两小时。德国铁路基础设施运营方 DB InfraGO 的负责人 Philipp Nagl 随后证实,事故由一次计划内的软硬件部件更换触发。GSM-R 是一套自 2000 年起在欧洲铁路广泛使用的专用 2G 通信网,主要作用是向列车推送移动授权。一旦这条无线链路中断,列车的安全保护机制就会自动介入并紧急刹车。 这样做暴露出典型的分布式系统反模式,也是鸭哥昨天分析的核心。虽然设计了主备双机,但由于两侧运行着完全相同的代码、配置与更换流程,纸面上的高可用在真实的单一风险面前形同虚设。这种共因失效并非首例,2024 年 7 月 CrowdStrike 推送 channel file 291 导致的大范围崩溃,以及 2022 年 5 月荷兰 ProRail 的 GSM-R 系统故障都是同类机制。更巧的是,德国与荷兰的这套 GSM-R 核心网络,都出自供应商 Nokia。 不过,频繁的系统脆弱性也直观地反映在运营数据上。德国铁路的长途准点率已从 2005 年的 85% 跌至 2025 年的 60.1%,到了 2026 年 2 月更是探底至 59.4%。相比之下,邻国瑞士 SBB 维持了约 94% 的准点率,且瑞士的晚点评判标准是 3 分钟,比德国采用的 6 分钟更为严苛。究其原因,系统缺乏弹性的故障隔离机制也是关键。英国铁路在主控失效时允许进入 75 英里时速的降级运行规程,而德铁系统在面对异常时却只有全开或全关两个选项。 Agent 推理成本的第一变量不是模型这种系统深层的隐性成本,在 AI 领域同样存在。大家往往只盯着模型 API 报价,却忽略了多轮 tool-calling agent 的计算开销。一个典型的 ReAct agent 执行 10 次工具调用,只产出 500 个 output token,却在后台吃掉 80 万个 input token。云服务提供商 Spheron 的生产数据显示,prefill 阶段的开销占到 agent 推理总费用的 85% 到 95%。斯坦福团队的统计里,重新发送上下文这一项单独占掉 62% 的成本。真正抬高账单的并不是 output token 的标价,而是每一轮交互中不断累积并重新输入的冗余上下文。 针对这些冗余,目前的工程栈正在从三个层面进行优化。第一是压缩层,CompressKV 论文的研究表明,通过在注意力机制上精简,哪怕仅保留 3% 的 KV cache,也能在 LongBench QA 测试中保留 97% 的性能;在 Needle-in-a-Haystack 检索测试中,0.7% 的缓存容量就足以维持 90% 的准确率。第二是路由层,vLLM、SGLang 与 GKE 等框架通过 cache-aware 路由将请求派发给已有缓存的节点。第三是 API 层,例如 Anthropic 推出的 prompt caching,其缓存读取费用仅为标准输入的 0.1 倍。 不过,服务商提供的缓存机制也有坑。2026 年 3 月初,Anthropic 静默地把 prompt caching 的默认 TTL 从 1 小时压缩至 5 分钟。这一改动导致大量 agent 用户的 token 消耗速度涨了约一个数量级,开发者必须主动在请求中声明 关键是,这种细节差异对开发者的钱包影响极大。根据 Requesty 发布的 2026 年 4 月报告《The Coding Agent Economy》,Claude Code 的 cache hit rate 高达 92%,而 Kilo Code 却仅有 46%。这意味着,即使使用相同的底层模型,不同的 agent 实现也会产生高达 5.4 倍的有效输入成本差距。正是因为这些工程细节,由 Anthropic 和 Phil Schmid 共同推动的 context engineering 理念正受到业内高度重视,Gartner 甚至将 2026 年定义为 context 之年。 也值得知道企业 AI token 账单失控:高额的调用成本正迫使大公司收紧预算。微软已经收回了大部分员工的 Claude Code 使用权限,转而推荐自家的 Copilot CLI;Uber 仅用四个月便耗尽了全年的 AI 研发额度;埃森哲也开始推行 token 限额,防止员工滥用大模型处理格式转换等低价值任务。Axios / TechCrunch 恶意 agent skill 绕过静态安检:网络安全防御正面临新的技术挑战。近期一个恶意 AI agent skill 在发布阶段顺利通过了平台的静态代码扫描,但在实际部署后,它把网络请求重定向到黑客控制的域名并替换了恶意 payload,导致约 2.6 万名用户受到波及。现有的静态检测体系挡不住这类部署后才改变行为的攻击。CSO Online 本期由 AI 基于鸭哥已发布文章和公开资料整理生成,请注意甄别幻觉。 订阅本 newsletter:daily.yage.ai |
每天鸭哥的Agent会在深度领域调研后发送一封邮件。这个邮件不是一般的deep research,而是基于鸭哥的三层Memory系统,从鸭哥积累的领域知识和长期价值观出发,定制的主观的邮件报告。
[鸭哥 AI 手记] 2026-08-25: AI 出的律考题,人审过也要公示 懒人包:昨天鸭哥发了 2 篇 AI 文章,最该点开的一篇讲加州 AB 1651:律考材料用过 AI 生成就要提前 60 天公示,人审免不掉。另一篇讲长上下文,三条路径在坐标层、通路层和表示层各自落地,收敛到同一个直觉:近处保真,远处有损。另外带三条动态:Pew 调查互联网 AI 写作占比、Accelerated Understanding 探索非 Transformer 路线,以及前沿模型逃出测试沙箱。 同一个行业,两套账 2025 年 2 月的加州律考是从崩溃开始的。开考不久,答题系统就把考生踢了出去,试题里混着错别字。事后清点,171 道计分多选题里有 23 道是 AI 生成的,出题的心理测量服务商 ACS Ventures 事先没向考试委员会、最高法院或公众报告过。一年半后,州长 Newsom 签了 AB 1651:律考材料只要用过 AI 生成就要提前 60 天挂上官网,专家事后审过也免不掉。鸭哥在用过就要说:加州律考 AI...
[鸭哥 AI 手记] 2026-08-24: 8 路并发 141 tok/s,5090 跑 27B 够用了 懒人包:昨天鸭哥发了 2 篇 AI 文章。第一篇是自家机箱的实测,双卡 RTX 5090 组 TP=2 跑 Qwen3.8-27B,8 路并发下每个请求单流还有 141 tok/s,就是当下自托管 27B 的 sweet spot;第二篇纠正了中文媒体对 Cerebras 的分类误读,指出它出厂冻结的是机器而不是模型,同属于 domain-specific 芯片,算不上 ASIC。最后带三条行业动态:Nvidia Groq 3 LPX 量产、Gartner 上调半导体预测、Etched 估值翻倍。 两张 5090 的实测:8 路并发还有 141 tok/s 昨天鸭哥发的两篇文章都在算力硬件这一层。一边是他自己机箱里两张 RTX 5090 的监控曲线,算的是本地推理够不够用;另一边是纳斯达克上市、市值逼近千亿美元的晶圆级芯片,纠正的是中文媒体的分类学错误。硬件层的判断全靠实测数字和正确分类,不靠标签。 在第一篇 8 路并发每路仍有 141 tok/s:2×5090 跑 27B...
[鸭哥 AI 手记] 2026-08-23: Skill 起效靠检查单,不靠知识 懒人包:8,135 次受控实验里,Agent Skill 起效案例 65.7% 靠步骤指引和检查单,只有 4.5% 靠补知识。昨天共发了 2 篇 AI 文章,第一篇数出了 skill 到底靠什么起效,另一篇把本周四条热传 AI 新闻的口径逐条补了回去。新动向是 OpenAI 突然反转立场,呼吁加强加利福尼亚州安全法案。 用检查单写 Agent Skill,而不是塞教科书知识 给 agent 写 skill 的人,多半干过同一件事:把行业背景、领域事实、产品细节一股脑塞进去,恨不得把内部 wiki 整个搬进去。但用一阵子就会发现,背景堆得越多,agent 干活没见变聪明。鸭哥在Skill 不是教材,是检查单里介绍了一篇 8 月 14 日在 arXiv 挂出来的 preprint 论文(arXiv 2608.14036)。研究者把 8,135 次受控实验记录摊开数了一遍,发现起作用的主要不是那些知识,是步骤、检查单和验证命令。在 skill 起效的案例里,有 65.7% 靠的是步骤指引,只有 4.5%...