[鸭哥 AI 手记] 2026-07-23: 72小时造热词,4小时跑实验:分辨AI虚与实


[鸭哥 AI 手记] 2026-07-23: 72小时造热词,4小时跑实验:分辨AI虚与实

懒人包:Peter Steinheimer 12 个单词的推文在 72 小时内变成了全网热词。从概念包装的 Graph Engineering,到 Cursor 用 Swarm Harness 跑完 SQLite 实验,再到汽车与 CMOS 的工业史,这三篇文章指出了 AI 从叙事幻觉走向工程落地的临界点,今天最该关注 Graph Engineering 的虚实之争。

一条 12 个单词的推文怎么变成全网热词

鸭哥在 为什么你必须立刻开始学习 Graph Engineering? 中指出,7 月 17 日,曾加入 OpenAI 专注 Agent 技术的 PSPDFKit 创始人 Peter Steinheimer 在 X 上发了一句 12 个单词的调侃(Pragmatic Engineer)。他没有给任何定义,没有写一行代码。72 小时后,这句话变成了全网热词 Graph Engineering。控制流派忙着用它包装 DAG,平台商用它宣传校验,自媒体则借此兜售虚拟公司概念。甚至 Eigent AI 借势给桌面平台打标签,LangGraph 也急于证明其 2024 年推出的 StateGraph 原语是正确的(LangChain Blog)。但实际上,用图组织代码逻辑的技术创新为零,早在 2014 年 Apache Airflow 就已使用这种拓扑。

这股热度在两周内快速退烧(Turing Post),背后的数据揭示了多 Agent 的高昂代价。MAST 论文分析了 1,642 条轨迹,指出多 Agent 协调失败率高达 41-86.7%(arXiv)。Anthropic 的报告也显示多 Agent 会消耗 15 倍 token(Anthropic)。相反,Rethinking 论文表明,单 Agent 运行相同拓扑不仅效果相当,成本还低得多(arXiv)。

比起在概念里打转,同一周里有人直接用受控实验来探底。


Cursor 花了 4 小时,然后公开承认它不够用

鸭哥在 Cursor 重写 SQLite:一次把 Harness Engineering 三个维度同时往前推的理想实验 中,拆解了 Wilson Lin 发布的 Cursor 实验(Cursor Blog)。他们做了一个受控实验:让 Agent 用 835 页 SQLite 手册从零写一个数据库引擎,并通过 SQLite 作者 D. Richard Hipp 开发的 sqllogictest 验证逻辑正确性(SQLite)。新设计的 Swarm Harness 搭配 Grok 4.5,在 4 小时内就达到了 80% 的通过率,并最终在所有配置下实现 100% 通过。相比之下,旧版 Swarm 在第 2 小时前就因代码冲突失控,Cursor 团队暂停了它的运行。

这次实验把代码冲突从旧版浏览器实验的 70,000 多次降到了新实验中的 1,000 次以内。成本对比同样悬殊:单独跑 GPT-5.5 消耗了 10,565 美元,而用 Opus 4.8 作为 planner、Composer 2.5 作为 worker 的混合方案只花了 1,339 美元,其中 worker 舰队只占 411 美元。但我们不能直接把这个数字外推为通用的 15 倍省钱方案。

他们把代码开源在 cursor/minisqlite 仓库里(GitHub)。虽然包含了 20 万行 Rust、14 个 crate 和 5,650 个测试,目前拿到了约 90 个 star 并处于静态归档状态。但它没有 CLI、没有 C API、没有 prepared statement,甚至没有跨进程文件锁。Hacker News 上的讨论赞赏其 Harness 工程,但也指出它缺失工程接口(Hacker News),证明 minisqlite 离生产可用还差得很远。

Cursor 的受控实验指出了 Swarm 在特定任务下的性价比,但一项技术能否真正跨过临界点成为行业标配,往往不单由 benchmark 决定。


技术在 benchmark 之外的真实账本

鸭哥在 涡轮和电车如何跨过临界点:AI 竞争也不只看技术 中,用工业史做了一个类比。欧洲的 EC 443/2009 排放法规规定,超标排放的罚金等于超标克数乘以 95 欧元,再乘以注册车辆总数(EUR-Lex)。这笔罚金强行改写了汽车厂商的成本账本,催生了涡轮增压技术的普及。而如今,混合动力又让自然吸气发动机回归,因为电机接管了起步加速,Toyota 2.5L 混动发动机热效率做到了 41%(Toyota)。类似地,手机拍照的兴起给 CMOS 带来了大市场,Sony 等厂商随后补齐了它比肩 CCD 的画质短板。根据 NBER 论文估算,电池的 learning-by-doing 效应让累计经验每翻倍,单位成本就下降约 7.5%(NBER)。到了 2025 年,中国 NEV 份额也已达到 54%(China Daily)。

这套逻辑正在进入 AI 行业。合规政策将像当年的排放法规一样改写供应商的成本结构。例如,欧盟 AI Act 的核心条款将在 2026 年 8 月 2 日全面生效,要求企业采购时嵌入数据驻留与可审计条款(Market Dojo)。高风险 AI 供应商的前期合规投入高达 20 至 60 万欧元,每年维护还需要 8 至 15 万欧元(Ovidiu Suciu)。决定 AI 能否落地的,正是这些隐蔽在 benchmark 之外的合规与商业账本。


也值得知道

Amazon Q 曝出 MCP 高危漏洞:Wiz 披露 VS Code 中的 Amazon Q 插件存在 CVE-2026-12957 漏洞,攻击者可能在 AI Coding Agent 调用本地 MCP 工具时诱导其执行恶意代码并泄露云凭证(Wiz)。

Alphabet AI 资本支出调高至 2000 亿美元:谷歌母公司将 2026 年 AI 相关资本支出指引调高至约 2000 亿美元,单季度达到 450 亿美元,引发了市场对算力回报率的争论(Yahoo Finance)。

Qwen 3.8 tMax 与 Kimi K3 引发开源安全讨论:阿里和月之暗面分别推出高性能开放权重模型,其 benchmark 表现促使美欧政策制定者重新审视开源模型的安全评估边界(HPCwire)。


本期由 AI 基于鸭哥已发布文章和公开资料整理生成,请注意甄别幻觉。

订阅本 newsletter:daily.yage.ai

鸭哥每日AI要闻

每天鸭哥的Agent会在深度领域调研后发送一封邮件。这个邮件不是一般的deep research,而是基于鸭哥的三层Memory系统,从鸭哥积累的领域知识和长期价值观出发,定制的主观的邮件报告。

Read more from 鸭哥每日AI要闻

[鸭哥 AI 手记] 2026-07-25: OpenAI发布Presence与Netflix用AI的300个title 懒人包:OpenAI Presence 把退款工单卡住转人工后的后半段改进做成了产品。此外,Netflix 披露了 300 个 title 接入 GenAI 的工作流,而智能音箱加入大模型后仍需重做三道交互关卡。昨天我们共发布了 3 篇 AI 文章。 OpenAI Presence 尝试把 FDE 的现场经验回流做成产品 7 月 22 日,OpenAI 发布了面向企业的 OpenAI Presence:把 FDE 的经验回流做成产品。一个用户提交退款工单,Agent 算不清金额卡住,自动转给人工客服。换在以前,人工处理完并在 CRM 里标记完成,事情就结束了。Presence 想收进产品的,是这之后的事:系统保存这次失败的完整运行上下文,团队在模拟环境里重现,补上规则并跑回归测试,最后用 Codex 改代码,让 Agent 下次能自己跑通。 OpenAI 自己用 Presence 运行英文支持热线 1-888-GPT-0090,在 10 天内通过 Codex...

[鸭哥 AI 手记] 2026-07-24: 美军只给新模型 30 天:慢比不完美更危险 懒人包:美军新战略要求在公开发布后 30 天内部署最新模型,并断言动作太慢的危险已大过模型不够完美对齐的风险。为了应对不完美状态,OpenAI 官方指南做出了少写步骤、写清交付的类似转向,而我们在生产端也能通过每天问 100 个无聊问题来低成本搭建 API 温度计。今天发布了三篇文章,如果你正在头疼 agent 落地,建议最先点开第一篇关于部署护栏的拆解。 美军只给新模型 30 天,还说慢比不完美更危险 1 月 9 日,美军 Secretary of War Hegseth 签发了一份战略备忘录(Nextgov 分析)。文件要求 CDAO 建立交付节奏,确保最新模型在发布后 30 天内可部署上线,并把此项设为未来的首要采购标准。备忘录写道:动作太慢的危险已经大过模型不够完美对齐的风险。每一次决策失误都可能付出生命代价的军方,选择用具体的机制来管理不完美模型,而不是无限期等待完美对齐。 鸭哥在AI Agent 不必等模型完美:美军给 AI Builder...

[鸭哥 AI 手记] 2026-07-21: 训练算合理使用,Anthropic 还是赔了 15 亿美元 懒人包:Anthropic 赔了 15 亿美元,但法院其实倾向认定训练符合 fair use,钱买的是硬盘上留存盗版书的诉讼风险。另外两篇文章指出,Sandbox 选型同名不同质,需要厘清运行状态与写操作控制;数学 Agent 协议则通过双循环严格隔离探索草稿与前提。 15 亿美元买的是什么 7 月 20 日,加州北区联邦法院批准了 Anthropic 与作家的 15 亿美元和解(Bloomberg Law)。这是美国史上最大的版权集体诉讼和解。但拿到这笔钱之前,法庭已经倾向于认定一件事:把书读进显存训练模型,属于 fair use。训练本身符合规范,问题出在同一份数字副本在硬盘里存了太久。 鸭哥在 同一本书,训练可算合理使用,盗版流程为何要赔 15 亿美元 中指出,Anthropic 联合创始人 Ben Mann 在 2021 至 2022 年间,明知是盗版仍从 LibGen 和 PiLiMi 下载了最高 700 万册图书(The...