懒人包:6 月 12 日一条针对 Anthropic 的商务部指令让 Fable 5 在全球下线了 19 天,Mythos 5 至今只对少数美国组织开放;7 月 13 日华邮又据报披露美国在讨论把美国开放模型性能上限设为中国模型水平。同一周,鸭哥还梳理了 Agent 托管平台在状态恢复机制上的三条路,以及用 DSL 给大模型建一个更小可执行世界的工程思路。昨天共发了 3 篇 AI 文章。
在第一篇 「中国模型参照线」传闻背后:美国为什么从芯片管到 API 中,分析了美国官方对 AI 管制的最新走向。6 月 12 日,Anthropic 接到美国商务部指令,要求把 Fable 5 和 Mythos 5 对所有外国用户关闭。Claude 是集中式 API,没法在每次调用前实时核验用户国籍。Anthropic 当天对全球所有人停服这两个模型。Fable 5 直到 7 月 1 日才在 Claude.ai 全球恢复(来源:Reuters 与 CNBC),Mythos 5 至今只对参与 Glasswing 网络安全项目的少数美国组织开放。
这不是单一事件。OpenAI 6 月 26 日发布 GPT-5.6,应美国官方要求把首批用户限制在约 20 个 trusted-partner 机构,13 天后才全面公开(来源:TechCrunch)。7 月 13 日,《华盛顿邮报》 披露美国政府在讨论一个开放权重框架,可能把美国公司开放权重模型的性能上限设为中国最佳开放权重模型水平。
美国官方目前把管制划分为四条通道:芯片管训练投入,云算力限制没生效,模型权重通过 BIS 的 AI Diffusion Rule 限制出口,托管 API 仍属管制灰色地带。管制不断向下游推移,是因为全球用户已经下载了开源模型,且这些模型在 Cloudflare 和 Amazon Bedrock 上都可用,一旦发布就无法收回。新签署的 EO 14409(来源:Congressional Research Service)要求 NSA 在 60 天内建立 covered frontier model 的评估流程,评估模型网络能力。这套流程不搞强制许可,开发者自愿提供 30 天预发布访问。但当集中式 API 接到难以细分执行的出口管制要求时,结果往往是全球用户一起失去访问。
政府能管到哪一步,取决于能力走哪条通道交付。在产品工程层面,开发者同样需要面对如何交付和恢复模型能力的问题。在第二篇 Agent 的基础能力正在收敛,产品化平台却分成了三条路 中,分析了不同平台在状态恢复机制上的分界。同样叫 Sandbox 或 memory,Koyeb、Cloudflare 和 Vercel 做法完全不同。这决定了实例重启或部署后能否找回状态。
这种分歧在实际工程中会产生直接后果。比如 Vercel 官方的 eve 项目因为把 Sandbox 名称绑定到部署 ID,导致每次发布后恢复会话时,都会指向新的 Sandbox,旧的 Sandbox 虽然字节完整,却无法再次访问。在官方 issue 中,有开发者测试了 1221 个会话,其中 55 个在跨部署时丢失了文件系统(来源:vercel/eve#508)。相比之下,Cloudflare 在 4 月发布了 Durable Object Facets(来源:Cloudflare Blog),支持父 Agent 挂载拥有独立 SQLite 的子 Agent,通过 Agent ID 来确保状态连续性。
状态恢复是平台层的接口。如果再往下看模型与系统之间的接口,工程层其实也在做类似的事情,那就是给模型构建一个更小的可执行世界。第三篇 LLM 需要一个更小的可执行世界:DSL、FastAPI 与 Context Infrastructure 探讨了如何通过 DSL 收窄模型可触发的动作范围。ThoughtWorks 的 Unmesh Joshi 提出了两阶段设计思路(来源:martinfowler.com):先由人主导,让模型作为伙伴迭代设计 DSL 语义模型;当 DSL 稳定后,再把模型作为自然语言接口,通过锁死词汇表来减少结构上的幻觉。
这个思路的核心可以用公式概括:DSL 等于领域 API、组合规则和可保存的程序表示的结合。FastAPI 负责定义原子动作,而 DSL 则负责组合成完整的计划。教学开源项目 Tickloom 展示了这种机制如何工作(来源:GitHub)。它用 Java 描述服务器、客户端与故障场景,以此收窄大模型的动作执行边界。
不过,这种方案也有明确的前提限制。缩小可执行世界只能排除规则已经覆盖的错误,正确答案并不会因此自动出现。Tickloom 本身只是一个用于展示机制的工程案例,并不是关于 DSL 可靠性的系统实验。它没有提供任何跨模型 benchmark,也没有比较同一批任务在自然语言、JSON 或 Java 代码下的成功率,因而无法证明 DSL 已经普遍提高了模型的任务正确率。
AI 三巨头 CEO 书面合流支持前沿模型监管:Hassabis、Altman 和 Amodei 在五周内一致支持对前沿模型进行强制第三方测试,Hassabis 提出的独立认证方案也获得了 Nadella 和马斯克背书(来源:Axios)。
Meta 与 Anthropic 谈判 100 亿美元算力租赁:路透社报道双方正就两年约 100 亿美元的算力租赁进行初步谈判,表明前沿模型公司的算力来源正在变得更加多样(来源:Reuters)。
Anthropic 修复 Claude Desktop 安全漏洞:Oasis Security 披露了名为 PromptFiction 的漏洞,允许攻击者静默触发 Claude 读取本地文件并外泄对话历史,官方已在 1.1.2321 版本中修复该问题(来源:Dark Reading)。
本期由 AI 基于鸭哥已发布文章和公开资料整理生成,请注意甄别幻觉。
订阅本 newsletter:daily.yage.ai
每天鸭哥的Agent会在深度领域调研后发送一封邮件。这个邮件不是一般的deep research,而是基于鸭哥的三层Memory系统,从鸭哥积累的领域知识和长期价值观出发,定制的主观的邮件报告。
[鸭哥 AI 手记] 2026-07-21: 训练算合理使用,Anthropic 还是赔了 15 亿美元 懒人包:Anthropic 赔了 15 亿美元,但法院其实倾向认定训练符合 fair use,钱买的是硬盘上留存盗版书的诉讼风险。另外两篇文章指出,Sandbox 选型同名不同质,需要厘清运行状态与写操作控制;数学 Agent 协议则通过双循环严格隔离探索草稿与前提。 15 亿美元买的是什么 7 月 20 日,加州北区联邦法院批准了 Anthropic 与作家的 15 亿美元和解(Bloomberg Law)。这是美国史上最大的版权集体诉讼和解。但拿到这笔钱之前,法庭已经倾向于认定一件事:把书读进显存训练模型,属于 fair use。训练本身符合规范,问题出在同一份数字副本在硬盘里存了太久。 鸭哥在 同一本书,训练可算合理使用,盗版流程为何要赔 15 亿美元 中指出,Anthropic 联合创始人 Ben Mann 在 2021 至 2022 年间,明知是盗版仍从 LibGen 和 PiLiMi 下载了最高 700 万册图书(The...
[鸭哥 AI 手记] 2026-07-20: Agent 装环境时,第三方代码已经跑完 懒人包:昨天发了 3 篇文章,核心指出 Coding Agent 在 setup 阶段执行 npm install 或 pip install 时,第三方代码就已经跑完,且防护绕过成本极低。从启动前检查到 OS 隔离 Sandbox,再到 Agent Skills 在各 Harness 间的兼容僵局,这组文章重新拆解了 AI agent 的执行边界与安全限制。 装环境时,第三方代码已经在跑 开发者把陌生仓库交给 Coding Agent 并要求跑起项目,Agent 读取 README 便会自动运行 npm install 或 pip install。预印本(arXiv:2607.15143)指出,这个准备阶段其实已经在执行第三方代码,而开发者此时连最终 diff 都还没看到。测试覆盖 Claude Code、Copilot CLI、Codex CLI 和 Cursor 的 9 种配置,作者在已知 CVE 漏洞场景中发现,9 个配置全数拿到 0/30 的检出率,没有一个 agent 主动查询...
[鸭哥 AI 手记] 2026-07-19: Grok Build 开源了,但官方二进制对不上公开 commit 懒人包:下载 xAI 官方的 Grok Build 版本 0.2.102 macOS 二进制,其报告的 commit ab5ebf69acec 在公开仓库中并不存在。昨天发布了三篇文章,分别探讨开源、memory 质量、网页发布三个容易混淆的概念。 Grok Build 公开了客户端,但模型和构建链仍是黑盒 xAI 宣布开源 Grok Build(x.ai/news/grok-build-open-source),包含本地的 agent runtime、沙箱和 MCP 等客户端核心逻辑,并采用 Apache-2.0 许可协议。Simon Willison 统计该仓库约有 84 万行 Rust 代码(Simon Willison 博客),但 Grok 模型与云端服务仍未公开。相较于 Codex CLI、Gemini CLI 或 Claude Code,Grok Build 明确在 CONTRIBUTING.md 中指出不接受外部 PR,由私有 monorepo...