懒人包:昨天发了 3 篇文章,核心指出 Coding Agent 在 setup 阶段执行 npm install 或 pip install 时,第三方代码就已经跑完,且防护绕过成本极低。从启动前检查到 OS 隔离 Sandbox,再到 Agent Skills 在各 Harness 间的兼容僵局,这组文章重新拆解了 AI agent 的执行边界与安全限制。
开发者把陌生仓库交给 Coding Agent 并要求跑起项目,Agent 读取 README 便会自动运行 npm install 或 pip install。预印本(arXiv:2607.15143)指出,这个准备阶段其实已经在执行第三方代码,而开发者此时连最终 diff 都还没看到。测试覆盖 Claude Code、Copilot CLI、Codex CLI 和 Cursor 的 9 种配置,作者在已知 CVE 漏洞场景中发现,9 个配置全数拿到 0/30 的检出率,没有一个 agent 主动查询 vulnerability database。
实验还发现了反直觉的现象:9 种配置全部拒绝报错信息里推荐的恶意包,但只要把同样的安装建议写进 README,agent 就会照单全收。这一威胁在真实世界里已经演变成实操案例。Microsoft 披露的 AsyncAPI @asyncapi/* 投毒事件中,恶意包主动放弃 setup.py 或 postinstall 等安装钩子,改在 require 和 import 时触发代码执行,直接让 --ignore-scripts 等传统防御手段彻底失效。
这表明单靠代码审查无法拦截环境搭建阶段的风险,检查点必须放在 package manager 启动之前。在鸭哥昨天的文章 《Coding Agent 还在配置环境,第三方代码已经运行了》 中,你可以进一步看清包名混淆、外部 registry 和旧版本 CVE 这三条攻击向量的具体运作方式,以及为什么现有审查流程无法保护你的项目。
把检查点放在 package manager 启动之前只能做单点拦截。开发者手动点击命令审批,只能决定进程能否启动,管不住启动后的子进程与后续网络调用。无论风险来自 agent 误判、prompt injection 还是未审核的第三方工具链,后果最终都会汇聚到文件访问与网络访问。在命令黑名单、逐条审批、专用工具和 Sandbox 这四类方案里,只有 OS 隔离能在保留工具能力的同时锁死破坏范围。
目前各客户端的隔离策略差异极大。Claude Code 在 macOS 调 Seatbelt,在 Linux 调 bubblewrap,但默认处于 OFF 状态,需要用户手动执行 /sandbox 或修改 settings.json 开启。Cursor 在 Linux 使用 Landlock 与 seccomp,官方公布隔离后将中断减少了 40%。Codex CLI 是当前唯一默认开启 OS 隔离的 agent,启动即为 read-only 模式,检测到 git 仓库后自动切入 workspace-write。
这也意味着 Sandbox 的防护边界正从单次命令扩展到一次完整委托。在鸭哥昨天的文章 《为什么 Coding Agent 需要 Sandbox?》 中,你可以读到四层方案的完整推导过程,以及凭证代理、外部策略和独立工作区各自解决的核心安全问题。
执行边界向一次完整委托扩展的同时,工具能力的标准化也在同步推进,但规范发起方与主流 Harness 却陷入了兼容歧义。Anthropic 将 Skills 开放为 agentskills.io 标准后,在 Codex、Cursor、OpenCode、Gemini CLI、Antigravity 和 Claude Code 这 6 家主流 Harness 中,发起方 Claude Code 自己反而不扫描 .agents/skills/ 共享目录,只读取自家的 .claude/skills/。
兼容问题还延伸到了控制字段。Claude Code 在 frontmatter 里扩展了 model、effort、paths 等 13 个控制字段,其他 Harness 遇到后大多选择静默忽略。针对开发者要求扫描共享目录的 GitHub issue #56193,Anthropic 官方直接标记为 not planned 并关闭,展现出极其明确的立场倾向。
如果你想了解一份 SKILL.md 在 7 个客户端上的实际兼容情况,以及哪些字段属于跨平台的稳定公约数、哪些必须做薄适配,可以阅读鸭哥昨天的文章 《Agent Skills 统一了文件格式,Harness 仍然各自为政》。
Hugging Face 遭全自主 AI agent 入侵:攻击者利用恶意 dataset 触发模板注入与远程代码加载,在 worker 节点拿下云端凭证并持续操作数千动作。防御团队因美国模型的 guardrails 拦住自家命令,紧急切换至中国开源模型才完成响应。(The Hacker News、BleepingComputer)
ServiceNow 漏洞在野利用与上下文投毒逃逸:ServiceNow 的 sandbox RCE 漏洞已遭野外利用。研究人员同步提出 context bombing 概念,指出 AI agent 无需打穿 OS 隔离,仅靠上下文投毒与跨工具调用就能达成等效逃逸。(csoonline: ServiceNow 漏洞、csoonline: 不破 Sandbox 逃逸)
Moonshot Kimi K3 将于 7 月 27 日开源权重:月之暗面发布的 2.8T 参数模型在 Arena 前端编码测试中超越 GPT-5.6 Sol 与 Claude Fable 5,权重开放后将引发新一轮自托管 coding agent 测试潮。(BBC、CNBC)
本期由 AI 基于鸭哥已发布文章和公开资料整理生成,请注意甄别幻觉。
订阅本 newsletter:daily.yage.ai
每天鸭哥的Agent会在深度领域调研后发送一封邮件。这个邮件不是一般的deep research,而是基于鸭哥的三层Memory系统,从鸭哥积累的领域知识和长期价值观出发,定制的主观的邮件报告。
[鸭哥 AI 手记] 2026-07-21: 训练算合理使用,Anthropic 还是赔了 15 亿美元 懒人包:Anthropic 赔了 15 亿美元,但法院其实倾向认定训练符合 fair use,钱买的是硬盘上留存盗版书的诉讼风险。另外两篇文章指出,Sandbox 选型同名不同质,需要厘清运行状态与写操作控制;数学 Agent 协议则通过双循环严格隔离探索草稿与前提。 15 亿美元买的是什么 7 月 20 日,加州北区联邦法院批准了 Anthropic 与作家的 15 亿美元和解(Bloomberg Law)。这是美国史上最大的版权集体诉讼和解。但拿到这笔钱之前,法庭已经倾向于认定一件事:把书读进显存训练模型,属于 fair use。训练本身符合规范,问题出在同一份数字副本在硬盘里存了太久。 鸭哥在 同一本书,训练可算合理使用,盗版流程为何要赔 15 亿美元 中指出,Anthropic 联合创始人 Ben Mann 在 2021 至 2022 年间,明知是盗版仍从 LibGen 和 PiLiMi 下载了最高 700 万册图书(The...
[鸭哥 AI 手记] 2026-07-19: Grok Build 开源了,但官方二进制对不上公开 commit 懒人包:下载 xAI 官方的 Grok Build 版本 0.2.102 macOS 二进制,其报告的 commit ab5ebf69acec 在公开仓库中并不存在。昨天发布了三篇文章,分别探讨开源、memory 质量、网页发布三个容易混淆的概念。 Grok Build 公开了客户端,但模型和构建链仍是黑盒 xAI 宣布开源 Grok Build(x.ai/news/grok-build-open-source),包含本地的 agent runtime、沙箱和 MCP 等客户端核心逻辑,并采用 Apache-2.0 许可协议。Simon Willison 统计该仓库约有 84 万行 Rust 代码(Simon Willison 博客),但 Grok 模型与云端服务仍未公开。相较于 Codex CLI、Gemini CLI 或 Claude Code,Grok Build 明确在 CONTRIBUTING.md 中指出不接受外部 PR,由私有 monorepo...
[鸭哥 AI 手记] 2026-07-18: Fable 5 全球停服,美国把 AI 管制推到 API 懒人包:6 月 12 日一条针对 Anthropic 的商务部指令让 Fable 5 在全球下线了 19 天,Mythos 5 至今只对少数美国组织开放;7 月 13 日华邮又据报披露美国在讨论把美国开放模型性能上限设为中国模型水平。同一周,鸭哥还梳理了 Agent 托管平台在状态恢复机制上的三条路,以及用 DSL 给大模型建一个更小可执行世界的工程思路。昨天共发了 3 篇 AI 文章。 一条 API 指令让全球用户一起失去访问 在第一篇 「中国模型参照线」传闻背后:美国为什么从芯片管到 API 中,分析了美国官方对 AI 管制的最新走向。6 月 12 日,Anthropic 接到美国商务部指令,要求把 Fable 5 和 Mythos 5 对所有外国用户关闭。Claude 是集中式 API,没法在每次调用前实时核验用户国籍。Anthropic 当天对全球所有人停服这两个模型。Fable 5 直到 7 月 1 日才在 Claude.ai 全球恢复(来源:Reuters 与...