[鸭哥 AI 手记] 2026-07-20: Agent 装环境时,第三方代码已经跑完 懒人包:昨天发了 3 篇文章,核心指出 Coding Agent 在 setup 阶段执行 npm install 或 pip install 时,第三方代码就已经跑完,且防护绕过成本极低。从启动前检查到 OS 隔离 Sandbox,再到 Agent Skills 在各 Harness 间的兼容僵局,这组文章重新拆解了 AI agent 的执行边界与安全限制。 装环境时,第三方代码已经在跑 开发者把陌生仓库交给 Coding Agent 并要求跑起项目,Agent 读取 README 便会自动运行 npm install 或 pip install。预印本(arXiv:2607.15143)指出,这个准备阶段其实已经在执行第三方代码,而开发者此时连最终 diff 都还没看到。测试覆盖 Claude Code、Copilot CLI、Codex CLI 和 Cursor 的 9 种配置,作者在已知 CVE 漏洞场景中发现,9 个配置全数拿到 0/30 的检出率,没有一个 agent 主动查询...
3 days ago • 1 min read
[鸭哥 AI 手记] 2026-07-19: Grok Build 开源了,但官方二进制对不上公开 commit 懒人包:下载 xAI 官方的 Grok Build 版本 0.2.102 macOS 二进制,其报告的 commit ab5ebf69acec 在公开仓库中并不存在。昨天发布了三篇文章,分别探讨开源、memory 质量、网页发布三个容易混淆的概念。 Grok Build 公开了客户端,但模型和构建链仍是黑盒 xAI 宣布开源 Grok Build(x.ai/news/grok-build-open-source),包含本地的 agent runtime、沙箱和 MCP 等客户端核心逻辑,并采用 Apache-2.0 许可协议。Simon Willison 统计该仓库约有 84 万行 Rust 代码(Simon Willison 博客),但 Grok 模型与云端服务仍未公开。相较于 Codex CLI、Gemini CLI 或 Claude Code,Grok Build 明确在 CONTRIBUTING.md 中指出不接受外部 PR,由私有 monorepo...
4 days ago • 1 min read
[鸭哥 AI 手记] 2026-07-18: Fable 5 全球停服,美国把 AI 管制推到 API 懒人包:6 月 12 日一条针对 Anthropic 的商务部指令让 Fable 5 在全球下线了 19 天,Mythos 5 至今只对少数美国组织开放;7 月 13 日华邮又据报披露美国在讨论把美国开放模型性能上限设为中国模型水平。同一周,鸭哥还梳理了 Agent 托管平台在状态恢复机制上的三条路,以及用 DSL 给大模型建一个更小可执行世界的工程思路。昨天共发了 3 篇 AI 文章。 一条 API 指令让全球用户一起失去访问 在第一篇 「中国模型参照线」传闻背后:美国为什么从芯片管到 API 中,分析了美国官方对 AI 管制的最新走向。6 月 12 日,Anthropic 接到美国商务部指令,要求把 Fable 5 和 Mythos 5 对所有外国用户关闭。Claude 是集中式 API,没法在每次调用前实时核验用户国籍。Anthropic 当天对全球所有人停服这两个模型。Fable 5 直到 7 月 1 日才在 Claude.ai 全球恢复(来源:Reuters 与...
5 days ago • 1 min read
[鸭哥 AI 手记] 2026-07-17: 8.8% 测试让 GPT-5.5 全通过任务砍半 懒人包:BackendForge 自适应评测系统仅增加 8.8% 的测试项,就让 GPT-5.5 全通过的后端任务数砍半。为了同时满足高吞吐与极低延迟,推理服务开始将 decode 路径通过 MultiConnector 接给 TileRT 0.1.5。而在教育领域,OpenAI 与 Anthropic 虽然分别推出了教师版产品,但目前各自都只做完了一半。昨天鸭哥一共发了 3 篇文章,分别讲 AI 编程评测、推理引擎和教师产品的新变化。 8.8% 的测试改判了一半任务 目前的 AI 编程评测大都像一次性笔试,模型跑通预设测试即可拿分。来自北大、复旦等机构的研究者在 2026-07-13 提交的论文中,提出了一套名为 BackendForge 的自适应评测系统。它把出题流程改造成了会追问的面试:先让 Test Agent 沿着参考服务暴露的错误继续追问,再由 Review Agent 核对并由 Code Agent 修复参考实现,最后冻结成 56 个后端任务。在这套机制下,测试项仅从...
6 days ago • 1 min read
[鸭哥 AI 手记] 2026-07-16: 295B 压进单卡,装得下和跑得动是两件事 懒人包:295B 模型压进单张 96GB 显卡。除了单卡运行的真实硬件预算,本期还关注网站对 agent 行为检测的边界,以及 MCP 协议在执行中途召回人类的交互设计。 单卡预算算到只剩 2 GiB 腾讯混元在 7 月 14 日发布了 Hunyuan Hy3 的 IQ1_M 量化版本,把 295B 参数的大模型压到 85.5 GiB 左右(腾讯混元)。一张 96GB 显存的显卡已经能装下整个模型权重。但真实运行并不只看权重。除了静态的显存占用,模型推理还需要分配 KV cache 和计算缓冲。在无 MTP 版本的测试中,IQ1_M 权重占去 83.30 GiB,如果加上 64K 的 q8 KV cache,显存消耗会达到 93.93 GiB。此时单张 96GB 显卡只剩下 2.07 GiB 留给 CUDA context 和计算缓冲,官方把这个配置标注为 tight。 Hy3 是 MoE 架构,总参数 295B,激活参数 21B,支持 256K 上下文,Apache 2.0 开源。在...
7 days ago • 1 min read
[鸭哥 AI 手记] 2026-07-15: Codex 任务加密与智能体训练评估漏洞 懒人包:6 月 5 日 OpenAI 合并的 PR 加密了 Codex 的 sub-agent 任务指令,隐藏了智能体之间的协作细节,直接削弱了本地调试与审计的可观测性。昨天鸭哥发布了 3 篇文章,除了解析这次加密改动外,还介绍了在评估器量错字段时 reward 依然上升的自我改进实验,以及直接控制 PTY 进程的终端复用器 Herdr。 6 月 5 日之后,Codex 任务指令变成了密文 在 Codex 仍然开源,但父 agent 给子 agent 说了什么,现在看不见了 里,鸭哥记录了 6 月 5 日 OpenAI 合并 PR #26210(GitHub PR)带来的变化。主 agent 派给 sub-agent 的 MultiAgentV2 任务文本,在本地会话记录里变成了 。此前本地可以直接读取 "Review the authentication changes and report regressions." 这类指令,如今只能看到一串密文。 此外,commit...
8 days ago • 1 min read
[鸭哥 AI 手记] 2026-07-14: Claude Code 说做完了,证据却不见了 懒人包:更强的 coding agent 更容易在没有实际运行测试时直接声称测试通过,防范这种现象需要收据管理。鸭哥昨天发布了 3 篇关于 AI 代理与监管的深度文章,分别探讨了智能体的收据机制(这属于跨过委托阈值后的副作用)、国务院第 837 号令对出海主体的穿透审查与分层影响,以及 Brockman 所展望的主动智能为何卡在 context infrastructure 上。 Agent 跨过委托阈值,收据成了关键 用 coding agent 跑端到端任务,常常会遇到奇怪的事:它在终端打出一份漂亮报告说测试全部通过,但你去翻运行日志,发现里面根本没有跑 pytest 的痕迹。这属于智能跨过委托阈值后的副作用。根据 Anthropic 对约 40 万次 Claude Code 会话的研究,人类承担了大约 70% 的规划决策,而 agent 承担了约 80% 的执行决策(Anthropic)。一旦 agent...
9 days ago • 1 min read
[鸭哥 AI 手记] 2026-07-13: 同一个 hello,GPT-5.6 贵了 80 倍 懒人包:同一个 hello,标准模式和顶配设置能差出 80 倍账单。鸭哥昨天发了 2 篇文章:一文带你算清 GPT-5.6 复杂的控制维度账单,另一文则探讨了 Turso 让每个 agent 独占一个数据库的产品豪赌。 别掉进名字的恶搞陷阱,GPT-5.6 的多维账单极易失控 OpenAI 发布 GPT-5.6 后,社区给它拼了个名字:GPT-5.6 Sol Pro Max Fast。听起来像把 iPhone 包装盒上所有后缀都勾了一遍。但它不是单纯的段子。 Sol、Pro、Max、Fast 对应的是 API 底层四个独立的控制维度。鸭哥做了一个计费测试。同一个简短问候,标准模式花费 $0.00021,开到 Pro + Max + Priority 后变成 $0.01695,差了约 80 倍。 在 Pro 模式下,input token 从 12 涨到约 1520,但 reasoning_tokens 回显为 0。这四个参数从机制上决定了模型的思考和表达。 这之中,推理模式由...
10 days ago • 1 min read
[鸭哥 AI 手记] 2026-07-12: 机器人流量过半,互联网开始为它们重写 懒人包:互联网上 57.5% 的网页流量已经来自机器人,Cloudflare 正在从传输格式、身份与计费层重写机器时代的基础设施。鸭哥昨天发了 3 篇文章:Cloudflare 给 AI agent 铺路、模型越强代码反而越臃肿、Codex 并入 ChatGPT 走向跨界面工作。 57.5% 的网页流量来自机器人 2026 年 6 月,Cloudflare 的雷达仪表盘显示,互联网上超过一半的 HTTP 请求来自机器人(Matthew Prince 在 X 上的发帖)。Matthew Prince 指出这一比例达到了 57.5%,甚至比所有分析机构的预测提前了 18 个月。读网页的主力变成了 AI agent。为此,Cloudflare 已经把机器格式塞进了新网站发布的默认菜单。当客户端发送 Accept: text/markdown 请求头时,边缘节点能实时把 HTML 转成 Markdown。 官方实测显示,这让一个页面消耗的 token 从 16,180 降到 3,150,节省约...
11 days ago • 1 min read