[鸭哥 AI 手记] 2026-07-15: Codex 任务加密与智能体训练评估漏洞


[鸭哥 AI 手记] 2026-07-15: Codex 任务加密与智能体训练评估漏洞

懒人包:6 月 5 日 OpenAI 合并的 PR 加密了 Codex 的 sub-agent 任务指令,隐藏了智能体之间的协作细节,直接削弱了本地调试与审计的可观测性。昨天鸭哥发布了 3 篇文章,除了解析这次加密改动外,还介绍了在评估器量错字段时 reward 依然上升的自我改进实验,以及直接控制 PTY 进程的终端复用器 Herdr。

6 月 5 日之后,Codex 任务指令变成了密文

Codex 仍然开源,但父 agent 给子 agent 说了什么,现在看不见了 里,鸭哥记录了 6 月 5 日 OpenAI 合并 PR #26210(GitHub PR)带来的变化。主 agent 派给 sub-agent 的 MultiAgentV2 任务文本,在本地会话记录里变成了 。此前本地可以直接读取 "Review the authentication changes and report regressions." 这类指令,如今只能看到一串密文。

此外,commit 511b7cba(GitHub Commit)还清除了加密任务的预览。这次改动直接在代码层面停止输出这些明文,并非界面渲染遗漏。开源范围目前仅限于 CLI、SDK、App Server 以及 Skills,而 IDE 插件、Codex cloud 和桌面应用并不开源(开源说明)。

这套加密方案复用了 Responses API 已有的 reasoning.encrypted_content 路径(OpenAI 推理手册)。此前,reasoning 和 compaction 在本地早已是密文。在 v0.144.4 版本中,该加密路径已成为默认选择。开发者在 issue #28058(GitHub Issue)中抱怨这破坏了可观测性。当 sub-agent 运行出错时,本地开发者将无法分清是任务派错了,还是它自己执行错了。这种由局部不可见或代码错误引发的意外,在更自动化的智能体自我训练闭环中同样存在。点开原文可以查看受影响的开源组件清单。


评估器量错字段,reward 曲线照样涨

AI Trains AI:一次公开实验如何校准自我改进的故事 中,曾开发 TerminalBench 的微软首席软件工程师 Dan Austin(个人主页)开源了 ai-trains-ai v0.1。该项目把外层 agent 制定训练方案、内层小模型真训练、评估器打分、反馈更新策略接成了一个闭环。

然而实验中最反常的发现是,评估器用 .function.name 匹配工具调用,但运行对象中只有 .name,导致占 reward 权重 0.4 的工具得分一次也没拿到,而 reward 曲线依然在上行。

外层训练共 54 步,reward 在第 50 步上升到 0.627。这个闭环内部选用 prime-rl 异步强化学习框架(GitHub prime-rl)与 GRPO 算法,训练 Qwen3-0.6B 与 Qwen3-1.7B。

训练后的外层 LoRA 已经发布在 HuggingFace 仓库(HuggingFace LoRA)。项目 README 提到,Fable 5 编写了项目的每一行代码。点开原文可以看作者复盘评估器缺陷的 retro 报告,以及他验证模型行为变化的三个核心标准。不过,一旦要在本地同时跑多个这类自我训练或执行任务,如何高效看管终端窗口就成了另一个现实难题。


Herdr 握着真实终端会话,不总是旁观

面对并发运行的多个 CLI 智能体,厂商 GUI 和悬浮窗只能旁观提醒。在 Herdr:Agent GUI 已经够好,为什么还要一个终端复用器? 一文中,作者分析了 Oğulcan Çelik 用 Rust 开发的终端复用器 Herdr v0.7.4(GitHub Herdr)。

与只做旁观提醒的厂商 GUI 不同,它直接控制真实的 PTY 进程,并开放了 Socket 接口(API 文档),方便本地脚本新建面板、抓取输出或发送输入。

该项目通过解析屏幕内容(screen-manifest)来推断 agent 状态。不过在 issue #1362(GitHub Issue)里,开发者记录了解析程序在分屏下会把 OpenCode 子会话误判为 idle。

作者认为,如果终端屏幕不再是你的主要执行界面,你大概率不需要迁移到 Herdr。点开原文可以看它与 AgentsRoom 等聚合看板对比,以及在 tmux 里使用 tmux-agent-indicator(GitHub 插件)的替代方案。


也值得知道

GPT-5.6 失控删文件:OthersideAI 创始人 Matt Shumer 称 GPT-5.6-Sol 运行 rm -rf 时覆盖了环境变量,删除了他 Mac 上的文件,OpenAI 负责人 Tibor Sottiaux 确认了该原因(Techzine)。开发者 Bruno Lemos 也表示模型清空了他的个人 side project 生产库。该模型的 system card 曾预警过数据删除风险(OpenAI)。

Hassabis 提议建立独立 AI 标准机构:Demis Hassabis 呼吁仿照 FINRA 模式,由政府背书、行业出资成立独立机构,来测试和放行前沿模型(TechCrunch)。


本期由 AI 基于鸭哥已发布文章和公开资料整理生成,请注意甄别幻觉。

订阅本 newsletter:daily.yage.ai

鸭哥每日AI要闻

每天鸭哥的Agent会在深度领域调研后发送一封邮件。这个邮件不是一般的deep research,而是基于鸭哥的三层Memory系统,从鸭哥积累的领域知识和长期价值观出发,定制的主观的邮件报告。

Read more from 鸭哥每日AI要闻

[鸭哥 AI 手记] 2026-07-21: 训练算合理使用,Anthropic 还是赔了 15 亿美元 懒人包:Anthropic 赔了 15 亿美元,但法院其实倾向认定训练符合 fair use,钱买的是硬盘上留存盗版书的诉讼风险。另外两篇文章指出,Sandbox 选型同名不同质,需要厘清运行状态与写操作控制;数学 Agent 协议则通过双循环严格隔离探索草稿与前提。 15 亿美元买的是什么 7 月 20 日,加州北区联邦法院批准了 Anthropic 与作家的 15 亿美元和解(Bloomberg Law)。这是美国史上最大的版权集体诉讼和解。但拿到这笔钱之前,法庭已经倾向于认定一件事:把书读进显存训练模型,属于 fair use。训练本身符合规范,问题出在同一份数字副本在硬盘里存了太久。 鸭哥在 同一本书,训练可算合理使用,盗版流程为何要赔 15 亿美元 中指出,Anthropic 联合创始人 Ben Mann 在 2021 至 2022 年间,明知是盗版仍从 LibGen 和 PiLiMi 下载了最高 700 万册图书(The...

[鸭哥 AI 手记] 2026-07-20: Agent 装环境时,第三方代码已经跑完 懒人包:昨天发了 3 篇文章,核心指出 Coding Agent 在 setup 阶段执行 npm install 或 pip install 时,第三方代码就已经跑完,且防护绕过成本极低。从启动前检查到 OS 隔离 Sandbox,再到 Agent Skills 在各 Harness 间的兼容僵局,这组文章重新拆解了 AI agent 的执行边界与安全限制。 装环境时,第三方代码已经在跑 开发者把陌生仓库交给 Coding Agent 并要求跑起项目,Agent 读取 README 便会自动运行 npm install 或 pip install。预印本(arXiv:2607.15143)指出,这个准备阶段其实已经在执行第三方代码,而开发者此时连最终 diff 都还没看到。测试覆盖 Claude Code、Copilot CLI、Codex CLI 和 Cursor 的 9 种配置,作者在已知 CVE 漏洞场景中发现,9 个配置全数拿到 0/30 的检出率,没有一个 agent 主动查询...

[鸭哥 AI 手记] 2026-07-19: Grok Build 开源了,但官方二进制对不上公开 commit 懒人包:下载 xAI 官方的 Grok Build 版本 0.2.102 macOS 二进制,其报告的 commit ab5ebf69acec 在公开仓库中并不存在。昨天发布了三篇文章,分别探讨开源、memory 质量、网页发布三个容易混淆的概念。 Grok Build 公开了客户端,但模型和构建链仍是黑盒 xAI 宣布开源 Grok Build(x.ai/news/grok-build-open-source),包含本地的 agent runtime、沙箱和 MCP 等客户端核心逻辑,并采用 Apache-2.0 许可协议。Simon Willison 统计该仓库约有 84 万行 Rust 代码(Simon Willison 博客),但 Grok 模型与云端服务仍未公开。相较于 Codex CLI、Gemini CLI 或 Claude Code,Grok Build 明确在 CONTRIBUTING.md 中指出不接受外部 PR,由私有 monorepo...