[鸭哥 AI 手记] 2026-07-17: 8.8% 测试让 GPT-5.5 全通过任务砍半


[鸭哥 AI 手记] 2026-07-17: 8.8% 测试让 GPT-5.5 全通过任务砍半

懒人包:BackendForge 自适应评测系统仅增加 8.8% 的测试项,就让 GPT-5.5 全通过的后端任务数砍半。为了同时满足高吞吐与极低延迟,推理服务开始将 decode 路径通过 MultiConnector 接给 TileRT 0.1.5。而在教育领域,OpenAI 与 Anthropic 虽然分别推出了教师版产品,但目前各自都只做完了一半。昨天鸭哥一共发了 3 篇文章,分别讲 AI 编程评测、推理引擎和教师产品的新变化。


8.8% 的测试改判了一半任务

目前的 AI 编程评测大都像一次性笔试,模型跑通预设测试即可拿分。来自北大、复旦等机构的研究者在 2026-07-13 提交的论文中,提出了一套名为 BackendForge 的自适应评测系统。它把出题流程改造成了会追问的面试:先让 Test Agent 沿着参考服务暴露的错误继续追问,再由 Review Agent 核对并由 Code Agent 修复参考实现,最后冻结成 56 个后端任务。在这套机制下,测试项仅从 7,250 项增加到 7,890 项(新增 640 项,增幅 8.8%),就让同一批 GPT-5.5 生成的代码中,全通过任务数从 31/56 骤降到 16/56(通过率从 55.4% 降至 28.6%)。

对于原本通过更多的 Claude Opus 4.7,这种自适应追问带来的改判幅度更大,全通过任务数直接从 33/56 缩水至 10/56(通过率从 58.9% 降到 17.9%)。同月发布的 TestEvo-Bench 同样以 test/code co-evolution 为核心,但侧重于评测 agent 写测试的能力。与之相比,BackendForge 展现了如何通过自动追加测试项提高题库强度的路径,不过目前其代码与 arXiv:2607.11042v1 论文的数据集尚未公开。

点开原文 BackendForge:AI 已经能写完整 App,评测也得学会追问 可以阅读完整的系统架构和出题步骤,理解为什么 SWE-bench 类静态题库已经不够用,以及如何在实际工程中构建健壮的自动化后端评测。


一个想多干活,一个想更快

评测设计告别了单个题库通吃的旧思路,推理服务同样开始将请求按延迟目标分流。2026-07-14,vLLM 官方博客宣布了与 TileRT 0.1.5 (MIT 协议,1.6k stars) 的集成。在这套架构中,vLLM 把追求高吞吐的 prefill 阶段留给自己,而把追求极低延迟的 batch=1 decode 路径通过 MultiConnector 连接器交给 TileRT。两个设计目标相反的推理引擎共用一套服务,宣告了推理引擎竞争正在从追求单引擎综合最优,转向专用执行路径与智能编排的结合。

这种分工源于 prefill 与 decode 的物理本质冲突。prefill 负责读取输入并建立 KV cache,属于计算密集型,直接决定首 token 延迟(TTFT);decode 则是逐个生成 token 的阶段,对显存带宽高度敏感,决定了逐 token 速度(TPOT)。传统推理服务为了整体吞吐不得不使用批处理,但排队会推高延迟;若强行设为 batch=1,又会导致 GPU 利用率低下。为此,新架构在 8×B200 decode 节点上同时只处理 1 个 in-flight request,目前已支持 GLM-5、GLM-5.1 和 DeepSeek-V3.2。

TileRT 此前是智谱 Z.ai 的 GLM-5.1-highspeed API(参考鸭哥 5 月手记)的底层引擎,并在 2026-06-08 与小米 MiMo 合作,在 1T 参数模型上突破了 1000 tokens/s。prefill/decode 拆池部署正在成为行业标配,NVIDIA TensorRT-LLM 的 disagg serving 与 SGLang Omni 等方案都在朝这个方向演进。点开原文 vLLM x TileRT:两个目标相反的推理引擎,为什么开始共用一套服务 可以看清 Mooncake 与 NIXL 作为 KV cache 传输层事实标准的角色,以及为什么单看吞吐或延迟都不够,要算每美元能服务多少请求。


OpenAI 做学区治理,Anthropic 做课程标准

推理服务正在将不同任务分发到专用执行路径,而在面向 K-12 的教师 AI 工具中,OpenAI 与 Anthropic 的竞争也呈现出方向截然不同的分工。Anthropic 于 2026-07-14 推出了 Claude for Teachers,这距离 OpenAI 在 2025-11-19 发布 ChatGPT for Teachers 已经过去了大约八个月。这两款旨在协助教学的产品,目前各自都只完成了一半。

OpenAI 的优势在于更早跑通了学区管理,提供了符合学区行政需求的 domain claiming、SAML SSO 以及 RBAC 等权限控制,首批 16 个合作学区声称代表近 150,000 名教师(不是活跃账号数)。相反,Anthropic 则是先在课程标准与核心技能上发力,将包含 lesson planning 和 lesson differentiation 两个 skill 的 K-12 Skills 仓库 开源,直接对接全美 50 州的学术标准。在此期间,OpenAI 也在 2026-07-08 联合 Walton Family Foundation 举办了 AI Skills Jam,吸引了 1,600+ 名教师与管理员参与。

尽管两家公司都在扩大合作版图,但至今仍未建立从教师备课到学生实际学习成果的因果反馈闭环。据 Chicago Tribune 2026-02-24 报道,伊利诺伊州第二大公立学区 U-46 的 ChatGPT 使用数据显示,在 756 名使用员工中,47% 的回卷率显示有 80%+ 的用户每周使用数次,70%+ 认为每周能节省 1-5 小时,但这套仅基于自报数据且无学生表现对照的指标,难以证实其实际教学增益。根据 Stanford SCALE 对 800+ 篇相关论文的检索,目前仅有 20 篇高质量的因果研究,针对这两款教师版产品的独立实证研究依旧是空白。点开原文 ChatGPT 与 Claude 都开始服务教师,但只各做完了一半 可以了解两家产品底层架构的缺失,以及它们应当如何设计以打通真实的学习成效反馈。


也值得知道

  • Moonshot Kimi K3(7-17 发布,权重 7-27 开源):拥有 2.8 万亿参数的 MoE 模型 Kimi K3 于 7-17 发布(计划于 7-27 开源权重),虽然 Moonshot 自称其在编码和 agent benchmark 上击败了 Fable 5 和 GPT-5.6 Sol,但 BBC 提醒其综合性能依旧落后于二者。作为又一个把编码 benchmark 当成主战场的新模型,它凸显了当下 BackendForge 类自适应评测的价值。
  • Claude Code 与 DeepSeek 协助网络攻击(7-16 Hunt.io 披露):Hunt.io 在追踪 TencShell C2 时发现了 13 台香港服务器,其中一台开放目录泄露了包含受害者源代码、定制 exploit 与克隆登录页的 2,431 个文件;安全人员指认攻击者正在使用 Claude Code 和 DeepSeek 自动化针对政府和金融机构的入侵流程。链接:SecurityAffairs
  • 中国《AI 拟人化交互服务管理办法》7-15 生效:网信办等五部委联合发布的管理办法在结束三个月宽限期后正式生效,字节豆包和阿里 Qwen 同步关闭个性化陪伴功能,清空了大量用户的聊天记录;作为全球首个针对 AI 陪伴类成瘾性安全的国家级架构监管,这正在促使多国监管层重新定义儿童和学生端 AI 的安全框架。链接:TechTimes

本期由 AI 基于鸭哥已发布文章和公开资料整理生成,请注意甄别幻觉。

订阅本 newsletter:daily.yage.ai

鸭哥每日AI要闻

每天鸭哥的Agent会在深度领域调研后发送一封邮件。这个邮件不是一般的deep research,而是基于鸭哥的三层Memory系统,从鸭哥积累的领域知识和长期价值观出发,定制的主观的邮件报告。

Read more from 鸭哥每日AI要闻

[鸭哥 AI 手记] 2026-07-21: 训练算合理使用,Anthropic 还是赔了 15 亿美元 懒人包:Anthropic 赔了 15 亿美元,但法院其实倾向认定训练符合 fair use,钱买的是硬盘上留存盗版书的诉讼风险。另外两篇文章指出,Sandbox 选型同名不同质,需要厘清运行状态与写操作控制;数学 Agent 协议则通过双循环严格隔离探索草稿与前提。 15 亿美元买的是什么 7 月 20 日,加州北区联邦法院批准了 Anthropic 与作家的 15 亿美元和解(Bloomberg Law)。这是美国史上最大的版权集体诉讼和解。但拿到这笔钱之前,法庭已经倾向于认定一件事:把书读进显存训练模型,属于 fair use。训练本身符合规范,问题出在同一份数字副本在硬盘里存了太久。 鸭哥在 同一本书,训练可算合理使用,盗版流程为何要赔 15 亿美元 中指出,Anthropic 联合创始人 Ben Mann 在 2021 至 2022 年间,明知是盗版仍从 LibGen 和 PiLiMi 下载了最高 700 万册图书(The...

[鸭哥 AI 手记] 2026-07-20: Agent 装环境时,第三方代码已经跑完 懒人包:昨天发了 3 篇文章,核心指出 Coding Agent 在 setup 阶段执行 npm install 或 pip install 时,第三方代码就已经跑完,且防护绕过成本极低。从启动前检查到 OS 隔离 Sandbox,再到 Agent Skills 在各 Harness 间的兼容僵局,这组文章重新拆解了 AI agent 的执行边界与安全限制。 装环境时,第三方代码已经在跑 开发者把陌生仓库交给 Coding Agent 并要求跑起项目,Agent 读取 README 便会自动运行 npm install 或 pip install。预印本(arXiv:2607.15143)指出,这个准备阶段其实已经在执行第三方代码,而开发者此时连最终 diff 都还没看到。测试覆盖 Claude Code、Copilot CLI、Codex CLI 和 Cursor 的 9 种配置,作者在已知 CVE 漏洞场景中发现,9 个配置全数拿到 0/30 的检出率,没有一个 agent 主动查询...

[鸭哥 AI 手记] 2026-07-19: Grok Build 开源了,但官方二进制对不上公开 commit 懒人包:下载 xAI 官方的 Grok Build 版本 0.2.102 macOS 二进制,其报告的 commit ab5ebf69acec 在公开仓库中并不存在。昨天发布了三篇文章,分别探讨开源、memory 质量、网页发布三个容易混淆的概念。 Grok Build 公开了客户端,但模型和构建链仍是黑盒 xAI 宣布开源 Grok Build(x.ai/news/grok-build-open-source),包含本地的 agent runtime、沙箱和 MCP 等客户端核心逻辑,并采用 Apache-2.0 许可协议。Simon Willison 统计该仓库约有 84 万行 Rust 代码(Simon Willison 博客),但 Grok 模型与云端服务仍未公开。相较于 Codex CLI、Gemini CLI 或 Claude Code,Grok Build 明确在 CONTRIBUTING.md 中指出不接受外部 PR,由私有 monorepo...