懒人包:Stanford 的 AgentFlow 在同一套骨架下对照了三种改法。换成 GPT-4o 只多 5.8 分,让 7B 在真实工具反馈里训练却多出 17.2 分,差距不在模型大小,在有没有反馈闭环。另一边把开源模型搬回家要面对利用率与延迟的冲突,两张 H100 私有部署每月吞吐要达到约 20 亿 token 才能打平云端 API,先租两三周跑跑看再做长期决定。鸭哥昨天发了 2 篇文章:《换 GPT-4o 只多 5.8 分,训练 7B 却多了 17.2 分》 讲清了反馈闭环重塑工具选择的机制,给出训练前的四道门自检与三条起步路径;《把模型搬回自己家之前,先算三本账》 算清了钱、数据与能力三本账,给出硬件谱系与七个决策信号。
Stanford 团队拿下 ICLR 2026 Oral 的 AgentFlow(AgentFlow 论文;项目主页),在同一套 agent 编排骨架下,专门对照了决策节点的三种改法。表格里摆着三组对照数据:原版冻结的 Qwen2.5-7B 决策节点,在六个基准上平均只有 38.5 分。换成 2024 年中的 GPT-4o,拿到 44.3 分,多 5.8 分。照抄 GPT-4o 成功轨迹做 SFT,反而跌到 19.5 分,倒扣 19 分。让原来的 7B 在真实工具反馈里在线训练(Flow-GRPO,8 条并发探索路径共享整条路径的成败信号),成绩冲到 55.7 分,净增 17.2 分。增益来自反馈闭环,无关模型大小。把决策从提示词手里拿走,交给权重。
行为上的变化比跑分更说明问题。在 MedQA 评测里,训练前模型 66.2% 的调用都堆在通用 Google 搜索上。训练之后,这一比例降到 10.9%,维基百科搜索从零升到 59.8%。没人写死规则让它换工具,真实反馈自己重塑了它的默认动作。模型没死记硬背更多医学名词,遇到专业问题,直接学会先伸手抓专业工具。
拿真实环境反馈校正行为,开源社区这阵子其实跑出过好几个标杆。WebRL(WebRL 论文)把 8B 模型在 WebArena-Lite 的成绩从 4.8% 提到 42.4%。SWE-Gym(SWE-Gym 论文)用 491 条轨迹让 32B 模型在 SWE-bench Verified 提升 12 到 14 个百分点。Agent Lightning v1.0(Agent Lightning 论文)用 6000 条样本把 9B 模型的 SWE-bench Verified 从 41.8% 提到 56.4%。
不过读这篇论文,几处边界得提前心里有数。对照组拿的是 2024 年中的 GPT-4o。多数基准只随机抽选 100 道题,AIME24 更是只选了 30 题。所有测试数字全来自作者自评,暂无第三方复现。算力账单只披露使用了 8 张 A100,训练总时长和裁判账单均未公布。
想自己动手训决策节点,得先过四道门自检:任务反复发生、成败能自动判定、错误瓶颈在决策节点、环境支持安全重置。落地可以走三条低门槛路径:Unsloth 配 OpenPipe ART、Agent Lightning 零改动接入,或者 LoRA SFT 两阶段切入。四道门自检清单和三条起步路径,鸭哥都放在 《换 GPT-4o 只多 5.8 分,训练 7B 却多了 17.2 分》 里了。骨架归编排,脾气归训练,互不抢活。
两篇其实都在做同一个动作:把站队争论的能不能,换成看条件的什么情况下才行。看完训练节点的准入门槛,把开源模型搬回家又是另一笔账。GPU 云厂商 Lambda 的工程师 Zach Mueller,自费在家里装了六张 RTX 6000 Blackwell 跑开源模型。他在与 Hamel Husain 的对谈里(视频)公开承认不省钱。家用 GPU 实际只跑 40% 到 60% 的时间,他的原话是 "it is training and sharpening my skills. I don't even try and justify it anymore"。卖 GPU 的人亲口推翻自托管省钱的假设,比分数榜单更能说明这笔账复杂。
能跑通不等于该自建。开源模型的可行性早已解决。OpenRouter 上 DeepSeek 周度 token 份额从 1 月的 9% 涨到 6 月的 18%,5 月中旬起稳居平台第一(OpenRouter 博客)。决策不能只看可行性,关键要算清钱、数据、能力三本账。
算钱这本账时,显卡利用率与交互延迟天生打架。在 H100 上跑 Llama 70B,并发从 1 拉到 100 时吞吐涨了 20 倍,首 token 延迟却从 45 毫秒涨到 740 毫秒(实测数据)。为了拉满利用率省钱,终端等第一个字的时间拉长十几倍。按原文作者估算(盈亏平衡计算),两张 H100 私有部署每月实际吞吐要达到约 20 亿 token,才能打平中等价位云端 API。
隐性开销与开源协议变数,又把门槛往上推了一截。算上软硬件维护,自建总开销往往达到硬件账单的三到五倍,单张 RTX 4090 全口径持有成本约每月 104 美元(成本分析)。开源模型本身的授权也有雷点,像 MiniMax M2.7 的 GitHub 仓库 LICENSE 里就写着非商用许可(MiniMax 许可)。
鸭哥在 《把模型搬回自己家之前,先算三本账》 里梳理了租 token、租硬件、自购硬件的三档谱系与七个决策信号。面对硬件投入,最稳妥的做法是先租两三周云端机器,记录真实的 token 吞吐与并发曲线,再决定签长期合同还是买硬件。Zach 的收尾原话是:"Otherwise, it's a toy and it's a very expensive toy"。
ChatGPT 与 Codex 出现大面积宕机:9 月 3 日上午 10:58 ET 起,15 个 ChatGPT 组件和 4 个 Codex 组件全部降级,Downdetector 峰值报告超 74,000 份。服务已于当日恢复,官方说明仅称 elevated errors 且未公布根因,同日 Claude 和 Grok 也出现服务故障(BleepingComputer 报道)。
Cognition 接近完成新一轮融资:据 Bloomberg 9 月 2 日报道,Devin 母公司 Cognition 接近完成约 10 亿美元新融资,估值从 5 月的 260 亿美元涨到约 470 亿美元。其年化营收从 4.92 亿美元升到 9 亿美元以上,目前谈判尚未关闭,最终条款可能变化(Investing.com 转述)。
美国在 G20 会议反对专项 AI 监管:9 月 1 至 2 日 G20 创新部长级会议上,美国公开反对 AI 专项监管,与欧盟推动新法的路径分开走。Politico 同周披露 Zuckerberg 私下致电反对设立独立 AI 监管机构,双方在监管尺度上的分歧正在扩大(Al Jazeera 报道)。
本期由 AI 基于鸭哥已发布文章和公开资料整理生成,请注意甄别幻觉。
订阅本 newsletter:daily.yage.ai
每天鸭哥的Agent会在深度领域调研后发送一封邮件。这个邮件不是一般的deep research,而是基于鸭哥的三层Memory系统,从鸭哥积累的领域知识和长期价值观出发,定制的主观的邮件报告。
[鸭哥 AI 手记] 2026-09-06: Claude 花 $1200 教 Gemma 玩方块,0 分涨到 16 分 懒人包:Lambda 在展台直播了两天半,让 Claude Code 教权重冻结的 Gemma 4 玩俄罗斯方块,跑了 90 个想法和 400 多局,花掉 1200 美元 API 费用,让分数从 0 涨到 16。提分靠的是锁死的考场、取中位数的纪律和实验记录本。另一边 Cerebras 标称约 1500 tok/s 的极速推理接进写代码工作流,长上下文有效吞吐中位数只剩 357 tok/s,65 秒就撞上 TPM 限额,3.24 分钟花掉 $1.57 任务还没写完。鸭哥昨天发了 2 篇文章:《Claude 花了 1200 美元,让 Gemma 玩俄罗斯方块从 0 分涨到 16 分》 梳理了三次堵漏过程与三条可直接搬走的 agent 落地原则,附带开源记录工具;《tok/s 是 agentic 场景里最会骗人的性能数字》 算清了 decode 速度与预填充时长的账本,给出一套拿自己真实负载测有效吞吐的方法与开源工具。 0 到 16 分之间堵了三次漏 Lambda...
[鸭哥 AI 手记] 2026-09-05: 四款独立 AI 浏览器退场,登录态离机器有多远 懒人包:一年内四款独立 AI 浏览器先后退场,agent 浏览能力退回既有入口,真正的分歧在于登录态放在离你机器多远的地方。九家厂商排成一条从本机到云端的队列,架构选择不消除事故概率,只决定出事时要收拾多大的摊子;另一边屏幕记忆面临两难,像素快照太重且隐私门槛高,纯事件日志又太空,第三条路是低保真文字加文件指针。鸭哥昨天发了 2 篇文章:《Agent 的浏览器放在哪:凭证不出本机的战争》 给出评估 agent 浏览器的三问框架与九家厂商落位,算清安全、法律与算力三本账;《屏幕记忆的第三条路:存指针,不存像素》 梳理了记忆系统的三层结构,给出一套直接落地的存储分配规则与两项排查。 登录态离机器有多远 从 5 月到 8 月,四款独立 AI 浏览器先后收摊。Google 的 Mariner 在 5 月 4 日关停(PCMag 报道),技术并入 Gemini Agent 和 Chrome。OpenAI 的 Atlas 7 月 9 日宣布退役、8 月 9 日停止工作(官方 FAQ),浏览能力并进...
[鸭哥 AI 手记] 2026-09-03: Codex 源码里的自唤醒机制,OpenAI 还不敢上线 懒人包:媒体把 Codex 的后台模式讲成 24/7 永动机,源码模板里写的是每 1 到 3 分钟醒一次的采样循环,而网络请求里这个档位的值还写着 disabled。主动帮忙的时机判断准确率最高只有 64.4%,闹钟和任务单都交给模型还为时过早;另一边 prompt caching 正在搅浑三本 AI 账,智能体 token 名义用量过线人类 5.2 倍、实际账单只差约 2 倍。鸭哥昨天发了 2 篇文章:《改完代码自己定闹钟盯 CI:OpenAI 源码里的自唤醒机制》 用两个问题给所有后台 agent 分了类,给出三条今天就能搬走的后台纪律;《智能体 token 用量过线人类、OpenAI 自研芯片跑分出炉、GitHub 发布文档压缩原型》 拆开名义口径和折扣后口径,给出核对用量、省钱故事与芯片跑分的三句口诀。 媒体标题与源码注释各说各话 WIRED 8 月 27 日爆料 OpenAI 正在给 Codex 开发后台模式(WIRED 报道),一圈媒体跟着发文,标题里写满 24/7...