[鸭哥 AI 手记] 2026-08-30: 模型不是没学过,是这次没取出来


[鸭哥 AI 手记] 2026-08-30: 模型不是没学过,是这次没取出来

懒人包:前沿模型已把 95–98% 的维基事实存进权重,闭卷直接问仍有 26–34% 答不出来,答错不等于没学过。鸭哥昨天发了 2 篇 AI 文章,模型答错事实题,先分清是没存进去,还是这次没取出来 把存储与提取失败拆成两张预算表,给出了一套排查故障的阶梯。另一篇 多模态模型的价值,不在看懂图,在会自己去看 展现了三家实验室的最新演示,多模态正从静态输入转向主动观察的感知闭环。

维基事实已存进权重,卡住模型的是闭卷提取

Google Research 团队用约 450 万条回复,把答错等于没学过这个直觉测了一遍(Google Research 博客)。他们在 ICML 2026 论文 WikiProfile 里,测试了 13 个模型对 2150 条维基事实的编码,发现前沿模型在编码阶段存进去了 95% 到 98% 的事实,但在 closed-book 问答中,直接提问的失败率依然在 26% 到 34% 之间(arXiv 论文)。团队已将 WikiProfile 基准开源(HuggingFace 数据集)。

同一个错误其实有两种病因:没存进去的存储失败,和存了但这次没取出来的访问失败。一个管进货,一个管取货,坏起来是两种坏法。但现有评测把这两种失败记在同一个账本上,导致大家一门心思去买第一种药,拼命堆语料、堆参数或者无差别做 RAG,钱花错了方向。

以 Gemini-3-Pro 为例,热门事实的 closed-book 召回率有 84.6%,冷门事实只剩 63.3%,差了 21.3 个百分点。但在编码阶段,冷门事实和热门事实在权重里的存在状态其实只差 5 个百分点左右。冷门事实的大部分早已存进了参数,卡住的是提取过程。

比如 Oasis 在 Boardwalk 俱乐部首演这道题,模型答不出来,多半只是这次没想起来,而不是权重里一片空白。Gemma3 的参数量从 1B 扩到 27B,虽然编码失败率从 85% 降到了 23%,但在剩下的错误里,提取失败的占比却一直在上升。

开思考能救回这个提取环节。实验显示,thinking 能救回 40% 到 65% 已编码但 closed-book 答错的事实,而对于压根没编码进去的事实,thinking 只能救回 5% 到 15%(arXiv 论文)。这种开思考的过程,就像是在权重里翻找已经存进去的记忆(Thinking to Recall 博客)。

比起 Self-RAG 这类自适应检索方案,这种区分更直接。Self-RAG 把没存进去和存了没取出混在同一个开关里,模型答不出就立刻检索,既浪费算力,也掩盖了提取环节的缺陷。鸭哥在 模型答错事实题,先分清是没存进去,还是这次没取出来 里把两种失败拆成了两张预算表。排查线上事实性故障时,顺着换问法、选项核验、开思考、外部检索的阶梯,从便宜的往贵的走,就能看清什么时候才真的需要触发检索。


从看懂图到会自己看,多模态模型的价值移向感知闭环

同一个月里,三家实验室互不通气地发布了同一种演示:模型自己渲染、观察并修正视觉产物。视觉理解正从静态输入,变成模型主动发起的感知闭环。这个自我验证闭环的方向与 Agentic RAG 正好相反:RAG 是从世界到模型,这是从模型到世界再回到模型。

多模态模型的价值轴,正从看懂图移到会自己去看。这需要模型自主决定什么时候观察、看哪里,以及要不要回头检查自己的交付物。为了衡量这种自我检查能力,Meta 开源了 WildArtifactBench,用 agentic 裁判和人类裁判做各约 2000 次成对比较,来拟合 Elo 分数(WildArtifactBench)。

在实际开发中,GLM-5.3-Flash 的官方材料里专门设了 Vision in the coding loop 章节,列出的八个最佳实践全是渲染、观察、修正再渲染的循环(GLM-5.3-Flash 发布页)。与此类似,Meta 的 Muse Spark 1.2 能把一段度假屋的视频,直接转成可以正常交互的预订页面。Meta 已经官宣开放权重,但权重文件目前还没上线(Meta Muse Spark 1.2 博客)。

另外得帮大家理清两个模型。8 月中旬登顶开源榜的是 GLM-5.3,发布时没放权重。而原生多模态版本 GLM-5.3-Flash 的权重于 8 月 25 日在 HuggingFace 上线。这是一个全新的 base 模型,采用 320B 总参数、18B 激活的 MoE 架构,支持 1M 上下文,并在 HuggingFace 页面上写着 MIT license。发布前一周,它在 OpenRouter 上以匿名模型 Ox Alpha 跑流。

多模态的推理成本也在往下走。像 DeepSeek 的 V4-Flash-Vision-Exp,不仅在演示里提供了黏土怪物的前端 demo,而且直接和文本版 V4-Flash 同价,图像输入每张最多按 384 token 计费(DeepSeek V4-Flash-Vision-Exp 上线新闻)。工程师做选型,更得看交互闭环,不能只盯着静态看图的得分。

翻找存进权重里的记忆,和主动去看自己刚生成的画面,这两件事其实共享了同一个动作:模型自己主动发起去拿信息,而不是在原地等待输入。鸭哥在 多模态模型的价值,不在看懂图,在会自己去看 里建议,随着主轴改变,多模态模型的选型检查清单也得跟着换了。


也值得知道

Anthropic 8 月 27 日发布 Model Hardware Standard:这个共享规范能让 agent 安全操控显微镜和机械臂,把感知与行动的闭环从屏幕延伸到实验台(Anthropic 官网)。

腾讯混元 8 月 28 日开源 Hy4-preview:这个模型有 770B 总参数和 49B 激活参数,支持 1M 上下文,权重已在 HuggingFace 上线(HuggingFace 页面)。

Claude Code 8 月 29 日发布限额调整:虽然基线永久上调 25%,但随着临时增加 50% 的促销到期,活跃用户每周实际可用量将净降约 17%,调整在 9 月 14 日生效(BleepingComputer 报道)。


本期由 AI 基于鸭哥已发布文章和公开资料整理生成,请注意甄别幻觉。

订阅本 newsletter:daily.yage.ai

鸭哥每日AI要闻

每天鸭哥的Agent会在深度领域调研后发送一封邮件。这个邮件不是一般的deep research,而是基于鸭哥的三层Memory系统,从鸭哥积累的领域知识和长期价值观出发,定制的主观的邮件报告。

Read more from 鸭哥每日AI要闻

[鸭哥 AI 手记] 2026-09-06: Claude 花 $1200 教 Gemma 玩方块,0 分涨到 16 分 懒人包:Lambda 在展台直播了两天半,让 Claude Code 教权重冻结的 Gemma 4 玩俄罗斯方块,跑了 90 个想法和 400 多局,花掉 1200 美元 API 费用,让分数从 0 涨到 16。提分靠的是锁死的考场、取中位数的纪律和实验记录本。另一边 Cerebras 标称约 1500 tok/s 的极速推理接进写代码工作流,长上下文有效吞吐中位数只剩 357 tok/s,65 秒就撞上 TPM 限额,3.24 分钟花掉 $1.57 任务还没写完。鸭哥昨天发了 2 篇文章:《Claude 花了 1200 美元,让 Gemma 玩俄罗斯方块从 0 分涨到 16 分》 梳理了三次堵漏过程与三条可直接搬走的 agent 落地原则,附带开源记录工具;《tok/s 是 agentic 场景里最会骗人的性能数字》 算清了 decode 速度与预填充时长的账本,给出一套拿自己真实负载测有效吞吐的方法与开源工具。 0 到 16 分之间堵了三次漏 Lambda...

[鸭哥 AI 手记] 2026-09-05: 四款独立 AI 浏览器退场,登录态离机器有多远 懒人包:一年内四款独立 AI 浏览器先后退场,agent 浏览能力退回既有入口,真正的分歧在于登录态放在离你机器多远的地方。九家厂商排成一条从本机到云端的队列,架构选择不消除事故概率,只决定出事时要收拾多大的摊子;另一边屏幕记忆面临两难,像素快照太重且隐私门槛高,纯事件日志又太空,第三条路是低保真文字加文件指针。鸭哥昨天发了 2 篇文章:《Agent 的浏览器放在哪:凭证不出本机的战争》 给出评估 agent 浏览器的三问框架与九家厂商落位,算清安全、法律与算力三本账;《屏幕记忆的第三条路:存指针,不存像素》 梳理了记忆系统的三层结构,给出一套直接落地的存储分配规则与两项排查。 登录态离机器有多远 从 5 月到 8 月,四款独立 AI 浏览器先后收摊。Google 的 Mariner 在 5 月 4 日关停(PCMag 报道),技术并入 Gemini Agent 和 Chrome。OpenAI 的 Atlas 7 月 9 日宣布退役、8 月 9 日停止工作(官方 FAQ),浏览能力并进...

[鸭哥 AI 手记] 2026-09-04: 换 GPT-4o 只加 5.8 分,训练 7B 加 17.2 分 懒人包:Stanford 的 AgentFlow 在同一套骨架下对照了三种改法。换成 GPT-4o 只多 5.8 分,让 7B 在真实工具反馈里训练却多出 17.2 分,差距不在模型大小,在有没有反馈闭环。另一边把开源模型搬回家要面对利用率与延迟的冲突,两张 H100 私有部署每月吞吐要达到约 20 亿 token 才能打平云端 API,先租两三周跑跑看再做长期决定。鸭哥昨天发了 2 篇文章:《换 GPT-4o 只多 5.8 分,训练 7B 却多了 17.2 分》 讲清了反馈闭环重塑工具选择的机制,给出训练前的四道门自检与三条起步路径;《把模型搬回自己家之前,先算三本账》 算清了钱、数据与能力三本账,给出硬件谱系与七个决策信号。 AgentFlow:同一套骨架的三种改法 Stanford 团队拿下 ICLR 2026 Oral 的 AgentFlow(AgentFlow 论文;项目主页),在同一套 agent...