懒人包:Thomson Reuters 两年累计投了 4000 万美元,在 open-weight 底座上训出 Thomson 1.0,自报法律域评测打赢了主流闭源模型。鸭哥昨天发了 2 篇 AI 文章,一篇算的是这笔账,另一篇则解析了 MCP 这两年的演进主线:默认调用者如何从屏幕前点审批的人,变成自带身份的云端进程。今日动态还有 Anthropic 发布的物理设备控制标准,以及 OpenAI 对 AI 驱动的网络攻击发出的预警。
2026 年 8 月 24 日,Thomson Reuters 把在 open-weight 底座 Qwen3.6-35B-A3B 上做后训练的 Thomson 1.0 挂上了 HuggingFace(HuggingFace)。这家有 175 年历史的公司自述两年累计投了 4000 万美元,耗费 35,207 个 B200 GPU 小时,算下来纯算力开销也就 10 万到 20 万美元。他们自报的法律域评测得分是 75.2,高过底座的 72.7、Gemma 4-31B 的 70.5 和 Haiku 4.5 的 67.7(LawNext)。
三年前 Bloomberg 走的是另一条路,在 2023 年 3 月用 363B token 的私有金融数据,从零训练出 50B 参数的 BloombergGPT(arXiv 2303.17564)。但 Bloomberg 终端产品负责人 Wayne Barlow 在 2026 年 4 月受访时说,这模型只是研究模型,没用在任何产品里(A-Team Insight)。
对数据富集的垂直公司来说,这展示了一条新路:在 open-weight 底座上做私有后训练。4000 万美元预算里算力只是零头,钱主要花在专有内容资产、专家标注和评测体系上,底座权重反而退成了随时能换的零件。
不过这也有代价。域注入后通用能力会回退,AIME 从 93.3 下滑到 90.0,以至于 CoCounsel 产品必须多模型共存。同时,用开放底座的前提也在收紧:Kimi K3 规定做 MaaS 且年营收超 2000 万美元得签单独协议,MiniMax H3 对年营收超 2000 万美元的商业产品同样要求书面授权,路透社还报道阿里计划向 Qwen 大客户收取分成,只是截至发稿尚未官宣(Quartz)。
鸭哥在 域模型的第三条路:一个 175 年公司的 $40M 答案 里写清了自研、租 API 和后训练三条路线的决策规则。文章同时梳理了 12 家企业成败分层,并提供了启动前的三项刚性前提自检清单。
域模型要进生产,必须调工具。但如果 agent 要在云端无人值守运行,每次都卡在浏览器点人工审批就不现实了。为此,MCP 路线图在 2026 年 8 月 22 日把 agent identity 列为五大优先级之一,要把默认调用者从屏幕前点审批的人,变成自带身份的云端进程(MCP 官方博客)。
这两年里,协议分四步补上了授权能力。维护者先在 2025 年 3 月引入 OAuth 2.1 框架,11 月支持机器对机器凭据,12 月提出 WIF 提案(GitHub),并在 2026 年 5 月把 ID-JAG 草案更新到了 v4(IETF)。
安全机制一层层叠上来,协议也跟着变厚。规范把面向个人开发者的几项能力砍掉了。
像 2026 年 7 月 28 日那次变更就废弃了 Sampling 与 Roots,Logging 也一并列入弃用(MCP 官网)。其中 Sampling 从进入规范到废弃,只存在了 8 个月。
往后谁能审批、谁能撤销委托,关口都交到了签发 token 的一方手里,在 .env 里贴长命 API key 的习惯正在成为历史。现在远程部署 MCP server,其实已经能接 OAuth 2.1 和 Enterprise-Managed Authorization 扩展;不过 WIF 还只是 Draft 状态,暂时不用急着写校验代码(GitHub)。要是未来两三个规范周期内,WIF 和 DPoP(RFC 9449)还停在草案里,这个判断就失效了。
在 从屏幕前的人到云端的进程:MCP 默认调用者的两年转向 里,鸭哥整理了 Hacker News 上拿了约 270 分的社区讨论(Hacker News)。文里还带上了 AWS 那篇喊 ditch the MCP overhead 的文章(AWS Builder)和 Cloudflare code mode 的实操细节(Cloudflare)。
中国开放权重模型开始赢得美国企业:Harvey 把新模型 Tenet 押在 Kimi K3 上后训练,复杂法律 agentic 任务的表现超过了 Fable 5 和 GPT-5.6 Sol(Fortune);IBM 把原本跑在 Claude 上的文档审查工作迁到了开放底座;同期 DeepSeek 启动了估值约 740 亿美元的 pre-IPO 融资(SCMP)。
Anthropic 发布 Model Hardware Standard:这是一套让 agent 标准化操控显微镜、机械臂等物理设备的接口,目前处于 research preview 阶段,计划开源(CNBC)。
OpenAI 联合 100 多家公司发公开信:警告未来几个月内可能发生针对关键基础设施、由 AI 驱动的网络攻击,联署方包括 Anthropic、Google、Microsoft 和 Visa(Fox Business)。
本期由 AI 基于鸭哥已发布文章和公开资料整理生成,请注意甄别幻觉。
订阅本 newsletter:daily.yage.ai
每天鸭哥的Agent会在深度领域调研后发送一封邮件。这个邮件不是一般的deep research,而是基于鸭哥的三层Memory系统,从鸭哥积累的领域知识和长期价值观出发,定制的主观的邮件报告。
[鸭哥 AI 手记] 2026-09-06: Claude 花 $1200 教 Gemma 玩方块,0 分涨到 16 分 懒人包:Lambda 在展台直播了两天半,让 Claude Code 教权重冻结的 Gemma 4 玩俄罗斯方块,跑了 90 个想法和 400 多局,花掉 1200 美元 API 费用,让分数从 0 涨到 16。提分靠的是锁死的考场、取中位数的纪律和实验记录本。另一边 Cerebras 标称约 1500 tok/s 的极速推理接进写代码工作流,长上下文有效吞吐中位数只剩 357 tok/s,65 秒就撞上 TPM 限额,3.24 分钟花掉 $1.57 任务还没写完。鸭哥昨天发了 2 篇文章:《Claude 花了 1200 美元,让 Gemma 玩俄罗斯方块从 0 分涨到 16 分》 梳理了三次堵漏过程与三条可直接搬走的 agent 落地原则,附带开源记录工具;《tok/s 是 agentic 场景里最会骗人的性能数字》 算清了 decode 速度与预填充时长的账本,给出一套拿自己真实负载测有效吞吐的方法与开源工具。 0 到 16 分之间堵了三次漏 Lambda...
[鸭哥 AI 手记] 2026-09-05: 四款独立 AI 浏览器退场,登录态离机器有多远 懒人包:一年内四款独立 AI 浏览器先后退场,agent 浏览能力退回既有入口,真正的分歧在于登录态放在离你机器多远的地方。九家厂商排成一条从本机到云端的队列,架构选择不消除事故概率,只决定出事时要收拾多大的摊子;另一边屏幕记忆面临两难,像素快照太重且隐私门槛高,纯事件日志又太空,第三条路是低保真文字加文件指针。鸭哥昨天发了 2 篇文章:《Agent 的浏览器放在哪:凭证不出本机的战争》 给出评估 agent 浏览器的三问框架与九家厂商落位,算清安全、法律与算力三本账;《屏幕记忆的第三条路:存指针,不存像素》 梳理了记忆系统的三层结构,给出一套直接落地的存储分配规则与两项排查。 登录态离机器有多远 从 5 月到 8 月,四款独立 AI 浏览器先后收摊。Google 的 Mariner 在 5 月 4 日关停(PCMag 报道),技术并入 Gemini Agent 和 Chrome。OpenAI 的 Atlas 7 月 9 日宣布退役、8 月 9 日停止工作(官方 FAQ),浏览能力并进...
[鸭哥 AI 手记] 2026-09-04: 换 GPT-4o 只加 5.8 分,训练 7B 加 17.2 分 懒人包:Stanford 的 AgentFlow 在同一套骨架下对照了三种改法。换成 GPT-4o 只多 5.8 分,让 7B 在真实工具反馈里训练却多出 17.2 分,差距不在模型大小,在有没有反馈闭环。另一边把开源模型搬回家要面对利用率与延迟的冲突,两张 H100 私有部署每月吞吐要达到约 20 亿 token 才能打平云端 API,先租两三周跑跑看再做长期决定。鸭哥昨天发了 2 篇文章:《换 GPT-4o 只多 5.8 分,训练 7B 却多了 17.2 分》 讲清了反馈闭环重塑工具选择的机制,给出训练前的四道门自检与三条起步路径;《把模型搬回自己家之前,先算三本账》 算清了钱、数据与能力三本账,给出硬件谱系与七个决策信号。 AgentFlow:同一套骨架的三种改法 Stanford 团队拿下 ICLR 2026 Oral 的 AgentFlow(AgentFlow 论文;项目主页),在同一套 agent...