懒人包:295B 模型压进单张 96GB 显卡。除了单卡运行的真实硬件预算,本期还关注网站对 agent 行为检测的边界,以及 MCP 协议在执行中途召回人类的交互设计。
腾讯混元在 7 月 14 日发布了 Hunyuan Hy3 的 IQ1_M 量化版本,把 295B 参数的大模型压到 85.5 GiB 左右(腾讯混元)。一张 96GB 显存的显卡已经能装下整个模型权重。但真实运行并不只看权重。除了静态的显存占用,模型推理还需要分配 KV cache 和计算缓冲。在无 MTP 版本的测试中,IQ1_M 权重占去 83.30 GiB,如果加上 64K 的 q8 KV cache,显存消耗会达到 93.93 GiB。此时单张 96GB 显卡只剩下 2.07 GiB 留给 CUDA context 和计算缓冲,官方把这个配置标注为 tight。
Hy3 是 MoE 架构,总参数 295B,激活参数 21B,支持 256K 上下文,Apache 2.0 开源。在 Artificial Analysis 评测中,其 Intelligence Index 达到 42 分(Artificial Analysis),智能体搜索能力在开源模型里表现强劲,不过代码能力弱于 GLM-5.2,推理成本约为后者的五分之一。点开 腾讯混元 Hy3 的 1-bit 量化:单卡能装下,离好用还有多远 可以看具体位宽分布与不同硬件下的部署建议。例如,IQ1_M 的实际平均位宽是 2.425 BPW,IQ1_M 把大量路由专家权重压到最低,但在注意力和共享专家等关键路径上保留了 Q6 到 Q8 的精度。
如果想用 MTP 提速,模型受单深度训练限制,在默认门控下 MTP 速度反而比基线慢,需要加上 --spec-draft-p-min=0.75 才能提速 26% 到 40%(llama.cpp PR)。Apple Silicon 上因为内存带宽瓶颈,MTP 几乎没有提速。
除了模型部署,agent 运行环境也在变得越来越真实。开发者开始用 Playwright 驱动真实的 Chrome 浏览器来干活,网站看到的浏览器环境完全真实,JavaScript 正常运行,请求也来自用户本人的设备。过去那套靠检查浏览器指纹合不合规的防线失效了。
为此,Cloudflare 在 7 月 13 日放出了 Cloudflare Precursor。它在客户端 session 级别盯着用户的操作,在 Turnstile 验证的间隙看动作合不合理。它不记录按键字符,也不绑定账户,只看访问者的连贯操作像不像真人,借此抓出混进来的 agent。
UC Davis 做了个 FP-Agent 受控实验,测出了传统防御的短板(arXiv)。他们拿 7 种不同的 Browser agent 各跑了 1000 次,并收集了 56 名人类学生的 546 份样本。结果显示,基于行为特征的分类器 F1 分数接近满分,而当时的 Cloudflare 只防住了 7 种 agent 中的 1 种。点开 Cloudflare Precursor:AI Agent 用上真实浏览器之后,Bot Detection 看什么 可以看 Bot Detection 演进过程、实验数据和身份授权层缺失的讨论。目前系统还是 pre-GA 免费预览,不过新闻稿写了 GA,技术博客写的是 rolling out。
当 agent 绕过网站的行为检测并开始干活,难免要调用各种外部工具。MCP 规范了 AI 应用和工具的连接方式,但当前的工具调用假设 client 发起请求时,server 已经拿齐了所有参数。但实际干活时,工具往往执行到一半,才发现需要用户点个授权、选个方案或者补齐关键信息。
MCP elicitation 给这个问题设计了反向通道:server 可以先停下任务,让 client 去问用户几个结构化问题,拿到回复后再带着之前的状态继续往前跑。
为了安全,协议把模式分成了 form 和 URL。form 负责收集非敏感的结构化输入;像 OAuth 授权、支付凭证等敏感流程则走 URL,直接把用户引到第三方页面,避免机密信息流进 client 或模型的上下文。
目前虽然协议成型了,但各家 client 的支持程度不一。Cursor 明确支持 form,但还不确定支不支持 URL;VS Code、Kiro、Claude Code 和 Codex 都有 form 和 URL 支持的直接证据;OpenCode 还在开发中。Cloudflare 在 7 月 13 日更新了 Cloudflare Agent SDK,让 Cloudflare Agent 能作为 MCP client 处理 form 和 URL 请求。点开 MCP 为什么需要 Elicitation:工具执行到一半,如何把人带回来 可以看三层边界设计和成熟 agent 交互原则的讨论。
DeepSeek 计划以约 $74B 估值再融资:DeepSeek 打算募集最多 500 亿元,目标是去上海 STAR Market IPO,其中 Tencent 出资 100 亿,CATL 出资 50 亿。这离它 6 月份刚拿到 $7.4B 融资才过去六周,估值已经从 4500 亿涨到 5000 亿元(路透社)。
Microsoft Patch Tuesday 修复 570 个漏洞创纪录:官方说,这次漏洞修复数量飙升是因为用上了 AI 辅助找漏洞。更新里包含了 2 个 zero-day 漏洞,CISA 已经把 SharePoint 漏洞列进了 KEV 列表(TechCrunch)。
本期由 AI 基于鸭哥已发布文章和公开资料整理生成,请注意甄别幻觉。
订阅本 newsletter:daily.yage.ai
每天鸭哥的Agent会在深度领域调研后发送一封邮件。这个邮件不是一般的deep research,而是基于鸭哥的三层Memory系统,从鸭哥积累的领域知识和长期价值观出发,定制的主观的邮件报告。
[鸭哥 AI 手记] 2026-07-21: 训练算合理使用,Anthropic 还是赔了 15 亿美元 懒人包:Anthropic 赔了 15 亿美元,但法院其实倾向认定训练符合 fair use,钱买的是硬盘上留存盗版书的诉讼风险。另外两篇文章指出,Sandbox 选型同名不同质,需要厘清运行状态与写操作控制;数学 Agent 协议则通过双循环严格隔离探索草稿与前提。 15 亿美元买的是什么 7 月 20 日,加州北区联邦法院批准了 Anthropic 与作家的 15 亿美元和解(Bloomberg Law)。这是美国史上最大的版权集体诉讼和解。但拿到这笔钱之前,法庭已经倾向于认定一件事:把书读进显存训练模型,属于 fair use。训练本身符合规范,问题出在同一份数字副本在硬盘里存了太久。 鸭哥在 同一本书,训练可算合理使用,盗版流程为何要赔 15 亿美元 中指出,Anthropic 联合创始人 Ben Mann 在 2021 至 2022 年间,明知是盗版仍从 LibGen 和 PiLiMi 下载了最高 700 万册图书(The...
[鸭哥 AI 手记] 2026-07-20: Agent 装环境时,第三方代码已经跑完 懒人包:昨天发了 3 篇文章,核心指出 Coding Agent 在 setup 阶段执行 npm install 或 pip install 时,第三方代码就已经跑完,且防护绕过成本极低。从启动前检查到 OS 隔离 Sandbox,再到 Agent Skills 在各 Harness 间的兼容僵局,这组文章重新拆解了 AI agent 的执行边界与安全限制。 装环境时,第三方代码已经在跑 开发者把陌生仓库交给 Coding Agent 并要求跑起项目,Agent 读取 README 便会自动运行 npm install 或 pip install。预印本(arXiv:2607.15143)指出,这个准备阶段其实已经在执行第三方代码,而开发者此时连最终 diff 都还没看到。测试覆盖 Claude Code、Copilot CLI、Codex CLI 和 Cursor 的 9 种配置,作者在已知 CVE 漏洞场景中发现,9 个配置全数拿到 0/30 的检出率,没有一个 agent 主动查询...
[鸭哥 AI 手记] 2026-07-19: Grok Build 开源了,但官方二进制对不上公开 commit 懒人包:下载 xAI 官方的 Grok Build 版本 0.2.102 macOS 二进制,其报告的 commit ab5ebf69acec 在公开仓库中并不存在。昨天发布了三篇文章,分别探讨开源、memory 质量、网页发布三个容易混淆的概念。 Grok Build 公开了客户端,但模型和构建链仍是黑盒 xAI 宣布开源 Grok Build(x.ai/news/grok-build-open-source),包含本地的 agent runtime、沙箱和 MCP 等客户端核心逻辑,并采用 Apache-2.0 许可协议。Simon Willison 统计该仓库约有 84 万行 Rust 代码(Simon Willison 博客),但 Grok 模型与云端服务仍未公开。相较于 Codex CLI、Gemini CLI 或 Claude Code,Grok Build 明确在 CONTRIBUTING.md 中指出不接受外部 PR,由私有 monorepo...