[鸭哥 AI 手记] 2026-07-19: Grok Build 开源了,但官方二进制对不上公开 commit


[鸭哥 AI 手记] 2026-07-19: Grok Build 开源了,但官方二进制对不上公开 commit

懒人包:下载 xAI 官方的 Grok Build 版本 0.2.102 macOS 二进制,其报告的 commit ab5ebf69acec 在公开仓库中并不存在。昨天发布了三篇文章,分别探讨开源、memory 质量、网页发布三个容易混淆的概念。

Grok Build 公开了客户端,但模型和构建链仍是黑盒

xAI 宣布开源 Grok Build(x.ai/news/grok-build-open-source),包含本地的 agent runtime、沙箱和 MCP 等客户端核心逻辑,并采用 Apache-2.0 许可协议。Simon Willison 统计该仓库约有 84 万行 Rust 代码(Simon Willison 博客),但 Grok 模型与云端服务仍未公开。相较于 Codex CLI、Gemini CLI 或 Claude Code,Grok Build 明确在 CONTRIBUTING.md 中指出不接受外部 PR,由私有 monorepo 单向同步。

Grok Build 官方二进制与公开源码之间并不完全一致。下载最新的 macOS 版本 0.2.102 客户端,它报告的 commit ab5ebf69acec 在公开仓库中找不到,也不等于仓库记录的 SOURCE_REV。此前包含数据上传争议的版本 0.2.93(commit f00f96316d4b)同样未出现在公开 Git 历史里。

虽然 cereblab 抓包(gist)显示旧版上传了完整 Git 仓库,且 xAI 后续已通过 disable_codebase_upload 选项关闭了代码库上传通道,但因为没有可以复现的构建链,下载到的程序是不是这份源码,仍要另外验证。鸭哥在 Grok Build 开源了,到底开源了什么? 里梳理了这一开源边界的细节。


memory benchmark 测 recall,产品却更需要写入 precision

源码是否可见容易查明,而 memory 质量的评估却存在概念混淆:基准评测关注的指标,与用户实际使用产品时在意的指标,并不是一回事。

目前的 memory 基准评测倾向于测试信息的 recall,即大模型在需要检索时能否找到;但对于真实产品,无序写入所带来的 precision 污染才是问题所在。一旦 AI 误存了一条事实,这个错误信息就会在后续的所有会话中反复出现,影响后续回答。

最新的 PASB 研究(arXiv:2607.10526v2)在 12 个大模型 backbone 下跨 Hermes-Agent 和 OpenClaw 框架测试发现,当大模型将信息写入长期 memory 时,下游任务的失败率均值从 45.0% 升到了 71.9%,相差 27 个百分点。即使像 OpenAI 的 Dreaming 架构 能在测试集上提升回忆率,ChatGPT、Claude 和 Gemini 这三家厂商也没公布功能启用率等实际产品指标。

个案数据更为直观:在 Mem0 社区的一个 issue 记录中(issue #4573),用户累积的 10,134 条 memory 在人工清理后只保留了 224 条。鸭哥在 AI Memory 的 Benchmark 偏向 Recall,产品却更需要 Precision 里探讨了产品内部指标的错配问题,说明了无序写入带来的噪声如何破坏实际体验。


AI 做完网页,先判断要不要后台

memory 决定了 AI 能否跨会话连续工作,而另一个容易忽略的环节是,AI 做出网页后还要发布给别人看。

使用 v0、Lovable 或 Bolt.new 等工具自动生成 slide 页面、个人主页或 demo 之后,托管选择落在四条路上:Cloudflare Workers Static Assets、Vercel Drop、Koyeb,或者自备 VPS。做决定的分水岭在于:该页面是否真的需要处理后台逻辑或访问敏感凭证。

如果是纯静态页面,首选 Cloudflare Workers Static Assets,其静态资产请求免费且不限量(Cloudflare 文档);如果需要团队协作 review,Vercel Drop 允许直接拖拽文件夹部署;如果即将接入后台,支持 scale-to-zero 的 Koyeb 能够提供更快的冷启动体验;而如果需要对接 Turso 等数据库,要避免把敏感凭证直接写入前端。这套选择清单能避免为了静态展示而引入不必要的后端复杂度,具体的决策路径可以参考鸭哥的 AI 做完了一个网页,下一步该放到哪里?


也值得知道

[Kimi K3 开源,权重 7-27 放]:Moonshot 推出了拥有 2.8 万亿参数、1M 上下文的 Kimi K3,并在编程与 agent 任务上宣称其表现出色,计划于 7 月 27 日开放权重(CNBC)。

[Patreon 用 Cloudflare 主动屏蔽 AI 爬虫]:Patreon 放弃了单纯依赖 robots.txt 的传统做法,改用 Cloudflare 的 AI Crawl Control 在网关处主动拦截各类训练爬虫(TechCrunch)。

[Capital One 开源 VulnHunter]:金融巨头 Capital One 开源了安全工具 VulnHunter,利用 AI 在代码交付前自动分析软件中的安全漏洞,绘制黑客可利用的攻击路径(VentureBeat)。


本期由 AI 基于鸭哥已发布文章和公开资料整理生成,请注意甄别幻觉。

订阅本 newsletter:daily.yage.ai

鸭哥每日AI要闻

每天鸭哥的Agent会在深度领域调研后发送一封邮件。这个邮件不是一般的deep research,而是基于鸭哥的三层Memory系统,从鸭哥积累的领域知识和长期价值观出发,定制的主观的邮件报告。

Read more from 鸭哥每日AI要闻

[鸭哥 AI 手记] 2026-07-21: 训练算合理使用,Anthropic 还是赔了 15 亿美元 懒人包:Anthropic 赔了 15 亿美元,但法院其实倾向认定训练符合 fair use,钱买的是硬盘上留存盗版书的诉讼风险。另外两篇文章指出,Sandbox 选型同名不同质,需要厘清运行状态与写操作控制;数学 Agent 协议则通过双循环严格隔离探索草稿与前提。 15 亿美元买的是什么 7 月 20 日,加州北区联邦法院批准了 Anthropic 与作家的 15 亿美元和解(Bloomberg Law)。这是美国史上最大的版权集体诉讼和解。但拿到这笔钱之前,法庭已经倾向于认定一件事:把书读进显存训练模型,属于 fair use。训练本身符合规范,问题出在同一份数字副本在硬盘里存了太久。 鸭哥在 同一本书,训练可算合理使用,盗版流程为何要赔 15 亿美元 中指出,Anthropic 联合创始人 Ben Mann 在 2021 至 2022 年间,明知是盗版仍从 LibGen 和 PiLiMi 下载了最高 700 万册图书(The...

[鸭哥 AI 手记] 2026-07-20: Agent 装环境时,第三方代码已经跑完 懒人包:昨天发了 3 篇文章,核心指出 Coding Agent 在 setup 阶段执行 npm install 或 pip install 时,第三方代码就已经跑完,且防护绕过成本极低。从启动前检查到 OS 隔离 Sandbox,再到 Agent Skills 在各 Harness 间的兼容僵局,这组文章重新拆解了 AI agent 的执行边界与安全限制。 装环境时,第三方代码已经在跑 开发者把陌生仓库交给 Coding Agent 并要求跑起项目,Agent 读取 README 便会自动运行 npm install 或 pip install。预印本(arXiv:2607.15143)指出,这个准备阶段其实已经在执行第三方代码,而开发者此时连最终 diff 都还没看到。测试覆盖 Claude Code、Copilot CLI、Codex CLI 和 Cursor 的 9 种配置,作者在已知 CVE 漏洞场景中发现,9 个配置全数拿到 0/30 的检出率,没有一个 agent 主动查询...

[鸭哥 AI 手记] 2026-07-18: Fable 5 全球停服,美国把 AI 管制推到 API 懒人包:6 月 12 日一条针对 Anthropic 的商务部指令让 Fable 5 在全球下线了 19 天,Mythos 5 至今只对少数美国组织开放;7 月 13 日华邮又据报披露美国在讨论把美国开放模型性能上限设为中国模型水平。同一周,鸭哥还梳理了 Agent 托管平台在状态恢复机制上的三条路,以及用 DSL 给大模型建一个更小可执行世界的工程思路。昨天共发了 3 篇 AI 文章。 一条 API 指令让全球用户一起失去访问 在第一篇 「中国模型参照线」传闻背后:美国为什么从芯片管到 API 中,分析了美国官方对 AI 管制的最新走向。6 月 12 日,Anthropic 接到美国商务部指令,要求把 Fable 5 和 Mythos 5 对所有外国用户关闭。Claude 是集中式 API,没法在每次调用前实时核验用户国籍。Anthropic 当天对全球所有人停服这两个模型。Fable 5 直到 7 月 1 日才在 Claude.ai 全球恢复(来源:Reuters 与...