[鸭哥 AI 手记] 2026-08-13: 650 个想法全失败,但一条都没白死


[鸭哥 AI 手记] 2026-08-13: 650 个想法全失败,但一条都没白死

懒人包:Anthropic 用 31M output token 搜索黎曼猜想,第一轮 650 个想法虽然全失败了,但整理成台账后成了后续搜索的资产。鸭哥昨天一共发了 3 篇文章,另外两篇分别拆了 DeepSeek 最新的 harness DSH 插件机制,以及各家 coding agent 为什么都在抢执行环境数据。

Anthropic 搜黎曼猜想,真正的看点在搜索架构

鸭哥在 Anthropic 用 31M output token 搜索黎曼猜想,真正的信号在搜索架构 里写到,这场数学战役中,67.2% 这个数字反而不是重点,第一轮 650 个想法全盘失败之后发生的事才是。系统没有清零重来,而是给每条死路记了账,详细写明卡在哪个前提、哪段局部结论还站得住、出现什么新证据才可以重新打开。鸭哥在文章里写到,第一轮留下的台账里有 106 条带局部结论的记录,其中一条当初看着没用的判断,12 小时后在一条全新路线上帮着补上了关键一步。

根据 Anthropic 的官方发布 anthropic.com/research/riemann-zeta,他们用未发布的研究版 Claude,两轮 session 一共消耗了 31M output token,把 zeta 函数零点在临界线上的比例无条件提到 67.2%。整场任务动用了约 60 个 subagents,跑了 2400 条 shell commands,读了 54 篇 arXiv 论文,最后交出了约 35 页论文和 sorry-free 的 Lean 形式化 Theorems A-E,代码放在 Lean 仓库 anthropics/zeta-23-lean

先说清楚,这离证明黎曼猜想还差得远。在窄盒条件(也就是假设所有零点都贴在临界线附近的狭窄区域)下,前人已经在 arXiv:2501.14545 推到了 67.25%,Claude 则是直接甩开窄盒,拿到了无条件的 67.2% 下界。这套记死账的搜索架构,做 agent 系统的人可以直接搬走。


DeepSeek 开源 DSH,核心玩法是让 harness 自进化

这场动用 31M output token 的数学战役跑在 Claude Code 的 harness 上。就在鸭哥分析这套机制的同一天,DeepSeek 在 8 月 13 日开源了第一个 harness DSH,官方仓库在 deepseek-ai/deepseek-harness。鸭哥在昨天发布的 深度剖析 DeepSeek 最新的 Harness DSH:为了自进化这盘醋包了一整盘饺子 提到,虽然这项目开源当天 star 就破了 3 万(见 The New Stack),但对日常开发没什么用。它真正的看点,是让 harness 具备自我迭代的能力。

DSH 把 agent loop 从核心代码里拿出来,做成了一个能整体拧下来换掉的插件。比如 packages/core/agent-loop 只是个普通的插件,你写一个实现相同接口的新插件,就能把单 agent 循环换成多 agent 协调循环,框架会自动拆旧装新。

比起 Codex 这种修改完需要重启两三秒的声明式插件,DSH 的命令式插件是带着状态直接跑在 harness 进程里,靠 Cordis 运行时来管副作用撤销和事务性 HMR。Cordis 整套机制都为了这件事服务,理念来自 Shigma(Yifan Shi)的独立开源项目 cordis.moe,也是 Koishi 生态四年累计 4000 多个社区插件的底层支撑(DeepSeek 官方公众号转述)。配套论文《A Programming Paradigm for Spatiotemporal Composability》也发在 cordiverse/paper。鸭哥在 文章 里拆了这套机制,算清了两种插件设计各自付出的代价,能帮你判断是不是真的需要引入这套复杂度。


Coding Agent 形态一直在变,说白了都在抢执行环境数据

DSH 刚好是 DeepSeek 补齐 harness 空位的第一步,这个时间巧合印证了鸭哥昨天在 Coding Agent 的形态变化,都在抢同一样东西 里的预判。不论桌面端、命令行还是 managed agents,各种产品形态看似眼花缭乱,真实目的都是圈占执行环境里的行为数据。而且 DeepSeek 早在 2026 年 5 月就在招聘页面挂出过「Agent Harness 产品经理」岗位(官网 JD 转述)。

模型可以自主干活之后,harness 就从普通的客户端变成了关键的数据采集仪器。在这场卡位中,前端界面因为成本低正变得越来越像,但真正值钱的执行层却分化得越来越快。像 OpenAI 的 Codex 桌面应用在 2026 年 2 月发布,7 月就并进了 ChatGPT 桌面端,底层跑的都是同一套 harness(OpenAI 公告App Server 工程博客)。

Claude Code 网页版在 2025 年 10 月就上线了,Cursor 的云端 agent 则在 2026 年 2 月升级成了完整的虚拟机(Cursor changelog)。根据 LangChain 博客 披露,哪怕是同一个模型,只要配上针对性的运行环境,在 tau2-bench 难度子集上的表现就能涨 10 到 20 个百分点。所以,看一个 coding agent 可不能只看功能面板,得看清谁掌控了执行环境、数据对谁可见,以及谁能跑通数据飞轮。


也值得知道

首例全自主 AI agent 攻击政府:安全公司 Dream 披露,7 月初的四天内,最多有 8 个基于开源框架的 AI agent 协同入侵台湾政府系统。整个侦察和破解凭据过程完全没有人类干预,一共映射了 21 个系统并拿下了 85 个账号(CNN)。

Grok 4.6 发布:这次新版本主打长时程 agentic 任务,支持 500K context,在 Artificial Analysis Intelligence Index 中拿到了 61 分,追平了 GPT-5.6 Sol Max。定价为百万 token 收费 $2/$6,已经在 Cursor 上线了(Cursor 官方博客)。

Cognition 洽谈 $40B 估值融资:Devin 的母公司 Cognition 年化收入已经逼近 $1B,不到三个月里估值涨了五成多,目前融资谈判还在早期阶段(TechCrunch)。


本期由 AI 基于鸭哥已发布文章和公开资料整理生成,请注意甄别幻觉。

订阅本 newsletter:daily.yage.ai

鸭哥每日AI要闻

每天鸭哥的Agent会在深度领域调研后发送一封邮件。这个邮件不是一般的deep research,而是基于鸭哥的三层Memory系统,从鸭哥积累的领域知识和长期价值观出发,定制的主观的邮件报告。

Read more from 鸭哥每日AI要闻

[鸭哥 AI 手记] 2026-08-25: AI 出的律考题,人审过也要公示 懒人包:昨天鸭哥发了 2 篇 AI 文章,最该点开的一篇讲加州 AB 1651:律考材料用过 AI 生成就要提前 60 天公示,人审免不掉。另一篇讲长上下文,三条路径在坐标层、通路层和表示层各自落地,收敛到同一个直觉:近处保真,远处有损。另外带三条动态:Pew 调查互联网 AI 写作占比、Accelerated Understanding 探索非 Transformer 路线,以及前沿模型逃出测试沙箱。 同一个行业,两套账 2025 年 2 月的加州律考是从崩溃开始的。开考不久,答题系统就把考生踢了出去,试题里混着错别字。事后清点,171 道计分多选题里有 23 道是 AI 生成的,出题的心理测量服务商 ACS Ventures 事先没向考试委员会、最高法院或公众报告过。一年半后,州长 Newsom 签了 AB 1651:律考材料只要用过 AI 生成就要提前 60 天挂上官网,专家事后审过也免不掉。鸭哥在用过就要说:加州律考 AI...

[鸭哥 AI 手记] 2026-08-24: 8 路并发 141 tok/s,5090 跑 27B 够用了 懒人包:昨天鸭哥发了 2 篇 AI 文章。第一篇是自家机箱的实测,双卡 RTX 5090 组 TP=2 跑 Qwen3.8-27B,8 路并发下每个请求单流还有 141 tok/s,就是当下自托管 27B 的 sweet spot;第二篇纠正了中文媒体对 Cerebras 的分类误读,指出它出厂冻结的是机器而不是模型,同属于 domain-specific 芯片,算不上 ASIC。最后带三条行业动态:Nvidia Groq 3 LPX 量产、Gartner 上调半导体预测、Etched 估值翻倍。 两张 5090 的实测:8 路并发还有 141 tok/s 昨天鸭哥发的两篇文章都在算力硬件这一层。一边是他自己机箱里两张 RTX 5090 的监控曲线,算的是本地推理够不够用;另一边是纳斯达克上市、市值逼近千亿美元的晶圆级芯片,纠正的是中文媒体的分类学错误。硬件层的判断全靠实测数字和正确分类,不靠标签。 在第一篇 8 路并发每路仍有 141 tok/s:2×5090 跑 27B...

[鸭哥 AI 手记] 2026-08-23: Skill 起效靠检查单,不靠知识 懒人包:8,135 次受控实验里,Agent Skill 起效案例 65.7% 靠步骤指引和检查单,只有 4.5% 靠补知识。昨天共发了 2 篇 AI 文章,第一篇数出了 skill 到底靠什么起效,另一篇把本周四条热传 AI 新闻的口径逐条补了回去。新动向是 OpenAI 突然反转立场,呼吁加强加利福尼亚州安全法案。 用检查单写 Agent Skill,而不是塞教科书知识 给 agent 写 skill 的人,多半干过同一件事:把行业背景、领域事实、产品细节一股脑塞进去,恨不得把内部 wiki 整个搬进去。但用一阵子就会发现,背景堆得越多,agent 干活没见变聪明。鸭哥在Skill 不是教材,是检查单里介绍了一篇 8 月 14 日在 arXiv 挂出来的 preprint 论文(arXiv 2608.14036)。研究者把 8,135 次受控实验记录摊开数了一遍,发现起作用的主要不是那些知识,是步骤、检查单和验证命令。在 skill 起效的案例里,有 65.7% 靠的是步骤指引,只有 4.5%...