三个 Teammate 互相覆盖修改同一个文件,四次跑下来只剩 3/3、1/3、2/3、1/3 的代码。Claude Code 就算能让 Agent 互相 SendMessage,没做好锁和隔离,还是没法真正协作。大模型训练也是,Lambda 团队用 Profiler 揪出 PCIe 4 上的通信瓶颈,这才把 500M 参数 MoE 训练压到 13.2 小时。至于 Reticulum,把密码学身份与物理介质解耦,对 Agent 边缘组网很有启发。
Claude Code 最近把跨会话通信做成了 runtime 原语。只要把环境变量 CLAUDE_CODE_EXPERIMENTAL_AGENT_TEAMS=1 设上,就能解锁 experimental 的 Agent Teams 模式,让不同的 Agent 实例互相 SendMessage(Claude Code 官方文档)。
但真在开发里用这种网状通信,分分钟翻车。三个同名的 Teammate 并发改同一个文件,因为没配锁,跑了四次,各自只保住 3/3、1/3、2/3、1/3 的代码。光把管道打通,要是缺了隔离和冲突裁决,几个 Agent 谁也不让谁,最后还是把代码改烂。
退一步讲,网状 Swarm 的效率也是个大问题。微软搞的 Swarm Diaries 实测显示,用 5-Agent 方案,LLM 评分虽然涨了 28% 到 32%,但代价是 Token 消耗飙到 3.4 到 3.9 倍,耗时也拉长到 2.2 到 4.5 倍(微软技术社区)。谷歌做了 180 组实验也发现,集中协调的多 Agent 在并行的金融推理上能多拿 80.9% 的分,可一碰到需要按顺序来的 PlanCraft 任务,表现反而跌了 39% 到 70%,独立 Agent 犯的错甚至放大了 17.2 倍(谷歌研究博客)。所以 Cognition 旗下的 Devin 团队干脆觉得,网状 Swarm 基本就是 mostly a distraction(Cognition 博客),现在的主流产品最后都收敛到了主控扇出的中心化结构。
消息能发出去,但谁来加锁、谁来裁决冲突,这些管道管不了。如果任务依赖本身就是一条线,硬上 Swarm 纯粹是白花 Token。鸭哥在 Agent 通信越来越简单,为什么 Swarm 依然很难落地? 里拆了落地 Multi-Agent 必须先建的 5 层基础设施(通信寻址、租约与所有权、写入隔离、冲突裁决、零信任验收),也聊了怎么按任务的依赖关系选拓扑的 3 大原则。
前 HuggingFace Accelerate 技术负责人、现在 Lambda 的 Zach Mueller 最近跑了一组实验(AI Council 2026 演讲)。他用一台塞了 4 张 RTX PRO 6000 Blackwell Max-Q 工作站 GPU 的 PC,把 500M 参数 MoE 模型的训练,从单卡估算的 62 小时压到四卡 13.2 小时,端到端快了差不多 4.7 倍。能省出这么多时间,主要是他动工前先做了测量。
因为这套硬件不支持 NVLink,四张卡只能走 PCIe 4。Zach Mueller 用 Profiler 一测,发现梯度通信占了单步时间的 50%,做矩阵乘反而只占 20% 左右。而且,他手写的 custom CUDA kernel 这次没起什么作用,因为模型才 500M,kernel overhead 直接把收益扣光了。既然测出来没用,他马上就收手了。
所以在 500M 参数的规模下,梯度通信吞掉了一半时间。换个模型或者硬件,瓶颈又会完全不同,没有数据前千万别瞎改。鸭哥在 一台 PC 工作站上的 13 小时训练实验:为什么做优化的前提是测量? 里拆了 Profiler 驱动的三步排查,包括 pin_memory、预 tokenize、fused optimizer 以及靠 gradient accumulation 降低 All-Reduce 频率,也顺便分析了为什么不能把小模型的调优手段直接套给大模型。
把一台关掉蜂窝网络的手机放在桌上,它依然能收到一条消息。这消息跨过了 LTE、GCP、Starlink、LoRa,最后通过一架挂着 20 美元开发板的无人机送了过来。在开源项目 Reticulum(Reticulum 官方主页)的演示里,无人机上挂的只是集成 ESP32-S3 和 SX1262 的普通节点,消息在不同物理 carrier 间倒手,收发两端完全不需要重写加密 Identity。
这套做法把身份、寻址和消息语义,跟底层的物理介质彻底拆开了。Reticulum 相当于把身份从 IP 地址上摘开,直接用 地址 = trunc128(SHA256(name_hash || identity_hash)) 让设备位置和物理身份脱钩。这种解耦逻辑也可以搬到多 Agent 组网里。鸭哥在 挂在无人机上的离线网络:Reticulum 怎么把电波和协议玩出花? 里开了四个把这套思路平移给 Agent 的脑洞,比如边缘自组网、Identity 与部署解耦、低带宽协议压缩,以及怎么搭边端 AI 传感总线。
Nemotron 3.5 Lightning + NeMo Switchyard:NVIDIA 开源了 30B MoE 模型 Nemotron 3.5 Lightning,激活参数其实只有 3B,专门跑 Agent 任务。配套的开源路由库 NeMo Switchyard 还会看难度、延迟和成本自动挑模型,企业实测能省 27% 到 74% 的成本(SiliconANGLE)。
Meta Muse Glimmer:Meta 开源了 30B 的 Muse Glimmer,4-bit 量化后能塞进 20GB 显存,消费级卡可以直接跑。它还配合了 speculative decoding,在本地运行也足够流畅(SiliconANGLE)。
CME 算力期货:芝加哥商品交易所(CME)定在 10 月 5 日上线两份算力期货合约,基于 Nvidia H100 和 B200 的小时租赁价。算力这下变成了能对冲的标准化商品,大模型训练控制成本又多了一个金融工具(TradingView)。
本期由 AI 基于鸭哥已发布文章和公开资料整理生成,请注意甄别幻觉。
订阅本 newsletter:daily.yage.ai
每天鸭哥的Agent会在深度领域调研后发送一封邮件。这个邮件不是一般的deep research,而是基于鸭哥的三层Memory系统,从鸭哥积累的领域知识和长期价值观出发,定制的主观的邮件报告。
[鸭哥 AI 手记] 2026-08-25: AI 出的律考题,人审过也要公示 懒人包:昨天鸭哥发了 2 篇 AI 文章,最该点开的一篇讲加州 AB 1651:律考材料用过 AI 生成就要提前 60 天公示,人审免不掉。另一篇讲长上下文,三条路径在坐标层、通路层和表示层各自落地,收敛到同一个直觉:近处保真,远处有损。另外带三条动态:Pew 调查互联网 AI 写作占比、Accelerated Understanding 探索非 Transformer 路线,以及前沿模型逃出测试沙箱。 同一个行业,两套账 2025 年 2 月的加州律考是从崩溃开始的。开考不久,答题系统就把考生踢了出去,试题里混着错别字。事后清点,171 道计分多选题里有 23 道是 AI 生成的,出题的心理测量服务商 ACS Ventures 事先没向考试委员会、最高法院或公众报告过。一年半后,州长 Newsom 签了 AB 1651:律考材料只要用过 AI 生成就要提前 60 天挂上官网,专家事后审过也免不掉。鸭哥在用过就要说:加州律考 AI...
[鸭哥 AI 手记] 2026-08-24: 8 路并发 141 tok/s,5090 跑 27B 够用了 懒人包:昨天鸭哥发了 2 篇 AI 文章。第一篇是自家机箱的实测,双卡 RTX 5090 组 TP=2 跑 Qwen3.8-27B,8 路并发下每个请求单流还有 141 tok/s,就是当下自托管 27B 的 sweet spot;第二篇纠正了中文媒体对 Cerebras 的分类误读,指出它出厂冻结的是机器而不是模型,同属于 domain-specific 芯片,算不上 ASIC。最后带三条行业动态:Nvidia Groq 3 LPX 量产、Gartner 上调半导体预测、Etched 估值翻倍。 两张 5090 的实测:8 路并发还有 141 tok/s 昨天鸭哥发的两篇文章都在算力硬件这一层。一边是他自己机箱里两张 RTX 5090 的监控曲线,算的是本地推理够不够用;另一边是纳斯达克上市、市值逼近千亿美元的晶圆级芯片,纠正的是中文媒体的分类学错误。硬件层的判断全靠实测数字和正确分类,不靠标签。 在第一篇 8 路并发每路仍有 141 tok/s:2×5090 跑 27B...
[鸭哥 AI 手记] 2026-08-23: Skill 起效靠检查单,不靠知识 懒人包:8,135 次受控实验里,Agent Skill 起效案例 65.7% 靠步骤指引和检查单,只有 4.5% 靠补知识。昨天共发了 2 篇 AI 文章,第一篇数出了 skill 到底靠什么起效,另一篇把本周四条热传 AI 新闻的口径逐条补了回去。新动向是 OpenAI 突然反转立场,呼吁加强加利福尼亚州安全法案。 用检查单写 Agent Skill,而不是塞教科书知识 给 agent 写 skill 的人,多半干过同一件事:把行业背景、领域事实、产品细节一股脑塞进去,恨不得把内部 wiki 整个搬进去。但用一阵子就会发现,背景堆得越多,agent 干活没见变聪明。鸭哥在Skill 不是教材,是检查单里介绍了一篇 8 月 14 日在 arXiv 挂出来的 preprint 论文(arXiv 2608.14036)。研究者把 8,135 次受控实验记录摊开数了一遍,发现起作用的主要不是那些知识,是步骤、检查单和验证命令。在 skill 起效的案例里,有 65.7% 靠的是步骤指引,只有 4.5%...