懒人包:昨天鸭哥发了 2 篇 AI 文章。第一篇是自家机箱的实测,双卡 RTX 5090 组 TP=2 跑 Qwen3.8-27B,8 路并发下每个请求单流还有 141 tok/s,就是当下自托管 27B 的 sweet spot;第二篇纠正了中文媒体对 Cerebras 的分类误读,指出它出厂冻结的是机器而不是模型,同属于 domain-specific 芯片,算不上 ASIC。最后带三条行业动态:Nvidia Groq 3 LPX 量产、Gartner 上调半导体预测、Etched 估值翻倍。
昨天鸭哥发的两篇文章都在算力硬件这一层。一边是他自己机箱里两张 RTX 5090 的监控曲线,算的是本地推理够不够用;另一边是纳斯达克上市、市值逼近千亿美元的晶圆级芯片,纠正的是中文媒体的分类学错误。硬件层的判断全靠实测数字和正确分类,不靠标签。
在第一篇 8 路并发每路仍有 141 tok/s:2×5090 跑 27B 小模型,为什么它已经是 sweet spot 里,鸭哥测了自家双卡 RTX 5090(TP=2,SGLang,NVFP4 量化 Qwen3.8-27B)。并发从 1 路加到 8 路,整机总吞吐从 268 涨到 962 tok/s,8 路并发下每个请求的单流速度还有 141 tok/s。NVIDIA 开发者论坛上有人拿双 DGX Spark 组 TP=2 跑同款模型,单流实测是 87 tok/s(NVIDIA 论坛),也说明双卡 5090 的数据在合理范围内。人类自然阅读也就每分钟 200 到 300 词,141 tok/s 远远够用了,瓶颈已经不在显卡,而在下游的消费速度。
在鸭哥看来,5090 之所以能成为自托管 27B 模型的 sweet spot,是因为它同时凑齐了四个条件:原生支持 NVFP4、拥有 1792 GB/s 的显存带宽、配了 32GB 显存,官方指导价只要 $1,999。这四项凑齐,27B 推理的账就算得过来了。
很多人自托管首选是为了省钱,但鸭哥算了一笔账。这套双卡硬件投入在 $6,000 到 $8,000 之间,而机器一天实际出 token 的时间也就 3.8 小时,月电费约 $11;对标订阅套餐,一个月省下约 $20,硬件回本得花 25 到 33 年。所以自托管买的是控制权,不是为了划算:数据留在本地介质、模型行为能无审查定制、断网也能跑,推理栈完全自己掌控。就像技术群里朋友说的,超市买的鱼又好又便宜,但钓鱼的人可不是为了吃鱼。
具体选型时,鸭哥给了一个三步框架:先看合规需求,再通过监控测出 7 到 14 天的真实使用率,最后选硬件。月负载使用率在 26% 到 45% 之间是自建和租赁的成本平衡点;低于 30% 走云端或 API 更好,高于 45% 且看重隐私再考虑自建。虽然主流大云上租不到 5090 实例,但 Vast(约 $0.34 每小时)和 RunPod(约 $0.99 每小时)这类专科云其实租得到(getdeploying)。不过,2026 年 8 月 5090 实际零售价已经涨到 $4,000 到 $4,300 之间(BuySellRam 8 月报告),双卡投入肯定比 第一篇文章 估算的下限偏高。
相比之下,强上工作站显卡 RTX PRO 6000 实在不值。虽说显存带宽和 5090 一样是 1792 GB/s,但价格已经从 2025 年 3 月的 $8,565 暴涨到 2026 年 8 月的 $16,000(wccftech)。而且 NVIDIA 开发者论坛上能看到很多固件崩溃报告,涉及 Xid 62、119、120、154 等错误,显卡跑了几个月后会突然重置,只能靠断电来恢复。花 8 倍的价钱,买回来的反而是个运维隐患。
算完了自己机箱里双卡的账,另一篇文章看的是尺度另一端的大硬件。第二篇 Cerebras:史上最大的芯片,不认识 Transformer 里,鸭哥纠正了中文媒体把 Cerebras 归入 ASIC 的分类错误。不论是写成专为 LLM 推理设计的 ASIC(雪球)、写成集成 90 万个专用 AI 计算核心(钛媒体),还是直接归为 ASIC(EET-China),一字之差,公众认知就跑偏了。其实看芯片是不是 ASIC,标准不在于硅片上有无固化电路,而在于出厂时冻结的是哪一层。Cerebras WSE 冻结的是面向张量负载的机器本身,程序留给软件;它和 TPU 一样属于 domain-specific 芯片,而不是直接把模型刻进硅片的 ASIC。
关于 Cerebras 有两个反直觉事实。一是这整片晶圆只认得基础加减乘除和核间通信,对 Transformer 根本没概念,模型和晶圆之间隔着一层编译器。二是权重其实不常驻晶圆,而是用 weight streaming 模式逐层流过、用完即走。它解决良率的办法也反过来证明了这一点:把核心切到 0.05 平方毫米那么小,再配上 1% 到 1.5% 的冗余备用核心,遇到坏核心直接用硬件动态绕过去。能这么绕,前提就是计算完全由软件分发,而不是固死在线路上。
这个晶圆级设计倒不是为了 Transformer 临时凑出来的。早在 2015 年,也就是 Transformer 诞生前两年,五个创始人就决定把筹码押在算力负载上。哪怕如今 AI 的主流算法变了,这套不用物理固化线路的架构到现在依然能跑。
Cerebras 真正的筹码,押在整片 46,225 平方毫米不切割的晶圆尺度上。它快,靠的是搬得少:片上 SRAM 带宽有 21 PB/s,权重只用走几十微米,数据不用长途搬运。2026 年 5 月 14 日在纳斯达克上市(代码 CBRS),发行价定在 $185,首日涨了 68.15%,盘中按 fully diluted 口径市值一度突破千亿美元(CNBC)。今年 3 月,它宣布和 AWS 合作,让 Trainium3 负责 prefill,Cerebras CS-3 负责 decode,两阶段分工搞定(Cerebras 官方 PR)。
资本市场正同时给这两种路线买单。一边是 OpenAI 给 Cerebras 下了超过 200 亿美元的算力订单(IPOScoop 引招股书);另一边是 OpenAI 和博通合作,在 2026 年 6 月 24 日发布了专用于推理的 ASIC 芯片 Jalapeño(OpenAI)。在算法冻结层级的另一端,直接把模型权重固化在金属层的芯片初创公司 Taalas,AMD 在 2026 年 8 月 6 日宣布了收购它的协议。
Nvidia 推理加速器 Groq 3 LPX 全面量产:在 Hot Chips 2026 上官宣(2026-08-24),该芯片定位 Vera Rubin 平台的推理扩展,专补 decode 阶段的超低时延,Nebius 是首个采用的 AI cloud。此前 Nvidia 在 2025 年 12 月以约 200 亿美元收购了 Groq 的核心资产。(NVIDIA 官方新闻稿、SiliconANGLE)
Gartner 上调 2026 半导体市场预测至 1.6 万亿美元:根据 2026-08-24 发布的数据,全年收入预测为 $1,555.2B,同比增长 92.2%;内存一项占总收入的 54%,贡献了全年增长的八成以上。(Gartner)
Etched 估值 26 天翻倍至 210 亿美元:Sohu 是 transformer 专用 ASIC,7 月向 Jane Street 交付首个推理机架。8 月 18 日,公司宣布由 Jane Street 领投的 $700M Series D 融资,估值从 7 月的 $10.3B 升到 $21B。(Reuters)
本期由 AI 基于鸭哥已发布文章和公开资料整理生成,请注意甄别幻觉。
订阅本 newsletter:daily.yage.ai
每天鸭哥的Agent会在深度领域调研后发送一封邮件。这个邮件不是一般的deep research,而是基于鸭哥的三层Memory系统,从鸭哥积累的领域知识和长期价值观出发,定制的主观的邮件报告。
[鸭哥 AI 手记] 2026-08-25: AI 出的律考题,人审过也要公示 懒人包:昨天鸭哥发了 2 篇 AI 文章,最该点开的一篇讲加州 AB 1651:律考材料用过 AI 生成就要提前 60 天公示,人审免不掉。另一篇讲长上下文,三条路径在坐标层、通路层和表示层各自落地,收敛到同一个直觉:近处保真,远处有损。另外带三条动态:Pew 调查互联网 AI 写作占比、Accelerated Understanding 探索非 Transformer 路线,以及前沿模型逃出测试沙箱。 同一个行业,两套账 2025 年 2 月的加州律考是从崩溃开始的。开考不久,答题系统就把考生踢了出去,试题里混着错别字。事后清点,171 道计分多选题里有 23 道是 AI 生成的,出题的心理测量服务商 ACS Ventures 事先没向考试委员会、最高法院或公众报告过。一年半后,州长 Newsom 签了 AB 1651:律考材料只要用过 AI 生成就要提前 60 天挂上官网,专家事后审过也免不掉。鸭哥在用过就要说:加州律考 AI...
[鸭哥 AI 手记] 2026-08-23: Skill 起效靠检查单,不靠知识 懒人包:8,135 次受控实验里,Agent Skill 起效案例 65.7% 靠步骤指引和检查单,只有 4.5% 靠补知识。昨天共发了 2 篇 AI 文章,第一篇数出了 skill 到底靠什么起效,另一篇把本周四条热传 AI 新闻的口径逐条补了回去。新动向是 OpenAI 突然反转立场,呼吁加强加利福尼亚州安全法案。 用检查单写 Agent Skill,而不是塞教科书知识 给 agent 写 skill 的人,多半干过同一件事:把行业背景、领域事实、产品细节一股脑塞进去,恨不得把内部 wiki 整个搬进去。但用一阵子就会发现,背景堆得越多,agent 干活没见变聪明。鸭哥在Skill 不是教材,是检查单里介绍了一篇 8 月 14 日在 arXiv 挂出来的 preprint 论文(arXiv 2608.14036)。研究者把 8,135 次受控实验记录摊开数了一遍,发现起作用的主要不是那些知识,是步骤、检查单和验证命令。在 skill 起效的案例里,有 65.7% 靠的是步骤指引,只有 4.5%...
[鸭哥 AI 手记] 2026-08-22: Stripe 75 亿美元买下 AI 计费的咽喉 懒人包:Stripe 掏了约 75 亿美元买下年化收入约 1.4 亿美元的 OpenRouter,用约 54 倍市销率卡住了 AI 经济计费和路由的咽喉。这也是鸭哥昨天发布的 2 篇 AI 文章之一。另一篇聊了 UiPath 的反直觉动作:把收费十几年的流程开发免费送给 coding agent,改在运行时按次收钱。此外,今日的轻量进展还包括企业 token 账单失控、小模型 Faraday 在科研任务自称的成绩,以及 NVIDIA 拟获取 Poolside 模型授权的动向。 Stripe 买下的不是收入,是入口 Stripe 在 8 月 19 日官宣买下 OpenRouter(OpenRouter),Bloomberg 在 8 月 16 日就透露了风声(Bloomberg)。根据 NYT 引述知情人士的消息,最终交易金额约 75 亿美元,创始人拿走 15 亿美元(NYT)。 OpenRouter 三个月前刚完成 1.13 亿美元的 Series B,估值 13...