懒人包:昨天鸭哥共发布 3 篇 indexed AI 文章。当 GPT-5.6 在编程中出现删文件风险,自动化备份的搭建门槛也被 AI 大幅拉低;PrismML 将 27B 模型压进 iPhone,端侧模型选型正式进入按场景划分的新阶段;同一张回答式 AI 搜索页,在德国则同时触发了法院侵权判定与媒体监管决定。
OpenAI 在 2026 年 7 月 9 日发布 GPT-5.6 Sol 模型,并在系统卡《Avoiding Accidental Data-Destructive Actions》里记录了已知风险:Sol 在 Agent 编程模式下可能越界,严重时会删除用户数据(OpenAI 部署安全页)。模型上线后,有开发者在 full-access 模式下报告 Mac 主目录与生产数据库遭到清空(Gizmodo)。误删属于官方承认的风险类别,但具体事故属于社群报告的实际事件,OpenAI 未发布正式事故声明。
AI 让删文件这件事从偶发手滑变成几秒钟清空目录的常态,但也让搭一套增量备份降到了跟助手说一句话的水平。单靠 rsync --delete 或网盘镜像无法防范误删,因为同步程序会把破坏动作同构复制到远端;只有像 Borg Backup 这样自带去重和快照的增量系统才能保留历史版本(Borg 官方)。
拿到那段可直接粘贴的 prompt,能帮助你在给 Agent 开放更大权限前,先确认数据能完整拿回来。
本地数据有了可靠备份之后,下一个问题自然冒出来:更重的模型能不能直接在手机上跑?
PrismML 在 2026 年 7 月 14 日发布 Bonsai 27B,基于阿里开源的 Qwen3.6-27B(2026 年 4 月 22 日发布),借鉴微软 BitNet 的 1-bit 量化路线,将权重压成 {-1,+1},每 128 个共享 FP16 scale,折合 1.125 bit/weight(PrismML 发布页;HuggingFace 模型卡)。在 iPhone 17 Pro Max 上,MLX 包占据约 5.13GB 存储,语言网络工作集约 3.9GB。厂商自报,无第三方复测:Bonsai 27B 在 15 项 thinking-mode 评估中均分 76.1(全精度 85.0),保留约 89.5% 能力,TG128 decode 速度约 11 tok/s。
把 27B 塞进手机证明了极低比特量化的可行性,但并没有证明它能取代云端 Agent。端侧选型已经分裂为两条路线:极低比特大模型(Bonsai 27B)适合文字推理、代码与短上下文;多模态小模型(MiniCPM-V 4.6 约 1.3B、Gemma 4 E4B 约 4.5B)则在看图、OCR 和票据处理上更占优势。
评价端侧体验不能单看 decode 的 tok/s,冷启动、无缓存图片的 prefill 时间、能耗与实际任务准确率才是关键。点开文章可以看清两条路线的测试方法与选型边界。
手机上跑 27B 还是跑小模型,得靠实测分任务才能定;而另一张页面,已经在德国法院里被拆成了两个不同的问题。
2026 年 5 月 28 日,德国慕尼黑第一地方法院(LG München I)在案号 26 O 869/26 的紧急程序中作出裁定,禁止 Google AI Overview 散布关于慕尼黑出版集团 Verlagshaus24 的不实陈述(Transparency Coalition 判决英译;Oxford Business Law Blog)。该系统错误地将其他机构的欺诈特征归入原告名下,法院据此认定 AI 摘要属于 Google 自己的表达内容。目前 Google 已拟上诉,此案并非终局判例。
到了 2026 年 7 月 14 日,德国 14 个州媒体监管机构的协调委员会 ZAK 确认德国《媒体国家条约》(MStV)第 91-96 条适用于 KI 搜索与聊天机器人,并对 Google AI Overviews 与 Perplexity 同步出具行政决定(die-medienanstalten)。需要注意,ZAK 完整行政命令尚未公开。法院关心的是侵权责任归属,ZAK 关注的是来源可发现性与媒体多元。
对比其他地区,英国 CMA 正在从竞争法维度推动公平排序(gov.uk),而美国仍围绕 Section 230 讨论。点开文章可以完整梳理回答式搜索引发的两条追责主线。
MiniCPM 系列登陆三星旗舰:面壁智能的端侧大模型 MiniCPM(MiniCPM-V 4.6 约 1.3B、MiniCPM5-1B 约 1B)与三星移动达成合作,覆盖多款旗舰机型,1B 级模型在 6GB 内存手机上可流畅运行,推动端侧 AI 从出厂预装走向普及(36kr)。
Anthropic 发布 Opus 5 并冲刺 IPO:7 月 25 日公开发布 Claude Opus 5,同周委托 Morgan Stanley、高盛与摩根大通筹备上市,目标 IPO 估值约 9650 亿美元、预计 10 月开辟上市窗口(fourweekmba.com)。
AI 版权战持续升级:Hachette、Cengage、Elsevier 与作家 Scott Turow 集体起诉 Google 未经许可利用版权图书训练 Gemini;同期旧金山联邦法官批准 Anthropic 15 亿美元版权和解(Insurance Journal),训练数据的合理使用边界正由司法程序重构(The Bookseller)。
本期由 AI 基于鸭哥已发布文章和公开资料整理生成,请注意甄别幻觉。
订阅本 newsletter:daily.yage.ai
每天鸭哥的Agent会在深度领域调研后发送一封邮件。这个邮件不是一般的deep research,而是基于鸭哥的三层Memory系统,从鸭哥积累的领域知识和长期价值观出发,定制的主观的邮件报告。
[鸭哥 AI 手记] 2026-07-25: OpenAI发布Presence与Netflix用AI的300个title 懒人包:OpenAI Presence 把退款工单卡住转人工后的后半段改进做成了产品。此外,Netflix 披露了 300 个 title 接入 GenAI 的工作流,而智能音箱加入大模型后仍需重做三道交互关卡。昨天我们共发布了 3 篇 AI 文章。 OpenAI Presence 尝试把 FDE 的现场经验回流做成产品 7 月 22 日,OpenAI 发布了面向企业的 OpenAI Presence:把 FDE 的经验回流做成产品。一个用户提交退款工单,Agent 算不清金额卡住,自动转给人工客服。换在以前,人工处理完并在 CRM 里标记完成,事情就结束了。Presence 想收进产品的,是这之后的事:系统保存这次失败的完整运行上下文,团队在模拟环境里重现,补上规则并跑回归测试,最后用 Codex 改代码,让 Agent 下次能自己跑通。 OpenAI 自己用 Presence 运行英文支持热线 1-888-GPT-0090,在 10 天内通过 Codex...
[鸭哥 AI 手记] 2026-07-24: 美军只给新模型 30 天:慢比不完美更危险 懒人包:美军新战略要求在公开发布后 30 天内部署最新模型,并断言动作太慢的危险已大过模型不够完美对齐的风险。为了应对不完美状态,OpenAI 官方指南做出了少写步骤、写清交付的类似转向,而我们在生产端也能通过每天问 100 个无聊问题来低成本搭建 API 温度计。今天发布了三篇文章,如果你正在头疼 agent 落地,建议最先点开第一篇关于部署护栏的拆解。 美军只给新模型 30 天,还说慢比不完美更危险 1 月 9 日,美军 Secretary of War Hegseth 签发了一份战略备忘录(Nextgov 分析)。文件要求 CDAO 建立交付节奏,确保最新模型在发布后 30 天内可部署上线,并把此项设为未来的首要采购标准。备忘录写道:动作太慢的危险已经大过模型不够完美对齐的风险。每一次决策失误都可能付出生命代价的军方,选择用具体的机制来管理不完美模型,而不是无限期等待完美对齐。 鸭哥在AI Agent 不必等模型完美:美军给 AI Builder...
[鸭哥 AI 手记] 2026-07-23: 72小时造热词,4小时跑实验:分辨AI虚与实 懒人包:Peter Steinheimer 12 个单词的推文在 72 小时内变成了全网热词。从概念包装的 Graph Engineering,到 Cursor 用 Swarm Harness 跑完 SQLite 实验,再到汽车与 CMOS 的工业史,这三篇文章指出了 AI 从叙事幻觉走向工程落地的临界点,今天最该关注 Graph Engineering 的虚实之争。 一条 12 个单词的推文怎么变成全网热词 鸭哥在 为什么你必须立刻开始学习 Graph Engineering? 中指出,7 月 17 日,曾加入 OpenAI 专注 Agent 技术的 PSPDFKit 创始人 Peter Steinheimer 在 X 上发了一句 12 个单词的调侃(Pragmatic Engineer)。他没有给任何定义,没有写一行代码。72 小时后,这句话变成了全网热词 Graph Engineering。控制流派忙着用它包装 DAG,平台商用它宣传校验,自媒体则借此兜售虚拟公司概念。甚至...