懒人包:OpenAI Presence 把退款工单卡住转人工后的后半段改进做成了产品。此外,Netflix 披露了 300 个 title 接入 GenAI 的工作流,而智能音箱加入大模型后仍需重做三道交互关卡。昨天我们共发布了 3 篇 AI 文章。
7 月 22 日,OpenAI 发布了面向企业的 OpenAI Presence:把 FDE 的经验回流做成产品。一个用户提交退款工单,Agent 算不清金额卡住,自动转给人工客服。换在以前,人工处理完并在 CRM 里标记完成,事情就结束了。Presence 想收进产品的,是这之后的事:系统保存这次失败的完整运行上下文,团队在模拟环境里重现,补上规则并跑回归测试,最后用 Codex 改代码,让 Agent 下次能自己跑通。
OpenAI 自己用 Presence 运行英文支持热线 1-888-GPT-0090,在 10 天内通过 Codex 驱动的改进循环将人工接管率压低约 15 个百分点,约 75% 的入站问题不再需要人工(OpenAI 官方)。
目前该服务处于 limited GA 状态,OpenAI 的 FDE(Forward Deployed Engineer,现场部署工程师)与指定集成商正在逐案部署(The Register)。Palantir 最早将这个角色制度化,OpenAI 也在 2026 年 5 月成立了 Deployment Company 来正式化这支现场力量(Palantir Blog)。
从资产角度看,决定下一次 Agent 行为的是失败记录与规则等生产改进材料。这些材料能否导出并带到 Sierra 或 Decagon 等多模型架构厂商上重跑,决定了客户是保有采购主动权,还是把控制权完全交给了供应商。
这种在工作流中寻找合适落点的尝试,同样出现在影视制作里。Netflix 在 7 月 16 日发布的 Q2 股东信中披露,他们在大约 300 个 title 中使用了 GenAI 工作流,且大部分工作集中在后期制作(股东信 PDF)。
这篇 Netflix 的 300 个 AI title,补上了 AI 短剧最缺的一课 指出,这里的 title 是片目统计词,股东信并未公布具体分母。它既不是指 300 部完全由 AI 生成的作品,也不是 300 部纯 AI 短剧。
例如纪录片 The American Experiment 包含 17 分钟的 AI 辅助画面,其联合首席执行官 Ted Sarandos 称这比先前的方案快了一倍,成本也减半(Fortune)。但这是相对于该剧组先前旧方案的个案,不是全行业通用的翻倍减半规律。
Netflix 依然对最终交付物有着明确的管理限制。根据制作规范,生成的材料默认只是临时的,不能算作 final deliverables(Netflix Partner Help)。
一旦素材涉及演员的 talent likeness(演员肖像)、个人数据或第三方 IP,制作伙伴必须先拿到书面批准,制作伙伴也必须为核心虚构场景申请升级审批。
针对国内短剧创作者,文章建议使用一套对比框架:用同一份 3 至 5 分钟的剧本,分别跑纯真人实拍、真人拍摄加 AI 后期、以及全虚拟角色三条路线,并详细记录生成次数、人工修复工时、返工卡点和素材授权情况,以此作为决定工作流的依据。
在消费级语音设备上,大模型提供的全双工语音同样需要按场景重做交互。正如 给智能音箱加上大模型以后,为什么还得重做交互? 所言,唤醒词、ASR 和 TTS 只是让机器能够听懂和说话。
但在实际生活中,同一句“下班后买牛奶”,用户在书桌前时可以弹窗核对,在驾驶中设备就应当只回复“已记下”,而在厨房等共享空间里,说话者可能是客人或孩子,直接写入主人账户会把日程完全搅乱。这需要设备具备 context infrastructure 和场景感知能力。
据 Bloomberg 报道,OpenAI 计划在 2026 年底发布一款搭载 GPT-Live 语音模式的可移动、无屏 AI 伴侣音箱(Bloomberg;The Verge 转述)。尽管 GPT-Live 实现了全双工语音升级,能识别停顿和打断,但它解决的只是底层表达能力(VentureBeat)。
产品依然要在交互端回答四个关键问题:回复长度能否随场景改变,如何判断当前是谁的上下文以避免隐私泄露,如何用 guardrail 区分低风险记事与高风险付款,以及执行后是否留有撤销通道。
学术界也早就指出,多用户家庭中不同使用者的隐私感知差异会带来安全风险(Berkeley PDF;CSCW 2021 PDF)。
[AMD]:据 WSJ 报道,AMD 拟投资 Anthropic 最高约 50 亿美元,并配套提供约 2GW 算力与芯片。(Reuters)
[Nvidia/Microsoft/Meta]:三家公司联合发声,反对监管层过早限制 open-weight 模型,认为这会拖慢技术创新。(CNBC)
[AI Agent 融资]:7 月全球 AI Agent 领域单月融资约 18 亿美元,资金高度向 10 亿美元以上的超大额交易集中。(Crunchbase News)
本期由 AI 基于鸭哥已发布文章和公开资料整理生成,请注意甄别幻觉。
订阅本 newsletter:daily.yage.ai
每天鸭哥的Agent会在深度领域调研后发送一封邮件。这个邮件不是一般的deep research,而是基于鸭哥的三层Memory系统,从鸭哥积累的领域知识和长期价值观出发,定制的主观的邮件报告。
[鸭哥 AI 手记] 2026-07-24: 美军只给新模型 30 天:慢比不完美更危险 懒人包:美军新战略要求在公开发布后 30 天内部署最新模型,并断言动作太慢的危险已大过模型不够完美对齐的风险。为了应对不完美状态,OpenAI 官方指南做出了少写步骤、写清交付的类似转向,而我们在生产端也能通过每天问 100 个无聊问题来低成本搭建 API 温度计。今天发布了三篇文章,如果你正在头疼 agent 落地,建议最先点开第一篇关于部署护栏的拆解。 美军只给新模型 30 天,还说慢比不完美更危险 1 月 9 日,美军 Secretary of War Hegseth 签发了一份战略备忘录(Nextgov 分析)。文件要求 CDAO 建立交付节奏,确保最新模型在发布后 30 天内可部署上线,并把此项设为未来的首要采购标准。备忘录写道:动作太慢的危险已经大过模型不够完美对齐的风险。每一次决策失误都可能付出生命代价的军方,选择用具体的机制来管理不完美模型,而不是无限期等待完美对齐。 鸭哥在AI Agent 不必等模型完美:美军给 AI Builder...
[鸭哥 AI 手记] 2026-07-23: 72小时造热词,4小时跑实验:分辨AI虚与实 懒人包:Peter Steinheimer 12 个单词的推文在 72 小时内变成了全网热词。从概念包装的 Graph Engineering,到 Cursor 用 Swarm Harness 跑完 SQLite 实验,再到汽车与 CMOS 的工业史,这三篇文章指出了 AI 从叙事幻觉走向工程落地的临界点,今天最该关注 Graph Engineering 的虚实之争。 一条 12 个单词的推文怎么变成全网热词 鸭哥在 为什么你必须立刻开始学习 Graph Engineering? 中指出,7 月 17 日,曾加入 OpenAI 专注 Agent 技术的 PSPDFKit 创始人 Peter Steinheimer 在 X 上发了一句 12 个单词的调侃(Pragmatic Engineer)。他没有给任何定义,没有写一行代码。72 小时后,这句话变成了全网热词 Graph Engineering。控制流派忙着用它包装 DAG,平台商用它宣传校验,自媒体则借此兜售虚拟公司概念。甚至...
[鸭哥 AI 手记] 2026-07-21: 训练算合理使用,Anthropic 还是赔了 15 亿美元 懒人包:Anthropic 赔了 15 亿美元,但法院其实倾向认定训练符合 fair use,钱买的是硬盘上留存盗版书的诉讼风险。另外两篇文章指出,Sandbox 选型同名不同质,需要厘清运行状态与写操作控制;数学 Agent 协议则通过双循环严格隔离探索草稿与前提。 15 亿美元买的是什么 7 月 20 日,加州北区联邦法院批准了 Anthropic 与作家的 15 亿美元和解(Bloomberg Law)。这是美国史上最大的版权集体诉讼和解。但拿到这笔钱之前,法庭已经倾向于认定一件事:把书读进显存训练模型,属于 fair use。训练本身符合规范,问题出在同一份数字副本在硬盘里存了太久。 鸭哥在 同一本书,训练可算合理使用,盗版流程为何要赔 15 亿美元 中指出,Anthropic 联合创始人 Ben Mann 在 2021 至 2022 年间,明知是盗版仍从 LibGen 和 PiLiMi 下载了最高 700 万册图书(The...