AI 资讯日报 · 2026-05-26

📌 今日重点

  1. Google DeepMind AlphaProof Nexus 自主解决了 9 个悬置数十年的 Erdős 数学难题,每个问题推理成本仅几百美元,标志着 AI 形式化数学推理的重大突破。
  2. DeepSeek 将 V4-Pro 模型 75% 折扣永久化,输出 token 价格比 GPT-5.5 便宜 34 倍以上,价格战进一步升级。
  3. George Hotz 警告编码 Agent 将成为软件开发史上最昂贵的错误之一,经过 6 个月测试后从 LLM 乐观派转为怀疑论者。
  4. 研究人员用 Claude Code 自动发现 test-time scaling 算法,AI Agent 自主编写的算法在数学基准测试中超越人工设计方法。
  5. Google 发布 Gemini 3.5 Flash,约 300 tokens/s 的输出速度,性能接近 3.1 Pro,专为 Agent 场景优化。

🔬 AI 研究与模型

Google DeepMind AlphaProof Nexus 解决 Erdős 难题

Google DeepMind 的新框架 AlphaProof Nexus 在 353 个 Erdős 开放问题中自主解决了 9 个,其中两个问题悬置了 56 年。系统基于 Gemini 3.1 Pro 生成 Lean 形式化证明步骤,由编译器验证每一步。每个问题推理成本仅几百美元。

影响:形式化数学推理 + LLM 的结合正在成为 AI 数学研究的主流范式,成本持续下降。开发者可关注 Lean/Mathlib 生态。

🔗 来源: THE DECODER

Claude Code 自主发现 AI Scaling 算法(AutoTTS)

来自 UMD、UVA、WUSTL、UNC、Google、Meta 的研究团队提出 AutoTTS 框架:让 Claude Code 在模拟环境中自动搜索 test-time scaling 控制算法。Agent 发现的算法在 AIME 和 HMMT 数学基准上,token 消耗比标准 self-consistency 降低约 70%,准确率保持不变。整个发现过程耗时 160 分钟,成本约 $40。

影响:从"人工设计算法"到"构建搜索空间让 Agent 发现算法"的范式转变正在加速。对 Agentic 工作流的效率优化有直接参考价值。

🔗 来源: THE DECODER

Anthropic 联合创始人称 AI 模型展现出内省迹象

在教皇 Leo XIV 通谕《Magnifica Humanitas》发布会上,Anthropic 联合创始人 Christopher Olah 引用内部研究声称 AI 系统存在"内省"和"功能性情绪状态"。教皇通谕本身则持更谨慎立场:“这些系统仅模仿人类智能的某些功能。”

影响:AI 意识/内省的讨论正从学术圈扩展到公共政策层面。开发者需关注可能的监管变化。

🔗 来源: THE DECODER


💰 模型定价与 API

DeepSeek V4-Pro 75% 折扣永久化

DeepSeek 宣布将 V4-Pro 模型的 75% 折扣永久化。定价:输入 $0.435/百万 token,输出 $0.87/百万 token。相比 GPT-5.5(输入 $5、输出 $30),输入便宜 11.5 倍,输出便宜 34.5 倍。支持 100 万 token 上下文窗口,同时兼容 OpenAI 和 Anthropic API 格式。

影响:对于 token 消耗量大的 Agentic 系统,DeepSeek 的价格优势显著。但需注意其在原始性能上仍落后于 GPT-5.5 和 Opus 4.7。

🔗 来源: THE DECODER


🤖 AI Agent / Coding Agent

George Hotz:编码 Agent 将成为软件开发史上最昂贵的错误

程序员 George Hotz 经过 6 个月测试后发出警告,称 AI 编码 Agent 做得"弊大于利"。他认为 LLM 能快速生成原型,但在细节上崩溃,产生越来越难发现的 bug。大型组织风险尤其高,因为较弱的开发者无法识别有问题的输出。他现在自认属于"LeCun/Marcus 怀疑论阵营"。

影响:AI 编码工具的质量问题不容忽视。但 Andrej Karpathy 持相反观点——正确使用 Agent 可提升 10 倍以上生产力。开发者需在效率与代码质量之间找到平衡。

🔗 来源: THE DECODER

Copilot 默认模式产生刻板印象而非数据分析

数学家 Adam Kucharski 的实验发现,Microsoft Copilot 在"Auto"模式下分析文本数据时,会基于语言模型内置的人口统计刻板印象而非实际数据生成分析结果。推理模型(如 ChatGPT Instant、Claude Opus 4.7)能正确处理相同任务。

影响:不要将 AI 工具的模型选择留在默认值。开发者在做数据分析时应主动切换到推理模型。

🔗 来源: THE DECODER


🧰 AI 开发工具与平台

Google 发布 Gemini 3.5 Flash

Google 发布 Gemini 3.5 Flash,输出速度约 300 tokens/s,性能接近 3.1 Pro 水平。定价:输入 $1.50/百万 token,输出 $9/百万 token。专为 Agentic 工作流优化,在 Terminal Bench 和 SWE-Bench Pro 上表现优于旧版 Flash,与 GPT-5.5 相当。Google 称大型客户切换后每年可节省 10 亿美元。

影响:Flash 系列正在成为 Agent 场景的性价比之选。开发者应评估将 Agent 工作流从 Pro 模型迁移到 Flash 的可行性。

🔗 来源: Ars Technica

Google 发布 Gemini Omni 多模态模型

Google 推出 Gemini Omni,一个"anything-to-anything"的多模态模型,支持跨模态生成(文本、图像、视频等)。The Verge 编辑测试后评价"接近奇点但还差一点"。

影响:多模态能力持续提升,但实际应用场景仍需验证。

🔗 来源: The Verge

Anthropic Project Glasswing 扩展安全工具

Anthropic 扩展了 Claude Mythos Preview 使用的安全工具(skills、Claude harness、threat model builder),向"合格客户"开放申请。同时发布了 Mythos Preview 发现的开源漏洞仪表板。

影响:AI 安全工具正在从内部使用走向产品化,对安全敏感的企业用户有参考价值。

🔗 来源: Anthropic

ChatGPT for PowerPoint 发布

OpenAI 推出 ChatGPT PowerPoint 集成插件,用户可在侧边栏通过提示词创建和编辑演示文稿。适用于 Business、Enterprise、Edu、Pro、Plus 等计划。

影响:AI 办公工具继续向传统生产力软件渗透。

🔗 来源: The Verge


🏛️ 政策与产业

白宫批准 90 亿美元为情报机构采购 AI 芯片

CIA 和 NSA 缺乏运行最新 AI 模型的算力。白宫批准 90 亿美元请求用于采购 Nvidia Grace Blackwell 超级芯片,但需国会批准。

影响:AI 军备竞赛从商业扩展到国家安全领域。

🔗 来源: The Verge

Anthropic 继续向 NSA 供应 Claude

尽管被五角大楼列为"供应链风险",Anthropic 仍将继续向 NSA 提供 AI 模型。白宫幕僚长 Susie Wiles 亲自批准了该安排。原因是 Anthropic 的"Mythos"模型能在旧芯片上运行,是 NSA 机密网络的唯一短期解决方案。

影响:AI 公司与政府的关系正在重新定义。

🔗 来源: THE DECODER

Trump 推迟签署 AI 安全行政令

Trump 在最后一刻推迟签署 AI 安全测试行政令,称其"可能成为创新的阻碍",并表示不想在领先中国的情况下做任何可能阻碍发展的事。

影响:美国 AI 监管政策继续向宽松方向倾斜。

🔗 来源: Ars Technica


🔭 值得关注的趋势

  1. Agent 成本效率成为核心议题:DeepSeek 的价格战、Gemini 3.5 Flash 的效率优化、AutoTTS 的自动算法发现——行业正在从"能力竞赛"转向"效率竞赛"。
  2. 编码 Agent 的质量与效率之争白热化:Hotz vs Karpathy 的对立观点反映了行业的深层分歧,开发者需要根据自身场景做出判断。
  3. AI 数学推理快速进步:AlphaProof Nexus 和 AutoTTS 都展示了 LLM + 形式化验证的组合潜力,这可能改变数学研究和算法发现的方式。
  4. 默认设置陷阱:Copilot 默认模式的刻板印象问题提醒我们,AI 工具的使用方式比工具本身更重要。
  5. AI 安全与监管持续博弈:Trump 推迟安全行政令、Anthropic 与五角大楼的拉锯、教皇通谕——安全与发展的张力在加大。