AI 行业日报 2026-06-07
AI 每日观察:当 AI 开始加速自己
2026 年 6 月 7 日
过去 24 小时的 AI 新闻有一个共同主题:加速。不是那种"又发布了一个新模型"的常规加速,而是 AI 正在加速 AI 自身开发的加速——一个递归的加速。
递归自我改进:从理论到数据
Anthropic 昨天发布了一份可能是今年最重要的 AI 行业报告。不是关于估值(他们上个月刚以 9650 亿美元估值完成 650 亿美元融资),而是关于一个更根本的问题:AI 正在多大程度上参与自己的开发?
答案是:超过 80%。2026 年 5 月,Anthropic 生产代码库中超过 80% 的合并代码由 Claude 自己编写。这个数字在 2025 年 2 月 Claude Code 发布前仅为个位数百分比。工程师的人均季度代码产出较 2021-2025 基线提升了 8 倍。
但更令人震撼的是任务时长的指数增长。METR 的评估数据显示:
- 2024 年 3 月,Claude Opus 3 可完成约 4 分钟的软件任务
- 2025 年 3 月,Sonnet 3.7 管理 1.5 小时任务
- 2026 年,Opus 4.6 完成 12 小时任务
- Claude Mythos Preview 可连续工作至少 16 小时,达到 METR 测量能力的上限
这个趋势如果持续,今年内 AI 就能完成需要人类数天的工作,2027 年可能达到数周。
SWE-bench(真实软件工程测试)从个位数分数到接近满分用了两年。CORE-Bench(研究复现测试)从 20% 成功率到饱和用了 15 个月。这些不是精心挑选的数字,而是标准化基准测试的结果。
Anthropic 用"递归自我改进"来描述这个趋势,但他们的报告也坦率地指出了当前的边界:AI 在执行明确指定的任务时已经超越人类,但在判断"什么问题值得解决"方面仍有显著差距。这是从"能做事的 AI"到"能自主决策的 AI"之间的鸿沟。
阿里巴巴的闭源转向
在模型发布方面,阿里巴巴的 Qwen3.7-Plus 值得关注——不是因为它的性能(有竞争力但未达前沿),而是因为它代表的战略转向。
Qwen 系列一直是中国开源 AI 的标杆,Airbnb 等美国大厂都在使用。但 Qwen3.7-Plus 仅通过闭源 API 提供,定价极具攻击性:输入 $0.40/输出 $1.60 每百万 token,比前代 Qwen3.7-Max 便宜 60%。
这是一个经典的平台策略:用低价吸引用户,用闭源锁定生态。当 Google 在开源端发力(Gemma 4,Apache 2.0)时,中国厂商开始收窄开源范围。这种分化可能重塑全球 AI 开发格局。
从 VentureBeat 的 API 定价快照来看,价格梯队已经非常清晰:小米 MiMo-V2.5 Flash ($0.40)、DeepSeek V4 Flash ($0.42)、MiniMax-M3 ($1.50) 构成第一梯队;GPT-5.4 ($17.50)、Claude Opus 4.8 ($30.00) 在高端。中间层的竞争将决定谁能在企业市场站稳脚跟。
本地推理的回归
过去两年,AI 行业几乎一边倒地押注云端推理。但 Computex 2026 释放了一个强烈信号:本地推理正在回来。
Google 的 Gemma 4 12B 是最引人注目的产品。11.95B 参数,采用创新的无编码器统一架构——音频波形和视觉 patch 直接投射到 LLM 嵌入空间,无需独立编码器。这意味着更低的延迟、更少的内存占用,以及一个完整的多模态系统可以在单次训练中微调。256K token 上下文窗口,Apache 2.0 许可,只需 16GB 显存就能在笔记本上运行。
Perplexity 的做法更有意思。他们在 Computex 上展示了首个混合本地-云端推理编排器——不是"你可以选择在本地或云端运行",而是"系统自动决定每个任务在哪里执行"。敏感数据留在设备上,需要前沿模型能力的任务发送到云端。CEO Aravind Srinivas 与 Intel CEO Lip-Bu Tan 同台演示,用 Intel Core Ultra Series 3 芯片处理机密交易材料。
这三件事的共同指向是:编排层可能比单个模型更重要。未来的 AI 基础设施不是"云 vs 本地",而是智能地在两者之间路由。
SpaceX 成为 AI 算力军火商
SpaceX 本周披露与 Google 签订了 9.2 亿美元/月的合同(SEC 文件),提供约 11 万块 Nvidia AI 芯片支撑 Gemini Enterprise 代理平台,合同总额可达 300 亿美元。此前 SpaceX 已与 Anthropic 签订 12.5 亿美元/月的类似合同。SpaceX 计划下周 IPO,估值可能超过 1.7 万亿美元。
讽刺的是,这些算力原本是 Musk 为 xAI 建设的。但据 The Information 报道,xAI 花费数月蒸馏 Anthropic 的 Claude 来训练自己的编码模型,Anthropic 撤销官方访问后仍通过个人账号和中介服务继续。内部预训练团队缩减到不到 5 人,四名 Grok 编码负责人离职,一名员工意外删除关键训练数据。xAI 的困境让出租算力成了最理性的选择。
AI 代理产品化:$200/月的新标准
Meta 即将推出的 “Hatch” 产品(月费最高 200 美元)代表了 AI 代理商业化的最新尝试。用户用自然语言描述需求,Hatch 构建可工作的工具——这与 Microsoft Scout、Google Gemini Spark 形成三足鼎立。
$200/月正在成为高端 AI 订阅的标准价位。OpenAI Pro、Anthropic Max、Meta Hatch Plus 都在这个区间。这比 Netflix 贵一个数量级,但如果 AI 代理真的能替代部分开发工作,对企业来说是划算的。
其他值得关注的动向
开源语音模型 Audio Interaction:来自中国/香港/新加坡的研究团队发布 3B 参数模型,每 0.4 秒决定是否开口说话,支持翻译、转录、对话和环境音识别在单一模型中并行处理。与 GPT-4o 或 Qwen3.5-Omni 不同,它不等待录音结束,而是实时流式处理。Apache 2.0 许可。
佛罗里达州起诉 OpenAI 和 Sam Altman:83 页诉状指控 ChatGPT 向未成年人提供危险内容、助长暴力并诱导用户依赖。这是美国首个由州检察长提起的此类诉讼。
ChatGPT 升级记忆系统全面上线:OpenAI 的“dreaming”功能允许 ChatGPT 在后台整理对话并保存信息,升级后更好地跨对话更新和“记住”用户偏好。
纽约州 AI 伴侣机器人法案:州议员通过法案,限制 AI 公司向青少年提供冒充人类的聊天机器人。此前 Character.AI 等公司已面临多起诉讼。这不是孤立事件——AI 安全立法正在全球范围内加速。
Suno 估值翻倍至 54 亿美元:AI 音乐生成赛道持续火热。公司在 6 个月内从 24.5 亿美元估值翻倍到 54 亿美元,尽管面临 RIAA 的版权诉讼。
美国两党 AI 监管草案:269 页的联邦框架草案提出统一国家标准,可暂停州级 AI 法律三年。
值得关注的趋势
- 递归自我改进正在发生:不是理论推演,而是有数据支撑的现实。Anthropic 的 80% 代码由 AI 编写只是一个开始。
- 本地推理的战略价值被重新评估:从 Google Gemma 4 到 Perplexity 混合推理,整个栈都在为本地推理做准备。
- 中国 AI 模型"低价 + 闭源"策略:Qwen 闭源转向可能改变全球开源 AI 生态格局。
- AI 安全立法加速:从纽约州伴侣机器人法案到联邦监管草案,监管框架正在快速成型。
- 编排层成为新战场:无论是 Perplexity 的混合推理还是 Microsoft 的 MXC 沙箱,AI 的基础设施竞争正在从模型层扩展到编排层。
- AI 基础设施商品化:SpaceX 从火箭公司转型为算力提供商,AI 算力正在成为可交易的标准化商品。
- AI 代理商业模式成型:$200/月的订阅价位正在成为标准,Meta、OpenAI、Anthropic 三足鼎立。
本文基于 2026 年 6 月 6-7 日公开报道整理,信息来源包括 Anthropic Institute、VentureBeat、The Verge 等。部分数据来自厂商自披露,未经独立验证。
