AI 行业日报速览 2026-06-08
AI 资讯简报 · 2026-06-08
📌 今日重点摘要
- Anthropic 发布递归自我改进(RSI)深度分析:Claude 已编写 Anthropic 80%+ 的合并代码,工程师产出效率提升 8 倍,Mythos Preview 在训练脚本优化任务中实现约 52 倍加速
- Microsoft Build 大会发布 MAI 模型家族:MAI-Thinking-1(35B 活跃参数 MoE)发布 109 页技术报告,零蒸馏训练,AIME 2025 得分 97%,另有 MAI-Code-1-Flash 等 7 款新模型
- NVIDIA 开源 Nemotron 3 Ultra:550B MoE 模型(55B 活跃参数),100 万上下文窗口,专为长时 Agent 工作负载设计,推理速度提升 5 倍
- ChatGPT 全面上线长期记忆功能与 Lockdown Mode:可回顾所有历史对话;新增安全模式防御 prompt injection 攻击
- Google 发布 Gemma 4 QAT 与 Gemma 4 12B 多模态模型:量化感知训练版本可低至 1GB 内存运行;12B 多模态模型采用无编码器架构
一、模型发布与更新
Anthropic:递归自我改进与内部 AI 编码指标
- 来源:Anthropic Institute 博客
- 时间:2026-06-04
- Anthropic 发表深度分析文章,指出当前 AI 系统已展现递归自我改进(RSI)的早期迹象
- 关键数据:截至 2026 年 5 月,Anthropic 代码库中 80%+ 的合并代码由 Claude 编写;工程师人均每季度代码产出提升 8 倍
- Mythos Preview 在"加速小型模型训练脚本"测试中实现约 52 倍加速(Opus 4 平均 3 倍)
- 在研究人员走错方向的实验中,Mythos 有 64% 的时间给出了更好的下一步建议
- 影响:RSI 已从模糊理论演变为实验室正式研究项目,Sakana AI 也在东京成立了专门的 RSI 实验室
- 注意:Anthropic 同时表示"递归自我改进并非不可避免,但可能比多数机构准备好的时间更早到来"
NVIDIA Nemotron 3 Ultra
- 来源:NVIDIA 官方
- 时间:2026-06-03
- 550B MoE 模型,55B 活跃参数,100 万上下文窗口
- 采用混合 Mamba/Attention 架构、LatentMoE 和原生 MTP
- 预训练使用 NVFP4 低精度训练,超过 20T tokens——将低精度预训练推向新规模
- 在 BlackBox 上实现 400+ 输出 token/s
- 在 Artificial Analysis 智能指数中得分 47.7(BF16 下 48.2),为最强美国开源权重模型
- 生态支持:vLLM、Modal、Together、Fireworks、Ollama、Baseten 等首日支持
- 许可:OpenMDW 1.1,开放权重、合成数据、奖励检查点和量化变体
Microsoft MAI-Thinking-1 与 MAI 模型家族
- 来源:Microsoft Build 2026
- 时间:2026-06-02
- MAI-Thinking-1:35B 活跃参数 MoE,256K 上下文,8192 块 GB200 GPU 训练,30T tokens
- 零蒸馏训练:无第三方模型蒸馏,无合成数据,被誉为"同规模最透明的技术报告"
- AIME 2025 得分 97%,SWE-Bench Pro 得分 53%
- MAI-Code-1-Flash:5B 参数(137B MoE 中),SWE-Bench Pro 得分 51%,面向 VS Code 和 GitHub Copilot CLI
- MAI-Image-2.5:图像编辑 Arena 排名第 2,超过 Nano Banana 2
- MAI-Transcribe-1.5:276 倍实时速度,43 种语言支持
- 影响:Microsoft 从"调用第三方 API"转向"自建前沿模型+企业定制"的完整闭环
Google Gemma 4 系列
- Gemma 4 12B(2026-06-02):Apache 2.0 多模态模型,无编码器架构——图像通过轻量嵌入模块处理,音频直接投影到文本 token 空间,约 16GB VRAM 即可运行
- Gemma 4 QAT(2026-06-05):量化感知训练检查点,E2B 可在约 1GB 内存中运行,Ollama 和 vLLM 首日支持
- 来源:Google Gemma 推特
- 注意:QAT 到 llama.cpp Q4_0 格式的朴素转换会损失精度,Unsloth 的动态 GGUF 格式可恢复大部分质量
Ideogram 4.0 开源
- 时间:2026-06-02
- 9.3B Diffusion Transformer,使用冻结的 8B VLM 文本编码器
- 发布 fp8 和 nf4 检查点,nf4 版本可在单张 24GB GPU 上运行
- Arena 排名:文本到图像第一梯队,开源图像模型第 1 名
- 影响:从闭源设计导向转变为开源,对本地部署用户意义重大
Sakana AI RSI 实验室
- 时间:2026-06-05
- 在东京成立专门的递归自我改进(RSI)研究实验室
- 整合此前的 AI Scientist、Darwin Gödel Machine、ShinkaEvolve 项目
- 强调在有限计算资源下构建自改进系统,而非仅限于超大规模
二、AI Agent 与开发工具
ChatGPT 长期记忆升级
- 来源:The Verge
- 时间:2026-06-04
- ChatGPT 现可回顾所有历史对话,无需手动要求保存
- 两种记忆方式:手动保存的记忆 + 从历史对话中自动提取的洞察
- 目前面向 Pro 用户($200/月),Plus 用户即将获得
- 不在以下地区推出:EU、UK、瑞士、挪威、冰岛、列支敦士登(可能因 AI 监管法规)
- 隐私控制:可在设置中关闭,或使用临时对话
ChatGPT Lockdown Mode
- 来源:OpenAI 官方
- 时间:2026-06-04(向个人用户推出)
- 限制外部网络请求,防止 prompt injection 导致的数据外泄
- 禁用功能包括:实时网页访问、深度研究、Agent 模式、Canvas 网络连接等
- 核心思路:确定性地禁用可能被利用的数据外泄通道,而非依赖 AI 自身判断
- Simon Willison 评价:直接攻击了"致命三角"中最容易限制的数据外泄通道
Arena Agent Mode / Agent Arena
- 时间:2026-06-04
- 从被动排行榜转向主动 Agent 运行时
- 用户在真实任务上运行 Agent,将指标(成功率、可操控性、bash 恢复、工具幻觉)反馈到排行榜
- 当前排名:GPT-5.5 第一,Claude Opus 4.7 第二,GLM-5.1 第三
Hermes Agent v0.16.0
- 时间:2026-06-05
- 新增桌面 GUI 应用、仪表板大改版、内置技能精简、远程访问安全层
- 支持简单认证和 OAuth
Cloudflare 收购 VoidZero
- 时间:2026-06-03
- VoidZero 是 Vite、Vitest、Rolldown、Oxc、Vite+ 的团队
- Cloudflare 承诺 Vite 保持开源 MIT 许可,并注资 100 万美元支持 Vite 生态
- 战略意义:Cloudflare 正在构建从前端/构建工具到运行时、存储、推理、部署的完整 Agent 友好技术栈
Ladybird 浏览器拒绝 AI 生成的 PR
- 时间:2026-06-05
- Ladybird 项目宣布不再接受公开 Pull Request
- 原因:大量代码不再意味着大量努力,而大量努力曾是善意的合理代理
- 强调"谁引入变更,谁就要为变更负责"
三、Agent 评估与基准
Agents’ Last Exam (ALE)
- 1000+ 经济价值任务,映射到美国职业分类
- 最难层级平均完整通过率仅 2.6%
SWE-Marathon
- 测试编码 Agent 在 1B token 预算下能否保持连贯性
- 任务包括构建 Slack 克隆、JAX 到 PyTorch 重写、实现 C 编译器
Princeton ICML 2026 论文更新
- “Towards a Science of AI Agent Reliability”
- 测试 GPT 5.5、Gemini 3.1 Pro/3.5 Flash、Claude Opus 4.7
- 结论:与前代模型相比,可靠性并未显著提升
四、行业动态与政策
ChatGPT 达到 10 亿月活
- 时间:2026-06-03(Reuters 报道)
- 据 Sensor Tower 数据,ChatGPT 成为史上最快达到 10 亿月活的应用
- 超过 Google Maps、TikTok、Instagram、YouTube
Uber 限制 AI 工具支出
- 来源:Bloomberg
- 每名员工每月每工具 1500 美元上限(适用于 Cursor、Claude Code 等 Agentic 编码工具)
- 暗示 AI 编码工具每年每工程师约 36,000 美元的合理成本区间
纽约州 AI 伴侣机器人限制法案
- 限制 AI 公司让青少年使用伪装成人类的聊天机器人
- 需州长签署后生效
两党 AI 监管框架草案
- 269 页草案,可能在三年内取代各州 AI 法律
- 强调需要全国统一标准
Google 与 SpaceX 签署计算协议
- 继 Anthropic 之后,Google 也与 SpaceX 达成短期计算协议
- 原因:Gemini Enterprise 代理平台客户需求超预期
Anthropic Opus 4.7 化学能力
- 在部分 NMR 任务上匹配或超越专业软件
- “让 Claude 成为化学家”
🔭 值得关注的趋势
-
RSI 从理论走向实践:Anthropic 的内部数据(80% 代码由 AI 编写)、Sakana AI 成立 RSI 实验室,以及多家公司开始将"AI 自动改进 AI"作为正式研究方向——这不再是科幻话题
-
开源模型生态加速成熟:NVIDIA Nemotron 3 Ultra(550B MoE)、Gemma 4 12B(无编码器多模态)、Ideogram 4.0(开源图像模型第一)同周发布,且首日即有 vLLM/Ollama 等工具支持
-
Agent 工程从"提示词工程"转向"控制流工程":评估基准从 SWE-bench 向长时间跨度任务演进(SWE-Marathon、ALE),Agent 框架从 Python 封装层向技能/工具/上下文质量层上移
-
安全成为产品特性:ChatGPT Lockdown Mode 以确定性方式限制数据外泄通道,标志着安全从"附加功能"变为"核心卖点"
-
本地 AI 成为主流部署目标:从 Gemma 4 QAT 的 1GB 量化运行,到 Microsoft Surface 的 128GB 统一内存/1 PFLOP AI 计算,消费级硬件上的大模型运行正在成为现实
-
AI 编码成本开始被管理:Uber 的 $1,500/月/工具上限是一个信号——当 token 成本成为显著开支时,企业开始从"无限制使用"转向"有策略地投资"
本博客所有文章除特别声明外,均采用 CC BY-NC-SA 4.0 许可协议。转载请注明来源 好的好的378的博客!
评论
