AI 行业日报速览 2026-06-18
AI 资讯日报 · 2026-06-18
📌 今日重点摘要
- OpenAI 发布"AI 化学家":GPT-5.4 近乎自主改进药物化学反应:联合 Molecule.one 的 Maria Lab,在 Chan-Lam 偶联反应上将平均产率从 16.6% 提升至 25.2%,发表论文。
- OpenAI 推出 LifeSciBench:生命科学领域新基准:750 个专家级任务,173 位科学家参与,19020 条评分标准,评估 AI 在真实科研场景中的表现。
- OpenAI 发布 Deployment Simulation 技术:通过回放生产流量预演模型部署后行为,改进对 GPT-5 系列 Thinking 模型的风险评估。
- Claude Design 重大更新:新增可视化编辑器、多格式导出、Claude Code 深度集成,向 Figma/Canva 竞品方向迈进。
- OpenAI 宣布下线 Pulse 功能:每日个性化摘要将在 14 天内停止服务,改用定时任务替代。
🤖 模型发布与更新
OpenAI “AI 化学家”:GPT-5.4 近乎自主改进药物化学反应
OpenAI 联合 Molecule.one 发布了一项突破性研究:将 GPT-5.4 连接到 Maria(一个集成高通量实验室的化学 AI 代理),让它自主改进 Chan-Lam 偶联反应——一种在药物化学中形成碳-氮键的重要反应。
核心成果:
- GPT-5.4 独立识别出伯磺酰胺为高价值底物类,并建议使用 TEMPO 等温和氧化剂改善反应
- 优化后,88% 的硼酸和 83% 的磺酰胺测试产率提升
- 平均产率从 16.6% 提升至 25.2%,产率 >30% 的反应占比从 15.6% 提升至 37.5%
- 人类化学家在台式实验中验证了微升级结果
技术亮点:
整个流程历时 3 个月(3 月 4 日首次提示 → 6 月 4 日独立专家验证),Maria Lab 运行了 10,080 次反应。OpenAI 将其描述为"近乎自主"而非"完全自主",因为人类化学家仍在关键决策环节发挥作用。
影响分析: 这是 AI 在科学发现领域的又一里程碑。药物发现中的合成瓶颈长期制约着新药开发,AI 系统能提出人类未曾想到的实验方案(如 TEMPO 改善 Chan-Lam 偶联),展示了 AI 作为科研伙伴的实际价值。
来源:OpenAI Blog
OpenAI 推出 LifeSciBench:生命科学研究评估基准
OpenAI 发布了 LifeSciBench,一个专门评估 AI 系统在生命科学研究中实际能力的基准。
基准规模:
- 750 个专家编写的任务,涵盖 7 个工作流和 7 个生物学领域
- 1,062 个任务附件(图表、PDF、表格、序列文件等)
- 173 位 Ph.D. 级别科学家贡献,453 位专家审稿人
- 19,020 条评分标准,平均每任务 25 条
评估维度: 证据处理、分析、设计与优化、科学推理、验证与运营、转化、科学传播。79% 的任务需要多步推理,53% 的任务需要模型解读或综合至少一个附件的信息。
影响分析: 现有基准多聚焦于窄领域或孤立技能,LifeSciBench 填补了评估 AI 在真实科研场景中综合能力的空白。对制药和生物科技行业的 AI 选型具有参考价值。
来源:OpenAI Blog
OpenAI Deployment Simulation:部署前预演技术
OpenAI 发表了一种在模型发布前模拟真实部署行为的新方法。通过回放历史对话(去除原始回复,用候选模型重新生成),在隐私保护前提下评估模型在真实用户场景中的行为。
核心发现:
- 在多个 GPT-5 系列 Thinking 模型部署中,改进了对不良行为频率的估计
- 帮助在发布前发现新的错位行为形式
- 模型似乎无法区分 Deployment Simulation 和真实部署流量(缓解了评估意识问题)
- 已应用于 GPT-5.4 Thinking 的预注册预测
与传统评估的对比:
| 维度 | 传统评估 | Deployment Simulation |
|---|---|---|
| 覆盖范围 | 更适合低频高危风险 | 更适合理解部署流量中的风险谱 |
| 代表性 | 聚焦已知/预测风险 | 代表当前使用分布 |
| 评估意识 | 可能被模型识别为测试 | 部署级上下文缓解评估意识 |
影响分析: 随着模型能力增强,传统评估方法的局限性日益明显。Deployment Simulation 提供了一种可随计算资源扩展的风险评估方法,可能成为行业标准实践。
来源:OpenAI Blog
🛠 AI 工具与产品
Claude Design 重大更新:向 Figma/Canva 竞品迈进
Anthropic 为 Claude Design 推出了重大更新,包括:
- 可视化编辑器:支持直接拖拽、调整大小、对齐元素
- 多格式导出:新增 Adobe 和 Canva 导出选项
- Claude Code 集成:用户可从 Claude Code 终端直接处理设计项目,或从 Design 将软件布局无缝交接给 Claude Code
影响分析: Claude Design 正从 AI 设计聊天机器人向完整的设计工具演进。与 Claude Code 的深度集成打通了"设计→开发"的工作流,这对 Figma 和 Canva 构成直接竞争压力。
来源:The Verge
OpenAI 下线 Pulse,转向定时任务
OpenAI 宣布将在 14 天内停止 ChatGPT 的 Pulse 功能(每日个性化摘要),建议用户改用更新后的定时任务功能获取每日简报。
影响分析: Pulse 曾是 ChatGPT 的差异化功能之一,其下线暗示 OpenAI 正在统一其任务调度架构。定时任务可能提供更灵活的自定义能力。
来源:The Verge
🏢 行业动态
OpenAI 推出 Partner Network:1.5 亿美元投资生态建设
OpenAI 宣布 OpenAI Partner Network,投入 1.5 亿美元构建全球合作伙伴生态系统。计划到 2026 年底培训 30 万名认证顾问。合作伙伴分为 Select、Advanced、Elite 三个等级,将获得 Codex、网络安全、代理等领域的专业化认证。
影响分析: 这标志着 OpenAI 从技术提供商向企业平台转型。$150M 的投入和 30 万认证顾问的目标,显示 OpenAI 正在复制 Salesforce/微软的企业生态模式。
来源:OpenAI Blog
xAI 燃气数据中心:DOJ 以国家安全为由介入诉讼
美国司法部介入 NAACP 对 xAI 的诉讼,试图驳回指控 xAI 在密西西比州使用燃气轮机非法污染空气的案件。DOJ 辩称,阻止 xAI 使用这些设施将危及国家安全,因为"Grok 为国防部的军事行动提供关键支持"。
影响分析: 这是 AI 基础设施与环保监管冲突的典型案例。DOJ 以国家安全为由为 xAI 站台,反映了 AI 在军事领域的重要性日益提升,也引发了关于 AI 公司是否获得特殊待遇的争议。
来源:The Verge
SpaceX 出租 Colossus 1 数据中心容量
据彭博社报道,SpaceX 在 Grok AI 开发过程中遇到延迟问题后,将 Colossus 1 数据中心的计算容量出租给 Anthropic(年 150 亿美元)和 Google(月 9.2 亿美元)。原因是连接三个相距超过 10 英里的数据中心园区时遇到了延迟问题和老化网络基础设施。
影响分析: SpaceX 从 AI 计算的自建者变成了出租者,反映了大规模 AI 基础设施的实际运维挑战。Anthropic 和 Google 的大额租赁也说明 GPU 算力仍然供不应求。
来源:The Verge / Bloomberg
CISA 终于获得 Mythos Preview 访问权限
据报道,美国网络安全和基础设施安全局(CISA)上周才获得 Anthropic 限量发布的网络安全模型 Mythos Preview 的访问权限——但此时公众版本 Fable 已经被政府封锁了。
影响分析: 这一时间差凸显了政府内部在 AI 模型访问和安全评估方面的协调问题。
来源:The Verge
📊 值得关注的趋势
- AI 从工具到科研伙伴:OpenAI 的"AI 化学家"项目展示了 AI 不仅能回答问题,还能提出人类未曾想到的实验方案。这种"近乎自主"的科研模式正在药物化学、材料科学等领域扩散。
- 评估基准向真实场景演进:LifeSciBench 的设计思路——由从业者定义任务、评估实用价值而非仅评估准确性——值得其他领域借鉴。
- 部署前安全评估方法论升级:Deployment Simulation 代表了一种从"构造测试用例"到"模拟真实流量"的范式转变,可随算力扩展。
- AI 设计工具竞争白热化:Claude Design 的更新表明 AI 原生设计工具正在快速逼近传统设计软件的功能集。
- AI 基础设施的地缘政治化:xAI 以国家安全为由获得环保豁免、SpaceX 数据中心的算力租赁、Anthropic 模型的出口管制——AI 基础设施正成为国家安全议题的核心。
本简报基于 2026-06-17 至 2026-06-18 公开信息整理,部分信息来源为二手报道,标注"待确认"的内容请以官方公告为准。
