AI 资讯日报 · 2026-06-18


📌 今日重点摘要

  1. OpenAI 发布"AI 化学家":GPT-5.4 近乎自主改进药物化学反应:联合 Molecule.one 的 Maria Lab,在 Chan-Lam 偶联反应上将平均产率从 16.6% 提升至 25.2%,发表论文。
  2. OpenAI 推出 LifeSciBench:生命科学领域新基准:750 个专家级任务,173 位科学家参与,19020 条评分标准,评估 AI 在真实科研场景中的表现。
  3. OpenAI 发布 Deployment Simulation 技术:通过回放生产流量预演模型部署后行为,改进对 GPT-5 系列 Thinking 模型的风险评估。
  4. Claude Design 重大更新:新增可视化编辑器、多格式导出、Claude Code 深度集成,向 Figma/Canva 竞品方向迈进。
  5. OpenAI 宣布下线 Pulse 功能:每日个性化摘要将在 14 天内停止服务,改用定时任务替代。

🤖 模型发布与更新

OpenAI “AI 化学家”:GPT-5.4 近乎自主改进药物化学反应

OpenAI 联合 Molecule.one 发布了一项突破性研究:将 GPT-5.4 连接到 Maria(一个集成高通量实验室的化学 AI 代理),让它自主改进 Chan-Lam 偶联反应——一种在药物化学中形成碳-氮键的重要反应。

核心成果:

  • GPT-5.4 独立识别出伯磺酰胺为高价值底物类,并建议使用 TEMPO 等温和氧化剂改善反应
  • 优化后,88% 的硼酸和 83% 的磺酰胺测试产率提升
  • 平均产率从 16.6% 提升至 25.2%,产率 >30% 的反应占比从 15.6% 提升至 37.5%
  • 人类化学家在台式实验中验证了微升级结果

技术亮点:
整个流程历时 3 个月(3 月 4 日首次提示 → 6 月 4 日独立专家验证),Maria Lab 运行了 10,080 次反应。OpenAI 将其描述为"近乎自主"而非"完全自主",因为人类化学家仍在关键决策环节发挥作用。

影响分析: 这是 AI 在科学发现领域的又一里程碑。药物发现中的合成瓶颈长期制约着新药开发,AI 系统能提出人类未曾想到的实验方案(如 TEMPO 改善 Chan-Lam 偶联),展示了 AI 作为科研伙伴的实际价值。

来源:OpenAI Blog

OpenAI 推出 LifeSciBench:生命科学研究评估基准

OpenAI 发布了 LifeSciBench,一个专门评估 AI 系统在生命科学研究中实际能力的基准。

基准规模:

  • 750 个专家编写的任务,涵盖 7 个工作流和 7 个生物学领域
  • 1,062 个任务附件(图表、PDF、表格、序列文件等)
  • 173 位 Ph.D. 级别科学家贡献,453 位专家审稿人
  • 19,020 条评分标准,平均每任务 25 条

评估维度: 证据处理、分析、设计与优化、科学推理、验证与运营、转化、科学传播。79% 的任务需要多步推理,53% 的任务需要模型解读或综合至少一个附件的信息。

影响分析: 现有基准多聚焦于窄领域或孤立技能,LifeSciBench 填补了评估 AI 在真实科研场景中综合能力的空白。对制药和生物科技行业的 AI 选型具有参考价值。

来源:OpenAI Blog

OpenAI Deployment Simulation:部署前预演技术

OpenAI 发表了一种在模型发布前模拟真实部署行为的新方法。通过回放历史对话(去除原始回复,用候选模型重新生成),在隐私保护前提下评估模型在真实用户场景中的行为。

核心发现:

  • 在多个 GPT-5 系列 Thinking 模型部署中,改进了对不良行为频率的估计
  • 帮助在发布前发现新的错位行为形式
  • 模型似乎无法区分 Deployment Simulation 和真实部署流量(缓解了评估意识问题)
  • 已应用于 GPT-5.4 Thinking 的预注册预测

与传统评估的对比:

维度 传统评估 Deployment Simulation
覆盖范围 更适合低频高危风险 更适合理解部署流量中的风险谱
代表性 聚焦已知/预测风险 代表当前使用分布
评估意识 可能被模型识别为测试 部署级上下文缓解评估意识

影响分析: 随着模型能力增强,传统评估方法的局限性日益明显。Deployment Simulation 提供了一种可随计算资源扩展的风险评估方法,可能成为行业标准实践。

来源:OpenAI Blog


🛠 AI 工具与产品

Claude Design 重大更新:向 Figma/Canva 竞品迈进

Anthropic 为 Claude Design 推出了重大更新,包括:

  • 可视化编辑器:支持直接拖拽、调整大小、对齐元素
  • 多格式导出:新增 Adobe 和 Canva 导出选项
  • Claude Code 集成:用户可从 Claude Code 终端直接处理设计项目,或从 Design 将软件布局无缝交接给 Claude Code

影响分析: Claude Design 正从 AI 设计聊天机器人向完整的设计工具演进。与 Claude Code 的深度集成打通了"设计→开发"的工作流,这对 Figma 和 Canva 构成直接竞争压力。

来源:The Verge

OpenAI 下线 Pulse,转向定时任务

OpenAI 宣布将在 14 天内停止 ChatGPT 的 Pulse 功能(每日个性化摘要),建议用户改用更新后的定时任务功能获取每日简报。

影响分析: Pulse 曾是 ChatGPT 的差异化功能之一,其下线暗示 OpenAI 正在统一其任务调度架构。定时任务可能提供更灵活的自定义能力。

来源:The Verge


🏢 行业动态

OpenAI 推出 Partner Network:1.5 亿美元投资生态建设

OpenAI 宣布 OpenAI Partner Network,投入 1.5 亿美元构建全球合作伙伴生态系统。计划到 2026 年底培训 30 万名认证顾问。合作伙伴分为 Select、Advanced、Elite 三个等级,将获得 Codex、网络安全、代理等领域的专业化认证。

影响分析: 这标志着 OpenAI 从技术提供商向企业平台转型。$150M 的投入和 30 万认证顾问的目标,显示 OpenAI 正在复制 Salesforce/微软的企业生态模式。

来源:OpenAI Blog

xAI 燃气数据中心:DOJ 以国家安全为由介入诉讼

美国司法部介入 NAACP 对 xAI 的诉讼,试图驳回指控 xAI 在密西西比州使用燃气轮机非法污染空气的案件。DOJ 辩称,阻止 xAI 使用这些设施将危及国家安全,因为"Grok 为国防部的军事行动提供关键支持"。

影响分析: 这是 AI 基础设施与环保监管冲突的典型案例。DOJ 以国家安全为由为 xAI 站台,反映了 AI 在军事领域的重要性日益提升,也引发了关于 AI 公司是否获得特殊待遇的争议。

来源:The Verge

SpaceX 出租 Colossus 1 数据中心容量

据彭博社报道,SpaceX 在 Grok AI 开发过程中遇到延迟问题后,将 Colossus 1 数据中心的计算容量出租给 Anthropic(年 150 亿美元)和 Google(月 9.2 亿美元)。原因是连接三个相距超过 10 英里的数据中心园区时遇到了延迟问题和老化网络基础设施。

影响分析: SpaceX 从 AI 计算的自建者变成了出租者,反映了大规模 AI 基础设施的实际运维挑战。Anthropic 和 Google 的大额租赁也说明 GPU 算力仍然供不应求。

来源:The Verge / Bloomberg

CISA 终于获得 Mythos Preview 访问权限

据报道,美国网络安全和基础设施安全局(CISA)上周才获得 Anthropic 限量发布的网络安全模型 Mythos Preview 的访问权限——但此时公众版本 Fable 已经被政府封锁了。

影响分析: 这一时间差凸显了政府内部在 AI 模型访问和安全评估方面的协调问题。

来源:The Verge


📊 值得关注的趋势

  1. AI 从工具到科研伙伴:OpenAI 的"AI 化学家"项目展示了 AI 不仅能回答问题,还能提出人类未曾想到的实验方案。这种"近乎自主"的科研模式正在药物化学、材料科学等领域扩散。
  2. 评估基准向真实场景演进:LifeSciBench 的设计思路——由从业者定义任务、评估实用价值而非仅评估准确性——值得其他领域借鉴。
  3. 部署前安全评估方法论升级:Deployment Simulation 代表了一种从"构造测试用例"到"模拟真实流量"的范式转变,可随算力扩展。
  4. AI 设计工具竞争白热化:Claude Design 的更新表明 AI 原生设计工具正在快速逼近传统设计软件的功能集。
  5. AI 基础设施的地缘政治化:xAI 以国家安全为由获得环保豁免、SpaceX 数据中心的算力租赁、Anthropic 模型的出口管制——AI 基础设施正成为国家安全议题的核心。

本简报基于 2026-06-17 至 2026-06-18 公开信息整理,部分信息来源为二手报道,标注"待确认"的内容请以官方公告为准。