https://openai.com/zh-Hans-CN/index/introducing-gpt-rosalind/

一、它主要想解决什么问题

文章以新药研发为例:一种新药从发现靶点到最终上市,平均需要 10 至 15 年。早期研究中的判断会产生“复利效应”:

  • 靶点选得更准确,后续失败率可能降低;
  • 生物学假设更严谨,实验资源浪费会减少;
  • 实验设计质量更高,可以更早发现有效方向;
  • 对文献和数据的综合更全面,有助于找到隐藏的关联。

因此,GPT‑Rosalind 的核心价值并不是单纯“写得更快”,而是希望帮助研究人员:

  • 更快获得可靠证据;
  • 探索更多潜在研究方向;
  • 更早排除错误假设;
  • 设计更有价值的后续实验;
  • 缩短研发早期阶段的周期。

二、它与普通聊天模型有什么不同

文章强调,这个模型是为“科学工作流”打造的,尤其重视两种能力。

1. 更强的生物医学推理

模型需要理解的不只是术语,而是多个层次之间的关系,例如:

  • 某个基因发生突变后可能影响什么蛋白质功能;
  • 某种蛋白质结构变化可能怎样改变相互作用;
  • 某条信号通路与某种疾病之间有什么证据;
  • 某个化学反应为什么能够发生;
  • 某段 DNA 或 RNA 序列可能具有什么功能。

2. 更强的工具调用能力

生命科学研究不能只依靠模型记忆。研究人员往往需要实时访问:

  • 论文和文献数据库;
  • 基因组和多组学数据库;
  • 蛋白质结构数据库;
  • 序列搜索工具;
  • 化学反应和分子分析工具;
  • 临床证据资源;
  • 公开实验数据集。

GPT‑Rosalind 的定位是能够判断“需要查什么、调用哪个工具、怎样组合多个工具”,然后把结果综合成研究结论或实验建议。

三、研究插件是什么

OpenAI 同时发布了一个免费的 生命科学研究插件,专门为 Codex 设计,代码托管在 GitHub 上。

这个插件相当于一个科研工作流工具包,包含面向以下领域的模块:

  • 人类遗传学;
  • 功能基因组学;
  • 蛋白质结构;
  • 生物化学;
  • 临床证据;
  • 公开研究检索。

插件可以连接 50 多种公开的多组学数据库、文献资源和生物学工具。它尤其适合处理一些重复但复杂的任务,例如:

  • 查询蛋白质结构;
  • 搜索相似序列;
  • 汇总某个主题的文献;
  • 查找公开数据集;
  • 对基因、蛋白质或疾病相关证据进行整理。

文章把插件称为“编排层”,意思是:它不一定自己完成所有科学计算,而是帮助模型把不同数据库和工具组织起来,形成一条完整的工作流程。

符合条件的 Enterprise 客户可以把插件与 GPT‑Rosalind 结合使用;普通用户则可以在主干模型中使用这个插件包。

四、文章公布了哪些评估结果

文章介绍了三类评估。

1. 内部科学能力评估

OpenAI 测试了模型在以下方向的能力:

  • 化学反应机制;
  • 蛋白质结构;
  • 蛋白质突变效应;
  • 蛋白质相互作用;
  • DNA 序列和系统发育分析;
  • 实验结果解读;
  • 专家级模式识别;
  • 根据外部信息设计后续实验;
  • 选择和调用正确的科学工具。

文章给出的总体结论是,GPT‑Rosalind 在端到端科研任务中取得了明显进步。

这里的“端到端”可以理解为:模型不是只完成一个孤立问题,而是从资料检索开始,经过分析、推理和工具调用,最后给出研究判断或实验计划。

2. BixBench 和 LABBench2

在 BixBench 这一生物信息学和数据分析基准中,文章称 GPT‑Rosalind 在已公布成绩的模型中名列前茅。

在 LABBench2 中,它测试了:

  • 文献检索;
  • 数据库访问;
  • 序列操作;
  • 实验方案设计。

文章称 GPT‑Rosalind 在 11 项任务中的 6 项超过 GPT‑5.4,最明显的提升出现在 CloningQA。这个任务要求模型为分子克隆实验设计 DNA 和酶试剂方案,属于较完整的实验设计任务。

3. Dyno Therapeutics 的 RNA 评估

OpenAI 还与 Dyno Therapeutics 合作,使用未公开的 RNA 序列数据,测试模型的:

  • RNA 序列功能预测;
  • RNA 序列生成。

测试结果与 57 名生物 AI 专家的历史评分进行比较。文章称:

  • 在预测任务中,模型最佳提交超过了约 95% 的人类专家;
  • 在序列生成任务中,模型最佳提交超过了约 84% 的人类专家。

需要注意,这些是特定数据集、特定任务和特定提交中的结果,不能简单理解为模型在所有生命科学任务上都超过 95% 的专家。

五、它可能如何参与真实科研工作

文章描绘的理想流程大致是:

flowchart LR
A[提出科学问题] --> B[检索论文与数据库]
B --> C[整合基因、蛋白质、化学和疾病证据]
C --> D[生成并比较生物学假设]
D --> E[选择工具并执行分析]
E --> F[设计后续实验]
F --> G[分析实验结果]
G --> D

例如,研究人员可以提出一个问题:

某个基因突变是否可能影响某种疾病相关蛋白的功能?

模型可能协助完成:

  1. 检索该基因、蛋白质和疾病的文献;
  2. 查询蛋白质结构;
  3. 比较正常序列和突变序列;
  4. 分析突变可能影响的结构区域;
  5. 查找已有实验或临床证据;
  6. 提出几个可检验的机制假设;
  7. 设计验证实验;
  8. 根据结果决定下一步研究方向。

模型的价值在于连接这些步骤,但最终结论仍然需要科学家审核和实验验证。

相关笔记:AI 制药的整个流程 · AlphaFold 在 AI 制药中的位置