https://openai.com/zh-Hans-CN/index/introducing-gpt-rosalind/
一、它主要想解决什么问题
文章以新药研发为例:一种新药从发现靶点到最终上市,平均需要 10 至 15 年。早期研究中的判断会产生“复利效应”:
- 靶点选得更准确,后续失败率可能降低;
- 生物学假设更严谨,实验资源浪费会减少;
- 实验设计质量更高,可以更早发现有效方向;
- 对文献和数据的综合更全面,有助于找到隐藏的关联。
因此,GPT‑Rosalind 的核心价值并不是单纯“写得更快”,而是希望帮助研究人员:
- 更快获得可靠证据;
- 探索更多潜在研究方向;
- 更早排除错误假设;
- 设计更有价值的后续实验;
- 缩短研发早期阶段的周期。
二、它与普通聊天模型有什么不同
文章强调,这个模型是为“科学工作流”打造的,尤其重视两种能力。
1. 更强的生物医学推理
模型需要理解的不只是术语,而是多个层次之间的关系,例如:
- 某个基因发生突变后可能影响什么蛋白质功能;
- 某种蛋白质结构变化可能怎样改变相互作用;
- 某条信号通路与某种疾病之间有什么证据;
- 某个化学反应为什么能够发生;
- 某段 DNA 或 RNA 序列可能具有什么功能。
2. 更强的工具调用能力
生命科学研究不能只依靠模型记忆。研究人员往往需要实时访问:
- 论文和文献数据库;
- 基因组和多组学数据库;
- 蛋白质结构数据库;
- 序列搜索工具;
- 化学反应和分子分析工具;
- 临床证据资源;
- 公开实验数据集。
GPT‑Rosalind 的定位是能够判断“需要查什么、调用哪个工具、怎样组合多个工具”,然后把结果综合成研究结论或实验建议。
三、研究插件是什么
OpenAI 同时发布了一个免费的 生命科学研究插件,专门为 Codex 设计,代码托管在 GitHub 上。
这个插件相当于一个科研工作流工具包,包含面向以下领域的模块:
- 人类遗传学;
- 功能基因组学;
- 蛋白质结构;
- 生物化学;
- 临床证据;
- 公开研究检索。
插件可以连接 50 多种公开的多组学数据库、文献资源和生物学工具。它尤其适合处理一些重复但复杂的任务,例如:
- 查询蛋白质结构;
- 搜索相似序列;
- 汇总某个主题的文献;
- 查找公开数据集;
- 对基因、蛋白质或疾病相关证据进行整理。
文章把插件称为“编排层”,意思是:它不一定自己完成所有科学计算,而是帮助模型把不同数据库和工具组织起来,形成一条完整的工作流程。
符合条件的 Enterprise 客户可以把插件与 GPT‑Rosalind 结合使用;普通用户则可以在主干模型中使用这个插件包。
四、文章公布了哪些评估结果
文章介绍了三类评估。
1. 内部科学能力评估
OpenAI 测试了模型在以下方向的能力:
- 化学反应机制;
- 蛋白质结构;
- 蛋白质突变效应;
- 蛋白质相互作用;
- DNA 序列和系统发育分析;
- 实验结果解读;
- 专家级模式识别;
- 根据外部信息设计后续实验;
- 选择和调用正确的科学工具。
文章给出的总体结论是,GPT‑Rosalind 在端到端科研任务中取得了明显进步。
这里的“端到端”可以理解为:模型不是只完成一个孤立问题,而是从资料检索开始,经过分析、推理和工具调用,最后给出研究判断或实验计划。
2. BixBench 和 LABBench2
在 BixBench 这一生物信息学和数据分析基准中,文章称 GPT‑Rosalind 在已公布成绩的模型中名列前茅。
在 LABBench2 中,它测试了:
- 文献检索;
- 数据库访问;
- 序列操作;
- 实验方案设计。
文章称 GPT‑Rosalind 在 11 项任务中的 6 项超过 GPT‑5.4,最明显的提升出现在 CloningQA。这个任务要求模型为分子克隆实验设计 DNA 和酶试剂方案,属于较完整的实验设计任务。
3. Dyno Therapeutics 的 RNA 评估
OpenAI 还与 Dyno Therapeutics 合作,使用未公开的 RNA 序列数据,测试模型的:
- RNA 序列功能预测;
- RNA 序列生成。
测试结果与 57 名生物 AI 专家的历史评分进行比较。文章称:
- 在预测任务中,模型最佳提交超过了约 95% 的人类专家;
- 在序列生成任务中,模型最佳提交超过了约 84% 的人类专家。
需要注意,这些是特定数据集、特定任务和特定提交中的结果,不能简单理解为模型在所有生命科学任务上都超过 95% 的专家。
五、它可能如何参与真实科研工作
文章描绘的理想流程大致是:
flowchart LR A[提出科学问题] --> B[检索论文与数据库] B --> C[整合基因、蛋白质、化学和疾病证据] C --> D[生成并比较生物学假设] D --> E[选择工具并执行分析] E --> F[设计后续实验] F --> G[分析实验结果] G --> D
例如,研究人员可以提出一个问题:
某个基因突变是否可能影响某种疾病相关蛋白的功能?
模型可能协助完成:
- 检索该基因、蛋白质和疾病的文献;
- 查询蛋白质结构;
- 比较正常序列和突变序列;
- 分析突变可能影响的结构区域;
- 查找已有实验或临床证据;
- 提出几个可检验的机制假设;
- 设计验证实验;
- 根据结果决定下一步研究方向。
模型的价值在于连接这些步骤,但最终结论仍然需要科学家审核和实验验证。
相关笔记:AI 制药的整个流程 · AlphaFold 在 AI 制药中的位置