2026 年 9 月 10 日,Insilico Medicine 生成式生物药产品经理 Andrew Aiginin 在 X 上宣布:在该公司运营的 DDD Benchmark 独立评测中,OpenAI 的 GPT-6 Astra 成为抗体可开发性预测表现最好的前沿模型。OpenAI 总裁 Greg Brockman 随后转发了这条消息。Astra 在这个模块拿到 37.98 分,第二名 GPT 5.6 Sol 为 32.64 分,Claude Opus 5 为 13.97 分。

这个结果值得展开的地方不在「又一个第一」,而在第一背后的两件事:抗体可开发性预测到底难在哪,以及同一个团队在小分子逆合成任务上是如何让大模型追平专用模型的。
先说清楚:可开发性是什么,为什么它是新药研发的死穴
抗体药物研发的流程里,找到一个能结合靶点的抗体只算开局。结合亲和力预测正是 AlphaFold 一类结构预测模型的强项,这方面已经卷了很多年。真正的分水岭在后面:这个抗体分子在溶液里会不会聚集成团?在存储和生产环节能不能保持结构稳定?大规模放大生产时批次间的一致性能不能保证?这些属性决定了一个实验室里表现漂亮的分子能不能走完临床前开发,行业内把它们统称为「可开发性」(developability)。
可开发性差是临床前管线折损的主力原因之一。一个分子的结合数据再漂亮,只要聚集倾向压不下去、热稳定性上不来,后续的制剂开发和生产就会持续烧钱,多数项目死在这一段。评价一个抗体的可开发性,行业常规做法是跑一组湿实验:热稳定性测定、聚集倾向分析、自相互作用检测、胶体稳定性、IgG 与 Fc 结构域溶解度、多特异性结合,每一项都是真金白银的实验成本。DDD Benchmark 的抗体可开发性模块正是综合了 6 种抗体实验数据来打分。
这就是为什么一个通用大模型在这个位置拿第一会引人注意:过去这个环节的计算工具是专门的三维图神经网络和物性预测模型,通用 LLM 一般只被当成辅助写代码、读文献的角色。
排行榜本身:分数差距与留白
DDD Benchmark 官网披露的抗体可开发性榜单目前有五个模型:
| 排名 | 模型 | 抗体可开发性得分 |
|---|---|---|
| 1 | GPT 6 Astra (medium) | 37.98 |
| 2 | GPT 5.6 Sol (high) | 32.64 |
| 3 | Grok 4.6 | 23.62 |
| 4 | Gemini 3.1 Pro | 18.94 |
| 5 | Claude Opus 5 | 13.97 |
三个细节值得逐条看。
第一,Astra 用的是 medium 推理档位,第二名 GPT 5.6 Sol 用的是 high 档位。推理档位高低大致对应单位任务花费的算力,用较低档位拿下第一,意味着这个成绩的性价比比表面分差更可观。
第二,Astra 领先第二名 5.34 分,第二名对第五名的分差是 18.67 分。前沿模型之间的差距远小于它们与榜单尾部之间的差距,说明这个任务对当前所有模型都难,Astra 是在难的任务上往前挪了一大步,而不是大家都能做、它做得稍微好一点。
第三,榜单上没有专用模型。DDD Benchmark 的公开总榜目前由 GPT 5.5、Claude Opus 5、GPT 5.6 Sol 等通用前沿模型占据前列,抗体模块公布的前五名也全是通用模型。专用系统在这个模块的表现没有公开数据,所以「通用模型第一次超过专用模型」这个说法目前没有榜单数据直接支撑,能支撑的说法是:一个没有经过抗体数据微调、没挂任何专业生物信息学工具的通用模型,把一批前沿同行甩开了明显身位。AI 学者 Rim Shayakhmetov 的评论指向的也是这一点:前沿大模型在不依赖外部专用工具的情况下,在药物发现基准里直接冲到前面,这很少见。
顺带一提工程侧的一个注脚:Aiginin 提到演示抗体机理的交互式可视化页面是 Astra 在大约 1 小时内搭出来的。这个数字与榜单无关,但它展示了同一批模型在「跑分」之外的实际工作节奏。
另一半拼图:同一团队刚证明了 LLM 能在小分子逆合成上追平专用模型
理解这次登顶的背景,需要看 Insilico Medicine 在 2026 年 8 月 19 日提交到 arXiv 的论文《Training Chemical Plausibility-Aware Large Language Models for Single-Step Retrosynthesis》(arXiv:2608.18940)。这篇论文处理的任务是单步逆合成:给定目标分子,倒推可以用哪些原料和反应把它合成出来。
逆合成评测有个先天缺陷:反应路径是一对多的,同一个目标分子有很多条合理路线,而传统评测拿专利数据库里的既有路线当唯一标准答案,模型给出的合理但不同的路线会被判错。Insilico 的做法是绕开标准答案,构建了 ChemCensor 打分框架,从反应中心映射、官能团兼容性这些底层化学规则出发判断模型给出的反应是否具备化学合理性。
论文的实验结果有一条清晰的曲线。在 Top-1 模式(只允许给一个答案)下,即便是 GPT 5.5、Gemini 3.1 Pro 这样的强模型,化学合理性得分也全面落后于 LocalRetro、MHNreact 这类传统专用模型。转折点是 Top-K 提示范式:让模型一次给出 15 个候选答案,再按化学合理性排序。仅这一项改动就让多数大模型的得分大幅上涨,Gemini 3.1 Pro 在 Top-15 模式下成为最强 LLM 基线。这条结果的实际含义是:大模型里已经装着相当完整的化学知识,差的输出方式会把它压住,差的提问方式也会。

在这个基础上,团队构建了约 4560 万条经核验反应的超大数据集 CREED-CCV-2+USPTO-XL 来训练 C3LM(化学约束一致语言模型),并用 GRPO 强化学习对齐,奖励函数由 6 个组件加权组成,其中两个方向起核心作用:最大化 ChemCensor 化学合理性得分,以及奖励生成训练集里不存在、但依然通过化学合理性校验的全新反应。最终 C3LM 在 URSA-expert-2026 盲测集(100 个机器生成、经人类化学专家确认合成可及性的全新分子,与公开训练数据完全隔离)上超过了全部传统专用模型。
论文还有一层容易被略过的信息:LLM 群体与传统模型探索的反应空间是互补的,LLM 能产出大量传统模型想不到的独特路径,作者据此建议把两类模型组成集成系统使用。
把这篇论文和抗体榜单放在一起看,脉络就出来了。Insilico 先花了大力气证明:在小分子化学这个有明确物理规则可依的领域,通用 LLM 需要定向训练加新的提问方式才能追上专用模型。紧接着,在大分子抗体可开发性这个维度更高、实验数据更稀缺的领域,GPT-6 Astra 未经任何领域微调直接登顶。小分子那套「4560 万数据微调加强化学习」的重武器没有用上,成绩反而更好。这中间的落差正是这次讨论的核心:通用模型预训练阶段吞下的化学与生物知识,可能已经足以在部分科学任务上直接兑现,不再需要每个领域都走一遍专用训练流程。
这个基准想解决的老问题:刷榜与背题
AI 制药评测有个公开的顽疾:数据污染。公开文献和专利里的分子数据早就混进了大模型的预训练语料,模型在很多学术基准上的高分来自背题而不是推理。Insilico 在 DDD Benchmark 的设计里针对这一点做了防御:URSA-expert-2026 的分子是机器新生成再经专家确认的,公开渠道不存在;抗体可开发性模块的数据来自自有管线积累的 6 种实验数据,同样不在公开语料里。
这个设计给结论划定的范围是:分数建立在运营方自建的防污染题库上,归一化的具体算法还没有完整公开,第三方独立复测也还没有出现。榜单持续在动,官网显示最近一次更新是 2026 年 9 月 4 日,总分口径下的模块分数与各模块单独口径并不一致,跨榜单比较时需要看同一口径。读任何「某模型登顶某基准」的消息,这些都是该做的核对,这次也不例外。
能确定的结论有两条。其一,通用大模型在药物研发的核心环节拿出了可量化的成绩,且是在防污染设计的独立基准上;其二,领域微调不再是通用模型进入垂直科学领域的前提条件,至少在抗体可开发性预测这个任务上不是。不确定的是这种能力在多大程度上泛化到真实研发决策,这正是 DDD Benchmark 把「候选药物 essentials」端到端评测做成另一套独立 suite 的原因。
对医药行业的影响会先从工具层开始。可开发性预测是管线里出结果快、试错成本高的环节,通用模型如果能把这个环节的计算初筛做进日常流程,湿实验的优先级排序效率会直接受益。至于「AI 制药的死亡之谷」会不会因此变浅,取决于预测准确率在真实管线里能不能持续兑现,这个问题的答案要靠接下来的第三方复测和更多模型的上榜来给。
参考来源
- Andrew Aiginin 在 X 的原帖:x.com/andrewaiginin/status/2098078245350518884
- Greg Brockman 转发:x.com/gdb/status/2098167375342239957
- DDD Benchmark 官网与抗体可开发性排行榜:dddbench.insilico.com
- 论文:Training Chemical Plausibility-Aware Large Language Models for Single-Step Retrosynthesis,arXiv:2608.18940,2026-08-19 提交
- Insilico Medicine DDD Benchmark 发布公告:insilico.com