2025 年 11 月 24 日,美国总统签署行政令启动 Genesis Mission(创世纪计划),目标是在十年内将美国科学和工程的产出与影响力翻一番。八个月后,美国能源部(DOE)与开源模型公司 Arcee AI 宣布了该计划下的第一个具体 AI 模型项目:Genesis-Science-1(GS1),一个专为科学研究设计的开源权重 AI 模型。

GS1 的定位与当前主流大语言模型有明确区分。它面向科学计算工作流:处理老旧的 Fortran 代码库、修复中断的模拟任务、梳理冲突的运行日志,在证据不完整的情况下做出一系列技术判断。模型本身的推理能力与一般大语言模型重叠,但核心设计目标围绕科学工作流展开。模型将搭配一套受管执行系统(governed execution system),在沙箱化环境中运行经批准的工具,维护任务状态、检查点进度,记录每次运行关联的提示词、工具调用、代码变更、数据集和中间产物。
规模与资金
Genesis Mission 已经汇聚了相当规模的资源。白宫在 2026 年 7 月 22 日宣布联邦总承诺超过 50 亿美元,超过 15 个联邦机构参与。能源部通过 Genesis Mission Consortium 获得了超过 8 亿美元的合作伙伴承诺,包括计算资源、模型访问、云基础设施和直接资金。
能源部的第一轮 RFA(申请请求)收到了超过 5000 份申请,最终选出 278 个项目,覆盖 340 多家机构。其中 168 个由大学主导,87 个由 DOE 国家实验室和 NNSA 设施主导,19 个由企业主导。这些项目将获得 2.5 亿美元资金,并使用 Genesis Mission Platform 的 AI 代理框架、先进模型和 HPC 资源。
参与的机构包括全部 17 个 DOE 国家实验室、5 个 NNSA 工厂和站点,以及 41 个行业、非营利和慈善组织。洛斯阿拉莫斯国家实验室(LANL)获得 7 个项目,费米实验室(Fermilab)获得一系列粒子加速器和 AI 项目。
Trinity 架构基础
GS1 建立在 Arcee 的 Trinity 模型家族之上。Arcee 发布的 Trinity Large 是一个 4000 亿参数的稀疏混合专家(MoE)模型,每个 token 激活 130 亿参数。架构参数如下:
| 参数 | Trinity Large | GS1(计划) |
|---|---|---|
| 架构 | 稀疏 MoE | 基于 Trinity 下一代 |
| 总参数量 | 400B | 万亿级(T-class) |
| 每 token 激活参数 | 13B | 待公布 |
| 专家数量 | 256 | 待公布 |
| 激活专家数 | 4 | 待公布 |
| 路由比例 | 1.56% | 待公布 |
| 注意力机制 | Grouped Query Attention (GQA) | — |
| 训练序列长度 | 256K(推理支持 512K) | — |
| 训练 token 数 | 17 万亿 | — |
| 许可证 | Apache 2.0 | 开源权重 |
Trinity Large 的稀疏度在同类模型中属于较高水平。作为对比,DeepSeek-V3 的路由比例是 8-of-256(3.13%),MiniMax-M2 同样是 8-of-256,Qwen3-235B-A22B 是 8-of-128(6.25%)。只有 Llama 4 Maverick 的 1-of-128(0.78%)比 Trinity Large 更稀疏。
GS1 将是万亿参数级别的模型,基于 Trinity 的下一代版本。Arcee 表示将负责获取算力、策划训练数据、完成预训练和后训练、构建受管执行环境、从经批准的 DOE 材料中创建训练工作台,并负责评估和发布。
科学计算训练工作台
GS1 的训练方式与通用模型有本质区别。传统的预训练数据集是清洗过的文本语料,而 GS1 的训练环境是"科学工作台"(scientific workbenches)——完整重建真实研究工作条件的训练环境。
每个工作台包含重建一个研究工作流所需的全部要素:代码、数据、工具、文档、日志、部分结果和失败状态。涉及的编程语言和技术栈包括 Python、Fortran、C/C++、MPI 和 OpenMP 并行计算框架、CUDA 和 HIP GPU 编程、命令行工具、Jupyter notebook、模拟软件包和计算调度器。
初始覆盖的研究方向包括:
- HPC 代码现代化:将遗留科学计算代码迁移到现代架构
- 实验数据分析:处理来自用户设施的实验和观测数据
- 模拟活动管理:处理超算模拟运行日志和输出
- 材料科学:材料和化学集合的分析
- 能源系统:能源相关的研究工作流
这些工作台的数据来源是 DOE 国家实验室的科学家提供的经审查材料:用户设施的实验和观测数据、超算活动的模拟输出和运行日志、材料和化学集合、研究软件,以及科学家用于开展和审查工作的工具。所有材料在进入项目前必须完成能源部的发布审查流程。
Arcee 特别强调,最有价值的训练材料往往是"混乱的"——充满部分运行、编译器错误、异常接口和失败模式,这些正是精心打磨的 benchmark 会遗漏、但严肃科学模型必须学会处理的内容。
受管执行系统
GS1 的运行架构分为模型层和执行系统层。模型本身负责推理和代码生成,执行系统负责管理和约束。
执行系统的核心功能包括:
- 沙箱化运行:批准的工具在分阶段隔离环境中运行
- 任务状态管理:维护当前进度、检查点和恢复机制
- 操作审计:记录每次运行的完整链路,包括提示词、工具调用、代码变更、数据集、中间产物和结论
- 人工审核保留:涉及安全、安全、出版和资源使用的决策由人类批准
模型不会获得对 DOE 系统的开放访问权限。一个成功的运行需要完成从规划到报告的完整工作流,在证据变化时修改方法,从工具故障中恢复,并留下另一个研究者可以检查的记录。科学专家将判断结果是否可靠,以及支持证据是否足够完整以供复现。
开源权重的制度逻辑
能源部选择开源权重模型有明确的制度考量。国家实验室可能需要在自己的基础设施内运行模型、在数年内保留特定版本、适配到专门领域,以及在不永久依赖外部 API 的情况下运行。
开源权重允许机构直接持有和操作模型:保留已知版本、在自己的环境中评估、适配到自己的领域,并追溯一个答案背后的完整工作链。Arcee CEO Mark McQuade 在公告中说:"一个国家如果在 AI 领域所领先的一切都是封闭的,就无法领导 AI。"
Arcee 在博客中也直接指出了当前开源模型的地缘分布问题。他们对中国开源模型实验室表达了认可——DeepSeek、Qwen、Kimi、MiniMax 和 GLM 构建了可靠的开源模型,在大部分领域走向封闭时坚持分享权重。但这些工作也暴露了一个事实:有能力制作开源模型的美国公司很少。对于处理敏感工作的机构,模型能力只是一部分,还涉及谁训练了模型、在哪里训练的、以什么许可发布、以及制作该模型的公司受哪个国家的法律管辖。
GS1 的发布将包含模型权重、技术报告和公开的工作台与演示材料。贡献门户(genesisopenmodels.anl.gov)邀请大学、国家实验室、公司、科学非营利组织和研究机构贡献数据、研究环境、评估方法和技术专业知识。
Genesis Mission 的进展时间线
| 时间 | 事件 |
|---|---|
| 2025-11-24 | 总统签署行政令启动 Genesis Mission |
| 2026-02-06 | 成立 Genesis Mission Consortium |
| 2026-03-17 | DOE 宣布 2.94 亿美元 RFA |
| 2026-04-28 | 第一阶段申请截止 |
| 2026-06-04 | 美日宣布 10 亿美元合作 |
| 2026-07-22 | 首届 Genesis Mission Summit,宣布 278 个项目、8 亿美元合作伙伴承诺 |
| 2026-07-22 | 宣布 GS1 模型项目,DOE + Arcee AI |
| 2026-08-06 | GS1 第一轮贡献窗口截止 |
| 2026 年内 | GS1 发布权重、技术报告和演示 |
行业意义
GS1 代表了一种正在增长的 AI 发展方向:面向特定行业垂直领域的开源权重模型,由政府机构提供数据和评估标准,由专业 AI 公司负责技术实现。这种模式与消费级通用模型的开发路径不同——训练目标不是 benchmark 分数或用户体验评分,而是"研究工作流能否被另一个科学家复现"。
对于需要长期稳定运行、在自有基础设施上部署、适配到专业领域的研究机构,GS1 的受管执行系统设计提供了一种可审计的 AI 工作模式。这种模式在其他受监管行业(金融、医疗、航空)中同样有应用潜力。
Arcee 同时也在企业市场运营其 Trinity 模型家族。Trinity Large Thinking 已在 OpenRouter 上线,Apache 2.0 许可。GS1 的技术积累将反哺 Arcee 的商业产品线,这种公私合作模式为美国开源模型生态提供了一个新的参考案例。