
GPT-5.6 Sol 做一次多轮搜索请求要花 $0.03,耗时超过 10 秒。Castform 用一个 4B 参数的开源模型,通过 RL 后训练,在搜索检索准确率上达到了 GPT-5.6 Sol 同等水平,推理成本降低了 100 倍。
这个结果来自 Neon(原独立 Postgres 平台,已被 Databricks 收购)与 Castform 的联合技术报告。核心思路是:大模型的通用能力在特定任务上属于浪费,把搜索检索这一单一任务拆出来,用强化学习后训练一个小模型,就能在垂直场景追平前沿模型。
问题:智能体搜索的成本爆炸
Agent 搜索正在经历一次范式迁移:从一次性查询(one-shot search)进入多跳检索(multi-hop retrieval)。一个典型流程是:模型分解问题、发出搜索、阅读结果、判断是否需要追问、再搜索——每一步循环都消耗一次前沿模型调用。
Neon 的技术博客给了具体数字:用 GPT-5.6 Sol 做一次完整的多轮搜索请求,端到端成本约 $0.03,延迟超过 10 秒。在生产环境中,一个用户会话可能触发几十次这样的循环。如果服务十万用户,每天仅搜索推理成本就在数万美元级别。
4B 参数的开源模型天然比前沿模型便宜两个数量级,但开箱即用的检索能力远不够用——模型不知道该怎么构造查询、怎么判断检索结果是否充分、怎么组合多个信息源。Castform 要解决的就是这个差距。
Castform 的工作原理
Castform 的定位是「让后训练像 prompt engineering 一样简单」。它是一个 RL 后训练平台,开发者不需要懂机器学习基础设施就能把开源模型训练成特定任务专家。
整个流程分三个阶段:
阶段一:从现有数据生成训练集
大多数企业并不缺数据,缺的是把数据变成可用训练集的工程能力。企业内部有文档、产品记录、客服记录、运营数据库——这些数据包含 Agent 需要的知识,但原始形态无法直接用于训练。
Castform 直接指向企业的知识库,自动生成问答对。例如,从一条差旅政策文档中提取出事实(「火车票必须订标准舱,需提前 14 天预订」),再合成出用户实际会问的问题(「用 Navan 订火车票,提前多久预订?选什么舱位?」)。这个步骤把「我们有文档」转化为「我们有带标注的训练数据」。
阶段二:搭建 RL 训练环境
有了训练集,接下来是搭建强化学习的训练循环。Castform 让开发者定义两样东西:工具和奖励函数。
工具定义 Agent 能做什么。在搜索场景下,工具是针对语料库的混合检索(hybrid search):
def run_tool(tool, tool_args):
"""单一工具:Lakebase 混合检索"""
if tool == "search":
query = tool_args["query"]
bm25 = neon.lakebase_text(query, k) # 关键词检索
vector = neon.lakebase_vector(query, k) # 向量检索
return rrf_merge(bm25, vector, k) # RRF 融合排序
def reward(trace, ground_truth):
"""对检索轨迹评分"""
answer = parse_trace(trace)
retrieval = ... # 是否检索到正确来源
citation = ... # 是否引用了正确片段
correctness = ... # 最终答案是否正确
return retrieval + citation + correctness奖励函数包含三个维度:检索准确率(是否找到正确来源)、引用质量(是否引用了正确片段)、答案正确性(最终回答是否准确)。三个维度加权和作为反馈信号,引导模型逐步优化搜索策略。
阶段三:RL 训练与可观测性
训练过程中,模型反复尝试任务、获得奖励分数、调整策略。Castform 提供完整的可观测性面板——不仅能看到奖励曲线上升,还能深入单个任务查看模型的具体行为,帮助调试工具故障或奖励作弊(reward hacking)。
这种调试能力至关重要。RL 训练最常见的失败模式是奖励作弊——模型找到了刷分捷径但没有真正学会任务。例如,如果奖励函数只考核检索命中率而不考核答案正确性,模型可能学会反复发同一个查询来提高表面命中率。逐条 trace 检查是发现这类问题的唯一手段。
为什么选 Neon 作为基础设施
训练搜索 Agent 需要一个能承受高并发检索请求的数据库。Neon(现 Databricks Lakebase Postgres)的架构恰好匹配:
弹性伸缩吸收突发负载:训练过程中,数千个并行 rollout 各自发起几十次搜索调用,形成极高的突发负载。Neon 的动态计算伸缩可以自动吸收这些峰值,不需要 Castform 按峰值容量全天候预配资源。空闲时计算资源缩容到零,训练时自动扩容。
数据库分支提供隔离:训练有状态 Agent 需要可创建、可重置的隔离环境,防止一个 rollout 的操作影响另一个或触碰生产数据。Neon 的分支功能可以为每个 rollout 提供独立的数据库状态快照。配合时间旅行查询(time-travel query),还能重建和检查 Agent 遇到的中间状态。
BM25 + 向量混合检索:Neon 的 Lakebase Search 扩展同时提供 lakebase_text(BM25 关键词检索)和 lakebase_vector(向量相似度检索)。训练时和推理时使用同一套检索接口,确保模型学到的搜索策略在生产环境中直接可用。
成本结构对比
这个方案的成本优势可以从几个层面理解:
| 维度 | GPT-5.6 Sol(API) | 4B 开源模型(RL 后训练) |
|---|---|---|
| 单次多轮搜索成本 | ~$0.03 | ~$0.0003 |
| 端到端延迟 | >10s | 更低(本地推理) |
| 搜索质量 | 前沿水平 | 前沿水平(同等) |
| 前期投入 | 零 | RL 训练计算 + 数据准备 |
| 数据控制 | 依赖 API 提供商 | 完全自主 |
100 倍的成本差距根源在于任务聚焦。4B 模型的参数量决定了它的通用推理能力远不如 GPT-5.6 Sol,但在搜索检索这一单一任务上,经过针对性 RL 后训练后,模型只需学会三件事:构造好的查询、判断检索结果是否充分、组合信息形成答案。这个任务空间足够窄,小模型可以做到足够好。
技术启示:后训练作为成本优化路径
Castform + Neon 的结果指向一个更广泛的技术趋势:当 Agent 应用进入生产环境,成本优化应该靠垂直任务的后训练,而非等待前沿模型降价。
这条路径的前提条件正在成熟:
开源基础模型质量提升:4B 级别的模型(如 Qwen、Llama 系列的小尺寸版本)已经具备足够的语言理解能力,可以作为后训练的起点。
RL 后训练工具链完善:Castform 这类平台把 RL 训练的门槛从「需要 GPU 集群和 ML 博士」降到「需要数据和一个搜索语料库」。
向量数据库基础设施普及:Neon(Lakebase Postgres)、pgvector 等提供低成本的混合检索能力,训练环境和生产环境共享同一套检索接口。
企业数据就绪:大部分企业的知识库已经数字化,数据本身不缺,缺的是把数据变成训练集的工具。
对于正在构建 Agent 搜索功能的团队,Castform 的方案提供了一个可直接评估的基准:如果你的搜索任务可以被明确定义(有清晰的对错判断标准),那么用 $0.0003/次的小模型替代 $0.03/次的大模型,前期投入的训练计算成本可以在百万级请求量下快速回收。
局限与边界
这个方案不是万能的。几个需要注意的前提:
任务必须有可定义的奖励函数。搜索检索的任务天然适合 RL——检索是否命中、引用是否正确、答案是否准确,都是可量化的。但开放域对话、创意写作等任务没有清晰的奖励信号,不适合这条路径。
需要足够的语料库。Castform 的训练数据生成依赖企业内部知识库。如果语料库太小或质量太差,合成问答的数据量不足以支撑有效的 RL 训练。
4B 模型的能力上限。文章只验证了搜索检索场景。如果 Agent 需要做复杂的多步推理(如数学证明、代码生成),4B 模型的天花板仍然很低。Castform 的方案本质是「用专精换成本」,不是通用能力的替代。
参考来源:How Castform + Neon Beats Frontier Models on Price and Efficiency(Neon 官方博客,2026-08-05),作者 Pranav Aurora、Ying Hang Seah、Angel Pan。