OmniRoute:日增 1300+ Star 的开源 AI 网关,一个端点接通 250 个模型提供商

AI 编码工具的碎片化问题正在加剧。Claude Code 订阅限额耗尽后得切到 Codex,Codex 也不够用时还得翻 DeepSeek——每换一个提供商就要改配置、换 API Key、重启工具。开发者每天在十几个 AI 服务的仪表盘之间反复横跳,还要提防月底账单跳闸。

OmniRoute 试图用一个本地代理终结这个局面。这个 MIT 协议的开源项目(GitHub 21k+ Star,日增 1343 Star)是一个智能路由网关:你在本地跑一个 http://localhost:20128/v1 端点,所有 AI 编码工具(Claude Code、Codex、Cursor、Cline、Copilot 等 24+ 款)都指向它,OmniRoute 在背后自动管理提供商选择、配额追踪、Token 压缩和故障转移。

架构:四层自动降级路由

OmniRoute 的核心机制是 Combo——一条由多个模型按策略串联而成的自动路由链。当某个提供商配额耗尽或请求失败时,Combo 会在毫秒级内自动切换到下一个,实现零停机。

路由按四个优先级分层:

优先级类型示例触发条件
Tier 1订阅配额Claude Code、Codex Pro首选消耗订阅额度
Tier 2付费 APIDeepSeek、Groq、xAI订阅额度用尽
Tier 3低成本 APIGLM $0.5/1M、MiniMax $0.2预算超限
Tier 4免费提供商Kiro、Qoder、Pollinations永久兜底

这种分层不是简单的顺序尝试。OmniRoute 提供 18 种路由策略,包括加权随机、成本优化、延迟优先、配额剩余量感知、上下文接力(跨模型传递对话上下文)等。最常用的 auto 模式会根据 12 个因子实时打分——健康状态、配额、成本、延迟、成功率等——自动选择最优路径。

OmniRoute GitHub 仓库截图,显示项目概览和关键数据

Token 压缩:10 引擎管线,最高节省 95%

OmniRoute 最有技术深度的模块是它的 Token 压缩管线。编码工具的 Token 消耗中,git diff、测试输出、日志等工具返回的内容占了大量开销,但这些内容往往高度重复或结构冗余。

压缩管线由 10 个可组合引擎按顺序执行:

引擎作用典型节省率
Session-Dedup跨轮次内容去重(内容寻址)10-20%
CCR大块内容归档,按需检索15-30%
RTK智能工具输出过滤、去重、截断(命令感知)60-90%
Headroom表格/JSON 数组的无损压缩~30%
Relevance基于用户查询的句子相关性打分10-20%
Caveman基于规则的散文压缩65-75%
LLMLingua-2MobileBERT ONNX 语义剪枝30-50%

引擎可以按 Combo 独立配置。默认的堆叠模式(RTK → Caveman)在工具密集型会话中实现 78-95% 的 Token 节省,平均约 89%。代码块、URL 和 JSON 结构化数据在压缩过程中会被保留引擎原样保护。

一个实际例子:一段 69 Token 的 React 重渲染解释被压缩到 19 Token——语义完全保留,精度无损。

免费额度聚合:每月约 16 亿 Token

OmniRoute 的另一个核心卖点是免费额度聚合。它将 40+ 个提供商池的免费额度整合为一个可追踪的数字,在仪表盘上实时显示当前月度的已用/剩余量。

  • 稳态免费额度:每月约 16 亿 Token
  • 首月(含注册奖励):最高约 21 亿 Token
  • 11 个永久免费的提供商(无需信用卡)
  • 计数方式按池去重——共享底层的提供商只算一次,避免虚高

这意味着一个开发者如果只使用免费层,每月有大约 16 亿 Token 的额度可供消耗。对于日常编码场景,这已经足够覆盖相当大的使用量。

免费层提供商一览

提供商免费模型条件
Kiro AIClaude 系列~50 credits/月
Qoder AIKimi-K2、DeepSeek-R1无限免费
PollinationsGPT-5、Claude、Llama 4无需 Key
Cloudflare AI50+ 模型10K neurons/天
NVIDIA NIM129 模型~40 RPM 免费
CerebrasQwen3 235B100 万 Token/天
AgentRouterGPT-5、Claude、Gemini$100 免费额度

94 个 MCP 工具和 A2A 协议支持

OmniRoute 本身也是一个 MCP(Model Context Protocol)服务器和 A2A(Agent-to-Agent)服务器。通过 MCP,AI Agent 可以自主控制 OmniRoute 的路由、提供商管理、压缩策略等。这意味着 Claude Code 或其他支持 MCP 的工具不仅通过 OmniRoute 路由请求,还能让 Agent 自己调优路由策略。

MCP 服务器暴露 94 个工具、3 种传输方式(stdio、HTTP SSE、SSE)和 30 个权限范围。A2A 支持则允许 AI Agent 之间通过 JSON-RPC 2.0 协议交互。

部署:从 npm 到 Termux

OmniRoute 支持多种部署方式:

  • npm 全局安装npm install -g omniroute && omniroute
  • Dockerdocker run diegosouzapw/omniroute(支持 AMD64 和 ARM64)
  • Desktop:Electron 原生窗口(Windows/macOS/Linux)
  • Termux:甚至可以在 Android 手机上运行
  • PWA:从浏览器"添加到主屏幕"
  • Arch Linux AURyay -S omniroute-bin

所有部署方式都是本地运行,API Key 用 AES-256-GCM 加密存储,默认零遥测。

OmniRoute 仪表盘截图,显示提供商管理界面,左侧导航栏包含代理、压缩、工具等模块

与同类工具的对比

特性OmniRouteLiteLLMOpenRouter
提供商数量25020-100100+
免费提供商90+(11 永久免费)1-5少量
路由策略18 种1-3 种基本轮询
Token 压缩RTK + Caveman(15-95%)无/20-40%
MCP 服务器94 工具
本地优先是(零遥测)否(云端服务)
许可证MITMIT商业

安全和弹性设计

OmniRoute 在弹性方面有三层独立的保护机制:熔断器(provider 级别,自动探测和恢复)、连接冷却(单 key 级别,跳过被限速的 key)、模型锁定(provider+model 级别,只隔离配额耗尽的模型而不是整个连接)。

此外还有 TLS 指纹伪装(JA3/JA4)、注入防护(prompt injection guard 跨所有路由)、以及可选的 MITM 解密模式(TPROXY)用于捕获不支持代理环境变量的 CLI 流量。

安装和上手

bash
# 安装
npm install -g omniroute

# 启动(仪表盘 + API 同时运行在 20128 端口)
omniroute

# 配置编码工具指向 OmniRoute
# Base URL: http://localhost:20128/v1
# Model: auto(零配置智能路由)

启动后,在仪表盘中连接一个免费提供商(如 Kiro AI,免费 Claude),然后在编码工具中将 API base 指向 http://localhost:20128/v1,模型设为 auto 即可。OmniRoute 会自动完成路由选择和故障转移。

适合谁用

OmniRoute 适合以下场景:

  1. 多工具开发者:同时使用 Claude Code、Cursor、Cline 等多个编码工具,希望统一管理 API 配置
  2. 成本敏感用户:想最大化利用免费额度,避免为多个付费订阅重复付费
  3. 高频使用者:经常触发配额限制或速率限制,需要自动降级和故障转移
  4. 团队共享:通过 Quota-Share 功能将一个订阅的配额按权重分配给多个开发者

对于只用一个 AI 编码工具且不关心成本的开发者,OmniRoute 带来的增益有限。但对于管理多个 AI 服务 API Key 和配额的开发者来说,它确实解决了一个真实存在的痛点。

项目地址:github.com/diegosouzapw/OmniRoute

推荐阅读