OmniRoute:日增 1300+ Star 的开源 AI 网关,一个端点接通 250 个模型提供商
AI 编码工具的碎片化问题正在加剧。Claude Code 订阅限额耗尽后得切到 Codex,Codex 也不够用时还得翻 DeepSeek——每换一个提供商就要改配置、换 API Key、重启工具。开发者每天在十几个 AI 服务的仪表盘之间反复横跳,还要提防月底账单跳闸。
OmniRoute 试图用一个本地代理终结这个局面。这个 MIT 协议的开源项目(GitHub 21k+ Star,日增 1343 Star)是一个智能路由网关:你在本地跑一个 http://localhost:20128/v1 端点,所有 AI 编码工具(Claude Code、Codex、Cursor、Cline、Copilot 等 24+ 款)都指向它,OmniRoute 在背后自动管理提供商选择、配额追踪、Token 压缩和故障转移。
架构:四层自动降级路由
OmniRoute 的核心机制是 Combo——一条由多个模型按策略串联而成的自动路由链。当某个提供商配额耗尽或请求失败时,Combo 会在毫秒级内自动切换到下一个,实现零停机。
路由按四个优先级分层:
| 优先级 | 类型 | 示例 | 触发条件 |
|---|---|---|---|
| Tier 1 | 订阅配额 | Claude Code、Codex Pro | 首选消耗订阅额度 |
| Tier 2 | 付费 API | DeepSeek、Groq、xAI | 订阅额度用尽 |
| Tier 3 | 低成本 API | GLM $0.5/1M、MiniMax $0.2 | 预算超限 |
| Tier 4 | 免费提供商 | Kiro、Qoder、Pollinations | 永久兜底 |
这种分层不是简单的顺序尝试。OmniRoute 提供 18 种路由策略,包括加权随机、成本优化、延迟优先、配额剩余量感知、上下文接力(跨模型传递对话上下文)等。最常用的 auto 模式会根据 12 个因子实时打分——健康状态、配额、成本、延迟、成功率等——自动选择最优路径。

Token 压缩:10 引擎管线,最高节省 95%
OmniRoute 最有技术深度的模块是它的 Token 压缩管线。编码工具的 Token 消耗中,git diff、测试输出、日志等工具返回的内容占了大量开销,但这些内容往往高度重复或结构冗余。
压缩管线由 10 个可组合引擎按顺序执行:
| 引擎 | 作用 | 典型节省率 |
|---|---|---|
| Session-Dedup | 跨轮次内容去重(内容寻址) | 10-20% |
| CCR | 大块内容归档,按需检索 | 15-30% |
| RTK | 智能工具输出过滤、去重、截断(命令感知) | 60-90% |
| Headroom | 表格/JSON 数组的无损压缩 | ~30% |
| Relevance | 基于用户查询的句子相关性打分 | 10-20% |
| Caveman | 基于规则的散文压缩 | 65-75% |
| LLMLingua-2 | MobileBERT ONNX 语义剪枝 | 30-50% |
引擎可以按 Combo 独立配置。默认的堆叠模式(RTK → Caveman)在工具密集型会话中实现 78-95% 的 Token 节省,平均约 89%。代码块、URL 和 JSON 结构化数据在压缩过程中会被保留引擎原样保护。
一个实际例子:一段 69 Token 的 React 重渲染解释被压缩到 19 Token——语义完全保留,精度无损。
免费额度聚合:每月约 16 亿 Token
OmniRoute 的另一个核心卖点是免费额度聚合。它将 40+ 个提供商池的免费额度整合为一个可追踪的数字,在仪表盘上实时显示当前月度的已用/剩余量。
- 稳态免费额度:每月约 16 亿 Token
- 首月(含注册奖励):最高约 21 亿 Token
- 11 个永久免费的提供商(无需信用卡)
- 计数方式按池去重——共享底层的提供商只算一次,避免虚高
这意味着一个开发者如果只使用免费层,每月有大约 16 亿 Token 的额度可供消耗。对于日常编码场景,这已经足够覆盖相当大的使用量。
免费层提供商一览
| 提供商 | 免费模型 | 条件 |
|---|---|---|
| Kiro AI | Claude 系列 | ~50 credits/月 |
| Qoder AI | Kimi-K2、DeepSeek-R1 | 无限免费 |
| Pollinations | GPT-5、Claude、Llama 4 | 无需 Key |
| Cloudflare AI | 50+ 模型 | 10K neurons/天 |
| NVIDIA NIM | 129 模型 | ~40 RPM 免费 |
| Cerebras | Qwen3 235B | 100 万 Token/天 |
| AgentRouter | GPT-5、Claude、Gemini | $100 免费额度 |
94 个 MCP 工具和 A2A 协议支持
OmniRoute 本身也是一个 MCP(Model Context Protocol)服务器和 A2A(Agent-to-Agent)服务器。通过 MCP,AI Agent 可以自主控制 OmniRoute 的路由、提供商管理、压缩策略等。这意味着 Claude Code 或其他支持 MCP 的工具不仅通过 OmniRoute 路由请求,还能让 Agent 自己调优路由策略。
MCP 服务器暴露 94 个工具、3 种传输方式(stdio、HTTP SSE、SSE)和 30 个权限范围。A2A 支持则允许 AI Agent 之间通过 JSON-RPC 2.0 协议交互。
部署:从 npm 到 Termux
OmniRoute 支持多种部署方式:
- npm 全局安装:
npm install -g omniroute && omniroute - Docker:
docker run diegosouzapw/omniroute(支持 AMD64 和 ARM64) - Desktop:Electron 原生窗口(Windows/macOS/Linux)
- Termux:甚至可以在 Android 手机上运行
- PWA:从浏览器"添加到主屏幕"
- Arch Linux AUR:
yay -S omniroute-bin
所有部署方式都是本地运行,API Key 用 AES-256-GCM 加密存储,默认零遥测。

与同类工具的对比
| 特性 | OmniRoute | LiteLLM | OpenRouter |
|---|---|---|---|
| 提供商数量 | 250 | 20-100 | 100+ |
| 免费提供商 | 90+(11 永久免费) | 1-5 | 少量 |
| 路由策略 | 18 种 | 1-3 种 | 基本轮询 |
| Token 压缩 | RTK + Caveman(15-95%) | 无/20-40% | 无 |
| MCP 服务器 | 94 工具 | 无 | 无 |
| 本地优先 | 是(零遥测) | 是 | 否(云端服务) |
| 许可证 | MIT | MIT | 商业 |
安全和弹性设计
OmniRoute 在弹性方面有三层独立的保护机制:熔断器(provider 级别,自动探测和恢复)、连接冷却(单 key 级别,跳过被限速的 key)、模型锁定(provider+model 级别,只隔离配额耗尽的模型而不是整个连接)。
此外还有 TLS 指纹伪装(JA3/JA4)、注入防护(prompt injection guard 跨所有路由)、以及可选的 MITM 解密模式(TPROXY)用于捕获不支持代理环境变量的 CLI 流量。
安装和上手
# 安装
npm install -g omniroute
# 启动(仪表盘 + API 同时运行在 20128 端口)
omniroute
# 配置编码工具指向 OmniRoute
# Base URL: http://localhost:20128/v1
# Model: auto(零配置智能路由)启动后,在仪表盘中连接一个免费提供商(如 Kiro AI,免费 Claude),然后在编码工具中将 API base 指向 http://localhost:20128/v1,模型设为 auto 即可。OmniRoute 会自动完成路由选择和故障转移。
适合谁用
OmniRoute 适合以下场景:
- 多工具开发者:同时使用 Claude Code、Cursor、Cline 等多个编码工具,希望统一管理 API 配置
- 成本敏感用户:想最大化利用免费额度,避免为多个付费订阅重复付费
- 高频使用者:经常触发配额限制或速率限制,需要自动降级和故障转移
- 团队共享:通过 Quota-Share 功能将一个订阅的配额按权重分配给多个开发者
对于只用一个 AI 编码工具且不关心成本的开发者,OmniRoute 带来的增益有限。但对于管理多个 AI 服务 API Key 和配额的开发者来说,它确实解决了一个真实存在的痛点。
- 华为开源 920 亿参数 openPangu-2.0-Flash 模型6/30/2026
- 美国政府要求 OpenAI 分阶段发布 GPT-5.66/26/2026
- Anthropic 获美国政府批准,恢复 Mythos 5 模型对关键基础设施组织的部署6/27/2026
- xAI 开源 Grok Build:Rust 编写的终端编程代理7/15/2026
- 腾讯玄武阿图因AI在CyberGym测试中超越Mythos7/3/2026
- OpenSEO:5800 Star 的开源 SEO 工具,10 美元/月挑战 Semrush 与 Ahrefs7/20/2026
- Gemini Omni Flash 登顶 Video Arena 盲测榜,领先第二名 101 分7/3/2026
- DeepSeek 联合北大开源 DSpark:半自回归推测解码,推理速度提升 57% 至 85%6/27/2026
- Cursor 研究:越强的 AI 模型越会"作弊"应对编程基准测试6/26/2026
- Claude Code 被指通过 system prompt 隐蔽传递代理与时区信息6/30/2026
- 华为天才少年的开源AI Agent全书:6700星、十章、可跑实验代码7/20/2026
- AI 代码审查的 token 困境:code-review-graph 如何用代码图谱砍掉 98% 的上下文7/20/2026
- Voicebox:43K Stars 的开源 AI 语音工作室,7 引擎 TTS + MCP Agent 集成7/19/2026
- 苹果首款触屏 MacBook 确认搭载 M5 Pro/Max,M7 版计划 2027 年跟进6/27/2026
- Hallmark:一份写给AI编码助手的反AI味设计手册7/17/2026
- B站在WAIC展出开源AI猫娘:能看懂屏幕、主动搭话的桌面伙伴7/18/2026
- Kimi K3 首登 DeepSWE v1.1:开源权重模型挤进前三7/18/2026
- 27B 模型塞进手机:PrismML Bonsai 27B 把权重压到 1-bit7/18/2026
- AI 连破三大数学猜想:Jacobian 猜想 87 年反例与形式化验证的新时代7/21/2026
- Qwen3.8 发布:2.4T 参数、原生多模态、开放权重承诺7/19/2026
- GPT-5.6用一段十页提示词,关闭凸优化30年的复杂性缺口7/19/2026
- Moonshine Micro:80美分芯片跑完整语音流水线,500KB内存装下VAD+STT+TTS7/18/2026
- LingBot-Map:用前馈3D基础模型做流式重建,20FPS跑完一万帧7/18/2026
- Kimi K3:2.8万亿参数开源模型,前端编程Arena登顶7/17/2026
- Linux登顶2026 CVE漏洞榜:内核维护者称这是好事7/4/2026
- 2026 年 AI 都学会了记忆,但你的记忆不属于你7/19/2026
- 马斯克:AI 和机器人将让工作变为可选,实现全民高收入7/3/2026
- transcribe.cpp:一个 ggml 运行时跑完 16 个语音转文字模型家族7/19/2026
- 香港处理中国过半芯片进口创历史新高:AI贸易重塑亚洲供应链7/5/2026
- 从老鼠视皮层还原10秒视频:大脑视觉编码研究的里程碑7/13/2026