OmniRoute 是一个免费开源的 AI 本地网关(GitHub 24k Star,MIT 协议),在本地起一个服务后,所有 AI IDE、CLI、Agent 都指向这一个端点。背后接了 278 个 AI 提供商,其中 90+ 有免费额度,40+ 永久免费。每月聚合约 15.3 亿免费 Token,Token 压缩平均省 89%,兼容 26+ 编程工具。
你在用 Claude Code 写代码的时候,有没有遇到过这些破事:
- Codex Pro 的 5 小时额度用完了,不得不干等刷新,写代码写一半卡住
- 十个 AI 工具各自配 API Key,Claude Code 一套、Cursor 一套、Cline 一套,换个工具重新配
- Agent 跑工具,shell 输出、测试结果、构建日志动不动烧掉几千 Token,钱跟流水一样
- 换个模型还要改 Endpoint、改配置、重新测试,烦得要死
- 有些 AI 服务在国内访问不稳,429、超时、被封,写代码正爽的时候给你来一下
这些事单独看都不大,但凑在一起就是很烦。而且你会发现,大部分时间不是你在写代码,是你在"伺候"这些工具。
OmniRoute 就是来解决这件事的。

OmniRoute 是什么?
一句话:免费开源的 AI 本地网关。
你在本地起一个服务,跑在 localhost:20128,然后你所有的 AI IDE、CLI、Agent 都指向这一个端点就完事了。背后它帮你接了 278 个 AI 提供商,其中 90+ 有免费额度,40+ 永久免费。
几个核心数字先甩出来:
- 每月聚合大约 **15.3 亿免费 Token**(首月加注册赠额能到 21.5 亿)
- Token 压缩平均省 **89%**,最高能到 95%
- 兼容 **26+ 编程工具**:Claude Code、Codex CLI、Cursor、Cline、Copilot、OpenCode、Kilo Code、Goose 等
- 23,959 Star,500+ 贡献者,25,000+ 测试用例,MIT 协议
核心思路就一句话:你只管写代码,它在后台帮你找最便宜、最稳定、还有剩余额度的模型。额度用完了自动切,服务挂了自动切,超预算了自动切——你完全无感,代码不会断。不得不说设计这个产品的真的是非常懂用户的痛点。
四级路由:永不中断
OmniRoute 最核心的设计就是这个四级降级链路:

你的 IDE 只认一个地址 http://localhost:20128/v1,请求进去之后,OmniRoute 自动在四级提供商之间找能用的:
- 1. **Tier 1 订阅**:Claude Code Pro、Codex Pro、Copilot Pro——你已经付过钱了,优先烧完
- 2. **Tier 2 API Key**:DeepSeek、Groq、xAI 这些按 Token 付费的
3. Tier 3 廉价:GLM( )、(0.2/M token)这种白菜价模型- 4. Tier 4 免费:Kiro、Qoder、Pollinations 这些完全免费的 每一级用完了或者挂了,毫秒级自动切到下一级。你写代码写到一半,Claude 额度用完了?没事,它 8 毫秒内切到 GLM,你根本感觉不到。
六大承诺,一个比一个实在

1. 永不中断
278 个提供商,某个挂了、额度用完了、被限速了,毫秒级自动切走。你写代码再也不会因为 "429 Too Many Requests" 被打断。
2. 最高省 95% Token
这个功能我觉得最值。每个请求自动过 11 个压缩引擎,代码块、URL、JSON 这些结构化数据字节保真,其他废话全给你压缩掉。
给你看个真实例子: >
**压缩前(69 tokens):** "The reason your React component is re-rendering is likely because you're creating a new object reference on each render cycle. When you pass an inline object as a prop, React's shallow comparison sees it as a different object every time, which triggers a re-render. I would recommend using useMemo to memoize the object."
>
**压缩后(19 tokens):** "New object ref each render. Inline object prop = new ref = re-render. Wrap in useMemo."
>
**意思一模一样,少了 72% Token。**
> Agent 跑工具的时候(shell 输出、测试结果、构建日志),压缩效果最猛,平均省 89%,最高 95%。省下来的 Token 就是真金白银。
3. 零成本起步

看到这里有小伙伴会问免费的没有那么准确,额度是有时效的,这个不用担心,统计的数字是每两周重新审计一次,CI 门禁保着,一般不会虚报的。
4. 所有工具都能用

Claude Code、Codex CLI、Cline、Kilo Code、Roo Code、Continue、Aider、OpenCode、Copilot CLI、Cursor CLI、Goose、OpenClaw、Warp AI 等等,一个 Base URL + 一个 API Key 全部搞定。还兼容任何 OpenAI API 格式的工具。
5. 一个端点
OmniRoute 把所有提供商的 API 差异屏蔽了。你拿到的是标准 OpenAI 兼容接口,也支持 Claude Messages API 和 Gemini 格式。一套代码到处跑,不用适配。
6. 生产级
不是玩具项目。内置熔断器、指数退避、防惊群、JA3/JA4 TLS 指纹伪装(反封锁)、104 个 MCP 工具、6 个 A2A 技能、记忆系统、PII 脱敏、Prompt 注入防护。全仓库 25,000+ 测试用例。
Combos:自动故障转移链
Combo 是 OmniRoute 最核心的概念。它就是一串模型链,额度用完了、服务挂了、费用超了,自动滑到链上下一个。这个设计让 OmniRoute "打不碎"。
零配置:直接用 auto
你甚至不用自己配 Combo,模型名填 auto 就完事了。OmniRoute 根据你连的提供商实时评分,自动构建最优链路:
Model ID干什么auto平衡默认,粘在上一个好用的提供商auto/coding代码质量优先auto/fast延迟最低优先auto/cheap最便宜优先auto/offline剩余额度最多的优先auto/smart质量优先 + 10% 探索发现更好模型
想精细控制?18 种路由策略随便组合
策略作用priority按顺序依次耗尽每个目标 🥇cost-optimized实时价格最低的优先 💸round-robin按顺序循环least-used当前负载最低的优先context-relay跨模型传递长对话上下文 🧠lkgp粘在上一次成功的目标fusion多模型并行 + 裁判模型合成答案 🧬pipeline链式步骤,前一个输出喂给下一个 🔗...还有 10 种,不一一列了 还有个 Quota-Share 功能挺实用——团队共用一个 Codex Pro 账号?它能按权重公平分配配额(比如 50/30/20),一个人突发烧额度不会把其他人锁外面,闲置额度还能"借"出来不浪费。
三层韧性保护

故障隔离做得很细,三个独立层,每层处理不同级别的故障:
- 1. **提供商熔断器**:整个提供商挂了(5xx 错误),熔断器打开,跳过它直到恢复
- 2. **连接冷却**:某个 Key 坏了或被限速,单独冷却这个 Key,同提供商其他 Key 继续服务
- 3. **模型锁定**:某个模型额度用完,只锁那个模型,其他模型不受影响
一个坏 Key 不会拖垮整个提供商,一个死模型不会废掉整个 Key。故障隔离到最小范围,其他一切照常服务。
Token 压缩:11 个引擎管线

每个请求依次经过 11 个压缩引擎,代码/URL/JSON 始终字节保真: 引擎作用Session-Dedup去掉多轮对话重复内容RTK智能工具结果过滤、去重、截断(命令感知)HeadroomJSON 表格数据无损压缩(约 30%)Caveman规则化文本压缩(输出约 65–75%)LLMLingua-2ML 语义剪枝(MobileBERT ONNX),代码安全...还有 6 个 预设组合一键切换: 模式节省适合🪶 Lite~15%始终开启的安全默认🪨 Standard~30%日常写代码⚡ Aggressive~50%工具密集长会话🔥 Ultra~75%最大节省🧰 RTK60–90%Shell/测试/构建/git 输出🔗 Stacked (RTK+Caveman)78–95%混合 Prompt + 工具日志 还支持中文文言风格压缩(CJK 极简模式),以及自适应上下文预算——自动判断该启动哪个引擎,保证内容始终塞进模型窗口。
MCP + A2A:Agent 自己就能操控它
OmniRoute 不只是代理,它还会说 Agent 语言。暴露 MCP 和 A2A 协议后,AI Agent 自己就能操控整个网关——查路由状态、切换提供商、调整压缩、管理配额。
CLI 也很完整,80+ 命令:
omniroute # 启动网关 + 面板
omniroute chat # TUI 聊天客户端
omniroute setup # 引导配置
omniroute doctor # 诊断提供商/端口/依赖远程模式也支持——VPS 上跑 OmniRoute,本地 CLI 用 scoped token 连上就能管:
omniroute doctor # 诊断提供商/端口/依赖远程模式也支持——VPS 上跑 OmniRoute,本地 CLI 用 scoped token 连上就能管:
omniroute connect 192.168.0.15 # 连远程
omniroute models list # 列远程模型
omniroute configure codex # 给本地 Codex 配远程模型MCP 端点:
omniroute configure codex # 给本地 Codex 配远程模型MCP 端点:
# 一条命令让 Claude Code 获得 OmniRoute 的 104 个工具
claude mcp add omniroute --type http --url http://localhost:20128/api/mcp/stream
claude mcp add omniroute --type http --url http://localhost:20128/api/mcp/stream

- 100% 在你自己硬件上跑,零云端跳转
- 默认零遥测
- 凭证 AES-256-GCM 加密存在你本地 SQLite
- 不需要注册账号
- 上游请求头清洗
- PII 脱敏可选
- 错误信息净化,不泄露内部信息
- MIT 协议,代码全开源可审
在这个数据满天飞的时代,一个 AI 网关能做到全本地、不开户、不收集数据,这点很加分。
如何快速上手
安装
npm install -g omniroute
npm install -g omniroute
连免费提供商
面板 → Providers → 连 Kiro AI(免费 Claude,约 50 credits/月)或 OpenCode Free(无需认证)→ 搞定。
配你的 IDE
Base URL: http://localhost:20128/v1
API Key: 面板 → Endpoints 复制
Model: auto
验证
curl http://localhost:20128/v1/models -H "Authorization: Bearer YOUR_KEY"看到模型列表就成了。直接写代码去吧,OmniRoute 在后台帮你自动路由。
curl http://localhost:20128/v1/models -H "Authorization: Bearer YOUR_KEY"看到模型列表就成了。直接写代码去吧,OmniRoute 在后台帮你自动路由。 其他安装方式:Docker、macOS/Win/Linux 桌面版(Electron)、Android(Termux)、PWA、Arch AUR、Nix Flake、Podman、Fly.io 部署都行,全平台覆盖。
对比其他方案
特性OmniRoute其他路由工具🌐 提供商27820–100🆓 免费提供商90+(40+ 永久免费)1–5🔀 路由策略18 种1–3 种🗜️ Token 压缩RTK+Caveman 堆叠 15–95%无 / 20–40%🧰 内置 MCP104 工具罕见🤝 A2A 协议6 技能无🥷 TLS 伪装JA3/JA4无🖥️ 多平台Web/Desktop/Termux/PWA仅 Web🌍 语言43 种0–4 种
技术栈
TypeScript 6.0(核心模块零 any)、Next.js 16 + React 19 + Tailwind CSS 4、better-sqlite3、Zod 校验、MCP + A2A 双协议、25,000+ 测试用例、Electron 桌面端、Termux 安卓端、PWA。
总结
我自己装完用了几天,说下真实感受:
**好的地方:**
- 装上之后所有工具一个配置,真的省心
- Token 压缩肉眼可见,同样的对话量 token 消耗降了一大截
- 免费额度聚合很香,轻度用户完全可以不花钱
- 全本地、不开户、数据不外传,隐私这块让人放心
- MCP/A2A 支持意味着 Agent 可以自己管网关,这个面向未来
**需要注意的:**
- 免费额度虽然多,但单个提供商的免费额度有限,重度用户还是需要配付费 API
- 11 个压缩引擎虽然牛,但某些场景可能需要调配置(默认 Lite 模式很安全)
- 项目迭代很快,文档偶尔跟不上代码
**适合谁用?**
- ✅ 用 Claude Code/Codex/Cursor 写代码,每月烧 $20+ 订阅费的
- ✅ 同时用多个 AI 工具,烦透了配置管理的
- ✅ 想白嫖免费 AI 额度,不想一个个去注册的
- ✅ 在乎数据隐私,不想把请求过第三方云的
24k Star、500+ 贡献者、25,000 测试、MIT 协议——这不是小作坊,是个正经的社区驱动基础设施。装上试试反正不要钱,60 秒就能跑起来,不合适卸载也干净。
模型调用速查(给需要自己接的朋友):
- 官网:https://omniroute.online
- GitHub:https://github.com/diegosouzapw/OmniRoute
- 安装:npm install -g omniroute
- 默认端口:20128
工具摆这了,强烈安利大家装一装试试。有问题评论区聊。