OmniRoute 杀疯了:一个 localhost 地址,把 Claude Code、Codex、Cursor 全接上,每月白嫖 16 亿 token!


腾讯orkbuddy注册即可得2000积分,可以干不少活。下载链接:https://www.workbuddy.cn/

百度Dumate智能体,也是工作搭配好工具:邀请码及下载地址:百度 Dumate邀请码: 7D8DUYG

字节TraeWork免费4500积分,点击下载字节跳动TraeWork免费4500积分

Tabbit AI浏览器,在浏览器里用AITabbit AI浏览器,点击下载

MonkeyCode 长亭百智云Monkeycode-AI,点击在线使用

「省 95% token,每月 16 亿免费额度,GitHub 上最火的趋势项目。」

6 月 28 日,GrowthSchool 创始人 Vaibhav Sisinty 在 X 上甩出这么一条帖子,配了一张密密麻麻的 token 预算表。评论区瞬间沸腾——2.2 万人围观,400 多人直接收藏。

他说的这个工具叫OmniRoute

Vaibhav Sisinty 的爆款推文(分段1)Vaibhav Sisinty 的爆款推文(分段2)Vaibhav Sisinty 的爆款推文(分段3)

▲ Vaibhav Sisinty 原帖:「我刚发现一个工具,能把 AI token 成本降低 95%」,2.2 万次查看,283 赞

开发者的账单噩梦

先说一个很多人不愿面对的现实:2026 年,AI 编码工具已经从"尝鲜"变成了"离不开"。

Claude Code 每月 $100 起步,Cursor Pro 一年 $192,Codex 按 token 计费用多少扣多少。一个重度开发者同时开着三四个工具,月底看账单直接心跳加速。

更难受的是额度焦虑。Claude Pro 用户刚进入心流状态,右上角弹出"已达今日使用上限"。Cursor 用户把 tab 补全关了又开、开了又关,生怕浪费在不值得的地方。

还有一笔隐形账——token 浪费。你以为发给模型的 prompt 都是有用信息?看看 Claude Code 一个 30 分钟会话的实际构成:git diff、测试日志、构建输出、浏览器快照、反复传入的上下文……这些"噪音"占据了 60% 到 90% 的 token,对最终代码质量几乎没有贡献。

你在为垃圾信息买单。

OmniRoute 瞄准的就是这三个痛点。

一个 URL 统治所有工具

OmniRoute 的核心理念简单到令人怀疑:装一次,改一个地址,所有 AI 编码工具共享同一个入口。

具体来说,它在本地启动一个网关服务,地址是http://localhost:20128/v1。Claude Code、Cursor、Codex CLI、Cline、Copilot、Continue——凡是支持 OpenAI 或 Anthropic 兼容协议的工具,把 Base URL 指向这个地址就行。

背后,OmniRoute 连接了231 个 LLM 提供商,其中 50 多个有免费额度,11 个永久免费。

GitHub 项目主页

▲ OmniRoute GitHub 仓库,7.6k stars,1.3k forks,268 个 release,MIT 开源协议

这个项目在 GitHub 上已经迭代到 v3.8.39,4530 次提交,270 多位贡献者。光看标签就知道它的野心——mcp、gemini、openai、cursor、copilot、codex、cline、claude、a2a、deepseek、claude-code、token-saver……恨不得把整个 AI 编码生态全覆盖。

它用开发者 diegosouzapw 的话说:Never Stop Coding(永远别停下来写代码)

压缩引擎:真正的杀手锏

省钱的秘密藏在两个压缩引擎里:RTKCaveman

RTK专门对付工具输出里的"废话"。git diff 里 500 行没变的上下文?砍掉。Jest 测试报告的进度条和 ANSI 颜色码?清除。构建日志里重复了 20 遍的 warning?只留一条。它用 49 条 JSON 过滤规则,精准识别并裁剪 Claude Code、Cursor 等工具最常产生的冗余输出。

官方给了一个真实案例:一个 30 分钟的 Claude Code 会话,原始消耗118,000 tokens,RTK 处理后只剩23,900 tokens——节省 79.7%。

Caveman则处理自然语言部分。它用一套多语言规则包,去掉填充词、犹豫表达和重复上下文,同时保护代码块、URL、JSON、文件路径这些结构化数据。

官方的一个压缩对比:

"The reason your React component is re-rendering is likely because you're creating a new object reference on each render cycle..."

压缩后变成:

"New object ref each render. Inline object prop = new ref = re-render. Wrap in useMemo."

69 个 token 变成 19 个,节省 72%,语义完全等价。

当 RTK 和 Caveman 叠加使用(官方称为 Stacked 模式),节省公式是:

combined = 1 - (1 - RTK节省率) × (1 - Caveman节省率)

按官方平均数据,RTK 节省 80%,Caveman 节省 46%,叠加后约89.2%。极端情况下(工具密集型会话),节省率可以到 95%。

这就是"省 95% token"这个数字的来源。激进吗?确实。但它有数学支撑,也有 fidelity gate(保真关卡)机制——如果压缩后语义偏移超过阈值,会自动退回原文。

16 亿免费 token:怎么算出来的?

这个数字是 OmniRoute 爆火的另一个核心卖点,也是最容易引发争议的地方。

项目维护者专门写了一份FREE_TIERS.md文档,解释计数方法论。他们用了一个叫pool-deduped(池化去重)的原则:多个免费提供商共享同一个后端池时,只计数一次,避免虚报。

FREE_TIERS.md 文档

▲ 官方免费额度文档,详细拆分了各级别 token 预算与计算方式

具体拆分:

  • 稳态每月约 15.4 亿 token(Documented recurring grant)
  • 首月可达约 21.5 亿(含注册赠送积分)
  • 永久无上限类别(Pollinations、Qoder、LongCat 等,真实可用但未计入主数字)

最大贡献者是 Mistral(约 10 亿),其次是 Gemini Flash 家族、Cerebras、Cloudflare AI 等。

值得注意的是,2026 年 6 月 17 日的版本做了一次"诚实修正"——Gemini Flash 家族从虚高的 4.62 亿修正为约 6000 万(pool-dedup 后),Cloudflare 从标称数字修正为实际约 3000 万。这种主动挤水分的做法,在开源项目里相当少见。

当然,这 15.4 亿是文档化上限,真实可用量受 rate limit、并发数和提供商状态影响。把它理解成"天花板"比"保证"更准确。

智能路由:17 种策略 + 三层容灾

OmniRoute 的路由引擎支持 17 种策略,核心逻辑是Combo(模型链)。

你可以设一条 Combo:优先用付费订阅额度 → 额度用完切低价 API → 再切免费池。模型 填auto,OmniRoute 会用 9 个因子实时评分(健康度、剩余配额、延迟、历史成功率、价格、上下文适配等),自动选最优提供商。

当某个提供商挂了或者限流,三层独立容灾机制启动:

  1. Circuit Breaker(熔断器):整个提供商级别隔离
  2. Connection Cooldown(连接冷却):单个 API key 限流时,其他 key 继续工作
  3. Model Lockout(模型锁定):只锁出问题的模型,同一提供商的其他模型不受影响

故障切换据称在10 毫秒以内完成。对开发者来说,正在跑的 agent 任务不会中断,甚至感知不到背后换了一个提供商。

5 分钟上手

Vaibhav 在跟帖里贴了完整的设置指南,简化到三步:

设置指南推文(分段1)设置指南推文(分段2)设置指南推文(分段3)

▲ 5 分钟设置 OmniRoute:安装 → 连接免费提供商 → 指向一个 URL

第一步:安装

npm install -g omniroute omniroute 

Dashboard 自动打开在localhost:20128

第二步:连接免费提供商

Dashboard → Providers → 点击 Kiro AI 或 OpenCode Free。不需要信用卡,不需要注册。Pollinations 甚至连 API key 都不用。

第三步:把工具指向一个 URL

所有编码工具的 Base URL 改成http://localhost:20128/v1,Model 填auto,API Key 从 Dashboard 复制。

Claude Code 用户改~/.claude/settings.json

{   "env": {     "ANTHROPIC_BASE_URL": "http://localhost:20128"   } } 

Codex CLI 用户设环境变量:

export OPENAI_BASE_URL="http://localhost:20128" 

v3.8 之后还加了一键命令:omniroute setup claudeomniroute setup cursor,连手动改配置都省了。

冷静一下:风险与争议

数字好看归好看,但上手之前有几件事必须知道。

ToS 灰色地带。部分免费提供商(Kiro、Gemini CLI、Antigravity)的服务条款明确禁止通过第三方代理访问。OmniRoute 的 FREE_TIERS.md 里专门列了一张 ToS 标记表,但用不用、风险自负。

压缩质量的边界。89% 的平均节省率来自工具密集型会话。如果你的 prompt 本身就很精简(比如直接贴一段代码问"哪里有 bug"),压缩带来的收益可能只有 15%-20%。而在极端复杂的上下文里,ultra 模式有概率引入语义偏移——虽然有 fidelity gate,但官方也承认需要用户自测 edge case。

"黑盒切换"的调试难题。auto 模式在后台自动换提供商和模型,表面上一切正常,但有 Reddit 用户反映遇到过"模型切换后 system prompt 行为微漂移"的情况。当你的 agent 任务出了诡异结果,定位问题会变得更复杂。

社区争议。Reddit 上有帖子对比 OmniRoute 与早期项目 9router 的代码和 UI,相似度很高。OmniRoute 被认为是"受启发后重构 + 增加了 MCP/A2A/更强容灾",但关于"fork 还是重写"的争论并未平息。

RoundtableSpace 的总结帖(分段1)RoundtableSpace 的总结帖(分段2)RoundtableSpace 的总结帖(分段3)

▲ @RoundtableSpace 总结帖:1.7 万次查看,148 赞——「所有免费层叠加,每个 token 发挥最大价值」

为什么偏偏在这个节点火了?

时机很关键。

2026 年上半年,AI 编码工具从"可选"变成了"标配"。Claude Code、Cursor、Codex 三足鼎立,开发者从"试用一个"变成了"同时依赖三四个"。多工具订阅的账单压力集中爆发。

与此同时,免费提供商的生态也在悄悄成熟——Pollinations 提供无需 key 的 GPT-5/Claude 访问,Qoder 给出无限量的 Kimi-K2 和 DeepSeek-R1,LongCat 每天 5000 万 token 的 Flash-Lite。这些散落各处的免费资源,需要有人把它们整合起来。

OmniRoute 做的就是这件事。再配上"95% 省 token + 16 亿免费 + 3 步设置"这组极具冲击力的数字,加上 AI 内容账号的模板化推广——一切条件都齐了。

写在最后

OmniRoute 代表的趋势比项目本身更值得关注:Token 优化正在成为 AI 编码的第二战场。

过去两年,开发者在"选哪个模型"上花了无数精力。现在,当模型能力趋于同质化,竞争焦点转向了基础设施层——谁能用更少的 token 完成同样的任务,谁能在多个提供商之间无缝切换,谁能把分散的免费额度拧成一股绳。

OmniRoute 用"本地网关 + 压缩引擎 + 智能路由"这套组合拳给出了一个答案。7600 多颗星、270 多位贡献者、268 个 release——这个项目的迭代速度说明社区真的有需求。

但魔法终归有代价。免费池的 ToS 风险、压缩的保真边界、自动路由的可观测性——每一条都需要你亲自验证。

建议的姿势是:先装上跑两天,测自己 workflow 里的压缩质量和 fallback 行为。生产环境的关键路径,留一条付费 API 兜底。

毕竟,免费的午餐吃得开心,但别把锅都扔了。

 

暂无评论,快来发表第一条评论吧!

📮 需求咨询