Brave
@47c132035ed7a1105a867946b99d67af 人工智能研究 公开
讨论 FreeLLMAPI 与 OmniRoute: 聚合全网免费LLM额度的免费网关

FreeLLMAPI 与 OmniRoute: 聚合全网免费LLM额度的免费网关

两个开源项目,同一件事:把各家 AI 厂商的免费额度聚合到一个 OpenAI 兼容接口。本文分两篇分别介绍,附免费厂商大全、隐私分级与选型建议。


背景:为什么需要"免费额度聚合网关"

免费额度的现状与格局

如今几乎所有主流 AI 实验室都提供免费额度——Google、Groq、Mistral、Cerebras、智谱、NVIDIA、Cloudflare……每家单独看都是"玩具额度":每月几百万 tokens、每天几千次请求,够写个 Demo,撑不起任何正经产品。

但把它们叠在一起,数字就完全不同了:仅 FreeLLMAPI 追踪的 29 家厂商就贡献了每月约 40 亿 token 的可用推理容量;OmniRoute 的可验证免费池也有每月约 15 亿 token。这意味着只要"路由"得当,一个重度的个人开发者可以完全零成本地跑完大部分日常 AI 工作负载。

手工叠加的痛苦

把免费额度逐个接入自己的项目,要面对:

  1. 几十套 SDK:每家厂商的客户端库、鉴权方式、错误格式都不一样;
  2. 几十套限流规则:RPM(每分钟请求数)、RPD(每日请求数)、TPM(每分钟 token 数)、TPD(每日 token 数)四维交叉,每家的额度窗口和重置时间还都不一样(UTC 午夜、太平洋时间午夜、滚动窗口……);
  3. 几十个失败点:429 限流、5xx 故障、模型下架、配额收紧——任何一个出错都要手写重试逻辑;
  4. 配额盲区:你不知道每家还剩多少额度,只能撞墙了才知道。

聚合网关解决什么

聚合网关把这一切折叠成一个 OpenAI 兼容端点:把任何客户端库的 base_url 指向本地网关,网关在配置好的厂商之间透明路由,配额耗尽自动切换下一家(fallover),并替你追踪每个 key 的用量,保证永远不触顶。

本文要介绍的两大项目是这一思路的两个极致代表:

  • FreeLLMAPIgithub.com/tashfeenahmed/freellmapi):窄而深——29 家精选厂商,月免费容量约 40 亿 tokens,路由可靠性与密钥安全打磨到极致;
  • OmniRoutegithub.com/diegosouzapw/OmniRoute):宽而全——330+ 厂商目录、1200+ 模型,19 种路由策略加一整套"军火库"级功能。

一、FreeLLMAPI:把 40 亿免费 tokens 汇成一个接口

1.1 项目简介

FreeLLMAPI 是开源的本地自托管 AI API 网关,发布于 2026 年 4 月,MIT 许可,目前 GitHub 1.8 万+ Star,代码以 Node.js 编写(要求 Node 20+,空闲内存占用约 40MB)。

每月约 40 亿 tokens、29 家免费 LLM 提供商、358 个免费模型端点,全部汇入一个 OpenAI 兼容的 /v1 接口。

项目的核心哲学是**"窄而深":不追求厂商数量,而是把 29 家精选厂商的接入质量、路由可靠性、密钥安全做到位。它自建了一个签名模型目录**(signed catalog),由维护团队每日测试模型、追踪配额变化,路由器定期从 freellmapi.co 拉取并验签应用——解决了"免费层每周都在变"的最大痛点。

1.2 版本演进史(快速了解项目成熟度)

  • v0.3.0:推出 Premium 实时目录。路由器每天两次拉取签名目录(Ed25519 验签),新模型、配额变化、厂商怪癖修复自动落地;免费用户跟随每月快照。
  • v0.4.1:稳定性修补。
  • v0.5.0(当前):一个月的重头戏——新增 9 家免费厂商(SEA-LION、NavyAI、NaraRouter、Aion、Requesty、AI Horde、Routeway、BazaarLink、AINative);新增 Anthropic 兼容 API/v1/messages,Claude Code 可直连);图片生成与音频/TTS 端点;MCP 服务器/mcp);结构化输出(json_schema 透传 + JSON 修复 + 不支持时的格式忽略切换);legacy completions 端点;嵌入 dimensions 参数(MRL 截断);托管 OpenAPI 文档(/v1/docs + /v1/openapi.json);可选响应缓存;统一四个厂商 fallback 循环(重试预算、熔断器、请求级 token 预算、丰富的中断诊断);客户端断连中止 + X-Fallback-Trail 头;睡眠唤醒恢复(漂移检测、socket 冲刷、即时 key 重探);密钥池月度 token 预算、批量 key 导入导出;自定义厂商 SSRF 防护等。

1.3 核心特性详解

1.3.1 完整的 OpenAI 接口面

  • /v1/chat/completions —— 对话补全(流式/非流式)
  • /v1/responses —— Codex CLI 依赖的新接口
  • /v1/completions —— 传统补全(编辑器"幽灵文本"自动补全用)
  • /v1/images/generations —— 图片生成(路由到带媒体模型的厂商)
  • /v1/audio/speech —— 文本转语音
  • /v1/embeddings —— 向量嵌入(支持 dimensions 参数做 MRL 截断)
  • /v1/models —— 模型列表

官方 OpenAI SDK 与任意 OpenAI 兼容客户端(LangChain、LlamaIndex、Continue、Hermes 等)只需改 base_url 即可接入。

1.3.2 Anthropic Messages API(Claude Code 原生接入)

/v1/messages 用 Anthropic 的线上协议(wire format)走同一个路由器,因此 Claude Code 和官方 Anthropic SDK 可以直接跑在免费额度池上。附带 system-role 修复,并保留 Gemini 的 thought-signature。配置时把 ANTHROPIC_BASE_URL 指向网关根地址(如 http://localhost:3001,不要自己补 /v1/messages,Claude Code 会自己拼),用 ANTHROPIC_AUTH_TOKEN 带统一 key,不要设 ANTHROPIC_API_KEY——否则 Claude Code 会认为存在冲突的第一方凭证而拒绝启动。

1.3.3 智能路由:六种策略 + fallback 链

  • 每种模型有实时的速度/能力/可靠性评分,构成你的"备用链"(fallback chain)排列依据;
  • 请求进来后,路由器选择优先级最高、key 健康、未触顶任何限流的模型,在内存中解密 key 后直连厂商;
  • 遇到 429/5xx 时冷却该 key 并重试链上下一个模型(带冷却时间与 key 轮换);
  • 支持 auto:* 路由策略:auto(自动选)、auto:fastauto:smart,或自定义 profile、直接指定模型 ID;
  • Unified models:同一模型出现在多个厂商时合并为一条,组内严格 fallover;
  • 命名备用链 profile:如 coding 链、vision 链,可从仪表盘切换或按请求用 auto:<profile> 指定;
  • Fusion 多模型融合:请求虚拟的 fusion 模型,路由器把提示词并行扇出给一桌多样化的免费模型,再由一个裁判模型综合各草稿生成最终答案。

1.3.4 每 key 限流追踪

(platform, model, key) 三维记录 RPM/RPD/TPM/TPD 计数器,并学习各厂商实际报告的额度上限——比如某厂商限 30 RPM,路由器会自动把该 key 的调度压到 28 RPM 以内。计数器持久化在 SQLite,配合冷却状态机(healthy / rate_limited / error),保证路由永远在额度之内运行。

1.3.5 Sticky Sessions 与会话交接

  • 同一对话保持在同一模型上 30 分钟(避免中途换模型导致人格漂移);
  • 当真发生中途切换时,生成一份紧凑的交接摘要(handoff note)注入新模型,保持对话连贯性。

1.3.6 可选提示词压缩(Prompt Compression)

共享的 fail-open 请求管线:去重提示词、过滤工具输出、压缩重复 JSON、裁剪陈旧上下文——在缓存查找与路由之前执行,用于降低 token 消耗。

1.3.7 密钥安全

厂商 key 用 AES-256-GCM 加密存入 SQLite,每次请求时在内存中解密使用;你的应用永远只见一个统一的 freellmapi-… bearer token。密钥健康检查定期执行,支持批量 key 导入/导出与 CSV 导出加固。

1.3.8 自更新模型目录

路由器每天两次拉取签名目录(pinned Ed25519 公钥验签),新模型、配额变化、厂商协议修复自动落地到本地 DB——不需要 git pull。你自己的启用/禁用选择和自定义厂商永不被覆盖。免费安装跟随月度快照;Premium 跟随 2–3 天刷新一次的实时流。

1.3.9 工具调用与结构化输出

OpenAI 风格 tools 在厂商间往返(纯文本工具调用会被"抢救"成真正的 tool_calls);response_formatseedlogprobs、penalties 等采样参数按厂商能力透传。结构化输出模式下 json_schema 透传上游,返回结果做 JSON 修复(JSON healing),厂商不兼容时按 routing filter 找到支持方,实在都不支持则忽略格式继续 fallover。

1.3.10 运营细节(Ops niceties)

可选响应缓存、加密 DB 备份、启动配置声明式管理、p50/p95/TTFT 延迟分析(24h–90d 窗口)、仪表盘登录保护、深色/浅色主题、60 种界面语言(RTL 语言整体翻转,只加载活跃语言词典)。

1.4 支持的厂商

Google、Groq、Cerebras、OpenCode Zen、Mistral、OpenRouter、Cloudflare、Cohere、Z.ai(智谱)、NVIDIA、HuggingFace、ModelScope(Qwen3、DeepSeek V4、GLM-5)……加上 v0.5.0 新增的 SEA-LION、NavyAI、NaraRouter、Aion、Requesty、AI Horde、Routeway、BazaarLink、AINative,共 29 家。

此外有自定义提供商(Custom provider):把 chat、embedding、image、audio 模型指向任何 OpenAI 兼容端点——llama.cpp、LM Studio、vLLM、本地 Ollama、远程网关都可以从 Keys 页面接入。以及本地原子表未列出的匿名层(无需 key)。

1.5 兼容的编码代理与自动化配置

Claude Code、Codex CLI、Gemini CLI、Aider、Cline、Roo Code、Continue(含内联补全)、opencode、Goose、Qwen Code、Kilo Code、Crush、Cursor、Zed、JetBrains AI 都可用。多数代理一条命令自动配置(自动拉取你的实时目录、备份现有配置、绝不覆盖已有内容):

代理自动化命令Base URL
Claude Codenpx freellmapi setup-claude根路径
Codex CLInpx freellmapi setup-codex/v1
Cline / Roo / Kilo / Crushsetup-cline / setup-roo / setup-kilo / setup-crush/v1
Continuesetup-continue/v1
Aidersetup-aider/v1
opencodesetup-opencode/v1
Goosesetup-goose/v1
Qwen Codesetup-qwen/v1(或原生 /v1beta
Cursor文档指引公网 /v1 URL

所有生成器支持 --dry-run,改动前创建带时间戳的备份;npx freellmapi launchlaunch-codex 是零持久化启动器——凭据只注入子进程,不落配置文件。Zed 与 JetBrains AI 走可选的 Ollama 模拟层;Gemini CLI 在 /v1beta 讲原生协议(generateContent、流式、token 计数、模型列表)。

1.6 API 使用示例

from openai import OpenAI

client = OpenAI(
    base_url="http://localhost:3001/v1",
    api_key="freellmapi-your-unified-key",
)

# 基础对话:auto 让路由器选最优模型
resp = client.chat.completions.create(
    model="auto",  # 或 auto:fast / auto:smart / profile / 具体模型 ID
    messages=[{"role": "user", "content": "用一句话总结罗马的衰落"}],
)
print(resp.choices[0].message.content)
print("实际路由到:", resp.headers.get("x-routed-via"))

每个响应都带 X-Routed-Via: <platform>/<model> 头;fallover 链上还有 X-Fallback-Trail 记录完整的尝试轨迹。流式、工具调用、视觉输入、Gemini Google Search 接地、嵌入、Anthropic 接口的 curl/代码示例见 docs/api.md

1.7 部署方式

  • Docker 一行脚本(推荐):curl -fsSL https://freellmapi.co/install.sh | bash——自动创建 ~/freellmapi、生成加密密钥、拉镜像、起容器;重复执行安全(.env 和密钥保留,容器更新到 latest)。docker pull ghcr.io/tashfeenahmed/freellmapi 也可直接拉取。
  • 桌面客户端:macOS .dmg 与 Windows .exe 安装器随每个 release 发布,托盘菜单栏应用,玻璃态弹窗显示实时请求统计,注册即用(唯一凭据就是托盘里的统一 API key)。
  • 本地源码开发npm install && npm run dev——服务器在 :3001、仪表盘在 :5173,均带 HMR;./scripts/dev-bootstrap.sh / .\scripts\dev-bootstrap.ps1 可重复初始化环境并保留已有 .env
  • Docker Compose / LAN 访问 / 生产构建 / 备份:见 docs/install.md
  • Android(实验性):Termux 指南见 docs/install/android-termux.md
  • 监督进程:PM2 / systemd / 任意你喜欢的方式。

1.8 架构与内部原理

一条请求的旅程:请求进 → 路由器选出"优先级最高 + key 健康 + 所有限流未触顶"的模型 → 内存解密 key → 直连厂商 → 429/5xx 则冷却该 key、重试链上下一个模型。组件划分:services/ratelimit.ts(RPM/RPD/TPM/TPD 计数器 + cooldown 状态机)、services/health.ts(周期探针,标记 key 为 healthy/rate_limited/error)、providers/*.ts(每厂商一个适配文件,继承 Provider 基类的 chatCompletion()streamChatCompletion())、index.ts(厂商 → 模型清单与限速配置)。

1.9 商业模式

路由器本体 MIT 协议永久免费。可选的 Premium(19 美元/年或 49 美元终身,Stripe 自助结账可随时取消)提供"实时目录订阅"——用来资助作者每日的模型测试和目录维护。一张 fla_ key 覆盖你所有路由器实例(桌面、homelab、树莓派)。目录服务器永远看不到你的提示词、补全内容和厂商 key——路由器始终完全自托管。


二、OmniRoute:330+ 厂商的"免费 AI 网关"

2.1 项目简介

OmniRoute(发音即"全路由"),仓库 github.com/diegosouzapw/OmniRoute,口号 "Never stop coding",MIT 许可,由 500+ 贡献者共建,技术栈 Next.js 16 / TypeScript。它走"宽而全"路线:

330+ 提供商(90+ 有免费层、40+ 永久免费)、1200+ 模型,一个端点全搞定——每月约 15 亿 tokens 的可验证免费容量。

OmniRoute 的免费池数字有一个与众不同的可信度设计:每两周对目录重新审计一次,数字"双向浮动"——厂商结束免费层,数字就下降;新增免费层,数字就上升。重复的计算(同一账号被多家引用)会去重,共享账号只算一次。它公布的是目录实际计算出的值,不是拍脑袋的乐观上界。

2.2 核心特性总览

  • Combos(旗舰功能):模型链自动路由,配额耗尽/厂商失败/涨价时静默滑到下一个模型——"这就是 OmniRoute 打不倒的原因";
  • 19 种路由策略,可混搭、可逐步骤(combo step)配置;
  • Auto-Combo 引擎:12–14 个因素实时打分;
  • Token 压缩:RTK + Caveman 七档管线,节省 15–95%;
  • 接口全家桶:OpenAI / Anthropic / Gemini / Ollama / 视频 / 音乐 / OCR / 重排 / 审核;
  • OAuth 订阅额度接入:Claude、Codex、GitHub Copilot、Cursor 等 16+ OAuth 模块;
  • Agent 协议:MCP(105 工具 / 31 作用域)、A2A(6 技能)、Webhooks、远程 CLI;
  • 韧性:三层熔断 + 冷却 + 锁定、防惊群、TLS 指纹伪装;
  • 记忆、护栏、评测:对话记忆(FTS5 + 向量)、Guardrails(PII/注入/视觉)、Eval 框架;
  • 3 级代理:全局/厂商/连接三级代理 + 1proxy 市场。

2.3 Combos 与 Auto 变体详解

Combo 是一条模型链,OmniRoute 在上面自动跨厂商路由。配额用完、厂商挂了、成本飙升——combo 静默滑向链上下一个模型。零配置用法:模型填 auto,OmniRoute 根据你已连接的厂商实时构建虚拟 combo:

模型 ID优化目标
auto均衡默认(LKGP——粘住最近成功的厂商)
auto/coding代码生成质量优先权重
auto/fast最低延迟优先
auto/cheap每 token 最便宜优先
auto/offline剩余配额/限流余量最多优先
auto/smart质量优先 + 10% 探索(发现更好的模型)

Auto-Combo 引擎对每个候选连接按 12 个因素打分:健康度、配额、成本、延迟、成功率、新鲜度……(docs/routing/AUTO-COMBO.md)。

2.4 全部 19 种路由策略

#策略行为
1priority按优先级有序取用,榨干前一个再换下一个
2fill-first先把某个目标的配额用满再转移
3weighted按权重随机(per-target weight)
4round-robin轮询切换
5p2cPower-of-two-choices 随机负载均衡
6least-used选当前负载最低的目标
7random均匀随机(去重)
8strict-random纯随机(不去重)
9cost-optimized按实时定价最小化每请求成本
10headroom选剩余配额最多的目标
11reset-window偏好配额窗口最早重置的目标
12reset-aware按配额重置时间排序(短窗口优先)
13context-relay长对话跨目标交接上下文
14context-optimized按当前上下文大小选最优适配
15cache-optimized把可复用的 prompt 前缀钉在同一账号,最大化缓存命中
16lkgpLast-Known-Good Path——粘住最近成功的路径
17auto12 因素实时打分综合路由
18fusion扇出给一桌模型,裁判模型综合成一份答案
19pipeline链式流水线——前一个目标的输出喂给下一个

另有 X-OmniRoute-Decision 响应头记录本次决策(策略/厂商/延迟),并提供只读的 /v1/auto-combo/{channel}/candidates 端点查看某 auto/* 通道的实时候选池;cache-optimized 配合 cacheAffinity 因素把重复请求路由回持有缓存前缀的连接。

2.5 Token 压缩管线(RTK + Caveman)

七档压缩选项:off / lite / standard / aggressive / ultra / RTK / stacked。混合节省 15–95% tokens:

  • RTK:命令输出压缩——过滤、可信度、校验、原始输出可恢复;
  • Caveman:规则包驱动(JSON 格式的 rule-pack schema),做语言检测与文本抽取;
  • 压缩在仪表盘/API/MCP 面都可用(docs/resiliencedocs/compression 系列文档)。

对 coding agent 场景(Claude Code / Codex 高频跑命令)尤其显著:一条 git diff 可能占几万 token,过滤后可能只剩几百。

2.6 接口全家桶

端点格式
POST /v1/chat/completionsOpenAI
POST /v1/messagesAnthropic(自动检测)
POST /v1/responsesOpenAI Responses
POST /v1/embeddingsOpenAI
POST /v1/images/generations/v1/images/editsOpenAI(含编辑/修补)
POST /v1/videos/generationsOpenAI 风格视频生成
POST /v1/music/generations音乐生成
POST /v1/audio/transcriptions/v1/audio/speech语音转写 / 合成
POST /v1/rerankCohere/Voyage 风格重排
POST /v1/moderationsOpenAI 内容审核
GET /v1/models模型列表
POST /v1/messages/count_tokensAnthropic token 计数
GET /v1beta/modelsPOST /v1beta/models/{...path}Gemini 原生
POST /v1/api/chat/api/v1/vscode/{token}/...Ollama 格式 + 令牌化别名

技术栈为 Next.js app router(src/app/api/v1/* 兼容 API,src/sse/* + open-sse/* 为共享 SSE/翻译核心),存储用 SQLite。每个 provider 有专属 executor 继承 BaseExecutor(URL 构建、请求头、指数退避重试、凭据刷新钩子、execute() 编排)。

2.7 OAuth 订阅额度接入(OmniRoute 的独门绝技)

16+ OAuth / 设备码模块,把"订阅账号"的额度也纳入路由池,这是其他开源网关没有的能力:

提供商认证方式特点
ClaudeAPI Key / OAuthtoken 刷新 ✅
Gemini / Gemini CLIAPI Key / Google OAuth配额见 Cloud Console
AntigravityOAuth完整配额 API,自定义 project/session ID、Retry-After 解析
CodexOpenAI Responses + OAuth强制流式、注入系统指令、reasoning effort
GitHub CopilotOAuth + Copilot TokenVSCode 伪装头、配额快照
Cursor自定义 checksumConnectRPC 协议、Protobuf、请求签名
Kiro(AWS CodeWhisperer)AWS SSO OIDCEventStream 二进制 → SSE 转换
Qwen / QoderOAuth / PATQoder 有多模型免费层
Kilo Code / Cline / Kimi CodingOAuth

重要警示:订阅转 API(尤其 Claude / Copilot / Cursor)明确踩在对方服务条款边缘,封号风险高于普通免费 API,见第八章风险提示。

2.8 代理与 Agent 协议

  • MCP server:stdio / HTTP / SSE 三种传输,暴露整个网关为 105 个工具、31 个作用域(路由、配额、记忆、技能……),带完整审计轨迹。claude mcp add-server omniroute --type http --url http://localhost:20128/api/mcp/stream 即可接入 Claude Desktop / Cursor 等任意 MCP 客户端;
  • A2A server:Agent-to-Agent(JSON-RPC 2.0 + SSE),6 项技能:智能路由、配额、发现、成本分析、健康报告;
  • Webhooks:用量、配额、错误、路由事件推送到你的 URL;
  • 远程 CLIomniroute connect 用作用域访问令牌驱动远程实例;
  • 云代理:Codex、Cursor、Devin、Jules 等云 Agent 可经 OmniRoute 统一驱动——创建任务、审批计划、流式结果。

2.9 韧性、记忆与安全特性

  • 三层容错:circuit breaker(熔断)+ cooldown(冷却)+ lockout(锁定),外加请求队列与防惊群(anti-thundering herd)设计;
  • TLS 指纹伪装wreq-js 压低 TLS 指纹特征,降低被上游风控识别为"机器人网关"的概率;
  • 记忆系统:FTS5 全文 + 向量检索双引擎,CRUD + 摘要 + 重索引 + Qdrant 设置,Playground 可交互预览;
  • Guardrails:PII 检测、提示注入防护、视觉审查;
  • Eval 评测框架:对路由行为做自动化评测;
  • 3 级代理系统:全局 / 单厂商 / 单连接三个层级(SOCKS5 & HTTP(S)),内置 1proxy 代理市场一键接入。

2.10 部署与快速上手

npm install -g omniroute && omniroute
  • 仪表盘 http://localhost:20128/dashboard,API 端点在 localhost:20128/v1
  • Providers 页连接厂商(90+ 免费层多半只需网页登录/OAuth,无需信用卡);
  • 设置模型为 auto 或自建 combo;每个响应带 X-OmniRoute-Decision 头标明实际服务方;
  • 42 种界面语言;桌面版与 PWA;数据存 storage.sqlite
  • 嵌入式服务:可安装并路由到本地运行的 9Router 与 CLIProxyAPI 进程(/api/services/{name}/*,所有路由标 LOCAL_ONLY)。

2.11 与同类项目的横向对比

特性OmniRoute9routerLiteLLMCLIProxyAPI
提供商数量268–330+(按版本)40+100+8+
路由策略17–19 种3 级 tierretry/priorityround-robin、fill-first
内置 MCP server✅(104 工具,暴露网关)⚠️ 仅客户端
A2A 协议✅ server(6 技能)⚠️ 客户端
Token 压缩RTK+Caveman 15–95%RTK 20–40%❌(仅 HTTP brotli)
OAuth 提供商16+5SSO6
容错层级3 层(熔断+冷却+锁定)⚠️ 仅冷却⚠️ 仅冷却⚠️ 仅冷却
记忆(FTS5+向量)⚠️ 语义缓存
Guardrails(PII/注入/视觉)⚠️
TLS 指纹伪装✅ wreq-js✅ utls
界面语言4243
TS / Next 16Node / Next 16PythonGo

LiteLLM 是 MCP/A2A 的客户端(去调用别人),OmniRoute 是服务端(把自己暴露为 104 个工具 / 6 项技能)。

2.12 局限

  • 免费池不是前沿模型(上限约等于 Gemini 2.5 Pro / DeepSeek 档);
  • 免费层无 SLA,晚高峰顶级免费模型撞每日配额后整体质量下降;
  • OAuth 订阅转 API 有封号风险(见风险提示);
  • Next.js 全家桶比 Node 单进程重,树莓派上资源占用高于 FreeLLMAPI。

三、免费额度玩家大全(两家通用的选商参考)

免费额度数字随时会变,以下为 2026 年中的公开数据,动手前请以各厂商官网为准。

3.1 第一梯队:量大、稳定、好上手

Groq —— "极速推理"的代名词

背景:2016 年由前 Google TPU 工程师创立(创始人之一 Jonathan Ross 参与过 Google 第一代 TPU),总部加州。它不做模型,而是做芯片——自研 LPU(Language Processing Unit),一种专为 LLM 推理设计的处理器,不走传统 GPU 路线,能把 Llama、Qwen、GPT-OSS 等开源模型跑到 500–1000+ tokens/秒。2025 年 9 月融资 7.5 亿美元、估值 69 亿美元,服务 200 万+ 开发者,连 McLaren F1 车队都用它做实时比赛数据分析。商业模式是卖 LPU 硬件给企业,免费 API 本质是"硬件展示窗口"——这解释了为什么免费层长期慷慨。

免费额度(无需信用卡,按模型限流,按"组织"计算——多开 key 不叠加,UTC 午夜重置):

模型RPMRPDTPM
llama-3.1-8b-instant3014,4006,000
llama-3.3-70b-versatile301,00012,000
Llama 4 Scout 17B301,00030,000
Qwen3 32B601,0006,000
GPT-OSS 20B/120B301,0008,000
Kimi K2 Instruct601,00010,000
groq/compound(Agent 系统)3025070,000
Whisper v3 / v3-turbo(语音转写)202,000 次/天

玩转要点:限流是"二维先到先得"——一分钟内发 30 个小请求就撞 RPM,即使 TPM 没满;8B 模型单日 14,400 次请求是最宽松的"勤杂工";Whisper 每天 2000 次语音转写(约合每小时两小时音频)是全平台最慷慨的免费 STT;prompt 缓存的 token 不计入 TPM 限额,长 system prompt 重复调用可白嫖缓存。付费开发版约 10 倍额度且解锁 Batch API(半价批处理)。局限:模型全为开源(智能上限不高),没有旗舰闭源模型。

Cerebras —— "全球最快推理"

背景:美国 AI 芯片公司,与 Groq 并称"推理速度双雄"。它造的是 WSE 晶圆级引擎——把整张晶圆做成一块芯片,面积是普通 GPU 的 58 倍,有史以来最大的 AI 芯片,推理速度 2000+ tokens/秒(部分模型 2600+),自称全球最快。不像 Groq 的历史包袱,它 2026 年 4 月才推出免费层,直接给出每天 100 万 token 的永久免费套餐。

免费额度每天 100 万 token(30 RPM / 60K TPM / 1M TPD),无信用卡。模型:Llama 4 Scout、Qwen3 32B、DeepSeek R1 Distill、GPT-OSS 等开源模型。中国访问需代理。

点评:日流量免费层冠军,长上下文/大 prompt 场景最合适;隐私画像与 Groq 相同(开源模型 + 芯片公司主业,训练动机弱)。

Google Gemini —— 额度最慷慨,但数据条款要看清

背景:Google 自家 Gemini 系列。免费层曾是开发者首选,2025 年底大幅削减(部分模型 RPD 砍 80–92%),且限额按 Google Cloud 项目计算,不按 API key——多开 key 不翻倍。重置时间太平洋时间午夜(北京时间下午 3–4 点)。官方明确"实际容量可能波动(actual capacity may vary)",实时限额以 AI Studio 项目视图为准。

免费额度(2026 年初公开数据):

模型RPMRPD上下文
Gemini 2.5 Pro5100100 万 token
Gemini 2.5 Flash10250100 万 token
Gemini 2.5 Flash-Lite151,000100 万 token

(TPM 统一 25 万;Gemini 3 Pro 免费层不可用——AI Studio 网页体验 ≠ 免费 API;Flash/Flash-Lite 的 Google Search grounding 共享 500 RPD)

点评2.5 Pro 是免费池里智能上限第一梯队,复杂推理靠它兜底;Flash-Lite 每天 1000 次做高频杂活。两个隐私雷区:① 免费层条款明确"提示词与响应可用于改进 Google 产品"(训练);② 欧盟/英国/瑞士终端用户只能用付费服务。2026 年 9 月起标准 API key 被拒,需迁移到 auth key(不影响额度,只是认证方式)。

3.2 第二梯队:特色鲜明,按需补充

Mistral —— 欧洲 AI 旗帜,隐私合规标杆

背景:法国巴黎公司,欧洲 AI 旗帜,主打开源模型(Mistral Small/Large、Codestral 代码模型、Ministral 3B 等),受欧盟 GDPR 管辖。免费层叫 Experiment 计划:每模型 1 次请求/秒、50 万 tokens/分钟、每月 10 亿 tokens,注册需手机号验证。

点评:月额度量级惊人,适合跑量。但实验计划也要求同意数据用于训练——"GDPR 管辖"≠"不训练",只是合规约束更强(数据留存、可删除权、透明度义务)。需要欧洲合规背书时的首选。

OpenRouter —— "聚合器的聚合器"

背景:最大的模型聚合平台(非模型厂商),把几十家厂商的模型汇到一个接口,/models?supported_parameters=:free 能筛出全部免费模型。一个账号访问几十家,省去逐家注册。

点评入坑第一站——先试各家免费模型,锁定合口味的再单独注册拿直连 key。代价:请求多一层第三方(OpenRouter 服务器),隐私再加一级;免费模型随时下架。充 $10 可提高 RPM。

GitHub Models —— 用 GitHub 账号白嫖前沿模型

背景:微软旗下 GitHub 官方模型平台,登录即用,Playground 和 API 都免费。速率限制随 Copilot 订阅层级浮动:GPT 系约 10 RPM / 50 RPD,轻量模型(Llama、Phi)15 RPM / 150 RPD,单次输入 8000 token 上限。模型阵容:GPT-4o/4.1、gpt-5 系列、o3/o4-mini、Llama 3.1/4、DeepSeek-R1/V3、Grok、Phi 等几十款。

点评免费摸到 GPT-5 系闭源模型的最短路径,但额度小气(一天几十次),适合评测尝鲜。2025 年 6 月起支持按量付费与 BYOK 扩展。微软系数据用途条款建议自读。

Z.ai(智谱)与 ModelScope(魔搭)—— 国产阵营

Z.ai:清华系智谱海外实体,GLM 系列(GLM-4.x/4.5-Flash 免费、GLM-5),国内网络直连。ModelScope:阿里系模型平台,免费跑 Qwen3、DeepSeek V4、GLM-5,需阿里云 CN 账号绑定。两家都是国产合规路径,隐私条款相对可预期,但同样默认拿数据做模型改进。智谱新模型早期往往不给并发(受限于国内备案节奏)。

OpenCode Zen / SiliconFlow / Requesty / Qoder / Kilo Code / 百度 ERNIE —— 白嫖党福利位
  • OpenCode Zen:DeepSeek V4、Nemotron 3,无 token 上限(少见的大方);
  • Qoder AI:Qwen3-Max、Kimi-K2,无限免费(PAT + OAuth 双支持);
  • Requesty:GPT-OSS 120B、Nemotron,永久免费;
  • SiliconFlow 硅基流动:DeepSeek V3.2/R1 免费层(国内直连,注册门槛低);
  • Kilo Code:自动路由 + Tencent Hy3,免费永久;
  • 百度 ERNIE:ERNIE 4.0 永久免费(国产大厂里最爽快的)。
NVIDIA NIM / HuggingFace / Cloudflare / Cohere —— 补充位
  • NVIDIA NIM:算力巨头官方免费端点(约 40 RPM),模型轮换勤;
  • HuggingFace:开源社区大户,免费推理端点(Inference Providers),适合小模型批量跑;
  • Cloudflare Workers AI:边缘网络全球部署,50+ 模型每天 1 万 neurons(约 10K 次轻量请求),低延迟亮点;
  • Cohere:加拿大公司,企业级 RAG 场景(Command 系列 + rerank),免费层够轻度使用。

3.3 特殊梯队:无 key 匿名层与本地模型(隐私优先者的首选)

  • Pollinations:GPT、Llama、Claude 模型,无需 key(浏览器/公开 API 直调),社区项目,速率受限;
  • LLM7:匿名端点,无需注册;
  • OVH AI Endpoints:法国电信巨头 OVH 的免费端点,无需 key,受 GDPR 管辖——匿名 + 欧盟合规双 Buff。

三家能力普遍偏弱(开源小模型 + 公共共享池),适合中低难度任务。本地 Ollama / llama.cpp / LM Studio / vLLM:经任一网关的自定义提供商接入,数据零外流、可离线,上限只看你硬件。

3.4 渠道推荐与隐私风险五级表(重点)

档位渠道风险推荐度
第一档本地 Ollama / llama.cpp / vLLM零外流★★★★★ 敏感数据唯一选择
第二档匿名端点 Pollinations / LLM7 / OVH极低(无身份绑定)★★★★☆ 日常杂活
第三档Groq / Cerebras / NVIDIA(开源模型 + 硬件生意)低(训练动机弱)★★★★☆ 高频主力
第四档Mistral(GDPR 但实验计划同意训练)中(合规强但用数据)★★★☆☆ 合规场景
第五档Google / 智谱 / 阿里 / GitHub / 百度(大厂免费层)高(明确训练条款)★★☆☆☆ 仅非敏感内容

一句话原则:敏感数据走第一档(本地),日常流量走第二、三档,大厂免费层只跑无关紧要的内容——把隐私风险当成和额度一样需要"路由"的资源。 备用链就按这个顺序排:本地 → 匿名 → 硬件厂商 → 大厂。


四、双雄对比与选型建议

维度FreeLLMAPIOmniRoute
定位窄而深:29 家精选宽而全:330+ 厂商目录
免费容量~40 亿 tokens/月(估算口径)~15 亿 tokens/月(双周审计口径)
模型端点358 个1200+ 个
路由策略6 种(评分 + fallback)19 种(优先级/成本/随机/流水线等)
接入方式仅 API keyAPI key + 16+ OAuth 订阅额度
接口面OpenAI + Anthropic + Gemini/Ollama上者 + 视频/音乐/OCR/rerank/moderations
密钥安全AES-256-GCM 加密存储本地 SQLite
目录更新签名目录 Ed25519 验签、每日同步双周重新审计、仪表盘实时展示
独门绝技Claude Code 原生接入、桌面托盘 app、Fusion、60 语言RTK+Caveman 压缩省 15–95%、TLS 指纹伪装、3 级代理、记忆/护栏/Eval、A2A、42 语言
资源占用轻(~40MB RSS,树莓派可跑)重(Next.js 全家桶)
端口300120128
商业模式免费 + Premium 实时目录(\(19/年或\)49 终身)纯免费
社区1.8 万+ Star500+ 贡献者

怎么选:

  • 要最大免费容量、要跑 Claude CodeFreeLLMAPI:40 亿 tokens/月是免费池天花板,Anthropic wire format 对 Claude Code 支持最顺,密钥加密与签名目录让人放心。
  • 要厂商覆盖面、要订阅额度白嫖、要花哨功能OmniRoute:OAuth 接 Claude/Copilot/Cursor 订阅额度、19 种路由策略、token 压缩,重度玩家首选(注意订阅转 API 的封号风险)。
  • 两个都装:端口不冲突(3001 vs 20128),可并行跑;或主用其一、另一冷备。
  • 树莓派 / 低配小主机 → 优先 FreeLLMAPI(轻量);主力开发机 → OmniRoute 的功能全家桶更值。

五、实战配置速查

5.1 Claude Code 接入

FreeLLMAPI

npx freellmapi setup-claude --url http://localhost:3001 --api-key <unified-key>
# 或零持久化启动
npx freellmapi launch

OmniRoute(MCP 方式):

claude mcp add-server omniroute --type http --url http://localhost:20128/api/mcp/stream

5.2 Codex CLI 接入

# FreeLLMAPI
npx freellmapi setup-codex --url http://localhost:3001 --api-key <unified-key>
# OmniRoute:base_url 指到 localhost:20128/v1,模型填 auto。

5.3 500 行内自建网关后端代码示例(FreeLLMAPI)

from openai import OpenAI

client = OpenAI(
    base_url="http://localhost:3001/v1",
    api_key="freellmapi-your-unified-key",
)

# 流式 + 路由信息
stream = client.chat.completions.create(
    model="auto:fast",
    messages=[{"role": "user", "content": "写一首关于树莓派的诗"}],
    stream=True,
)
for chunk in stream:
    print(chunk.choices[0].delta.content or "", end="")

六、风险提示(务必知悉)

  1. 违反厂商服务条款(ToS)风险:免费额度是为开发者原型试用设计的——多数厂商不认可"个人单用户代理"这层用法;OmniRoute 的 OAuth 订阅转 API(Claude/Copilot/Cursor)风险最高,是明确的 ToS 灰色地带。批量消费免费额度轻则限流、重则封号,责任自负。FreeLLMAPI 文档逐厂商做过多轮 ToS 审查(详见 docs/architecture.md#terms-of-service-review)。
  2. 数据隐私风险:key 存本机、请求直达上游,但内容会经过多家第三方——Google 免费层有明确训练条款、Mistral 实验计划同样要求同意数据训练。敏感数据务必只走本地模型。
  3. 稳定性风险:无 SLA、延迟波动大、单一厂商随时停发免费额度;免费池没有前沿旗舰模型(上限约 Gemini 2.5 Pro / DeepSeek 档);傍晚顶级免费模型撞每日配额后"智能水平"整体下降,UTC 午夜重置。把免费层当成原型入口,不要当生产基座。
  4. 合规风险:国内用户使用境外服务商可能涉及合规问题(ModelScope 需阿里云 CN 绑定、Cerebras 等需代理);生产环境无商业级兜底。面向欧盟终端用户时,Google 免费层不可用。

七、小结

FreeLLMAPI 与 OmniRoute 是同一思路的两种极致:前者把 29 家免费额度堆成每月 40 亿 token 的"免费算力池",后者把 330+ 厂商塞进一个端点再配上一整套路由军火库。对开发者来说,它们既是省钱利器,更是多模型路由设计的活教材——19 种路由策略、签名目录、OAuth 额度池、token 压缩管线,每一项都能拆出来当架构课。

但请记住:"免费午餐"的本质是拿隐私和稳定性换成本——个人实验随便玩,生产环境请务必切换到付费 API;日常使用按隐私分级挑选渠道,敏感数据留给本地模型。