FreeLLMAPI 实测:34 家免费模型 1 个端点搞定

你有没有算过,现在主流 AI 实验室加起来每月给你多少免费 token?答案是大概 74 亿。Google 给一些,Groq 给一些,Cerebras、SambaNova、Mistral、GitHub Models,每个都有一点。但 34 个不同的 SDK、34 套限速规则、34 个可能出错的地方,手动管理简直是噩梦。

最近我挖到一个叫 FreeLLMAPI 的开源项目,它把 34 家 LLM 提供商的免费额度全聚合到一个统一的 OpenAI 兼容端点后面,智能路由、自动故障转移、密钥加密都帮你处理好了。我照着文档跑了一遍,说说我的实际感受。

01 它到底是什么

FreeLLMAPI 是一个自托管的 API 网关,不是什么新的聊天界面。它在你本地跑一个服务,把 Google、Groq、Cerebras、Mistral、OpenRouter、Cloudflare、Cohere、HuggingFace、智谱 Z.ai、ModelScope 等 34 家 AI 厂商的免费额度全部接进来,对外暴露一个标准的 OpenAI 兼容 /v1 端点。

你需要做的是去各家注册账号、拿到免费 API Key,填进 FreeLLMAPI 的管理面板。剩下的它全包:哪个模型当前可用、哪个 Key 快限流了、请求该路由到哪家、失败了自动切下一个。你的应用只需要对着一个 freellmapi-... 的统一 token 发请求,跟调 OpenAI 一模一样。

目前 MIT 协议开源,GitHub 上 6k+ star,最新版本 v0.9.0,更新挺活跃。作者 Tashfeen Ahmed 是微软的高级产品设计师。

02 核心能力

这部分是它的重头戏,几个能力把多模型管理的痛点基本覆盖了。

统一 OpenAI 兼容端点。支持 /v1/chat/completions/v1/responses(Codex CLI 需要的)、/v1/completions(编辑器自动补全)、/v1/embeddings/v1/models,还有图像生成、视频生成、语音合成和转录。流式非流式都支持,任何 OpenAI 兼容客户端都能直接用。

Anthropic 和 Gemini 原生接口。除了 OpenAI 格式,它还支持 /v1/messages(Anthropic 协议),所以 Claude Code 和官方 Anthropic SDK 也能跑在你的免费池上;Gemini CLI 可以用 /v1beta 原生接口。甚至还带 Ollama 模拟,Zed、JetBrains AI 这些本地模型客户端也能接。

智能路由 + 自动故障转移。6 种路由策略,实时按速度、能力、可靠性给模型打分排序。某个提供商返回 429(限流)或 5xx(服务端错误)时,自动重试下一个模型,带冷却时间和 Key 轮换。你不用手动盯着哪个 Key 又超限了。

Fusion 多模型合成。请求虚拟的 fusion 模型,路由器会把你的 prompt 并行发给一组不同的免费模型,再由一个 judge 模型从多个草稿里合成一个答案。免费模型也能跑出比单模型更好的质量,代价是 token 消耗更快。

按密钥速率追踪。每个(平台、模型、Key)组合都有 RPM/RPD/TPM/TPD 计数器,会学习各家上报的上限,路由时始终保持在每个免费额度的天花板以下,不会因为超限被封。

加密密钥 + 统一 token。所有提供商的 API Key 用 AES-256-GCM 加密存在本地 SQLite 里,每次请求才在内存里解密。你的应用永远只看到一个统一的 freellmapi-... bearer token,真实密钥不会泄露给应用层。

自更新模型目录。路由器每天两次从 freellmapi.co 同步签名的模型目录,新模型上线、配额变更、提供商兼容性修复,不用 git pull 就能自动跟上。免费版跟踪月度快照(新模型延迟 30 天),高级版当天同步。

核心能力

03 支持的提供商和兼容工具

目前支持 34 家免费 LLM 提供商,635 个免费模型端点,474 个模型家族。主要包括:Google(Gemini 系列)、Groq、Cerebras、SambaNova、NVIDIA、Mistral、OpenRouter、GitHub Models、Cohere、Cloudflare Workers AI、HuggingFace、智谱 Z.ai、Ollama、Kilo、Pollinations、LLM7、OpenCode Zen、ModelScope(Qwen3、DeepSeek V4、GLM-5,需要阿里云绑定)等。

除了内置提供商,它还支持自定义提供商,任何 OpenAI 兼容端点都能接进来,比如本地的 llama.cpp、LM Studio、vLLM、Ollama,或者远程网关。

兼容的编码 Agent 和 CLI 也很全:Claude Code、Codex CLI、Gemini CLI、Aider、Cline、Roo Code、Continue、OpenCode、Goose、Qwen Code、Kilo Code、Crush、Cursor、Zed、JetBrains AI、DeepSeek Harness。大部分工具一条命令就能配置好,比如 npx freellmapi setup-claudesetup-codexsetup-aider,会自动备份现有配置、拉取实时目录、绝不覆盖你已有的设置。

04 部署方式

部署比我想象的简单,有几种方式可选。

一键脚本(推荐,需要 Docker)。一行命令搞定,会自动创建 ~/freellmapi 目录、生成加密密钥、拉取镜像、启动容器:curl -fsSL https://freellmapi.co/install.sh | bash。重复运行也安全,.env 和加密密钥会保留,容器更新到 latest。

桌面应用。macOS .dmg 和 Windows .exe 安装包,从 GitHub Releases 下载。整个路由器+管理面板跑在菜单栏里,带一个玻璃质感的弹出窗口显示实时请求统计。不用设账号密码,装完就能用。Windows 用户最省事的方式就是这个。

Docker Compose / 本地开发。需要更细粒度控制的可以看 docs/install.md,支持声明式启动配置、生产构建、局域网访问、加密备份等。

Android Termux。实验性支持,手机上也能跑。

启动后访问 http://localhost:3001,在 Keys 页面添加各家的 API Key,调整 Fallback Chain 的顺序,然后从页面头部复制统一 API Key,把你的 OpenAI SDK 的 base_url 指向本地服务就行。

运行环境要求很低:Node 20+,Windows/macOS/Linux/ARM 单板机(树莓派都行),空闲内存约 40MB。

部署方式

05 优点

说几个实在的地方。

免费额度聚合的威力是真的大。34 家加起来每月 74 亿 token,个人开发、做原型、跑小项目基本够用,不用再为 API 账单发愁。一个端点走天下,不用管理 34 套 SDK 和限速规则,切换模型零成本。

智能路由加自动故障转移很省心。某个提供商限流或挂了自动切下一个,不用手动盯着 Key 状态。密钥是 AES-256-GCM 加密存储的,应用只看到统一 token,真实密钥不会泄露。

兼容主流编码 Agent 这点很实用。Claude Code、Codex CLI、Cursor 等一条命令配置好,写代码也能白嫖免费额度。Fusion 多模型合成把免费模型组合起来,也能跑出不错的质量。

自托管的好处是数据都在你本地,不经过第三方服务器。而且它很轻量,40MB 空闲内存,树莓派都能跑,桌面应用一键安装。MIT 协议,桌面应用和自托管都免费。新模型不用 git pull 就能自动跟上。

优点

06 缺点和坑

也有几盆冷水要泼。

免费额度不是无限的。每家都有速率限制和月度配额,74 亿是理论总和,实际用的时候单家可能很快就到上限,路由会频繁切换。

前期配置工作量不小。要去 34 家分别注册账号、验证邮箱、拿到 API Key,全部填进去得花点时间,不是装完就能用。免费版模型目录还有 30 天延迟,新模型上线后要等一个月才能在免费版里用,想第一时间体验得买高级版($19/年,可随时取消)。

免费模型能力有限。强模型如 GPT-4o、Claude 3.5 Sonnet 不在免费池里,免费池主要是各家的中小模型,复杂推理任务可能力不从心。

还有几个坑要留意。自托管意味着要有一台常开的电脑或服务器,手机端想用得自己做内网穿透。部分提供商的服务条款可能禁止通过代理聚合免费额度,有账号被封的风险。Fusion 消耗快,一次请求消耗多家的 token,额度用得比单模型快得多。项目还在 v0.x,API 和功能可能还会变,生产环境用要留意版本更新。国内网络环境下,Google、Groq、Cerebras 等部分提供商访问需要网络环境,不是所有 Key 都能直接连上。

07 获取方式

项目在 GitHub 上开源,建议先看官网和文档:

GitHub:https://github.com/tashfeenahmed/freellmapi

官网(模型目录和定价):https://freellmapi.co

完整文档:https://github.com/tashfeenahmed/freellmapi/blob/main/docs/README.md

桌面应用下载(macOS/Windows):https://github.com/tashfeenahmed/freellmapi/releases/latest

写在最后

折腾完这一圈,我的体感是:FreeLLMAPI 解决的不是”有没有免费模型用”的问题,而是”免费模型太散、管理太麻烦”的问题。34 家的免费额度单独看每家都不够用,但聚在一起、加上智能路由和自动故障转移,个人开发者做原型、跑小项目、写代码辅助,确实能省不少 API 费用。

但它不是银弹。免费模型能力有限、前期配 Key 麻烦、有 TOS 风险、需要常开服务器。做生产级应用、需要稳定强模型的话,还是得付费;个人开发者想低成本折腾 AI 工具、给编码 Agent 配个免费后端,它确实是个很实用的方案。

最后提醒两句:用之前看一下各家提供商的服务条款,避免账号被封;生产环境用务必做好密钥备份和数据安全,自托管的安全得自己把好。工具是开源免费的,但用它的边界和风险得自己清楚。

我是胖猫小栈,一个自己折腾 AI 工具的站长。这篇就到这儿,觉得有用的话,欢迎点赞、在看、转发,我们下篇见。

© 版权声明
THE END
喜欢就支持一下吧
点赞5 分享
评论 抢沙发

请登录后发表评论

    暂无评论内容