汇集34家提供商、635个免费端点于单一/v1接口,智能路由+自动故障切换+加密存储密钥,月均路由74亿token。
每月 74 亿 token。34 家免费 LLM 提供商。635 个免费模型端点。一个 OpenAI 兼容端点。
汇聚数十家提供商的免费用量层级,加上自定义 OpenAI 兼容 chat、embedding、image 和 audio 端点,全部通过单一的 /v1 API 对外提供服务。密钥以加密形式存储。路由器会为每个请求挑选当前最优的可用模型,当某个提供商触发限速时自动切换到下一家,并追踪每个密钥的用量以确保不超过各免费层级的配额上限。
freellmapi.co · 浏览完整目录:474 个模型系列,635 个免费端点

你的路由器从一个签名源自动更新模型目录:新的免费模型、配额变更和兼容性修复无需执行 git pull 即可生效。免费安装用户获取每月快照,因此一个模型在加入实时源后 30 天才会触达他们;高级路由器则在当天同步。立即上线 freellmapi.co($19/年,随时取消)。
兼容的 CLI 和编码智能体
兼容 OpenAI 的客户端
高级版(实时目录)
指南:安装与部署 · API 参考 · 客户端与编码智能体 · Prompt 压缩 · 架构与内部原理 · 文档索引 · 贡献者指南
目前每一家正经的 AI 实验室都提供免费层级,每月数百万 token、每天数千次请求。单独看,每个层级都只是个玩具。但堆叠在一起,它们加起来每月可提供约 74 亿 token 的有效推理容量,涵盖 474 个模型系列/635 个提供商端点,从小而快到具备一定能力的各种模型。
问题在于手动堆叠这些服务非常痛苦:34 套不同的 SDK、34 套不同的速率限制、34 处可能出错的请求点。FreeLLMAPI 将这些收敛为一个 OpenAI 兼容端点。将任何 OpenAI 客户端库指向你的本地服务器,它就会透明地在你添加过密钥的各提供商之间路由请求。
免费层级的格局每周都在变化:提供商上线模型、下线模型、悄无声息地调整配额。FreeLLMAPI 为你追踪这一切。路由器自行从 freellmapi.co 拉取签名的模型目录,所以你的安装无需 git pull 就能跟上变化。参见高级版(实时目录)了解同步速度。

……以及另外 22 家免费提供商
加一个自定义 provider——从「密钥」页面将 chat、embedding、image 或 audio 模型指向任意 OpenAI 兼容端点(llama.cpp、LM Studio、vLLM、本地 Ollama 或远程网关)。
完整的实时列表参见 freellmapi.co/models,包含每个模型的速率限制、上下文窗口和免费 token 配额。
兼容的 CLI 和编码智能体
……以及任意 OpenAI 兼容客户端、Anthropic SDK、Gemini SDK 或支持 Ollama 的应用
其中大多数只需一条命令即可完成自配置——npx freellmapi setup-claude、setup-codex、setup-aider、setup-dsh(DeepSeek Harness),以及另外十一种生成器,它们会获取你的实时目录、备份现有配置,且绝不会覆盖已有的内容。Claude Code 和 Codex 还提供零持久化启动器(freellmapi launch、freellmapi launch-codex),仅将凭证注入子进程。Zed 和 JetBrains AI 通过可选的 Ollama 模拟层连接;Gemini CLI 在 /v1beta 上使用其原生协议。
每个工具的配方、setup CLI 参考、无头部客户端的可撤销 URL 令牌,以及 MCP 服务器均位于「客户端与编码智能体」→

基于 2026 年 7 月的公开文档——欢迎纠错。

每一种 OpenAI 风格接口——/v1/chat/completions、/v1/responses(Codex CLI 所需)、/v1/completions(编辑器 ghost-text 自动补全)、/v1/images/generations、/v1/videos/generations、/v1/audio/speech、/v1/audio/transcriptions、/v1/embeddings 和 /v1/models——流式和非流式响应,兼容官方 SDK 或任意 OpenAI 兼容客户端。API 参考 →
Anthropic Messages API — /v1/messages 通过同一路由器承载 Anthropic 的有线格式,因此 Claude Code 和官方 Anthropic SDK 可以在你的免费池中运行。详情 →
原生 Gemini + Ollama 接口 — Gemini CLI 可使用 /v1beta(generateContent、流式、token 计数、模型),可选启用的 Ollama 模拟层提供 NDJSON chat/generate、tags、metadata 和 embedding,用于 Zed、JetBrains 和其他本地模型客户端。
Fusion(多模型合成)— 请求虚拟 fusion 模型,路由器会将你的 prompt 并行分发到一组多样化的免费模型,然后由裁判模型从各草稿中综合出一份答案。详情 →
图像、视频和语音生成 — /v1/images/generations、/v1/videos/generations 和 /v1/audio/speech 在提供媒体模型的提供商之间路由;图像和语音也接受自定义 OpenAI 兼容媒体端点。视频任务在同步和队列提供商之间标准化处理,返回完成的 MP4 文件。
工具调用和结构化输出 — OpenAI 风格工具跨提供商往返(纯文本工具调用会被拯救为真实的 tool_calls),加上 response_format、seed、logprobs、惩罚参数及其他采样参数按提供商透传。
智能路由,六种策略 — 实时按模型速度/能力/可靠性评分排列你的链路;自动故障转移在遇到 429/5xx 时用冷却时间和密钥轮换重试下一个模型。路由详解 →
统一模型与配置文件 — 同一模型在多个提供商上合并为一个条目,具备严格的组内故障转移;命名回退链配置文件(一条编程链、一条视觉链)可通过仪表板切换或按请求通过 auto:<profile> 切换。
按密钥的速率追踪 — 每个(平台、模型、密钥)的 RPM/RPD/TPM/TPD 计数器学习提供商报告的上限,使路由始终保持在每个配额之下。
自更新模型目录 — 路由器每天两次从 freellmapi.co 同步签名目录:新模型、配额变更和提供商怪癖修复自动落地。免费安装追踪每月快照,每个模型在进入实时源 30 天后才触达他们;高级路由器当天同步。高级版 →
粘性会话和上下文交接 — 对话在同一模型上保持 30 分钟;可选的压缩交接注释在线程中途切换时保持连贯。详情 →
Prompt 压缩(可选)— 一个共享的、故障开放的请求管道可在缓存查找和路由之前去重 prompt、过滤工具输出、压缩重复 JSON 并裁剪过时上下文。详情 →
加密密钥,单一出 token — 提供商密钥以 AES-256-GCM 加密存储在 SQLite 中,每个请求在内存中解密;你的应用只看到一个统一的 freellmapi-… bearer token。
管理仪表板与分析 — React UI 管理密钥、重排序链路、运行 playground 并读取 24 小时至 90 天窗口内的 p50/p95/TTFT 分析;登录鉴权、明暗主题、60 种语言。
MCP 服务器和交互式文档 — 智能体可通过 /mcp 内省可用模型、提供商健康状况和路由策略;无依赖的 OpenAPI 查看器位于 /v1/docs。编码智能体 →
运维便利 — 可选启用的响应缓存、加密数据库备份、定期密钥健康检查、批量密钥导入/导出、声明式启动配置。安装与部署 →
运行在任何 Node 20+ 能跑的地方 — Windows、macOS、Linux 服务器,或小型 ARM SBC(含树莓派)。空闲时约 40 MB RSS,可接 PM2 / systemd 或任意你喜欢的监管进程。
范围有意收窄——参见尚未支持的功能。
一行命令安装(需要 Docker——会在 ~/freellmapi 创建目录、生成加密密钥、拉取镜像并启动容器):
curl -fsSL https://freellmapi.co/install.sh | bash
不想直接跑 bash?想先看看脚本内容?戳这里。重复运行是安全的:你的 .env(和加密密钥)会被保留,容器会更新到 :latest。
打开 http://localhost:3001,在 Keys 页面添加你的 Provider 密钥、按需调整 Fallback Chain,然后从页面顶部的 Keys 处获取你的统一 API key。这个统一密钥就是你要配置给 OpenAI SDK 使用的。
Windows 上最简便的方式是从 Releases 下载桌面 .exe 安装包(见下方)。Android 用户请参阅实验性的 Termux 指南。
其他所有内容——Docker Compose、本地开发、声明式启动配置、生产构建、局域网访问和备份——都在 docs/install.md 中。
桌面端还有一个原生菜单栏应用,位于 desktop/:整个路由和仪表盘以托盘常驻方式本地运行,玻璃弹出层实时展示请求统计。

从 Releases 下载——macOS 的 .dmg 和 Windows 的 .exe 安装包都附在每次发版中。无需注册账号或设置密码:唯一需要的凭证是托盘弹出层里的统一 API key。源码构建步骤和数据存放位置:docs/install.md。
兼容所有 OpenAI 兼容客户端
任何能配置 OpenAI 兼容 base URL 的客户端都能用:填入 http://localhost:3001/v1 并配上仪表盘里的统一密钥。Claude Code、Codex CLI、Cline / Roo Code、Continue(含内联自动补全)、Aider、opencode 和 Cursor 各自在 docs/clients.md 中有简短的配置示例——同时这个路由本身也是一个 MCP Server,你的 AI 智能体可以在会话中途对其进行内省。
最快的初始化方式是从你的在线服务器上可用模型自动生成配置:
npx freellmapi setup-claude --url http://localhost:3001 --api-key <unified-key>
每个生成器都支持 --dry-run,在修改现有文件前会创建带时间戳的备份,并合并到用户配置中。启动器完全不把凭证写入配置文件:npx freellmapi launch 用于 Claude Code,npx freellmapi launch-codex 用于 Codex。
FreeLLMAPI 设计上优先本地运行、单一用户。您的 Provider 密钥加密存储在 SQLite 数据库中,请求从您的机器直接发往您启用上游 Provider。
仪表盘支持 60 种语言(桌面托盘菜单支持 6 种)。界面在首次加载时自动检测浏览器/系统语言,之后随时可通过 ⋯ → Settings 切换;语言选择会被记住。从右向左书写的语言(العربية、עברית、فارسی、اردو)会自动翻转整个布局,而且只加载当前语言对应的词典——其余语言完全不会消耗您的带宽。
完整的语言列表在 client/src/i18n/locale-config.ts。
最初的六个语言包经过人工审核;较新的语言包由机器翻译,原住民纠正后会逐步改进——提交一个字符串的 PR 就是很好的首次贡献。
翻译文件位于 client/src/i18n/locales/,以扁平 JSON 文件形式存储。修正某个字符串时,编辑对应语言包的 JSON 中的 value。要添加语言,复制 en.json,翻译所有 value,然后在 client/src/i18n/locale-config.ts(桌面端托盘字符串还需在 desktop/src/i18n.ts)中注册该语言;npm test 会检查每个语言包的 key 和占位符是否一致——欢迎提交 PR。
高级版(实时目录)
路由器自动保持模型目录新鲜:每天两次从 freellmapi.co 拉取签名目录,并将新模型、配额变更和 Provider 怪癖修复应用到本地数据库。您自己的启用/禁用选择和自定义 Provider 永远不会被改动,每次下载在应用前都会用固定的 Ed25519 密钥验证签名。
目前目录追踪了 34 个 Provider、474 个模型系列、635 个免费 Provider/模型端点(584 个聊天、41 个嵌入、7 个语音转录、3 个视频),以及每月约 74 亿 Token 的listed免费层级额度。可以在 freellmapi.co/models 浏览完整列表。
免费安装同样拉取签名目录,但来自月度快照:某个模型进入实时源后 30 天才会加入快照,所以免费构建目前落后约 303 个模型。没有什么会过期或被阉割——只是来得晚一些。
高级版让每个路由器的签名目录保持最新。当某个 Provider 上线了强的免费模型、静默收紧了配额或破坏了wire格式时,实时源路由器会在我们发布更新的当天收到通知。
前往 freellmapi.co → 开通
每年 $19 或一次性 $49,终身有效。Stripe 支付;随时取消、自助管理。
一个 fla_ key 覆盖你运行的所有路由器:桌面端、家用服务器、Raspberry Pi。
在仪表盘的 Premium 下激活;在 freellmapi.co/manage 自助取消或管理账单。
路由器本身保持 MIT 协议、完全免费。高级版只是实时源,而且它正是资助每日模型测试和目录维护的资金来源,让目录始终可用。
目录服务器永远不会看到你的提示词、回复或 Provider 密钥——无论哪种模式,路由器都完全自托管。
from openai import OpenAI
client = OpenAI(
base_url="http://localhost:3001/v1",
api_key="freellmapi-your-unified-key",
)
resp = client.chat.completions.create(
model="auto", # 让路由器选择;也可指定 "auto:fast"、"auto:smart"、某个 profile 或模型 ID
messages=[{"role": "user", "content": "用一句话概括罗马的衰落。"}],
)
print(resp.choices[0].message.content)
print("Routed via:", resp.headers.get("x-routed-via"))
流式输出、auto:* 路由策略、工具调用、视觉输入、Gemini Google Search 接地、嵌入以及 Anthropic Messages 表面的用法——每种都有 curl 和 Python 示例——全部在 docs/api.md 中。每个响应都带有一个 X-Routed-Via: <platform>/<model> 头,这样你就能看到实际提供服务的 Provider。
选择一种路由策略,观察每月 Token 预算如何在整个 Provider 舰队中消耗。每个模型都显示实时可靠性、速度和智能评分——下图中的顺序就是当前请求的实际路由方式。

管理 Provider 凭证,获取你的应用需要连接的统一 API key。每个 key 都有状态指示点和最后一次健康检查的时间。

通过路由器发送一个聊天补全请求,就能看到是哪个 Provider 服务的,模型 ID 和延迟直接打印在消息上。可以通过按钮上传文件、拖拽或粘贴:图片(PNG/JPEG/WebP/GIF)在浏览器中缩小后作为图片内容部分发送给支持视觉的模型,文本文件(TXT/MD/CSV/JSON/LOG)则以围栏代码块的形式内联到提示词中。

24 小时 / 7 天 / 30 天 / 90 天窗口内的请求量、成功率、输入/输出 Token 数、平均延迟以及各 Provider 分解。


一个请求进入,最佳免费模型输出:路由器选择优先级最高且密钥健康且未超所有限额的模型,在内存中解密密钥,然后调用 Provider——遇到 429/5xx 时将该密钥冷却,然后重试链中下一个模型。组件详解、路由内部机制和运维细节在 docs/architecture.md。
需要密码吗?桌面应用不需要——仪表盘用一个隐藏的本地账户自动登录,所以无需设置、无需记住任何东西。从托盘图标 → Open Dashboard 打开即可。服务器安装(Docker、一行命令、npm run dev)确实有邮箱+密码账户。
我忘了服务器安装的密码。在登录页面点击 Forgot password?。没有邮箱可以发链接,所以一次性验证码会打印到服务器日志——用 docker compose logs -f freellmapi 查看(或者在看运行服务器的终端,或桌面日志文件中),然后在重置表单中输入。验证码有效期 15 分钟。
日志在哪里?Docker 方式在容器日志中,源码运行在终端,桌面应用在 <数据目录>/logs/freeapi.log——可从托盘菜单的 Open Logs Folder 打开。
如何卸载?删除应用(macOS 扔进垃圾桶、Windows 在设置 → 应用中卸载、Docker 用 docker compose down -v),然后删除数据目录:%APPDATA%\FreeLLMAPI\、~/Library/Application Support/FreeLLMAPI/ 或 ~/.config/FreeLLMAPI/。卸载本身不会触碰这些文件夹。
更长的答案、各安装方式的细节见:docs/install.md#faq-passwords-logs-uninstall。
叠加免费额度有真实的权衡:没有前沿模型、延迟不稳定、没有 SLA——而且在当天靠后时段,随着顶级模型触达每日限额,终点智能会下降,然后在 UTC 零点重置。在基于此构建真正项目之前,请先阅读 docs/architecture.md#limitations 中的坦诚清单。
非常欢迎贡献者!参见 CONTRIBUTING.md,了解开发循环、PR 期望以及关于 AI/LLM 辅助贡献的政策(简要版:欢迎,但质量门槛与其他 PR 相同)。适合作为首次 PR 的起点:
添加一个 provider —— 复制 server/src/providers/openai-compat.ts 作为模板,接入 server/src/providers/index.ts,在 server/src/db/index.ts 中为其模型种子数据,在 server/src/tests/providers/ 中添加测试。
添加一个端点 —— 审核(moderations)和其他 OpenAI 兼容面。provider 基类可以生长出新方法;adapters 声明自己支持哪些。
改进路由器 —— 成本感知路由(最便宜-最健康-最快权衡)、更好的延迟加权优先级、区域固定。
仪表盘优化 —— 分析页面的图表、密钥轮换 UX、从 .env 批量导入密钥。
文档 —— 更多示例、Go/Rust 等的客户端库片段、Docker 或 Fly 的部署配方。
npm install && npm run dev 即可在 :3001 启动服务器、在 :5173 启动仪表盘,两者都支持 HMR。要获得可重复的设置,在 Bash 上使用 ./scripts/dev-bootstrap.sh,在 PowerShell 上使用 .\scripts\dev-bootstrap.ps1;每个脚本都会保留现有的 .env。PR 应包含测试,保持现有套件绿色(npm test),并遵循仓库中已有的 .editorconfig / tsconfig 默认值。数据库迁移工作流和完整贡献者循环参见 CONTRIBUTING.md。
本项目仅供个人实验和学习,不适用于生产环境。免费额度的存在是为了让开发者能够基于它们进行原型开发;它们不是一个稳定的、有支持的推理底层,不应被当作这样的东西。如果你基于 FreeLLMAPI 构建了真正的项目,在发布前换用付费 API。你与每个上游提供商的关系受你创建账户时接受的条款约束——当流量通过本项目代理时,那些条款仍然适用,你有责任遵守它们。
各提供商的服务条款如何对待个人、单用户的代理——2026 年 5 月逐一审查——见 docs/architecture.md#terms-of-service-review。