free-llm-api-resources
收集了多个提供免费LLM推理API的服务,涵盖OpenRouter、Google AI Studio、NVIDIA NIM、Mistral、HuggingFace、Groq、GitHub Models等,并附有详细的速率限制和使用条件。亮点是统一整理免费额度、试用积分以及各服务支持的模型列表,方便开发者快速找到可用的免费API资源。注意:请勿滥用服务,且列表排除了逆向工程等非正规渠道。
README
免费 LLM API 资源
以下列出各项提供免费访问或 API 类型 LLM 使用积分的服务。
[!NOTE]
请勿滥用这些服务,否则我们可能会失去它们。
[!WARNING]
此列表明确排除任何不合法服务(例如逆向工程现有聊天机器人)。
免费提供商
OpenRouter
限制:
20 请求/分钟
50 请求/天
通过 10 美元终身充值可提升至 1000 请求/天
模型共享同一配额。
- Gemma 3 12B Instruct
- Gemma 3 27B Instruct
- Gemma 3 4B Instruct
- Hermes 3 Llama 3.1 405B
- Llama 3.2 3B Instruct
- Llama 3.3 70B Instruct
- baidu/qianfan-ocr-fast:free
- cognitivecomputations/dolphin-mistral-24b-venice-edition:free
- google/gemma-3n-e2b-it:free
- google/gemma-3n-e4b-it:free
- google/gemma-4-26b-a4b-it:free
- google/gemma-4-31b-it:free
- inclusionai/ling-2.6-1t:free
- liquid/lfm-2.5-1.2b-instruct:free
- liquid/lfm-2.5-1.2b-thinking:free
- minimax/minimax-m2.5:free
- nvidia/nemotron-3-nano-30b-a3b:free
- nvidia/nemotron-3-nano-omni-30b-a3b-reasoning:free
- nvidia/nemotron-3-super-120b-a12b:free
- nvidia/nemotron-nano-12b-v2-vl:free
- nvidia/nemotron-nano-9b-v2:free
- openai/gpt-oss-120b:free
- openai/gpt-oss-20b:free
- poolside/laguna-m.1:free
- poolside/laguna-xs.2:free
- qwen/qwen3-coder:free
- qwen/qwen3-next-80b-a3b-instruct:free
- tencent/hy3-preview:free
- z-ai/glm-4.5-air:free
Google AI Studio
在英国/瑞士/欧洲经济区/欧盟之外使用时的数据会用于训练。
| 模型名称 | 模型限制 |
|---|---|
| Gemini 3 Flash | 250,000 tokens/分钟 20 请求/天 5 请求/分钟 |
| Gemini 3.1 Flash-Lite | 250,000 tokens/分钟 500 请求/天 15 请求/分钟 |
| Gemini 2.5 Flash | 250,000 tokens/分钟 20 请求/天 5 请求/分钟 |
| Gemini 2.5 Flash-Lite | 250,000 tokens/分钟 20 请求/天 10 请求/分钟 |
| Gemini 3.1 Flash TTS | 10,000 tokens/分钟 10 请求/天 3 请求/分钟 |
| Gemini 2.5 Flash TTS | 10,000 tokens/分钟 10 请求/天 3 请求/分钟 |
| Gemini Robotics-ER 1.6 | 250,000 tokens/分钟 20 请求/天 5 请求/分钟 |
| Gemini Robotics-ER 1.5 | 250,000 tokens/分钟 20 请求/天 10 请求/分钟 |
| Gemma 3 27B Instruct | 15,000 tokens/分钟 14,400 请求/天 30 请求/分钟 |
| Gemma 3 12B Instruct | 15,000 tokens/分钟 14,400 请求/天 30 请求/分钟 |
| Gemma 3 4B Instruct | 15,000 tokens/分钟 14,400 请求/天 30 请求/分钟 |
| Gemma 3 1B Instruct | 15,000 tokens/分钟 14,400 请求/天 30 请求/分钟 |
NVIDIA NIM
需要验证手机号码。 模型通常有上下文窗口限制。
限制: 40 请求/分钟
Mistral (La Plateforme)
- 免费层级(实验计划)需选择允许数据训练
- 需要验证手机号码。
限制(每个模型): 1 请求/秒,500,000 tokens/分钟,1,000,000,000 tokens/月
Mistral (Codestral)
- 目前免费使用
- 基于月度订阅
- 需要验证手机号码
限制: 30 请求/分钟,2,000 请求/天
- Codestral
HuggingFace Inference Providers
HuggingFace Serverless Inference 仅限小于 10GB 的模型。部分流行模型即使超过 10GB 也支持。
限制: 每月 $0.10 积分
- 支持提供商中的各种开源模型
Vercel AI Gateway
路由到各种受支持的提供商。
限制: 每月 $5
OpenCode Zen
提供精选模型的 AI 网关。
免费模型可能会使用数据来改进。
- Big Pickle Stealth
- MiniMax M2.5 Free
- Arcee Large Preview Free
Cerebras
| 模型名称 | 模型限制 |
|---|---|
| gpt-oss-120b | 30 请求/分钟 60,000 tokens/分钟 900 请求/小时 1,000,000 tokens/小时 14,400 请求/天 1,000,000 tokens/天 |
| Llama 3.1 8B | 30 请求/分钟 60,000 tokens/分钟 900 请求/小时 1,000,000 tokens/小时 14,400 请求/天 1,000,000 tokens/天 |
Groq
| 模型名称 | 模型限制 |
|---|---|
| Allam 2 7B | 7,000 请求/天 6,000 tokens/分钟 |
| Llama 3.1 8B | 14,400 请求/天 6,000 tokens/分钟 |
| Llama 3.3 70B | 1,000 请求/天 12,000 tokens/分钟 |
| Llama 4 Scout Instruct | 1,000 请求/天 30,000 tokens/分钟 |
| Whisper Large v3 | 7,200 音频秒/分钟 2,000 请求/天 |
| Whisper Large v3 Turbo | 7,200 音频秒/分钟 2,000 请求/天 |
| canopylabs/orpheus-arabic-saudi | |
| canopylabs/orpheus-v1-english | |
| groq/compound | 250 请求/天 70,000 tokens/分钟 |
| groq/compound-mini | 250 请求/天 70,000 tokens/分钟 |
| meta-llama/llama-prompt-guard-2-22m | |
| meta-llama/llama-prompt-guard-2-86m | |
| openai/gpt-oss-120b | 1,000 请求/天 8,000 tokens/分钟 |
| openai/gpt-oss-20b | 1,000 请求/天 8,000 tokens/分钟 |
| openai/gpt-oss-safeguard-20b | 1,000 请求/天 8,000 tokens/分钟 |
| qwen/qwen3-32b | 1,000 请求/天 6,000 tokens/分钟 |
Cohere
限制:
模型共享同一月度配额。
- c4ai-aya-expanse-32b
- c4ai-aya-vision-32b
- command-a-03-2025
- command-a-reasoning-08-2025
- command-a-translate-08-2025
- command-a-vision-07-2025
- command-r-08-2024
- command-r-plus-08-2024
- command-r7b-12-2024
- command-r7b-arabic-02-2025
GitHub Models
输入/输出 tokens 限制极其严格。
限制: 取决于 Copilot 订阅层级(Free/Pro/Pro+/Business/Enterprise)
- AI21 Jamba 1.5 Large
- Codestral 25.01
- Cohere Command A
- Cohere Command R 08-2024
- Cohere Command R+ 08-2024
- DeepSeek-R1
- DeepSeek-R1-0528
- DeepSeek-V3-0324
- Grok 3
- Grok 3 Mini
- Llama 4 Maverick 17B 128E Instruct FP8
- Llama 4 Scout 17B 16E Instruct
- Llama-3.2-11B-Vision-Instruct
- Llama-3.2-90B-Vision-Instruct
- Llama-3.3-70B-Instruct
- MAI-DS-R1
- Meta-Llama-3.1-405B-Instruct
- Meta-Llama-3.1-8B-Instruct
- Ministral 3B
- Mistral Medium 3 (25.05)
- Mistral Small 3.1
- OpenAI GPT-4.1
- OpenAI GPT-4.1-mini
- OpenAI GPT-4.1-nano
- OpenAI GPT-4o
- OpenAI GPT-4o mini
- OpenAI Text Embedding 3 (large)
- OpenAI Text Embedding 3 (small)
- OpenAI gpt-5
- OpenAI gpt-5-chat (preview)
- OpenAI gpt-5-mini
- OpenAI gpt-5-nano
- OpenAI o1
- OpenAI o1-mini
- OpenAI o1-preview
- OpenAI o3
- OpenAI o3-mini
- OpenAI o4-mini
- Phi-4
- Phi-4-mini-instruct
- Phi-4-mini-reasoning
- Phi-4-multimodal-instruct
- Phi-4-reasoning
Cloudflare Workers AI
限制: 10,000 neurons/天
- @cf/aisingapore/gemma-sea-lion-v4-27b-it
- @cf/google/gemma-4-26b-a4b-it
- @cf/ibm-granite/granite-4.0-h-micro
- @cf/moonshotai/kimi-k2.5
- @cf/moonshotai/kimi-k2.6
- @cf/nvidia/nemotron-3-120b-a12b
- @cf/openai/gpt-oss-120b
- @cf/openai/gpt-oss-20b
- @cf/qwen/qwen3-30b-a3b-fp8
- @cf/zai-org/glm-4.7-flash
- DeepSeek R1 Distill Qwen 32B
- Deepseek Coder 6.7B Base (AWQ)
- Deepseek Coder 6.7B Instruct (AWQ)
- Deepseek Math 7B Instruct
- Discolm German 7B v1 (AWQ)
- Falcom 7B Instruct
- Gemma 2B Instruct (LoRA)
- Gemma 3 12B Instruct
- Gemma 7B Instruct
- Gemma 7B Instruct (LoRA)
- Hermes 2 Pro Mistral 7B
- Llama 2 13B Chat (AWQ)
- Llama 2 7B Chat (FP16)
- Llama 2 7B Chat (INT8)
- Llama 2 7B Chat (LoRA)
- Llama 3 8B Instruct
- Llama 3 8B Instruct (AWQ)
- Llama 3.1 8B Instruct (AWQ)
- Llama 3.1 8B Instruct (FP8)
- Llama 3.2 11B Vision Instruct
- Llama 3.2 1B Instruct
- Llama 3.2 3B Instruct
- Llama 3.3 70B Instruct (FP8)
- Llama 4 Scout Instruct
- Llama Guard 3 8B
- Mistral 7B Instruct v0.1
- Mistral 7B Instruct v0.1 (AWQ)
- Mistral 7B Instruct v0.2
- Mistral 7B Instruct v0.2 (LoRA)
- Mistral Small 3.1 24B Instruct
- Neural Chat 7B v3.1 (AWQ)
- OpenChat 3.5 0106
- OpenHermes 2.5 Mistral 7B (AWQ)
- Phi-2
- Qwen 1.5 0.5B Chat
- Qwen 1.5 1.8B Chat
- Qwen 1.5 14B Chat (AWQ)
- Qwen 1.5 7B Chat (AWQ)
- Qwen 2.5 Coder 32B Instruct
- Qwen QwQ 32B
- SQLCoder 7B 2
- Starling LM 7B Beta
- TinyLlama 1.1B Chat v1.0
- Una Cybertron 7B v2 (BF16)
- Zephyr 7B Beta (AWQ)
有试用积分的提供商
Fireworks
积分: $1
模型: 各种开源模型
Baseten
积分: $30
Nebius
积分: $1
模型: 各种开源模型
Novita
积分: $0.5,有效期 1 年
模型: 各种开源模型
AI21
积分: $10,有效期 3 个月
模型: Jamba 系列模型
Upstage
积分: $10,有效期 3 个月
模型: Solar Pro/Mini
NLP Cloud
积分: $15
要求: 手机号码验证
模型: 各种开源模型
Alibaba Cloud (International) Model Studio
积分: 每个模型 100 万 tokens
模型: 各种开源和专有 Qwen 模型
Modal
积分: 注册时每月 $5,添加支付方式后每月 $30
模型: 任何受支持的模型 - 按计算时间付费
Inference.net
积分: $1,回复邮件问卷可获 $25
模型: 各种开源模型
Hyperbolic
积分: $1
模型:
- DeepSeek V3 0324
- Llama 3.3 70B Instruct
- deepseek-ai/deepseek-r1-0528
- qwen/qwen3-coder-480b-a35b-instruct
SambaNova Cloud
积分: $5,有效期 3 个月
模型:
- Llama 3.3 70B
- Llama-4-Maverick-17B-128E-Instruct
- deepseek-ai/DeepSeek-V3.1
- deepseek-ai/DeepSeek-V3.1
- deepseek-ai/DeepSeek-V3.2
- google/gemma-3-12b-it
- minimaxai/minimax-m2.5
- openai/gpt-oss-120b
Scaleway Generative APIs
积分: 1,000,000 免费 tokens
模型:
- BGE-Multilingual-Gemma2
- Gemma 3 27B Instruct
- Llama 3.3 70B Instruct
- Pixtral 12B (2409)
- Whisper Large v3
- devstral-2-123b-instruct-2512
- gpt-oss-120b
- holo2-30b-a3b
- mistral-small-3.2-24b-instruct-2506
- qwen3-235b-a22b-instruct-2507
- qwen3-coder-30b-a3b-instruct
- qwen3-embedding-8b
- qwen3.5-397b-a17b
- voxtral-small-24b-2507