Free Cloudflare Workers AI API Key, Base URL & Rate Limits
Model ProviderCloudflare Workers AI runs open-weight models directly on Cloudflare's global edge network.
How to get a free Cloudflare Workers AI API key
- 1
- 2 Go to Workers & Pages → AI
- 3 Create an API token with Workers AI permissions
- 4 Pick a model Llama 3.2 3B and Mistral 7B are reliable choices.
- 5 Configure client Native run base URL: https://api.cloudflare.com/client/v4/accounts/YOUR_ACCOUNT_ID/ai/run. OpenAI-compatible base URL: https://api.cloudflare.com/client/v4/accounts/YOUR_ACCOUNT_ID/ai/v1
Provider Snapshot
Supported Models 39 models
View in directory →| Model ID | Developer | Context | Availability | Free Tier | Use cases |
|---|---|---|---|---|---|
| @cf/google/gemma-4-26b-a4b-it @cf/google/gemma-4-26b-a4b-it | 256K | Online | Yes | chat | |
| @cf/moonshotai/kimi-k2.7-code @cf/moonshotai/kimi-k2.7-code | Cloudflare Workers AI | 262K | Online | Yes | chatcoding |
| @cf/openai/gpt-oss-120b @cf/openai/gpt-oss-120b | Cloudflare Workers AI | 128K | Online | Yes | chatcoding |
| @cf/nvidia/nemotron-3-120b-a12b @cf/nvidia/nemotron-3-120b-a12b | Cloudflare Workers AI | 8K | Online | Yes | chat |
| @cf/baai/bge-large-en-v1.5 @cf/baai/bge-large-en-v1.5 | Cloudflare Workers AI | 8K | Online | Yes | chat |
| @cf/meta/llama-4-scout-17b-16e-instruct @cf/meta/llama-4-scout-17b-16e-instruct | Cloudflare Workers AI | 10.0M | Online | Yes | chat |
| @cf/mistralai/mistral-small-3.1-24b-instruct @cf/mistralai/mistral-small-3.1-24b-instruct | Cloudflare Workers AI | 128K | Online | Yes | chat |
| @cf/mistral/mistral-7b-instruct-v0.1 Mistral 7B | Cloudflare Workers AI | 33K | Online | Yes | chat |
| @cf/qwen/qwen1.5-7b-chat Qwen 1.5 7B | Cloudflare Workers AI | 33K | Online | Yes | chat |
| @cf/zai-org/glm-4.7-flash @cf/zai-org/glm-4.7-flash | Cloudflare Workers AI | 8K | Online | Yes | chat |
| @cf/qwen/qwq-32b @cf/qwen/qwq-32b | Cloudflare Workers AI | 8K | Online | Yes | chat |
| @cf/deepseek-ai/deepseek-r1-distill-qwen-32b @cf/deepseek-ai/deepseek-r1-distill-qwen-32b | DeepSeek | 32K | Online | Yes | chatreasoning |
| @cf/baai/bge-m3 @cf/baai/bge-m3 | Cloudflare Workers AI | 8K | Online | Yes | chat |
| @cf/google/gemma-2b-it-lora @cf/google/gemma-2b-it-lora | Cloudflare Workers AI | 8K | Online | Yes | chat |
| @cf/moonshotai/kimi-k2.6 @cf/moonshotai/kimi-k2.6 | Cloudflare Workers AI | 8K | Online | Yes | chat |
| @cf/ibm-granite/granite-4.0-h-micro @cf/ibm-granite/granite-4.0-h-micro | Cloudflare Workers AI | 8K | Online | Yes | chat |
| @cf/baai/bge-small-en-v1.5 @cf/baai/bge-small-en-v1.5 | Cloudflare Workers AI | 8K | Online | Yes | chat |
| @cf/zai-org/glm-5.2 @cf/zai-org/glm-5.2 | Cloudflare Workers AI | 8K | Online | Yes | chat |
| @cf/baai/bge-base-en-v1.5 @cf/baai/bge-base-en-v1.5 | Cloudflare Workers AI | 8K | Online | Yes | chat |
| @cf/aisingapore/gemma-sea-lion-v4-27b-it @cf/aisingapore/gemma-sea-lion-v4-27b-it | Cloudflare Workers AI | 8K | Online | Yes | chat |
| @cf/openai/gpt-oss-20b @cf/openai/gpt-oss-20b | Cloudflare Workers AI | 8K | Online | Yes | chat |
| @cf/moondream/moondream3.1-9B-A2B @cf/moondream/moondream3.1-9B-A2B | Cloudflare Workers AI | 8K | Online | Yes | chat |
| @cf/meta/llama-3.3-70b-instruct-fp8-fast @cf/meta/llama-3.3-70b-instruct-fp8-fast | Meta | 131K | Online | Yes | chat |
| @cf/qwen/qwen2.5-coder-32b-instruct @cf/qwen/qwen2.5-coder-32b-instruct | Cloudflare Workers AI | 8K | Online | Yes | chat |
| @cf/mistral/mistral-7b-instruct-v0.2-lora @cf/mistral/mistral-7b-instruct-v0.2-lora | Cloudflare Workers AI | 8K | Online | Yes | chat |
| @cf/meta-llama/llama-2-7b-chat-hf-lora @cf/meta-llama/llama-2-7b-chat-hf-lora | Cloudflare Workers AI | 8K | Online | Yes | chat |
| @cf/google/gemma-7b-it-lora @cf/google/gemma-7b-it-lora | Cloudflare Workers AI | 8K | Online | Yes | chat |
| @cf/qwen/qwen3-30b-a3b-fp8 @cf/qwen/qwen3-30b-a3b-fp8 | Cloudflare Workers AI | 8K | Online | Yes | chat |
| @cf/meta/llama-3.2-3b-instruct @cf/meta/llama-3.2-3b-instruct | Cloudflare Workers AI | 8K | Online | Yes | chat |
| @cf/meta/llama-3.1-8b-instruct-fp8 @cf/meta/llama-3.1-8b-instruct-fp8 | Cloudflare Workers AI | 8K | Online | Yes | chat |
| @cf/meta/llama-3.2-1b-instruct @cf/meta/llama-3.2-1b-instruct | Cloudflare Workers AI | 8K | Online | Yes | chat |
| @cf/meta/llama-guard-3-8b @cf/meta/llama-guard-3-8b | Cloudflare Workers AI | 8K | Online | Yes | chat |
| @cf/qwen/qwen3-embedding-0.6b @cf/qwen/qwen3-embedding-0.6b | Cloudflare Workers AI | 8K | Online | Yes | chat |
| @cf/pfnet/plamo-embedding-1b @cf/pfnet/plamo-embedding-1b | Cloudflare Workers AI | 8K | Online | Yes | chat |
| @cf/google/embeddinggemma-300m @cf/google/embeddinggemma-300m | Cloudflare Workers AI | 8K | Online | Yes | chat |
| cf-zhipuai-glm-4-7-flash @cf/zhipuai/glm-4.7-flash | Cloudflare Workers AI | 131K | Check provider | Yes | chat |
| cf-moonshotai-kimi-k2-5 @cf/moonshotai/kimi-k2.5 | Cloudflare Workers AI | 256K | Check provider | Yes | chat |
| cf-meta-llama-3-2-11b-vision-instruct @cf/meta/llama-3.2-11b-vision-instruct | Meta | 131K | Check provider | Yes | chatvision |
| cf-meta-llama-3-1-8b-instruct-fp8-fast @cf/meta/llama-3.1-8b-instruct-fp8-fast | Meta | 131K | Check provider | Yes | chat |
Developer Tools
Cloudflare Workers AI FreeLLM Score free API access score
How we score →What is Cloudflare Workers AI?
Edge AI inference — 10,000 neurons/day, 50+ models.
Cloudflare Workers AI runs open-weight models directly on Cloudflare's global edge network. The free tier allocates 10,000 Neurons (compute units) per day, supporting 50+ models including Llama, Mistral, Gemma, DeepSeek, and Qwen. Unlike other providers, billing is based on Neurons rather than tokens, making it hard to predict exact request counts. Ideal for low-latency edge deployments.
- 50+ models on the free tier
- 10,000 Neurons/day
- Global edge network for low latency
- Text, image, audio, and embedding models
API Compatibility: Live-tested Cloudflare Workers AI native run and OpenAI-compatible Chat Completions
Cloudflare Workers AI Free Tier Limits & Pricing
Cloudflare Workers AI API Setup Tutorials
Cloudflare Workers AI is fully compatible with popular AI coding assistants like Cursor, Claude Code, and more. To see step-by-step API configuration instructions for your favorite tool, please visit our Global Configuration Guide →
Cloudflare Workers AI Model Use Cases
What Cloudflare Workers AI's free models are best for, based on aggregated model capabilities:
Cloudflare Workers AI Limitations & Caveats
- Neurons billing is opaque — hard to predict exact request counts
- Model availability varies by Cloudflare region
- 10,000 Neurons/day shared across all models
Cloudflare Workers AI FAQ
How many requests is 10,000 Neurons on Cloudflare Workers AI?
It depends on the model and prompt length. For Llama 3.2 3B with a 500-token prompt, ~10,000 Neurons ≈ 200-400 requests/day. Larger models consume more Neurons per request. Monitor your usage in the Cloudflare dashboard.
Do I need a Cloudflare Workers plan to use Workers AI?
No — the free Workers plan includes 10,000 Neurons/day for AI inference. You don't need to deploy any Workers code; just use the AI API endpoint directly.
Is Cloudflare Workers AI good for production?
The free tier is great for prototyping and low-volume apps. For production, the paid tier offers higher limits and SLAs. The edge network provides low global latency, which is a unique advantage.