Overview
Fireworks AI provides fast inference for open-source LLMs and embedding models. The provider extends OpenAI’s interface with Fireworks AI’s API endpoints.Installation
Basic Usage
LLM
Embeddings
Constructor Options
FireworksLLM
string
default:"accounts/fireworks/models/mixtral-8x7b-instruct"
Fireworks AI model name
string
Fireworks API key (defaults to
FIREWORKS_API_KEY env variable)number
Sampling temperature
number
Maximum tokens in response
number
Nucleus sampling parameter
object
Additional OpenAI client options (e.g., custom baseURL)
FireworksEmbedding
string
default:"nomic-ai/nomic-embed-text-v1.5"
Fireworks AI embedding model name
string
Fireworks API key (defaults to
FIREWORKS_API_KEY env variable)object
Additional OpenAI client options
Supported Models
Chat Models
Llama 3.1
accounts/fireworks/models/llama-v3p1-405b-instruct: 405B, most capableaccounts/fireworks/models/llama-v3p1-70b-instruct: 70B, balancedaccounts/fireworks/models/llama-v3p1-8b-instruct: 8B, fast
Llama 3
accounts/fireworks/models/llama-v3-70b-instructaccounts/fireworks/models/llama-v3-8b-instruct
Mixtral
accounts/fireworks/models/mixtral-8x7b-instruct: Default modelaccounts/fireworks/models/mixtral-8x22b-instruct
Qwen
accounts/fireworks/models/qwen2p5-72b-instructaccounts/fireworks/models/qwen2p5-7b-instruct
DeepSeek
accounts/fireworks/models/deepseek-v3
Embedding Models
nomic-ai/nomic-embed-text-v1.5: Default, 768 dimensionsnomic-ai/nomic-embed-text-v1: 768 dimensionsWhereIsAI/UAE-Large-V1: 1024 dimensionsthenlper/gte-large: 1024 dimensions
Streaming
Function Calling
Fireworks AI supports function calling on compatible models:Structured Output
With LlamaIndex
Convenience Functions
Configuration
Environment Variables
Custom Base URL
https://api.fireworks.ai/inference/v1
Global Settings
Model Selection Guide
Performance
Fireworks AI optimizes for low latency:- Fast inference: Optimized model serving
- Batch processing: Efficient for high throughput
- Streaming: Real-time token generation
- Global deployment: Low latency worldwide
Error Handling
Rate Limits
Fireworks AI has different rate limits based on your plan:Best Practices
- Choose right model: Balance quality vs. speed and cost
- Use streaming: Better UX for chat applications
- Enable function calling: For structured interactions
- Monitor performance: Track latency and costs
- Set appropriate tokens: Control response length
- Use embeddings: nomic-embed-text-v1.5 for RAG applications