Skip to main content

Overview

Fireworks AI provides fast inference for open-source LLMs and embedding models. The provider extends OpenAI’s interface with Fireworks AI’s API endpoints.

Installation

Basic Usage

LLM

Embeddings

Constructor Options

FireworksLLM

string
default:"accounts/fireworks/models/mixtral-8x7b-instruct"
Fireworks AI model name
string
Fireworks API key (defaults to FIREWORKS_API_KEY env variable)
number
Sampling temperature
number
Maximum tokens in response
number
Nucleus sampling parameter
object
Additional OpenAI client options (e.g., custom baseURL)

FireworksEmbedding

string
default:"nomic-ai/nomic-embed-text-v1.5"
Fireworks AI embedding model name
string
Fireworks API key (defaults to FIREWORKS_API_KEY env variable)
object
Additional OpenAI client options

Supported Models

Chat Models

Llama 3.1

  • accounts/fireworks/models/llama-v3p1-405b-instruct: 405B, most capable
  • accounts/fireworks/models/llama-v3p1-70b-instruct: 70B, balanced
  • accounts/fireworks/models/llama-v3p1-8b-instruct: 8B, fast

Llama 3

  • accounts/fireworks/models/llama-v3-70b-instruct
  • accounts/fireworks/models/llama-v3-8b-instruct

Mixtral

  • accounts/fireworks/models/mixtral-8x7b-instruct: Default model
  • accounts/fireworks/models/mixtral-8x22b-instruct

Qwen

  • accounts/fireworks/models/qwen2p5-72b-instruct
  • accounts/fireworks/models/qwen2p5-7b-instruct

DeepSeek

  • accounts/fireworks/models/deepseek-v3

Embedding Models

  • nomic-ai/nomic-embed-text-v1.5: Default, 768 dimensions
  • nomic-ai/nomic-embed-text-v1: 768 dimensions
  • WhereIsAI/UAE-Large-V1: 1024 dimensions
  • thenlper/gte-large: 1024 dimensions

Streaming

Function Calling

Fireworks AI supports function calling on compatible models:

Structured Output

With LlamaIndex

Convenience Functions

Configuration

Environment Variables

Custom Base URL

Default base URL: https://api.fireworks.ai/inference/v1

Global Settings

Model Selection Guide

Performance

Fireworks AI optimizes for low latency:
  • Fast inference: Optimized model serving
  • Batch processing: Efficient for high throughput
  • Streaming: Real-time token generation
  • Global deployment: Low latency worldwide

Error Handling

Rate Limits

Fireworks AI has different rate limits based on your plan:

Best Practices

  1. Choose right model: Balance quality vs. speed and cost
  2. Use streaming: Better UX for chat applications
  3. Enable function calling: For structured interactions
  4. Monitor performance: Track latency and costs
  5. Set appropriate tokens: Control response length
  6. Use embeddings: nomic-embed-text-v1.5 for RAG applications

Example: RAG Application

Pricing

Fireworks AI offers competitive pricing for open-source models. Check Fireworks AI pricing for current rates.

See Also