Llama 3.3 70B Instruct
Llama 3.3 is a multilingual large language model optimized for dialogue use cases across multiple languages. It is a pretrained and instruction-tuned generative model with 70 billion parameters, outperforming many open-source and closed chat models on common industry benchmarks. Llama 3.3 supports a context length of 128,000 tokens and is designed for commercial and research use in multiple languages.
| Provider | Status | Input | Output | Limits | Uptime | Speed | Notes |
|---|---|---|---|---|---|---|---|
| DeepInfra | available | $0.10/Mtok | $0.32/Mtok | 131K tokens context | 97% | 332 ms p50 TTFT | fp8 |
| AkashML | available | $0.13/Mtok | $0.40/Mtok | 131K tokens context | 99.2% | 539 ms p50 TTFT | fp8 |
| Parasail | available | $0.22/Mtok | $0.50/Mtok | 131K tokens context | 99.6% | 581 ms p50 TTFT | fp8 |
| Groq | available | $0.59/Mtok | $0.79/Mtok | 131K tokens context | 99% | 279 ms p50 TTFT | |
| WandB | available | $0.71/Mtok | $0.71/Mtok | 128K tokens context | 100.0% | 208 ms p50 TTFT | fp16 |
| available | $0.72/Mtok | $0.72/Mtok | 128K tokens context | 100.0% | 293 ms p50 TTFT | ||
| Nebius | -2 | $0.13/Mtok | $0.40/Mtok | 131K tokens context | 94% | 543 ms p50 TTFT | fp8 |
| Novita | -2 | $0.14/Mtok | $0.40/Mtok | 6K tokens context | 90% | 645 ms p50 TTFT | bf16 |
| Cloudflare | -2 | $0.29/Mtok | $2.25/Mtok | 24K tokens context | 93% | 627 ms p50 TTFT | fp8 |
| SambaNova | -2 | $0.45/Mtok | $0.90/Mtok | 16K tokens context | 93% | 719 ms p50 TTFT | bf16 |
| Together | -2 | $1.04/Mtok | $1.04/Mtok | 131K tokens context | 89% | 710 ms p50 TTFT | fp8 |