Gemma 4 31B
Gemma 4 31B is Google DeepMind's flagship dense multimodal model with 31 billion parameters and a 256K context window. Ranks #3 among open models on Arena AI. Built from the same research as Gemini 3, it features Per-Layer Embeddings, Shared KV Cache, alternating sliding-window and global attention, and variable aspect ratio vision encoding. Achieves an estimated LMArena text score of 1452.
| Provider | Status | Input | Output | Limits | Uptime | Speed | Notes |
|---|---|---|---|---|---|---|---|
| WandB | available | $0.12/Mtok | $0.35/Mtok | 262K tokens context | 100.0% | 508 ms p50 TTFT | bf16 |
| Venice | available | $0.12/Mtok | $0.36/Mtok | 256K tokens context | 99.6% | 1,247 ms p50 TTFT | bf16 |
| DeepInfra | available | $0.13/Mtok | $0.38/Mtok | 262K tokens context | 99.4% | 699 ms p50 TTFT | fp8 |
| Novita | available | $0.14/Mtok | $0.40/Mtok | 262K tokens context | 99% | 1,511 ms p50 TTFT | bf16 |
| Parasail | available | $0.15/Mtok | $0.40/Mtok | 262K tokens context | 98% | 785 ms p50 TTFT | fp8 |
| Phala | available | $0.15/Mtok | $0.46/Mtok | 262K tokens context | 95% | 2,084 ms p50 TTFT | |
| ModelRun | available | $0.22/Mtok | $0.55/Mtok | 262K tokens context | 100.0% | 460 ms p50 TTFT | fp4 |
| SambaNova | available | $0.38/Mtok | $1.15/Mtok | 131K tokens context | 100.0% | 2,233 ms p50 TTFT | |
| Together | available | $0.39/Mtok | $0.97/Mtok | 262K tokens context | 99.8% | 185 ms p50 TTFT | |
| Cerebras | available | $0.99/Mtok | $1.49/Mtok | 131K tokens context | 100.0% | 202 ms p50 TTFT | fp16 |
| OpenInference | -2 | $0.10/Mtok | $0.35/Mtok | 262K tokens context | 94% | 496 ms p50 TTFT | bf16 |
| Chutes | -2 | $0.12/Mtok | $0.37/Mtok | 131K tokens context | 95% | 1,694 ms p50 TTFT | fp4 |
| SiliconFlow | -5 | $0.13/Mtok | $0.40/Mtok | 262K tokens context | 1% | 1,123 ms p50 TTFT | fp8 |