Gemma 4 26B-A4B
Gemma 4 26B-A4B is Google DeepMind's Mixture-of-Experts multimodal model with 26 billion total parameters and 3.8 billion activated parameters per token, with a 256K context window. Ranks #6 among open models on Arena AI, outcompeting models 20x its size. Achieves an estimated LMArena text score of 1441. Supports image and text inputs.
| Provider | Status | Input | Output | Limits | Uptime | Speed | Notes |
|---|---|---|---|---|---|---|---|
| DeepInfra | available | $0.07/Mtok | $0.34/Mtok | 262K tokens context | 99.9% | 498 ms p50 TTFT | fp8 |
| Cloudflare | available | $0.10/Mtok | $0.30/Mtok | 256K tokens context | 99% | 341 ms p50 TTFT | |
| NextBit | available | $0.12/Mtok | $0.35/Mtok | 262K tokens context | 99.8% | 3,679 ms p50 TTFT | bf16 |
| Novita | available | $0.13/Mtok | $0.40/Mtok | 262K tokens context | 99.1% | 1,444 ms p50 TTFT | bf16 |
| Parasail | available | $0.13/Mtok | $0.40/Mtok | 262K tokens context | 99% | 773 ms p50 TTFT | bf16 |
| Venice | available | $0.13/Mtok | $0.40/Mtok | 256K tokens context | 99% | 1,065 ms p50 TTFT | bf16 |
| Wafer | available | $0.13/Mtok | $0.40/Mtok | 262K tokens context | 100.0% | 658 ms p50 TTFT | fp8 |
| DekaLLM | -2 | $0.06/Mtok | $0.33/Mtok | 262K tokens context | 90% | 1,434 ms p50 TTFT | bf16 |
| SiliconFlow | -5 | $0.12/Mtok | $0.40/Mtok | 262K tokens context | 25% | 5,363 ms p50 TTFT | fp8 |
| -5 | $0.15/Mtok | $0.60/Mtok | 262K tokens context | 41% | 375 ms p50 TTFT |