GPT OSS 20B
The gpt-oss-20b model (technically 20.9B parameters) achieves near-parity with OpenAI o4-mini on core reasoning benchmarks, while running efficiently on a single 80 GB GPU. The gpt-oss-20b model delivers similar results to OpenAI o3‑mini on common benchmarks and can run on edge devices with just 16 GB of memory, making it ideal for on-device use cases, local inference, or rapid iteration without costly infrastructure. Both models also perform strongly on tool use, few-shot function calling, CoT reasoning (as seen in results on the Tau-Bench agentic evaluation suite) and HealthBench (even outperforming proprietary models like OpenAI o1 and GPT‑4o). Note: While referred to as '20b' for simplicity, it technically has 20.9B parameters.
| Provider | Status | Input | Output | Limits | Uptime | Speed | Notes |
|---|---|---|---|---|---|---|---|
| WandB | available | $0.03/Mtok | $0.13/Mtok | 131K tokens context | 99% | 275 ms p50 TTFT | fp4 |
| DeepInfra | available | $0.03/Mtok | $0.14/Mtok | 131K tokens context | 100.0% | 268 ms p50 TTFT | bf16 |
| Novita | available | $0.04/Mtok | $0.15/Mtok | 131K tokens context | 99.7% | 370 ms p50 TTFT | fp4 |
| Phala | available | $0.04/Mtok | $0.15/Mtok | 131K tokens context | 96% | 631 ms p50 TTFT | |
| SiliconFlow | available | $0.04/Mtok | $0.18/Mtok | 131K tokens context | 97% | 1,317 ms p50 TTFT | fp8 |
| Together | available | $0.05/Mtok | $0.20/Mtok | 131K tokens context | — | 233 ms p50 TTFT | |
| Amazon Bedrock | available | $0.07/Mtok | $0.15/Mtok | 131K tokens context | 100.0% | 525 ms p50 TTFT | |
| Fireworks | available | $0.07/Mtok | $0.30/Mtok | 131K tokens context | 99.5% | 297 ms p50 TTFT | |
| Groq | available | $0.07/Mtok | $0.30/Mtok | 131K tokens context | 99.9% | 415 ms p50 TTFT | |
| DekaLLM | -2 | $0.03/Mtok | $0.14/Mtok | 131K tokens context | 83% | 924 ms p50 TTFT | bf16 |
| Parasail | -5 | $0.04/Mtok | $0.20/Mtok | 131K tokens context | 56% | 372 ms p50 TTFT | fp4 |
| -5 | $0.07/Mtok | $0.25/Mtok | 131K tokens context | — | — |