GPT OSS 120B
GPT-OSS-120B is an open-weight, 116.8B-parameter Mixture-of-Experts (MoE) language model from OpenAI designed for high-reasoning, agentic, and general-purpose production use cases. It activates 5.1B parameters per forward pass and is optimized to run on a single H100 GPU with native MXFP4 quantization. The model supports configurable reasoning depth, full chain-of-thought access, and native tool use, including function calling, browsing, and structured output generation. It achieves near-parity with OpenAI o4-mini on core reasoning benchmarks. Note: While referred to as '120b' for simplicity, it technically has 116.8B parameters.
| Provider | Status | Input | Output | Limits | Uptime | Speed | Notes |
|---|---|---|---|---|---|---|---|
| WandB | available | $0.04/Mtok | $0.14/Mtok | 131K tokens context | 100.0% | 407 ms p50 TTFT | fp4 |
| Mancer 2 | available | $0.04/Mtok | $0.38/Mtok | 131K tokens context | 100.0% | 779 ms p50 TTFT | fp4 |
| Novita | available | $0.05/Mtok | $0.25/Mtok | 131K tokens context | 99.5% | 457 ms p50 TTFT | fp4 |
| DigitalOcean | available | $0.07/Mtok | $0.49/Mtok | 128K tokens context | 100.0% | 649 ms p50 TTFT | |
| available | $0.09/Mtok | $0.36/Mtok | 131K tokens context | 99% | 372 ms p50 TTFT | ||
| BaseTen | available | $0.10/Mtok | $0.50/Mtok | 128K tokens context | 99.9% | 285 ms p50 TTFT | fp4 |
| Parasail | available | $0.10/Mtok | $0.75/Mtok | 131K tokens context | 99% | 361 ms p50 TTFT | fp4 |
| SambaNova | available | $0.14/Mtok | $0.95/Mtok | 131K tokens context | 99.6% | 1,231 ms p50 TTFT | |
| Amazon Bedrock | available | $0.15/Mtok | $0.60/Mtok | 131K tokens context | — | — | |
| DeepInfra | available | $0.15/Mtok | $0.60/Mtok | 131K tokens context | 99.9% | 565 ms p50 TTFT | bf16 |
| Groq | available | $0.15/Mtok | $0.60/Mtok | 131K tokens context | 100.0% | 199 ms p50 TTFT | |
| Phala | available | $0.15/Mtok | $0.60/Mtok | 131K tokens context | 100.0% | 1,120 ms p50 TTFT | |
| Together | available | $0.15/Mtok | $0.60/Mtok | 131K tokens context | 98% | 276 ms p50 TTFT | |
| Cerebras | available | $0.35/Mtok | $0.75/Mtok | 131K tokens context | 100.0% | 248 ms p50 TTFT | fp16 |
| DekaLLM | -2 | $0.03/Mtok | $0.18/Mtok | 131K tokens context | 93% | 1,004 ms p50 TTFT | bf16 |
| SiliconFlow | -2 | $0.05/Mtok | $0.45/Mtok | 131K tokens context | 86% | 2,290 ms p50 TTFT | fp8 |
| Nebius | -5 | $0.15/Mtok | $0.60/Mtok | 131K tokens context | 77% | 690 ms p50 TTFT | fp4 |
| Mara | -5 | $0.15/Mtok | $0.75/Mtok | 131K tokens context | 55% | 2,698 ms p50 TTFT |