GLM-5
GLM-5 is Zhipu AI's flagship foundation model designed for complex system engineering and long-range Agent tasks, shifting focus from coding to engineering. It features 744B total parameters (40B activated) in a Mixture of Experts architecture, trained on 28.5T tokens. GLM-5 integrates DeepSeek Sparse Attention for higher token efficiency while preserving long-context quality. It supports 200K context length and 128K max output tokens, with capabilities including thinking modes, real-time streaming, function calling, context caching, and structured output. GLM-5 approaches Claude Opus 4.5 in code-logic density and systems-engineering capability.
| Provider | Status | Input | Output | Limits | Uptime | Speed | Notes |
|---|---|---|---|---|---|---|---|
| StreamLake | available | $0.60/Mtok | $1.92/Mtok | 198K tokens context | 98% | 5,498 ms p50 TTFT | fp8 |
| DeepInfra | available | $0.60/Mtok | $2.08/Mtok | 203K tokens context | 99.9% | 1,014 ms p50 TTFT | fp4 |
| Baidu | available | $0.70/Mtok | $2.24/Mtok | 203K tokens context | 99.3% | 1,185 ms p50 TTFT | fp8 cache |
| Chutes | available | $0.95/Mtok | $2.55/Mtok | 203K tokens context | — | 3,309 ms p50 TTFT | fp8 |
| SiliconFlow | available | $0.95/Mtok | $2.55/Mtok | 205K tokens context | 99.8% | 3,399 ms p50 TTFT | fp8 |
| AtlasCloud | available | $0.95/Mtok | $3.15/Mtok | 203K tokens context | 99.8% | 5,382 ms p50 TTFT | fp8 |
| Novita | available | $1.00/Mtok | $3.20/Mtok | 203K tokens context | 100.0% | 5,513 ms p50 TTFT | fp8 |
| Parasail | available | $1.00/Mtok | $3.20/Mtok | 203K tokens context | 96% | 3,603 ms p50 TTFT | fp8 |
| Venice | available | $1.00/Mtok | $3.20/Mtok | 198K tokens context | 99.3% | 1,745 ms p50 TTFT | fp8 |
| Z.AI | available | $1.00/Mtok | $3.20/Mtok | 203K tokens context | 99.5% | 7,525 ms p50 TTFT | fp8 |
| Phala | available | $1.20/Mtok | $3.50/Mtok | 203K tokens context | — | 3,395 ms p50 TTFT | |
| GMICloud | -5 | $0.60/Mtok | $1.92/Mtok | 203K tokens context | 78% | 2,156 ms p50 TTFT | fp8 |
| DigitalOcean | -2 | $0.75/Mtok | $2.40/Mtok | 64K tokens context | 92% | 2,258 ms p50 TTFT | |
| Amazon Bedrock | -5 | $1.00/Mtok | $3.20/Mtok | 203K tokens context | 8% | 2,912 ms p50 TTFT |