SWE-Bench Verified coding A verified subset of 500 software engineering problems from real GitHub issues, validated by human annotators for evaluating language models' ability to resolve real-world coding issues by generating patches for Python codebases. Leaderboard Showing 20 of 101 results Show all Export CSV Graph Rank Claude Fable 5 95.0% iClaude Mythos Preview 93.9% iClaude Opus 4.8 88.6% iClaude Opus 4.7 87.6% iClaude Haiku 4.5 85.7% iClaude Opus 4.5 80.9% iClaude Opus 4.6 80.8% iDeepSeek-V4-Pro-Max 80.6% iGemini 3.1 Pro 80.6% iMiniMax M3 80.5% iQwen3.7 Max 80.4% iKimi K2.6 80.2% iMiniMax M2.5 80.2% iGPT-5.2 80.0% iClaude Sonnet 4.6 79.6% iDeepSeek-V4-Flash-Max 79.0% iMiMo-V2.5-Pro 78.9% iQwen3.6 Plus 78.8% iGemini 3 Flash 78.0% iMiMo-V2-Pro 78.0% i