SWE-bench Verified

Healthy

1.0 · Princeton NLP / OpenAI · coding

Evaluate coding agents on real-world GitHub issues with verified patches.

Reproducibility
reproducible
Contamination concern
medium
Saturation
Not assessed
Last reviewed
2026-07-20

Reviewed results

ModelScoreDateProvenanceSource
GLM-5.2~62%2026-07-01Vendor-runEvidence
Kimi K3~70%2026-07-01Vendor-runEvidence
Qwen3-Coder-Next~68%2026-07-01Vendor-runEvidence
Gemini 3.5 Flash~65%2026-07-01Vendor-runEvidence
Claude Fable 580.0%2026-07-01Vendor-runEvidence
GPT-5.6 Sol72.7%2026-07-01Vendor-runEvidence