Model Directory
Only reviewed and explicitly published model records appear here. Methodology →
Closed and API-only models
69.7 TRACE Score
Parameters unknown
Context 200K
Modalities text,code,image
Tool use ✓
Structured output ✓
API Available
Local —
Best for
large codebase worklong-running agents
Weaknesses
- Higher latency than GPT-5.6 Sol
Full details → Parameters unknown
Context 200K
Modalities text,code,image
Tool use ✓
Structured output ✓
API Available
Local —
Best for
analysiswritingreasoning
Weaknesses
- Less specialised for coding than Fable 5
Full details → Parameters unknown
Context 128K
Modalities text,code
Tool use ✓
Structured output ✓
API Available
Local —
Best for
software engineeringrepository work
Weaknesses
- Requires IDE integration; cost can accumulate on long sessions
Full details → Parameters unknown
Context 128K
Modalities text,code
Tool use ✓
Structured output ✓
API Available
Local —
Best for
enterprise RAGtool usesummarisation
Weaknesses
- Less competitive on pure coding benchmarks
Full details → Parameters unknown
Context 128K
Modalities text,code,image
Tool use ✓
Structured output ✓
API Available
Local —
Best for
general reasoningcoding
Full details → Parameters unknown
Context 128K
Modalities text,code
Tool use ✓
Structured output ✓
API Available
Local —
Best for
high-volume APIchatquick coding
Weaknesses
- Less capable on long-horizon tasks
Full details → 77 TRACE Score
Parameters unknown
Context 128K
Modalities text,code,image
Tool use ✓
Structured output ✓
API Available
Local —
Best for
agentic codingterminal usecomplex reasoning
Weaknesses
- SWE-Bench Pro lags behind Claude Fable 5
Full details → Parameters unknown
Context 1M
Modalities text,code,image,audio,video
Tool use ✓
Structured output ✓
API Available
Local —
Best for
high-volume APIchatreal-time
Weaknesses
- Less capable on complex reasoning than Pro
Full details → Parameters unknown
Context 2M
Modalities text,code,image,audio,video
Tool use ✓
Structured output ✓
API Available
Local —
Best for
complex reasoninglong contextresearch
Weaknesses
- Higher cost than Flash variants
Full details → Parameters unknown
Context 1M
Modalities text,code,image,audio,video
Tool use ✓
Structured output ✓
API Available
Local —
Best for
agentic taskscodingmultimodal
Weaknesses
- Preview-tier models may have rate limits
Full details → Parameters unknown
Context 128K
Modalities text,code,image
Tool use ✓
Structured output —
API Available
Local —
Best for
real-time knowledgeconversational AI
Weaknesses
- Limited third-party evaluation; X platform dependency
Full details → Parameters unknown
Context 128K
Modalities text,code
Tool use ✓
Structured output ✓
API Available
Local —
Best for
European compliancemultilingualcoding
Weaknesses
- Smaller ecosystem than OpenAI/Anthropic
Full details → Open-weight and open-source models
Parameters 671B
Context 128K
Modalities text,code
Tool use ✓
Structured output —
API Available
Local Available
Best for
complex mathcompetitive codingreasoning
Weaknesses
- MoE + reasoning adds inference cost
Full details → Parameters 671B
Context 128K
Modalities text,code
Tool use ✓
Structured output —
API Available
Local Available
Best for
cost-effective APIlocal inference
Weaknesses
- MoE architecture adds complexity; Chinese regulatory environment
Full details → Parameters unknown
Context 1M
Modalities text,code
Tool use ✓
Structured output —
API Available
Local Available
Best for
agentic taskslong-context reasoningcoding
Weaknesses
- MoE architecture adds complexity; Chinese regulatory environment
Full details → Parameters unknown
Context 128K
Modalities text,code
Tool use ✓
Structured output —
API Available
Local Available
Best for
codinglocal inference
Weaknesses
- Smaller community than Llama/Qwen
Full details → 64.4 TRACE Score
Parameters unknown
Context 1M
Modalities text,code
Tool use ✓
Structured output —
API Available
Local Available
Best for
complex agentic taskscodingreasoning
Weaknesses
- Smaller ecosystem than Llama/Qwen; limited third-party evaluation
Full details → Parameters 70B
Context 128K
Modalities text,code
Tool use ✓
Structured output —
API Available
Local Available
Best for
local deploymentcost-effective API
Weaknesses
- Less capable than Llama 4 405B
Full details → Parameters 405B
Context 128K
Modalities text,code,image
Tool use ✓
Structured output —
API Available
Local Available
Best for
local deploymentresearchfine-tuning
Weaknesses
- Requires significant hardware for full precision
Full details → Parameters 22B
Context 32K
Modalities text,code
Tool use ✓
Structured output —
API Available
Local Available
Best for
local codingedge deployment
Weaknesses
- Limited context window and reasoning depth
Full details → 81 TRACE Score
Parameters unknown
Context 128K
Modalities text,code
Tool use ✓
Structured output —
API Available
Local Available
Best for
coding agentslocal developmentrepository work
Weaknesses
- Specialised for coding; less suitable for general chat
Full details → Parameters 2.4T
Context 128K
Modalities text,code,image
Tool use ✓
Structured output —
API Available
Local Available
Best for
extreme-scale inferenceresearch
Weaknesses
- Enormous hardware requirements; 2.4T parameters impractical for most users
Full details →