Model · Anthropic
Anthropic Claude Sonnet 5
5 appearances · meta-score 66.9/100 · last seen 2026-07-23 · scored under rubric v15
Pooled composite across 5 primary runs: 56.3 ± 12.2 (95% CI)
- $455.65Total cost
- 639,175,680Tokens
- 73.7%Cache hit
- 7,648Requests
- 0.26%Failure rate
- 0.99Tools/response
- 1,402,762Tokens per $
Agent role scores
| Agent role | Score / 10 |
|---|---|
| Sprint-Review Agent | 8.17 |
| Develop Agent | 7.42 |
| Architect | 7.38 |
| Orchestrator | 7.09 |
| Code-Review Agent | 6.72 |
| Build Agent | 6.66 |
| Platform Agent | 6.64 |
| Scout Agent | 6.50 |
| Spec Agent | 6.38 |
| Sprint-Plan Agent | 6.35 |
| Test Agent | 6.01 |
| Code Agent | 5.86 |
| Pseudocode Agent | 5.45 |
Run history (primary model)
| Run | SoW | Date | Composite |
|---|---|---|---|
| Claude Sonnet 5 | circles | Jul 2026 | 47.8 |
| Claude Sonnet 5 | circles | Jul 2026 | 46.6 |
| Claude Sonnet 5 | circles | Jul 2026 | 70.8 |
| Claude Sonnet 5 | circles | Jul 2026 | 57.9 |
| Claude Sonnet 5 + Gemini Flash Lite | solarSystem | Jul 2026 | 58.3 |
- ▲ 2026-07-17 scored 70.8, outside the prior 95% interval 39.1–55.3 (n=2) — a statistically notable improvement. All flags.
Every run on Favur Evals is scored by the same deterministic engine, on the same Statements of Work. The benchmark is self-funded — no vendor sponsorship, credits, or grants.