Model · DeepSeek
DeepSeek Deepseek Pro v4
3 appearances · meta-score 58.6/100 · last seen 2026-07-05 · scored under rubric v15
Pooled composite across 3 primary runs: 53.9 ± 5.0 (95% CI)
- $67.22Total cost
- 154,667,711Tokens
- 82.0%Cache hit
- 2,366Requests
- 0.13%Failure rate
- 1.18Tools/response
- 2,300,897Tokens per $
Agent role scores
| Agent role | Score / 10 |
|---|---|
| Sprint-Plan Agent | 7.58 |
| Scout Agent | 7.43 |
| Sprint-Review Agent | 6.78 |
| Spec Agent | 6.60 |
| Test Agent | 6.22 |
| Develop Agent | 6.14 |
| Code-Review Agent | 5.56 |
| Pseudocode Agent | 5.25 |
| Platform Agent | 5.19 |
| Build Agent | 4.89 |
| Code Agent | 4.82 |
| Orchestrator | 4.68 |
Run history (primary model)
| Run | SoW | Date | Composite |
|---|---|---|---|
| Deepseek Pro v4 | circles | Jun 2026 | 53.9 |
| Deepseek Pro v4 | circles | Jul 2026 | 51.9 |
| Deepseek Pro v4 | circles | Jul 2026 | 55.9 |
Every run on Favur Evals is scored by the same deterministic engine, on the same Statements of Work. The benchmark is self-funded — no vendor sponsorship, credits, or grants.