Model · DeepSeek
DeepSeek Deepseek Flash v4
6 appearances · meta-score 74.0/100 · last seen 2026-07-22 · scored under rubric v15
Pooled composite across 6 primary runs: 58.8 ± 7.4 (95% CI)
- $63.25Total cost
- 1,112,185,494Tokens
- 73.0%Cache hit
- 13,928Requests
- 5.25%Failure rate
- 1.14Tools/response
- 17,583,393Tokens per $
Agent role scores
| Agent role | Score / 10 |
|---|---|
| Director | 8.60 |
| Scout Agent | 8.48 |
| Sprint-Review Agent | 8.42 |
| Sprint-Plan Agent | 8.17 |
| Develop Agent | 8.06 |
| Architect | 7.94 |
| Test Agent | 7.74 |
| Orchestrator | 7.73 |
| Build Agent | 7.65 |
| Spec Agent | 7.43 |
| Code Agent | 6.65 |
| Pseudocode Agent | 6.44 |
| Code-Review Agent | 6.14 |
| Platform Agent | 5.81 |
Run history (primary model)
| Run | SoW | Date | Composite |
|---|---|---|---|
| Deepseek Flash v4 | the2048 | Jun 2026 | 55.6 |
| Deepseek Flash v4 | solarSystem | Jun 2026 | 50.2 |
| Deepseek Flash v4 | circles | Jul 2026 | 56.0 |
| Deepseek Flash v4 | circles | Jul 2026 | 56.8 |
| Deepseek Flash v4 | circles | Jul 2026 | 64.0 |
| Deepseek Flash v4 | circles | Jul 2026 | 70.1 |
- ▲ 2026-07-22 scored 70.1, outside the prior 95% interval 50.4–62.7 (n=5) — a statistically notable improvement. All flags.
- ▲ 2026-07-10 scored 64.0, outside the prior 95% interval 49.8–59.5 (n=4) — a statistically notable improvement. All flags.
Every run on Favur Evals is scored by the same deterministic engine, on the same Statements of Work. The benchmark is self-funded — no vendor sponsorship, credits, or grants.