Model · Google
Google Gemini Flash 3.5
8 appearances · meta-score 59.9/100 · last seen 2026-07-16 · scored under rubric v15
Pooled composite across 8 primary runs: 62.7 ± 12.5 (95% CI)
- $211.05Total cost
- 464,065,290Tokens
- 67.2%Cache hit
- 10,686Requests
- 0.07%Failure rate
- 0.92Tools/response
- 2,198,818Tokens per $
Agent role scores
| Agent role | Score / 10 |
|---|---|
| Develop Agent | 8.10 |
| Orchestrator | 7.89 |
| Spec Agent | 7.11 |
| Sprint-Plan Agent | 6.70 |
| Test Agent | 6.22 |
| Scout Agent | 6.17 |
| Platform Agent | 5.70 |
| Code-Review Agent | 5.40 |
| Sprint-Review Agent | 5.26 |
| Code Agent | 5.03 |
| Build Agent | 4.98 |
| Architect | 4.92 |
| Pseudocode Agent | 4.92 |
Run history (primary model)
| Run | SoW | Date | Composite |
|---|---|---|---|
| Gemini Flash 3.5 | circles | Jul 2026 | 47.4 |
| Gemini Flash 3.5 | circles | Jul 2026 | 52.6 |
| Gemini Flash 3.5 + Gemini Flash Lite | solarSystem | Jul 2026 | 57.6 |
| Gemini Flash 3.5 + Gemini Flash Lite | solarSystem | Jul 2026 | 42.6 |
| Gemini Flash 3.5 + Gemini Flash Lite | circles | Jul 2026 | 81.8 |
| Gemini Flash 3.5 + Gemini Flash Lite | circles | Jul 2026 | 79.6 |
| Gemini Flash 3.5 + Gemini Flash Lite | circles | Jul 2026 | 74.6 |
| Gemini Flash 3.5 + Gemini Flash Lite | circles | Jul 2026 | 65.6 |
- ▲ 2026-07-15 scored 81.8, outside the prior 95% interval 39.8–65.3 (n=3) — a statistically notable improvement. All flags.
- ▼ 2026-07-15 scored 42.6, outside the prior 95% interval 44.1–83.5 (n=5) — a statistically notable regression. All flags.
Every run on Favur Evals is scored by the same deterministic engine, on the same Statements of Work. The benchmark is self-funded — no vendor sponsorship, credits, or grants.