Model · Google
Google Gemini Pro 3.1 (preview)
2 appearances · meta-score 58.0/100 · last seen 2026-07-03 · scored under rubric v15
Pooled composite across 2 primary runs: 52.5 ± 10.8 (95% CI) provisional: n < 3, treat as unsettled
- $39.67Total cost
- 32,216,705Tokens
- 51.2%Cache hit
- 773Requests
- 1.29%Failure rate
- 1.07Tools/response
- 812,021Tokens per $
Agent role scores
| Agent role | Score / 10 |
|---|---|
| Test Agent | 7.20 |
| Sprint-Plan Agent | 6.80 |
| Pseudocode Agent | 5.96 |
| Spec Agent | 5.81 |
| Code-Review Agent | 5.76 |
| Code Agent | 5.75 |
| Sprint-Review Agent | 5.68 |
| Develop Agent | 5.68 |
| Orchestrator | 5.24 |
| Architect | 5.21 |
| Build Agent | 4.76 |
| Platform Agent | 4.59 |
Run history (primary model)
| Run | SoW | Date | Composite |
|---|---|---|---|
| Gemini Pro 3.1 (preview) | circles | Jun 2026 | 51.7 |
| Gemini Pro 3.1 (preview) | circles | Jul 2026 | 53.4 |
Every run on Favur Evals is scored by the same deterministic engine, on the same Statements of Work. The benchmark is self-funded — no vendor sponsorship, credits, or grants.