Model · Moonshot AI
Moonshot AI Kimi Code k2.7
2 appearances · meta-score 67.4/100 · last seen 2026-07-10 · scored under rubric v15
Pooled composite across 2 primary runs: 60.2 ± 11.6 (95% CI) provisional: n < 3, treat as unsettled
- $43.48Total cost
- 151,171,278Tokens
- 88.0%Cache hit
- 2,458Requests
- 0.00%Failure rate
- 0.93Tools/response
- 3,477,119Tokens per $
Agent role scores
| Agent role | Score / 10 |
|---|---|
| Sprint-Plan Agent | 7.55 |
| Pseudocode Agent | 7.48 |
| Sprint-Review Agent | 7.32 |
| Scout Agent | 7.22 |
| Spec Agent | 6.92 |
| Develop Agent | 6.72 |
| Code-Review Agent | 6.62 |
| Code Agent | 6.53 |
| Orchestrator | 5.90 |
| Test Agent | 5.84 |
| Platform Agent | 5.32 |
| Build Agent | 5.08 |
Run history (primary model)
| Run | SoW | Date | Composite |
|---|---|---|---|
| Kimi Code k2.7 | circles | Jul 2026 | 61.1 |
| Kimi Code k2.7 | circles | Jul 2026 | 59.3 |
Every run on Favur Evals is scored by the same deterministic engine, on the same Statements of Work. The benchmark is self-funded — no vendor sponsorship, credits, or grants.