Favur Evals
favur.dev

Trends

With repeated runs under a versioned rubric, drift is the most valuable signal in the dataset. Everything below is derived at build time from the published composites — the same numbers on every run page — and every chart has its table right beside it.

Cohort drift

Is the whole cohort improving, or is the rubric getting easier? Both readings, published: the least-squares slope of composite against run sequence is+0.222 points per runacross 75 runs.Every run was scored under rubric v15, so measurement change cannot explain any of it — whatever drift exists is the models and the rosters.

Mean composite by calendar month
MonthRunsMean composite
2026-061150.9
2026-076461.2

Automated regression detection

A run is flagged when its composite falls outside the 95% confidence interval pooled from that model's prior runs (at least two priors required). Moves in both directions are published — improvements are flagged with the same rule as regressions.

Runs whose composite moved beyond the model's prior 95% interval
ModelRunDateCompositePrior 95% intervalDirection
DeepSeek Deepseek Flash v4circles/deepseek-deepseek-v4-flash-7.22.20262026-07-2270.150.4–62.7 (n=5)improvement
Google Gemini Flash 3.6the2048/gemini-multi-model-7-22-20262026-07-2252.657.0–82.5 (n=3)regression
Google Gemini Flash 3.6solarSystem/google-multi-model-7.21.20262026-07-2163.865.7–79.6 (n=2)regression
Google Gemini Flash Lite 3.1circles/google-gemini-3.1-flash-lite-7.19.20262026-07-1951.059.6–68.5 (n=3)regression
Anthropic Claude Sonnet 5circles/anthropic-claude-sonnet-5-7.16.20262026-07-1770.839.1–55.3 (n=2)improvement
Google Gemini Flash 3.5circles/google-multi-model-7.15.20262026-07-1581.839.8–65.3 (n=3)improvement
Google Gemini Flash 3.5solarSystem/google-multi-model-7.15.20262026-07-1542.644.1–83.5 (n=5)regression
DeepSeek Deepseek Flash v4circles/deepseek-deepseek-v4-flash-7.10.20262026-07-1064.049.8–59.5 (n=4)improvement

Composite over time, per model

Models with at least two primary runs, chronological. Full history on each model page.

Per-model composite trend
ModelnTrendComposites (oldest → newest)Pooled mean
Anthropic Claude Sonnet 4.6242.344.443.4 ± 13.3 †
Anthropic Claude Sonnet 5547.846.670.857.958.356.3 ± 12.2
DeepSeek Deepseek Flash v4655.650.256.856.064.070.158.8 ± 7.4
DeepSeek Deepseek Pro v4353.951.955.953.9 ± 5.0
Google Gemini Flash 3 (preview)656.628.953.839.156.554.448.2 ± 12.1
Google Gemini Flash 3.5847.452.657.681.879.642.674.665.662.7 ± 12.5
Google Gemini Flash 3.6573.272.163.852.661.164.6 ± 10.5
Google Gemini Flash Lite 3.1465.762.264.251.060.8 ± 10.6
Google Gemini Pro 3.1 (preview)251.753.452.5 ± 10.8 †
Meta Muse Spark 1.1380.867.256.868.3 ± 29.9
Moonshot AI Kimi Code k2.7261.159.360.2 ± 11.6 †
Moonshot AI Kimi k2.6353.149.963.355.5 ± 17.4
Qwen Plus qwen3.7464.379.954.776.768.9 ± 18.5
Stepfun Step Flash 3.7258.956.957.9 ± 12.7 †
xAI Grok 4.5461.063.262.364.762.8 ± 2.5
Xiaomi Mimo Pro v2.5563.057.664.364.363.262.5 ± 3.5
Xiaomi Mimo v2.5364.975.981.274.0 ± 20.7
Z.ai Glm 5.2346.954.561.654.3 ± 18.3

† provisional — fewer than 3 primary runs. Models with a single run have no trend yet and are omitted here; they appear on the model index.

Version deltas

When a vendor ships a new version, the delta against its predecessor — meta-score, pooled composite, and every agent role both versions handled.

Anthropic Claude Sonnet 4.6Anthropic Claude Sonnet 5

Meta-score +23.7 · Pooled composite +12.9 (n=2 → n=5)

Per-agent-role deltas, Anthropic Claude Sonnet 4.6 to Anthropic Claude Sonnet 5
Agent roleDelta
Sprint-Review Agent+5.0
Orchestrator+3.9
Develop Agent+3.9
Code-Review Agent+3.0
Build Agent+2.6
Test Agent+1.2
Code Agent+0.9
Pseudocode Agent+0.8
Sprint-Plan Agent+0.2
Scout Agent+0.0

Google Gemini Flash 3 (preview)Google Gemini Flash 3.5

Meta-score −1.9 · Pooled composite +14.5 (n=6 → n=8)

Per-agent-role deltas, Google Gemini Flash 3 (preview) to Google Gemini Flash 3.5
Agent roleDelta
Develop Agent+2.4
Orchestrator+2.1
Spec Agent−0.0
Platform Agent−0.3
Code-Review Agent−0.3
Code Agent−0.6
Test Agent−0.7
Build Agent−0.7
Sprint-Plan Agent−0.8
Sprint-Review Agent−0.9
Pseudocode Agent−1.3
Scout Agent−1.5
Architect−2.2

Google Gemini Flash 3.5Google Gemini Flash 3.6

Meta-score +12.4 · Pooled composite +1.8 (n=8 → n=5)

Per-agent-role deltas, Google Gemini Flash 3.5 to Google Gemini Flash 3.6
Agent roleDelta
Architect+3.4
Code-Review Agent+3.3
Sprint-Review Agent+3.1
Build Agent+1.8
Platform Agent+1.3
Code Agent+1.2
Test Agent+0.6
Scout Agent+0.3
Develop Agent+0.0
Pseudocode Agent−0.0
Orchestrator−0.1
Spec Agent−0.5
Sprint-Plan Agent−0.7

Google Gemini Flash Lite 3.1Google Gemini Flash Lite 3.5

Meta-score −3.4 · Pooled composite +17.5 (n=4 → n=1)

Per-agent-role deltas, Google Gemini Flash Lite 3.1 to Google Gemini Flash Lite 3.5
Agent roleDelta
Build Agent+1.8
Develop Agent+0.4
Scout Agent+0.3
Code-Review Agent+0.3
Platform Agent+0.2
Code Agent+0.1
Orchestrator−0.2
Test Agent−0.5
Spec Agent−0.5
Sprint-Review Agent−0.8
Pseudocode Agent−1.6
Sprint-Plan Agent−2.4

Consistency

Which models are consistent and which are erratic across repeat runs — the sample standard deviation of each model's composites, most consistent first. Consistency is a purchasing criterion nobody publishes.

Composite over time, per Statement of Work

circles — 59 runs
Runs in circles, chronological
DateRunCompositeRubric
2026-06-26circles/google-gemini-3-flash-preview-6.26.202656.6v15
2026-06-27circles/deepseek-deepseek-v4-pro-6.27.202653.9v15
2026-06-27circles/moonshotai-kimi-k2.6-6.27.202653.1v15
2026-06-28circles/xiaomi-mimo-v2.5-pro-6.28.202663.0v15
2026-06-28circles/google-gemini-3.1-pro-preview-6.28.202651.7v15
2026-06-28circles/z-ai-glm-5.2-6.27.202646.9v15
2026-06-28circles/anthropic-claude-sonnet-4.6-6.28.202642.3v15
2026-07-03circles/z-ai-glm-5.2-7.3.202654.5v15
2026-07-03circles/google-gemini-3.1-pro-preview-7.3.202653.4v15
2026-07-03circles/deepseek-deepseek-v4-pro-7.3.202651.9v15
2026-07-03circles/anthropic-claude-sonnet-4.6-7.3.202644.4v15
2026-07-04circles/deepseek-deepseek-v4-flash-7.4.202656.8v15
2026-07-04circles/deepseek-deepseek-v4-flash-7.3.202656.0v15
2026-07-05circles/xiaomi-mimo-v2.5-pro-7.5.202664.3v15
2026-07-05circles/deepseek-deepseek-v4-pro-7.5.202655.9v15
2026-07-05circles/google-gemini-3-flash-preview-7.5.202653.8v15
2026-07-05circles/moonshotai-kimi-k2.6-7.5.202649.9v15
2026-07-05circles/google-gemini-3.5-flash-7.5.202647.4v15
2026-07-08circles/moonshotai-kimi-k2.7-code-7.8.202661.1v15
2026-07-08circles/google-gemini-3.5-flash-7.8.202652.6v15
2026-07-08circles/anthropic-claude-sonnet-5-7.8.202647.8v15
2026-07-08circles/google-gemini-3-flash-preview-7.7.202639.1v15
2026-07-09circles/google-gemini-3.1-flash-lite-7.9.202665.7v15
2026-07-09circles/qwen-qwen3.7-plus-7.9.202664.3v15
2026-07-09circles/google-gemini-3-flash-preview-7.8.202656.5v15
2026-07-10circles/xiaomi-mimo-v2.5-pro-7.10.202664.9v15
2026-07-10circles/deepseek-deepseek-v4-flash-7.10.202664.0v15
2026-07-10circles/x-ai-grok-4.5-7.10.202661.0v15
2026-07-10circles/moonshotai-kimi-k2.7-code-7.9.202659.3v15
2026-07-10circles/google-gemini-3-flash-preview-7.9.202654.4v15
2026-07-12circles/openai-gpt-5.6-terra-7.11.202661.5v15
2026-07-12circles/anthropic-claude-sonnet-5-7.11.202646.6v15
2026-07-13circles/stepfun-step-3.7-flash-7.13.202658.9v15
2026-07-14circles/openai-gpt-5.6-luna-7.14.202661.1v15
2026-07-15circles/google-multi-model-7.15.202681.8v15
2026-07-15circles/google-multi-model-7.16.202679.6v15
2026-07-15circles/google-gemini-3.1-flash-lite-7.14.202664.2v15
2026-07-16circles/google-multi-model-7.17.202674.6v15
2026-07-16circles/google-multi-model-7.18.202665.6v15
2026-07-17circles/meta-muse-spark-1.1-7.16.202680.8v15
2026-07-17circles/qwen-qwen3.7-plus-7.16.202679.9v15
2026-07-17circles/anthropic-claude-sonnet-5-7.16.202670.8v15
2026-07-17circles/moonshotai-kimi-k2.6-7.16.202663.3v15
2026-07-17circles/x-ai-grok-4.5-7.16.202663.2v15
2026-07-17circles/z-ai-glm-5.2-7.17.202661.6v15
2026-07-18circles/thinkingmachines-inkling-7.18.202648.6v15
2026-07-19circles/x-ai-grok-4.5-7.18.202662.3v15
2026-07-19circles/google-gemini-3.1-flash-lite-7.19.202651.0v15
2026-07-21circles/google-gemini-3.5-flash-lite-7.21.202678.2v15
2026-07-21circles/google-gemini-3.6-flash-7.21.202673.2v15
2026-07-21circles/x-ai-grok-4.5-7.21.202672.1v15
2026-07-22circles/xiaomi-mimo-v2.5-7.22.202681.2v15
2026-07-22circles/qwen-qwen3.7-plus-7.22.202676.7v15
2026-07-22circles/deepseek-deepseek-v4-flash-7.22.202670.1v15
2026-07-22circles/x-ai-grok-4.5-7.22.202664.7v15
2026-07-22circles/anthropic-claude-sonnet-5-7.21.202657.9v15
2026-07-22circles/thinkingmachines-inkling-7.22.202651.7v15
2026-07-24circles/xiaomi-multi-model-2.5-2.5-pro-7.24.202664.3v15
2026-07-24circles/google-gemini-3.6-flash-7.23.202661.1v15
solarSystem — 13 runs
the2048 — 3 runs
Runs in the2048, chronological
DateRunCompositeRubric
2026-06-26the2048/deepseek-deepseek-v4-flash-6.26.202655.6v15
2026-07-19the2048/meta-muse-spark-1.1-7.19.202656.8v15
2026-07-22the2048/gemini-multi-model-7-22-202652.6v15

Rubric-version impact

Every published score was produced under rubric v15, so there is no measurement change to separate from model change yet. When a rubric revision lands, runs re-scored under both versions will appear here side by side, and the dataset changelog records what changed.

Every run on Favur Evals is scored by the same deterministic engine, on the same Statements of Work. The benchmark is self-funded — no vendor sponsorship, credits, or grants.