Winner

Grok 4.7 Medium

UX · October 9, 2026 · Difficulty: High

Final combined results in supplied rank order. Tied ranks remain tied.
ResultRank 1Grok 4.7 MediumRank 2GPT-6.1 Sol LowRank 3Grok 4.7 Extra HighRank 4GPT-6 Astra MediumRank 5Composer 2.5 DefaultRank 6GPT-6 Luna Low
Combined score81.8177.4276.3174.6363.4756.43
Judge
Judge score /10090.0082.0084.0079.5066.0053.50
Correctness /10988865
Coverage /10989775
Evidence /10998976
Actionability /10989876
Time419.98 s38.24 s491.21 s41.62 s44.27 s5.43 s
Estimated USD$0.253216$0.078056$0.29958$0.39631$0.032084$0.003537

Cost estimates are reference estimates, not billed charges.

Judge score uses recorded rubric metrics; final rank uses the combined score.

Component points
Final combined results in supplied rank order. Tied ranks remain tied.
ResultRank 1 Grok 4.7 MediumRank 2 GPT-6.1 Sol LowRank 3 Grok 4.7 Extra HighRank 4 GPT-6 Astra MediumRank 5 Composer 2.5 DefaultRank 6 GPT-6 Luna Low
Quality points8173.875.671.5559.448.15
Test points000000
Speed points0.6253.05370.54432.95232.87734.5854
Cost points0.190.56780.16150.12311.18813.6936

Swipe, scroll or use Previous and More to compare configurations. Row labels stay visible.

Advanced results and scoring details

ux · 2026-10-09T08:50:14.550Z · Prospective evaluation. Equal transport and native system conditions are unverified.

Applied weights: quality 90%, tests 0%, speed 5%, cost 5%.

Displayed scores are rounded; pairwise outcomes use exact recorded fractions. Reference costs are estimates, not billed charges. Missing components follow the recorded assessment.

Pairwise results

  • GPT-6 Luna Low vs Grok 4.7 Medium: Second configuration wins
  • GPT-6 Luna Low vs Composer 2.5 Default: Second configuration wins
  • GPT-6 Luna Low vs Grok 4.7 Extra High: Second configuration wins
  • GPT-6 Luna Low vs GPT-6 Astra Medium: Second configuration wins
  • GPT-6 Luna Low vs GPT-6.1 Sol Low: Second configuration wins
  • Grok 4.7 Medium vs Composer 2.5 Default: First configuration wins
  • Grok 4.7 Medium vs Grok 4.7 Extra High: First configuration wins
  • Grok 4.7 Medium vs GPT-6 Astra Medium: First configuration wins
  • Grok 4.7 Medium vs GPT-6.1 Sol Low: First configuration wins
  • Composer 2.5 Default vs Grok 4.7 Extra High: Second configuration wins
  • Composer 2.5 Default vs GPT-6 Astra Medium: Second configuration wins
  • Composer 2.5 Default vs GPT-6.1 Sol Low: Second configuration wins
  • Grok 4.7 Extra High vs GPT-6 Astra Medium: First configuration wins
  • Grok 4.7 Extra High vs GPT-6.1 Sol Low: Second configuration wins
  • GPT-6 Astra Medium vs GPT-6.1 Sol Low: Second configuration wins