Winner

Composer 2.5 Default

Quality · October 8, 2026 · Difficulty: Medium

Final combined results in supplied rank order. Tied ranks remain tied.
ResultRank 1Composer 2.5 DefaultRank 2GPT-6 Luna Extra HighRank 3GPT-6.1 Sol LowRank 4Grok 4.7 LowRank 5Grok 4.7 HighRank 6GPT-6.1 Sol HighRank 7DeepSeek Flash N/ARank 8GPT-6 Luna Low
Combined score84.9484.5882.5182.4582.1381.9981.8560.17
Judge rank14411478
Judge score /10090.0086.0086.0090.0090.0086.0082.5057.00
Time57.47 s31.55 s19.16 s311.85 s419.13 s28.58 s8.87 s7.18 s
Estimated USD$0.026177$0.0028207$0.02786$0.067888$0.08911$0.03143$0.0054036$0.0013537

Estimated reference costs are not billed charges. Judge rank is derived from recorded rubric metrics across judged configurations; final rank uses the combined score.

Component points
Final combined results in supplied rank order. Tied ranks remain tied.
ResultRank 1 Composer 2.5 DefaultRank 2 GPT-6 Luna Extra HighRank 3 GPT-6.1 Sol LowRank 4 Grok 4.7 LowRank 5 Grok 4.7 HighRank 6 GPT-6.1 Sol HighRank 7 DeepSeek Flash N/ARank 8 GPT-6 Luna Low
Quality points8177.477.4818177.474.2551.3
Test points00000000
Speed points2.55393.2773.78960.80680.62613.38674.35614.4657
Cost points1.38213.89991.32070.64190.50451.20693.2464.4039

Swipe, scroll or use Previous and More to compare configurations. Row labels stay visible.

Advanced results and scoring details

quality · 2026-10-08T21:27:09.782Z · Prospective evaluation. Equal transport and native system conditions are unverified.

Applied weights: quality 90%, tests 0%, speed 5%, cost 5%.

Displayed scores are rounded; pairwise outcomes use exact recorded fractions. Reference costs are estimates, not billed charges. Missing components follow the recorded assessment.

Pairwise results

  • Grok 4.7 High vs Grok 4.7 Low: Second configuration wins
  • Grok 4.7 High vs GPT-6 Luna Extra High: Second configuration wins
  • Grok 4.7 High vs GPT-6.1 Sol Low: Second configuration wins
  • Grok 4.7 High vs Composer 2.5 Default: Second configuration wins
  • Grok 4.7 High vs GPT-6 Luna Low: First configuration wins
  • Grok 4.7 High vs DeepSeek Flash N/A: First configuration wins
  • Grok 4.7 High vs GPT-6.1 Sol High: First configuration wins
  • Grok 4.7 Low vs GPT-6 Luna Extra High: Second configuration wins
  • Grok 4.7 Low vs GPT-6.1 Sol Low: Second configuration wins
  • Grok 4.7 Low vs Composer 2.5 Default: Second configuration wins
  • Grok 4.7 Low vs GPT-6 Luna Low: First configuration wins
  • Grok 4.7 Low vs DeepSeek Flash N/A: First configuration wins
  • Grok 4.7 Low vs GPT-6.1 Sol High: First configuration wins
  • GPT-6 Luna Extra High vs GPT-6.1 Sol Low: First configuration wins
  • GPT-6 Luna Extra High vs Composer 2.5 Default: Second configuration wins
  • GPT-6 Luna Extra High vs GPT-6 Luna Low: First configuration wins
  • GPT-6 Luna Extra High vs DeepSeek Flash N/A: First configuration wins
  • GPT-6 Luna Extra High vs GPT-6.1 Sol High: First configuration wins
  • GPT-6.1 Sol Low vs Composer 2.5 Default: Second configuration wins
  • GPT-6.1 Sol Low vs GPT-6 Luna Low: First configuration wins
  • GPT-6.1 Sol Low vs DeepSeek Flash N/A: First configuration wins
  • GPT-6.1 Sol Low vs GPT-6.1 Sol High: First configuration wins
  • Composer 2.5 Default vs GPT-6 Luna Low: First configuration wins
  • Composer 2.5 Default vs DeepSeek Flash N/A: First configuration wins
  • Composer 2.5 Default vs GPT-6.1 Sol High: First configuration wins
  • GPT-6 Luna Low vs DeepSeek Flash N/A: Second configuration wins
  • GPT-6 Luna Low vs GPT-6.1 Sol High: Second configuration wins
  • DeepSeek Flash N/A vs GPT-6.1 Sol High: Second configuration wins