{"data":{"snapshot_id":"snap_2026_10_06_001","generated_at":"2026-10-06T06:09:18.557Z","benchmarks":[{"id":"gpqa_diamond","display_name":"GPQA Diamond","unit":"percent","weight":0.1471},{"id":"swe_bench_verified","display_name":"SWE-bench Verified","unit":"percent","weight":0.1471},{"id":"livebench","display_name":"LiveBench","unit":"index","weight":0.1103},{"id":"mmlu_pro","display_name":"MMLU-Pro","unit":"percent","weight":0.1103},{"id":"hle","display_name":"Humanity's Last Exam","unit":"percent","weight":0.1029},{"id":"aime","display_name":"AIME (annual)","unit":"percent","weight":0.0735},{"id":"arc_agi_2","display_name":"ARC-AGI-2","unit":"percent","weight":0.0735},{"id":"arena_elo","display_name":"LMArena / Arena Elo","unit":"elo","weight":0.0735},{"id":"tau_bench","display_name":"tau-bench / tau2-bench","unit":"percent","weight":0.0442},{"id":"terminal_bench","display_name":"Terminal-Bench (Hard)","unit":"percent","weight":0.0441}],"hardware":[{"id":"intel_b70","display_name":"Intel Arc Pro B70","memory_gb":32,"usable_memory_gb":null,"aliases":["b70","arc-b70","arc-pro-b70"]},{"id":"nvidia_h100_sxm_80g","display_name":"NVIDIA H100 SXM5 80GB","memory_gb":80,"usable_memory_gb":null,"aliases":["h100","h100-sxm","h100-sxm5","h100-80gb"]},{"id":"nvidia_dgx_spark","display_name":"NVIDIA DGX Spark (GB10 Grace Blackwell)","memory_gb":128,"usable_memory_gb":null,"aliases":["dgx-spark","spark","gb10"]}],"vram_frontier_fit":{"method":"frontier-residual-v1","n":132,"r2":0.646,"resid_sd":1.211,"beta0":3.671,"beta1":0.737,"beta2_moe":1.489,"fitted_over":"current released/preview open-weight ranked models with an INT8 estimate","caveat":"Efficiency relative to a frontier FIT ON THIS INDEX’S OWN FLEET (n and r2 stated in vram_frontier_fit): expected INT8 GB for the model’s intelligence and architecture class, divided by its actual INT8 GB. Above 1 = leaner than the frontier predicts. Refit every render; values move as the fleet moves. Sources: documentation/research/R11 (2026-08-19)."},"index_subset_bias_fit":{"method":"subset-knn-v1","peer_min_coverage":0.8,"k":10,"min_peers":8,"peers":60,"benchmark_offsets":{"aime":{"mean":18.87,"n":39},"arc_agi_2":{"mean":-27.73,"n":37},"arena_elo":{"mean":1.62,"n":57},"gpqa_diamond":{"mean":15.84,"n":60},"hle":{"mean":-26.63,"n":60},"livebench":{"mean":-0.72,"n":30},"mmlu_pro":{"mean":7.53,"n":59},"swe_bench_verified":{"mean":0.98,"n":58},"tau_bench":{"mean":9.47,"n":55},"terminal_bench":{"mean":-14.66,"n":60}},"caveat":"Mean (subset index − own index) over the K full-coverage peers nearest on this model's own benchmark subset. Positive = the subset flatters the index. Diagnostic only; ranking is unchanged. Blind to row-level mismatches (edition/config) inside a benchmark."},"models":[{"id":"gpt-6-astra","display_name":"GPT-6 Astra","family_id":"gpt","vendor":"OpenAI","status":"current","kind":"model","superseded_by":null,"release_date":"2026-09-03","intelligence_index":93.7,"coverage":0.4047,"index_subset_bias":{"offset":4.33,"peers":10,"method":"subset-knn-v1"},"params_total_b":null,"params_active_b":null,"vram_est":null,"vram_frontier":null,"fits_on":null,"is_moe":false,"is_open_weights":false,"context_window_tok":1050000,"pricing":{"prompt_usd_per_m":10,"completion_usd_per_m":50,"blended_usd_per_m":20},"scores":{"arc_agi_2":{"raw":95,"norm":100,"trust":1,"source_url":"https://openai.com/index/gpt-6-astra/","config":null,"measured_date":"2026-09-03"},"gpqa_diamond":{"raw":96,"norm":100,"trust":1,"source_url":"https://openai.com/index/gpt-6-astra/","config":"maximum at any effort, research environment or api","measured_date":"2026-09-03"},"hle":{"raw":57.2,"norm":81.18,"trust":1,"source_url":"https://openai.com/index/gpt-6-astra/","config":"maximum at any effort, with tools","measured_date":"2026-09-03"},"livebench":{"raw":82.16,"norm":93.69,"trust":1,"source_url":"https://www.datalearner.com/en/ai-models/pretrained-models/gpt-6-astra/analysis","config":"max","measured_date":null},"terminal_bench":{"raw":57.9,"norm":62.24,"trust":1,"source_url":"https://openai.com/index/gpt-6-astra/","config":"4.0, agentic terminal tasks, maximum at any effort","measured_date":"2026-09-03"}}},{"id":"claude-opus-5.5","display_name":"Claude Opus 5.5","family_id":"claude","vendor":"Anthropic","status":"current","kind":"model","superseded_by":null,"release_date":"2026-09-22","intelligence_index":92.48,"coverage":0.6428,"index_subset_bias":null,"params_total_b":null,"params_active_b":null,"vram_est":null,"vram_frontier":null,"fits_on":null,"is_moe":false,"is_open_weights":false,"context_window_tok":1000000,"pricing":{"prompt_usd_per_m":4,"completion_usd_per_m":20,"blended_usd_per_m":8},"scores":{"arc_agi_2":{"raw":93.33,"norm":98.14,"trust":3,"source_url":"https://arcprize.org/leaderboard","config":"effort=high, run: high, semi-private","measured_date":"2026-09-24"},"arena_elo":{"raw":1503.7,"norm":99.87,"trust":3,"source_url":"https://lmarena.ai/leaderboard","config":"text","measured_date":"2026-10-03"},"gpqa_diamond":{"raw":90.24,"norm":91.89,"trust":2,"source_url":"https://openrouter.ai/anthropic/claude-opus-5.5","config":"openrouter autoexacto, provider=anthropic","measured_date":null},"hle":{"raw":61.35,"norm":87.28,"trust":2,"source_url":"https://artificialanalysis.ai/models/claude-opus-5-5","config":"default fallback, effort=max, max effort, reasoning=on, run: adaptive reasoning, tools=off","measured_date":null},"livebench":{"raw":83.22,"norm":96.04,"trust":3,"source_url":"https://livebench.ai/","config":"effort=max, livebench-2026-06-25 release, run: max effort","measured_date":null},"tau_bench":{"raw":73.4,"norm":71.2,"trust":2,"source_url":"https://openrouter.ai/anthropic/claude-opus-5.5","config":"domain=airline (verified), openrouter autoexacto, provider=anthropic","measured_date":null},"terminal_bench":{"raw":87.64,"norm":97.22,"trust":3,"source_url":"https://www.vals.ai/benchmarks/terminal-bench-2-1","config":"effort=high, v2.1","measured_date":"2026-09-22"}}},{"id":"claude-fable-5.1","display_name":"Claude Fable 5.1","family_id":"claude","vendor":"Anthropic","status":"current","kind":"model","superseded_by":null,"release_date":"2026-09-01","intelligence_index":91.72,"coverage":0.5158,"index_subset_bias":null,"params_total_b":null,"params_active_b":null,"vram_est":null,"vram_frontier":null,"fits_on":null,"is_moe":false,"is_open_weights":false,"context_window_tok":1000000,"pricing":{"prompt_usd_per_m":10,"completion_usd_per_m":50,"blended_usd_per_m":20},"scores":{"arena_elo":{"raw":1504,"norm":100,"trust":3,"source_url":"https://arena.ai/leaderboard/text","config":"2906 votes, claude-fable-5.1-max, rank 3, text arena overall","measured_date":"2026-09-02"},"gpqa_diamond":{"raw":94,"norm":97.18,"trust":2,"source_url":"https://artificialanalysis.ai/leaderboards/models","config":"artificial analysis independent eval, leaderboard cell displayed rounded to whole percent, max effort with fallback","measured_date":null},"hle":{"raw":60.9,"norm":86.62,"trust":1,"source_url":"https://www.anthropic.com/claude-fable-and-mythos-5-1","config":"no tools","measured_date":null},"livebench":{"raw":83.4,"norm":96.44,"trust":3,"source_url":"https://livebench.ai/","config":"global average (overall), livebench-2026-06-25 release, max effort","measured_date":"2026-06-25"},"terminal_bench":{"raw":55.8,"norm":59.76,"trust":1,"source_url":"https://www.anthropic.com/claude-fable-and-mythos-5-1","config":"4.0, agentic coding, anthropic launch table (vendor-reported), production safeguards enabled","measured_date":"2026-09-01"}}},{"id":"claude-fable-5","display_name":"Claude Fable 5","family_id":"claude","vendor":"Anthropic","status":"superseded","kind":"model","superseded_by":"claude-fable-5.1","release_date":"2026-06-09","intelligence_index":91.24,"coverage":0.8016,"index_subset_bias":null,"params_total_b":null,"params_active_b":null,"vram_est":null,"vram_frontier":null,"fits_on":null,"is_moe":false,"is_open_weights":false,"context_window_tok":1000000,"pricing":{"prompt_usd_per_m":10,"completion_usd_per_m":50,"blended_usd_per_m":20},"scores":{"arc_agi_2":{"raw":89.17,"norm":93.52,"trust":3,"source_url":"https://arcprize.org/results/anthropic-claude-fable-5","config":"cost_per_task_usd=5.449076000000001, eval=arc-agi-2 semi-private (v2_semi_private), model_group=anthropic-claude-fable-5, org=anthropic, run: max, setting=evaluation conducted with 'max' reasoning effort., system_type=cot","measured_date":"2026-08-21"},"arena_elo":{"raw":1504.3,"norm":100,"trust":3,"source_url":"https://lmarena.ai/leaderboard","config":"text","measured_date":"2026-10-03"},"gpqa_diamond":{"raw":93.18,"norm":96.03,"trust":3,"source_url":"https://www.vals.ai/benchmarks/gpqa","config":"compute_effort=max, edition=gpqa diamond v1, runner=platform, stderr=1.939, task=overall, updated=2026-08-19","measured_date":"2026-08-19"},"hle":{"raw":53,"norm":75,"trust":2,"source_url":"https://artificialanalysis.ai/articles/claude-fable-5-mythos-intelligence-index","config":"artificial analysis harness; adaptive reasoning max effort, opus 4.8 fallback on ~9% of hle tasks","measured_date":"2026-06-09"},"mmlu_pro":{"raw":91.5,"norm":85.83,"trust":3,"source_url":"https://www.vals.ai/benchmarks/mmlu_pro","config":"compute_effort=max, edition=mmlu pro v1, runner=platform, stderr=0.278, task=overall, updated=2026-08-19","measured_date":"2026-08-19"},"swe_bench_verified":{"raw":95,"norm":94.44,"trust":3,"source_url":"https://www.vals.ai/benchmarks/swebench","config":"compute_effort=max, edition=swe-bench verified v1, runner=external, stderr=0.976, task=overall, updated=2026-08-19","measured_date":"2026-08-19"},"tau_bench":{"raw":98.54,"norm":100,"trust":2,"source_url":"https://artificialanalysis.ai/models/claude-fable-5","config":"aa field tau2, aa field tau2 (not mapped to tau_bench), artificial analysis intelligence index v4.1.1 suite, effort=max, max effort, opus 4.8 fallback, reasoning=true, run: adaptive reasoning, source value 0.985380116959064 is a 0-1 fraction, x100 at harvest","measured_date":null},"terminal_bench":{"raw":80.52,"norm":88.85,"trust":3,"source_url":"https://www.vals.ai/benchmarks/terminal-bench-2-1","config":"edition=terminal-bench 2.1, runner=external, stderr=1.35, task=overall, updated=2026-08-19","measured_date":"2026-08-19"}}},{"id":"claude-opus-5","display_name":"Claude Opus 5","family_id":"claude","vendor":"Anthropic","status":"superseded","kind":"model","superseded_by":"claude-opus-5.5","release_date":"2026-07-24","intelligence_index":90.38,"coverage":0.8016,"index_subset_bias":null,"params_total_b":null,"params_active_b":null,"vram_est":null,"vram_frontier":null,"fits_on":null,"is_moe":false,"is_open_weights":false,"context_window_tok":1000000,"pricing":{"prompt_usd_per_m":5,"completion_usd_per_m":25,"blended_usd_per_m":10},"scores":{"arc_agi_2":{"raw":90.42,"norm":94.91,"trust":3,"source_url":"https://arcprize.org/results/anthropic-claude-opus-5","config":"cost_per_task_usd=2.06, eval=arc-agi-2 semi-private (v2_semi_private), model_group=anthropic-claude-opus-5, org=anthropic, run: max, setting=evaluation conducted with 'max' output effort., system_type=cot","measured_date":"2026-08-21"},"arena_elo":{"raw":1489.7,"norm":93.63,"trust":3,"source_url":"https://lmarena.ai/leaderboard","config":"text","measured_date":"2026-10-03"},"gpqa_diamond":{"raw":93.43,"norm":96.38,"trust":3,"source_url":"https://www.vals.ai/benchmarks/gpqa","config":"edition=gpqa diamond v1, runner=platform, stderr=1.244, task=overall, updated=2026-08-19","measured_date":"2026-08-19"},"hle":{"raw":53,"norm":75,"trust":2,"source_url":"https://artificialanalysis.ai/articles/opus-5","config":"effort level unstated","measured_date":"2026-07-24"},"mmlu_pro":{"raw":91.59,"norm":85.98,"trust":3,"source_url":"https://www.vals.ai/benchmarks/mmlu_pro","config":"compute_effort=max, edition=mmlu pro v1, runner=platform, stderr=0.276, task=overall, updated=2026-08-19","measured_date":"2026-08-19"},"swe_bench_verified":{"raw":97,"norm":96.67,"trust":3,"source_url":"https://www.vals.ai/benchmarks/swebench","config":"edition=swe-bench verified v1, runner=external, stderr=0.764, task=overall, updated=2026-08-19","measured_date":"2026-08-19"},"tau_bench":{"raw":80,"norm":80,"trust":2,"source_url":"https://openrouter.ai/anthropic/claude-opus-5","config":"domain (airline/retail/telecom) not stated on source page. other provider endpoints range 78.9-80.9 [raw: tau-bench], first-party anthropic provider endpoint row, openrouter \"benchmarks\" panel","measured_date":null},"terminal_bench":{"raw":84.64,"norm":93.69,"trust":3,"source_url":"https://www.vals.ai/benchmarks/terminal-bench-2-1","config":"compute_effort=high, edition=terminal-bench 2.1, runner=external, stderr=0.991, task=overall, updated=2026-08-19","measured_date":"2026-08-19"}}},{"id":"gpt-5.6-sol","display_name":"GPT-5.6 Sol","family_id":"gpt","vendor":"OpenAI","status":"current","kind":"model","superseded_by":null,"release_date":"2026-07-09","intelligence_index":90,"coverage":0.9207,"index_subset_bias":null,"params_total_b":null,"params_active_b":null,"vram_est":null,"vram_frontier":null,"fits_on":null,"is_moe":false,"is_open_weights":false,"context_window_tok":1050000,"pricing":{"prompt_usd_per_m":2,"completion_usd_per_m":10,"blended_usd_per_m":4},"scores":{"arc_agi_2":{"raw":92.5,"norm":97.22,"trust":3,"source_url":"https://arcprize.org/results/openai-gpt-5-6-sol","config":"cost_per_task_usd=1.44, eval=arc-agi-2 semi-private (v2_semi_private), model_group=openai-gpt-5-6-sol, org=openai, run: max, system_type=cot","measured_date":"2026-08-21"},"arena_elo":{"raw":1483.9,"norm":91.05,"trust":3,"source_url":"https://lmarena.ai/leaderboard","config":"text","measured_date":"2026-10-03"},"gpqa_diamond":{"raw":95.2,"norm":98.87,"trust":3,"source_url":"https://www.vals.ai/benchmarks/gpqa","config":"edition=gpqa diamond v1, reasoning_effort=max, runner=platform, stderr=1.074, task=overall, updated=2026-08-19","measured_date":"2026-08-19"},"hle":{"raw":49.49,"norm":69.84,"trust":2,"source_url":"https://artificialanalysis.ai/models","config":"artificial analysis eval, gpt-5.6 sol (max)","measured_date":null},"livebench":{"raw":81.05,"norm":91.22,"trust":3,"source_url":"https://livebench.ai/","config":"global average, livebench-2026-06-25 release, run gpt-5.6-sol-max","measured_date":null},"mmlu_pro":{"raw":89.1,"norm":81.83,"trust":3,"source_url":"https://www.vals.ai/benchmarks/mmlu_pro","config":"edition=mmlu pro v1, reasoning_effort=max, runner=platform, stderr=0.308, task=overall, updated=2026-08-19","measured_date":"2026-08-19"},"swe_bench_verified":{"raw":96.2,"norm":95.78,"trust":3,"source_url":"https://www.vals.ai/benchmarks/swebench","config":"edition=swe-bench verified v1, reasoning_effort=max, runner=external, stderr=0.856, task=overall, updated=2026-08-19","measured_date":"2026-08-19"},"tau_bench":{"raw":85.09,"norm":86.79,"trust":2,"source_url":"https://artificialanalysis.ai/models/gpt-5-6-sol","config":"aa field tau2, aa field tau2 (not mapped to tau_bench), artificial analysis intelligence index v4.1.1 suite, effort=max, reasoning=true, run: max, source value 0.850877192982456 is a 0-1 fraction, x100 at harvest","measured_date":null},"terminal_bench":{"raw":85.77,"norm":95.02,"trust":3,"source_url":"https://www.vals.ai/benchmarks/terminal-bench-2-1","config":"edition=terminal-bench 2.1, reasoning_effort=max, runner=external, stderr=1.35, task=overall, updated=2026-08-19","measured_date":"2026-08-19"}}},{"id":"gemini-3.8-flash","display_name":"Gemini 3.8 Flash","family_id":"gemini","vendor":"Google","status":"current","kind":"model","superseded_by":null,"release_date":"2026-09-02","intelligence_index":89.29,"coverage":0.3968,"index_subset_bias":{"offset":0.78,"peers":10,"method":"subset-knn-v1"},"params_total_b":null,"params_active_b":null,"vram_est":null,"vram_frontier":null,"fits_on":null,"is_moe":false,"is_open_weights":false,"context_window_tok":1048576,"pricing":{"prompt_usd_per_m":0.75,"completion_usd_per_m":3.75,"blended_usd_per_m":1.5},"scores":{"arena_elo":{"raw":1494.8,"norm":95.9,"trust":3,"source_url":"https://lmarena.ai/leaderboard","config":"text","measured_date":"2026-10-03"},"gpqa_diamond":{"raw":95.25,"norm":98.94,"trust":2,"source_url":"https://artificialanalysis.ai/models/gemini-3-8-flash","config":"artificial analysis harness, high reasoning effort","measured_date":null},"hle":{"raw":47.82,"norm":67.38,"trust":2,"source_url":"https://artificialanalysis.ai/models/gemini-3-8-flash","config":"artificial analysis harness, high reasoning effort, no tools","measured_date":null},"terminal_bench":{"raw":87.64,"norm":97.22,"trust":2,"source_url":"https://artificialanalysis.ai/models/gemini-3-8-flash","config":"artificial analysis harness, high reasoning effort, v2.1","measured_date":null}}},{"id":"fugu-1-ultra","display_name":"Fugu Ultra","family_id":"fugu","vendor":"sakana","status":"current","kind":"model","superseded_by":null,"release_date":"2026-06-24","intelligence_index":87.97,"coverage":0.3174,"index_subset_bias":{"offset":-0.67,"peers":10,"method":"subset-knn-v1"},"params_total_b":null,"params_active_b":null,"vram_est":null,"vram_frontier":null,"fits_on":null,"is_moe":false,"is_open_weights":false,"context_window_tok":1000000,"pricing":{"prompt_usd_per_m":5,"completion_usd_per_m":30,"blended_usd_per_m":11.25},"scores":{"gpqa_diamond":{"raw":95.5,"norm":99.3,"trust":2,"source_url":"https://arxiv.org/html/2606.21228v1","config":"sakana fugu technical report, table 1 (model card)","measured_date":null},"hle":{"raw":50,"norm":70.59,"trust":2,"source_url":"https://arxiv.org/html/2606.21228v1","config":"sakana fugu technical report, table 1 (model card)","measured_date":null},"terminal_bench":{"raw":82.1,"norm":90.71,"trust":2,"source_url":"https://arxiv.org/html/2606.21228v1","config":"2.1, sakana fugu technical report, table 1 (model card)","measured_date":null}}},{"id":"muse-spark-1.3-contributor","display_name":"Muse Spark 1.3 Contributor","family_id":"muse","vendor":"Meta","status":"current","kind":"model","superseded_by":null,"release_date":"2026-09-02","intelligence_index":87.08,"coverage":0.3174,"index_subset_bias":{"offset":-0.67,"peers":10,"method":"subset-knn-v1"},"params_total_b":null,"params_active_b":null,"vram_est":null,"vram_frontier":null,"fits_on":null,"is_moe":false,"is_open_weights":false,"context_window_tok":1048576,"pricing":{"prompt_usd_per_m":0.1,"completion_usd_per_m":0.2,"blended_usd_per_m":0.125},"scores":{"gpqa_diamond":{"raw":94,"norm":97.18,"trust":2,"source_url":"https://artificialanalysis.ai/articles/muse-spark-1-3","config":"artificial analysis intelligence index component, xhigh reasoning","measured_date":"2026-09-02"},"hle":{"raw":49,"norm":69.12,"trust":2,"source_url":"https://artificialanalysis.ai/articles/muse-spark-1-3","config":"+2 vs xhigh, max","measured_date":"2026-09-02"},"terminal_bench":{"raw":86,"norm":95.29,"trust":2,"source_url":"https://artificialanalysis.ai/articles/muse-spark-1-3","config":"+6 vs 1.2 80%, 2.1, max","measured_date":"2026-09-02"}}},{"id":"muse-spark-1.3","display_name":"Muse Spark 1.3","family_id":"muse","vendor":"Meta","status":"current","kind":"model","superseded_by":null,"release_date":"2026-09-02","intelligence_index":86.96,"coverage":0.3174,"index_subset_bias":{"offset":-0.67,"peers":10,"method":"subset-knn-v1"},"params_total_b":null,"params_active_b":null,"vram_est":null,"vram_frontier":null,"fits_on":null,"is_moe":false,"is_open_weights":false,"context_window_tok":1048576,"pricing":{"prompt_usd_per_m":1.25,"completion_usd_per_m":4.25,"blended_usd_per_m":2},"scores":{"gpqa_diamond":{"raw":93.84,"norm":96.96,"trust":2,"source_url":"https://artificialanalysis.ai/models/muse-spark-1-3","config":"artificial analysis harness, max reasoning effort","measured_date":null},"hle":{"raw":49.07,"norm":69.22,"trust":2,"source_url":"https://artificialanalysis.ai/models/muse-spark-1-3","config":"artificial analysis harness, max reasoning effort, no tools","measured_date":null},"terminal_bench":{"raw":85.77,"norm":95.02,"trust":2,"source_url":"https://artificialanalysis.ai/models/muse-spark-1-3","config":"artificial analysis harness, max reasoning effort, v2.1","measured_date":null}}},{"id":"claude-opus-4.8","display_name":"Claude Opus 4.8","family_id":"claude","vendor":"Anthropic","status":"superseded","kind":"model","superseded_by":"claude-opus-5.5","release_date":"2026-05-27","intelligence_index":85.66,"coverage":0.6826,"index_subset_bias":{"offset":0.1,"peers":10,"method":"subset-knn-v1"},"params_total_b":null,"params_active_b":null,"vram_est":null,"vram_frontier":null,"fits_on":null,"is_moe":false,"is_open_weights":false,"context_window_tok":1000000,"pricing":{"prompt_usd_per_m":5,"completion_usd_per_m":25,"blended_usd_per_m":10},"scores":{"arc_agi_2":{"raw":72.08,"norm":74.53,"trust":3,"source_url":"https://arcprize.org/leaderboard","config":"cost_per_task_usd=2.7425, eval=arc-agi-2 semi-private (v2_semi_private), model_group=anthropic-opus-4-8, org=anthropic, run: high, setting=evaluation conducted with 'high' output effort., system_type=cot","measured_date":"2026-08-21"},"arena_elo":{"raw":1474.5,"norm":86.86,"trust":3,"source_url":"https://lmarena.ai/leaderboard","config":"text","measured_date":"2026-10-06"},"gpqa_diamond":{"raw":92.02,"norm":94.39,"trust":2,"source_url":"https://artificialanalysis.ai/models/claude-opus-4-8","config":"aa field gpqa, artificial analysis intelligence index v4.1.1 suite, effort=max, gpqa diamond, max effort, reasoning=true, run: adaptive reasoning, source value 0.92020202020202 is a 0-1 fraction, x100 at harvest","measured_date":null},"hle":{"raw":48.66,"norm":68.62,"trust":2,"source_url":"https://artificialanalysis.ai/models/claude-opus-4-8","config":"aa field hle, artificial analysis intelligence index v4.1.1 suite, effort=max, humanity's last exam, max effort, reasoning=true, run: adaptive reasoning, source value 0.486561631139944 is a 0-1 fraction, x100 at harvest","measured_date":null},"swe_bench_verified":{"raw":88.6,"norm":87.33,"trust":2,"source_url":"https://www.vellum.ai/blog/claude-opus-4-8-benchmarks-explained","config":"anthropic-reported; default (high) effort","measured_date":"2026-05-28"},"tau_bench":{"raw":94.44,"norm":99.25,"trust":2,"source_url":"https://artificialanalysis.ai/models/claude-opus-4-8","config":"aa field tau2, aa field tau2 (not mapped to tau_bench), artificial analysis intelligence index v4.1.1 suite, effort=max, max effort, reasoning=true, run: adaptive reasoning, source value 0.944444444444445 is a 0-1 fraction, x100 at harvest","measured_date":null},"terminal_bench":{"raw":84.64,"norm":93.69,"trust":2,"source_url":"https://artificialanalysis.ai/models/claude-opus-4-8","config":"aa field terminalbenchv21, artificial analysis intelligence index v4.1.1 suite, effort=max, max effort, reasoning=true, run: adaptive reasoning, source value 0.846441947565543 is a 0-1 fraction, terminal-bench 2.1, x100 at harvest","measured_date":null}}},{"id":"gemini-3.1-pro","display_name":"Gemini 3.1 Pro","family_id":"gemini","vendor":"Google","status":"current","kind":"model","superseded_by":null,"release_date":"2026-02","intelligence_index":85.04,"coverage":1,"index_subset_bias":null,"params_total_b":null,"params_active_b":null,"vram_est":null,"vram_frontier":null,"fits_on":null,"is_moe":false,"is_open_weights":false,"context_window_tok":1048576,"pricing":{"prompt_usd_per_m":2,"completion_usd_per_m":12,"blended_usd_per_m":4.5},"scores":{"aime":{"raw":98.12,"norm":97.65,"trust":3,"source_url":"https://www.vals.ai/benchmarks/aime","config":"archived=true, edition=aime v1, reasoning_effort=high, runner=platform, stderr=0.343, task=overall, updated=2026-04-16","measured_date":"2026-08-19"},"arc_agi_2":{"raw":77.1,"norm":80.11,"trust":1,"source_url":"https://deepmind.google/models/model-cards/gemini-3-1-pro/","config":"arc prize verified; thinking high","measured_date":"2026-02-19"},"arena_elo":{"raw":1487,"norm":92.43,"trust":3,"source_url":"https://lmarena.ai/leaderboard","config":"text","measured_date":"2026-10-01"},"gpqa_diamond":{"raw":95.45,"norm":99.23,"trust":3,"source_url":"https://www.vals.ai/benchmarks/gpqa","config":"edition=gpqa diamond v1, reasoning_effort=high, runner=platform, stderr=1.046, task=overall, updated=2026-08-19","measured_date":"2026-08-19"},"hle":{"raw":47.03,"norm":66.22,"trust":2,"source_url":"https://artificialanalysis.ai/models/gemini-3-1-pro-preview","config":"aa field hle, artificial analysis intelligence index v4.1.1 suite, effort=none, humanity's last exam, reasoning=true, source value 0.470342910101946 is a 0-1 fraction, x100 at harvest","measured_date":null},"livebench":{"raw":77,"norm":82.22,"trust":3,"source_url":"https://livebench.ai/","config":"global average, livebench leaderboard row \"gemini 3.1 pro preview high\"","measured_date":"2026-08-17"},"mmlu_pro":{"raw":90.99,"norm":84.98,"trust":3,"source_url":"https://www.vals.ai/benchmarks/mmlu_pro","config":"edition=mmlu pro v1, reasoning_effort=high, runner=platform, stderr=0.284, task=overall, updated=2026-08-19","measured_date":"2026-08-19"},"swe_bench_verified":{"raw":78.8,"norm":76.44,"trust":3,"source_url":"https://www.vals.ai/benchmarks/swebench","config":"edition=swe-bench verified v1, reasoning_effort=high, runner=external, stderr=1.83, task=overall, updated=2026-08-19","measured_date":"2026-08-19"},"tau_bench":{"raw":95.61,"norm":100,"trust":2,"source_url":"https://artificialanalysis.ai/models/gemini-3-1-pro-preview","config":"aa field tau2, aa field tau2 (not mapped to tau_bench), artificial analysis intelligence index v4.1.1 suite, effort=none, reasoning=true, source value 0.956140350877193 is a 0-1 fraction, x100 at harvest","measured_date":null},"terminal_bench":{"raw":70.79,"norm":77.4,"trust":3,"source_url":"https://www.vals.ai/benchmarks/terminal-bench-2-1","config":"edition=terminal-bench 2.1, reasoning_effort=high, runner=external, stderr=1.124, task=overall, updated=2026-08-19","measured_date":"2026-08-19"}}},{"id":"gpt-5.5","display_name":"GPT-5.5","family_id":"gpt","vendor":"OpenAI","status":"current","kind":"model","superseded_by":null,"release_date":"2026-04-23","intelligence_index":84.84,"coverage":0.9207,"index_subset_bias":null,"params_total_b":null,"params_active_b":null,"vram_est":null,"vram_frontier":null,"fits_on":null,"is_moe":false,"is_open_weights":false,"context_window_tok":1050000,"pricing":{"prompt_usd_per_m":5,"completion_usd_per_m":30,"blended_usd_per_m":11.25},"scores":{"arc_agi_2":{"raw":85,"norm":88.89,"trust":3,"source_url":"https://arcprize.org/leaderboard","config":"cost_per_task_usd=1.87, eval=arc-agi-2 semi-private (v2_semi_private), model_group=gpt-5-5-2026-04-22-thinking, org=openai, run: xhigh, system_type=cot","measured_date":"2026-08-21"},"arena_elo":{"raw":1476.7,"norm":87.84,"trust":3,"source_url":"https://lmarena.ai/leaderboard","config":"text","measured_date":"2026-10-06"},"gpqa_diamond":{"raw":93.18,"norm":96.03,"trust":3,"source_url":"https://www.vals.ai/benchmarks/gpqa","config":"edition=gpqa diamond v1, reasoning_effort=xhigh, runner=platform, stderr=1.288, task=overall, updated=2026-08-19","measured_date":"2026-08-19"},"hle":{"raw":45.78,"norm":64.38,"trust":2,"source_url":"https://artificialanalysis.ai/models/gpt-5-5","config":"aa field hle, artificial analysis intelligence index v4.1.1 suite, effort=xhigh, humanity's last exam, reasoning=true, run: xhigh, source value 0.457831325301205 is a 0-1 fraction, x100 at harvest","measured_date":null},"livebench":{"raw":80.19,"norm":89.31,"trust":3,"source_url":"https://livebench.ai/","config":"livebench-2026-06-25 release, run: xhigh effort","measured_date":null},"mmlu_pro":{"raw":88.14,"norm":80.23,"trust":3,"source_url":"https://www.vals.ai/benchmarks/mmlu_pro","config":"edition=mmlu pro v1, reasoning_effort=xhigh, runner=platform, stderr=0.318, task=overall, updated=2026-08-19","measured_date":"2026-08-19"},"swe_bench_verified":{"raw":82.6,"norm":80.67,"trust":3,"source_url":"https://www.vals.ai/benchmarks/swebench","config":"edition=swe-bench verified v1, reasoning_effort=xhigh, runner=external, stderr=1.695, task=overall, updated=2026-08-19","measured_date":"2026-08-19"},"tau_bench":{"raw":93.86,"norm":98.48,"trust":2,"source_url":"https://artificialanalysis.ai/models/gpt-5-5","config":"aa field tau2, aa field tau2 (not mapped to tau_bench), artificial analysis intelligence index v4.1.1 suite, effort=xhigh, reasoning=true, run: xhigh, source value 0.93859649122807 is a 0-1 fraction, x100 at harvest","measured_date":null},"terminal_bench":{"raw":76.4,"norm":84,"trust":3,"source_url":"https://www.vals.ai/benchmarks/terminal-bench-2-1","config":"edition=terminal-bench 2.1, reasoning_effort=high, runner=external, stderr=0.649, task=overall, updated=2026-08-19","measured_date":"2026-08-19"}}},{"id":"kimi-k3","display_name":"Kimi K3","family_id":"kimi","vendor":"Moonshot AI","status":"current","kind":"model","superseded_by":null,"release_date":"2026-07-16","intelligence_index":84.38,"coverage":0.873,"index_subset_bias":null,"params_total_b":2779.93,"params_active_b":104,"vram_est":{"bf16_gb":5560,"int8_gb":2947,"int4_gb":1668,"method":"linear-rom-v1","approximate":true,"basis":"params_total_b"},"vram_frontier":{"efficiency":0.2,"expected_int8_gb":604,"method":"frontier-residual-v1","approximate":true},"fits_on":{},"is_moe":true,"is_open_weights":true,"context_window_tok":1048576,"pricing":{"prompt_usd_per_m":0.95,"completion_usd_per_m":14,"blended_usd_per_m":4.2125},"scores":{"arc_agi_2":{"raw":60.42,"norm":61.58,"trust":3,"source_url":"https://arcprize.org/results/moonshot-kimi-k3","config":"cost_per_task_usd=1.5926940250000003, eval=arc-agi-2 semi-private (v2_semi_private), model_group=moonshot-kimi-k3, org=moonshot ai, run: max, setting=evaluation conducted with 'max' reasoning effort via baseten., system_type=cot","measured_date":"2026-08-21"},"arena_elo":{"raw":1489,"norm":93.32,"trust":3,"source_url":"https://arena.ai/leaderboard/text","config":"arena.ai text leaderboard, kimi-k3-max (+/-6)","measured_date":null},"gpqa_diamond":{"raw":92.93,"norm":95.68,"trust":3,"source_url":"https://www.vals.ai/benchmarks/gpqa","config":"edition=gpqa diamond v1, runner=platform, stderr=1.309, task=overall, updated=2026-08-19","measured_date":"2026-08-19"},"hle":{"raw":46.9,"norm":66.03,"trust":2,"source_url":"https://artificialanalysis.ai/models/kimi-k3","config":"aa field hle, artificial analysis intelligence index v4.1.1 suite, effort=max, humanity's last exam, reasoning=true, run: max, source value 0.468952734012975 is a 0-1 fraction, x100 at harvest","measured_date":null},"livebench":{"raw":79.19,"norm":87.09,"trust":3,"source_url":"https://livebench.ai/","config":"livebench-2026-06-25 release","measured_date":null},"mmlu_pro":{"raw":87.97,"norm":79.95,"trust":3,"source_url":"https://www.vals.ai/benchmarks/mmlu_pro","config":"edition=mmlu pro v1, reasoning_effort=max, runner=platform, stderr=0.321, task=overall, updated=2026-08-19","measured_date":"2026-08-19"},"swe_bench_verified":{"raw":93.4,"norm":92.67,"trust":3,"source_url":"https://www.vals.ai/benchmarks/swebench","config":"edition=swe-bench verified v1, runner=external, stderr=1.111, task=overall, updated=2026-08-19","measured_date":"2026-08-19"},"terminal_bench":{"raw":80.9,"norm":89.29,"trust":3,"source_url":"https://www.vals.ai/benchmarks/terminal-bench-2-1","config":"edition=terminal-bench 2.1, runner=external, stderr=0.649, task=overall, updated=2026-08-19","measured_date":"2026-08-19"}}},{"id":"gpt-5.6-terra","display_name":"GPT-5.6 Terra","family_id":"gpt","vendor":"OpenAI","status":"current","kind":"model","superseded_by":null,"release_date":"2026-07-09","intelligence_index":84.26,"coverage":0.9207,"index_subset_bias":null,"params_total_b":null,"params_active_b":null,"vram_est":null,"vram_frontier":null,"fits_on":null,"is_moe":false,"is_open_weights":false,"context_window_tok":1050000,"pricing":{"prompt_usd_per_m":2,"completion_usd_per_m":12,"blended_usd_per_m":4.5},"scores":{"arc_agi_2":{"raw":83.9,"norm":87.67,"trust":3,"source_url":"https://arcprize.org/results/openai-gpt-5-6-terra","config":"cost_per_task_usd=1.09, eval=arc-agi-2 semi-private (v2_semi_private), model_group=openai-gpt-5-6-terra, org=openai, run: max, system_type=cot","measured_date":"2026-08-21"},"arena_elo":{"raw":1465.5,"norm":82.84,"trust":3,"source_url":"https://lmarena.ai/leaderboard","config":"text","measured_date":"2026-10-03"},"gpqa_diamond":{"raw":90.91,"norm":92.83,"trust":3,"source_url":"https://www.vals.ai/benchmarks/gpqa","config":"edition=gpqa diamond v1, reasoning_effort=xhigh, runner=platform, stderr=1.906, task=overall, updated=2026-08-19","measured_date":"2026-08-19"},"hle":{"raw":42.91,"norm":60.16,"trust":2,"source_url":"https://artificialanalysis.ai/models/gpt-5-6-terra","config":"aa field hle, artificial analysis intelligence index v4.1.1 suite, effort=max, humanity's last exam, reasoning=true, run: max, source value 0.429101019462465 is a 0-1 fraction, x100 at harvest","measured_date":null},"livebench":{"raw":77.9,"norm":84.22,"trust":3,"source_url":"https://livebench.ai/","config":"agentic coding 54.9, coding 78.2, data analysis 79. [raw: livebench (livebench-2026-06-25) overall], global/overall average, livebench-2026-06-25 release, mathematics 94.9, row \"gpt-5.6 terra max effort\" (category splits on same row: reasoning 90.6","measured_date":null},"mmlu_pro":{"raw":86.66,"norm":77.77,"trust":3,"source_url":"https://www.vals.ai/benchmarks/mmlu_pro","config":"edition=mmlu pro v1, reasoning_effort=xhigh, runner=platform, stderr=0.333, task=overall, updated=2026-08-19","measured_date":"2026-08-19"},"swe_bench_verified":{"raw":95.4,"norm":94.89,"trust":3,"source_url":"https://www.vals.ai/benchmarks/swebench","config":"edition=swe-bench verified v1, reasoning_effort=max, runner=external, stderr=0.938, task=overall, updated=2026-08-19","measured_date":"2026-08-19"},"tau_bench":{"raw":86.26,"norm":88.35,"trust":2,"source_url":"https://artificialanalysis.ai/models/gpt-5-6-terra","config":"aa field tau2, aa field tau2 (not mapped to tau_bench), artificial analysis intelligence index v4.1.1 suite, effort=max, reasoning=true, run: max, source value 0.862573099415205 is a 0-1 fraction, x100 at harvest","measured_date":null},"terminal_bench":{"raw":77.53,"norm":85.33,"trust":3,"source_url":"https://www.vals.ai/benchmarks/terminal-bench-2-1","config":"edition=terminal-bench 2.1, reasoning_effort=max, runner=external, stderr=2.247, task=overall, updated=2026-08-19","measured_date":"2026-08-19"}}},{"id":"gpt-5.4-pro","display_name":"GPT-5.4 Pro","family_id":"gpt","vendor":"OpenAI","status":"superseded","kind":"model","superseded_by":"gpt-5.5-pro","release_date":"2026-03-05","intelligence_index":84.14,"coverage":0.3492,"index_subset_bias":{"offset":-1.16,"peers":10,"method":"subset-knn-v1"},"params_total_b":null,"params_active_b":null,"vram_est":null,"vram_frontier":null,"fits_on":null,"is_moe":false,"is_open_weights":false,"context_window_tok":1050000,"pricing":{"prompt_usd_per_m":30,"completion_usd_per_m":180,"blended_usd_per_m":67.5},"scores":{"arc_agi_2":{"raw":83.33,"norm":87.03,"trust":3,"source_url":"https://arcprize.org/leaderboard","config":"cost_per_task_usd=16.41, eval=arc-agi-2 semi-private (v2_semi_private), model_group=gpt-5-4-pro, org=openai, run: xhigh, system_type=cot","measured_date":"2026-08-21"},"gpqa_diamond":{"raw":94.6,"norm":98.03,"trust":2,"source_url":"https://epoch.ai/models/gpt-5-4-pro","config":"90% ci ±1.6%, best score across settings, epoch ai independent eval","measured_date":null},"hle":{"raw":44.3,"norm":62.21,"trust":2,"source_url":"https://epoch.ai/models/gpt-5-4-pro","config":"best score across settings, epoch ai independent eval, no tools","measured_date":null}}},{"id":"grok-4.6","display_name":"Grok 4.6","family_id":"grok","vendor":"xAI","status":"superseded","kind":"model","superseded_by":"grok-4.7","release_date":"2026-08-12","intelligence_index":83.8,"coverage":0.873,"index_subset_bias":null,"params_total_b":null,"params_active_b":null,"vram_est":null,"vram_frontier":null,"fits_on":null,"is_moe":false,"is_open_weights":false,"context_window_tok":500000,"pricing":{"prompt_usd_per_m":2,"completion_usd_per_m":6,"blended_usd_per_m":3},"scores":{"arc_agi_2":{"raw":67.08,"norm":68.98,"trust":3,"source_url":"https://arcprize.org/results/xai-grok-4-6","config":"cost_per_task_usd=0.7574904499999999, eval=arc-agi-2 semi-private (v2_semi_private), model_group=xai-grok-4-6, org=xai, run: xhigh, setting=evaluation conducted with 'xhigh' reasoning effort., system_type=cot","measured_date":"2026-08-21"},"arena_elo":{"raw":1453.8,"norm":77.63,"trust":3,"source_url":"https://lmarena.ai/leaderboard","config":"text","measured_date":"2026-10-03"},"gpqa_diamond":{"raw":94.7,"norm":98.17,"trust":3,"source_url":"https://www.vals.ai/benchmarks/gpqa","config":"edition=gpqa diamond v1, reasoning_effort=high, runner=platform, stderr=1.125, task=overall, updated=2026-08-19","measured_date":"2026-08-19"},"hle":{"raw":44.07,"norm":61.87,"trust":2,"source_url":"https://artificialanalysis.ai/models/grok-4-6-xhigh","config":"aa field hle, artificial analysis intelligence index v4.1.1 suite, effort=xhigh, humanity's last exam, reasoning=true, run: xhigh, source value 0.440685820203893 is a 0-1 fraction, x100 at harvest","measured_date":null},"livebench":{"raw":78.04,"norm":84.53,"trust":3,"source_url":"https://livebench.ai/","config":"global average, livebench-2026-06-25 release, run grok-4.6","measured_date":null},"mmlu_pro":{"raw":89.4,"norm":82.33,"trust":3,"source_url":"https://www.vals.ai/benchmarks/mmlu_pro","config":"edition=mmlu pro v1, reasoning_effort=high, runner=platform, stderr=0.305, task=overall, updated=2026-08-19","measured_date":"2026-08-19"},"swe_bench_verified":{"raw":95.6,"norm":95.11,"trust":3,"source_url":"https://www.vals.ai/benchmarks/swebench","config":"edition=swe-bench verified v1, reasoning_effort=high, runner=external, stderr=0.918, task=overall, updated=2026-08-19","measured_date":"2026-08-19"},"terminal_bench":{"raw":78.28,"norm":86.21,"trust":3,"source_url":"https://www.vals.ai/benchmarks/terminal-bench-2-1","config":"edition=terminal-bench 2.1, reasoning_effort=high, runner=external, stderr=2.085, task=overall, updated=2026-08-19","measured_date":"2026-08-19"}}},{"id":"qwen-3.5-plus","display_name":"Qwen3.5 Plus 2026-04-20","family_id":"qwen","vendor":"Alibaba","status":"superseded","kind":"model","superseded_by":"qwen-3.7-plus","release_date":"2026-03-04","intelligence_index":83.6,"coverage":0.3572,"index_subset_bias":{"offset":14.46,"peers":10,"method":"subset-knn-v1"},"params_total_b":397,"params_active_b":17,"vram_est":{"bf16_gb":794,"int8_gb":421,"int4_gb":238,"method":"linear-rom-v1","approximate":true,"basis":"params_total_b"},"vram_frontier":null,"fits_on":null,"is_moe":false,"is_open_weights":false,"context_window_tok":1000000,"pricing":{"prompt_usd_per_m":0.26,"completion_usd_per_m":1.56,"blended_usd_per_m":0.585},"scores":{"aime":{"raw":86.04,"norm":82.55,"trust":3,"source_url":"https://www.vals.ai/benchmarks/aime","config":"+/-1.11, vals ai independent eval","measured_date":"2026-04-16"},"gpqa_diamond":{"raw":87.37,"norm":87.85,"trust":3,"source_url":"https://www.vals.ai/benchmarks/gpqa","config":"+/-1.67, vals ai independent eval","measured_date":null},"mmlu_pro":{"raw":87.18,"norm":78.63,"trust":3,"source_url":"https://www.vals.ai/benchmarks/mmlu_pro","config":"+/-0.33, overall task, vals ai independent eval","measured_date":"2026-09-01"}}},{"id":"gpt-5.5-pro","display_name":"GPT-5.5 Pro","family_id":"gpt","vendor":"OpenAI","status":"current","kind":"model","superseded_by":null,"release_date":"2026-04-24","intelligence_index":83.45,"coverage":0.3492,"index_subset_bias":{"offset":-1.68,"peers":10,"method":"subset-knn-v1"},"params_total_b":null,"params_active_b":null,"vram_est":null,"vram_frontier":null,"fits_on":null,"is_moe":false,"is_open_weights":false,"context_window_tok":1050000,"pricing":{"prompt_usd_per_m":30,"completion_usd_per_m":180,"blended_usd_per_m":67.5},"scores":{"arc_agi_2":{"raw":84.58,"norm":88.42,"trust":3,"source_url":"https://arcprize.org/leaderboard","config":"cost_per_task_usd=10.51, eval=arc-agi-2 semi-private (v2_semi_private), model_group=gpt-5-5-pro-2026-04-23-thinking, org=openai, run: high, system_type=cot","measured_date":"2026-08-21"},"gpqa_diamond":{"raw":93.92,"norm":97.07,"trust":3,"source_url":"https://epoch.ai/data/benchmarks.csv","config":"epoch ai independent run, gpt-5.5-pro-pre-release, xhigh reasoning effort","measured_date":"2026-04-24"},"hle":{"raw":43.1,"norm":60.44,"trust":2,"source_url":"https://benchmarklist.com/models/openai-gpt-5.5-pro/","config":"no tools (with-tools score 57.2%), openai gpt-5.5 system card","measured_date":"2026-06-09"}}},{"id":"muse-spark-1.2","display_name":"Muse Spark 1.2","family_id":"muse","vendor":"Meta","status":"superseded","kind":"model","superseded_by":"muse-spark-1.3","release_date":"2026-08-05","intelligence_index":83.21,"coverage":0.7936,"index_subset_bias":{"offset":0.4,"peers":10,"method":"subset-knn-v1"},"params_total_b":null,"params_active_b":null,"vram_est":null,"vram_frontier":null,"fits_on":null,"is_moe":false,"is_open_weights":false,"context_window_tok":1048576,"pricing":{"prompt_usd_per_m":1.25,"completion_usd_per_m":4.25,"blended_usd_per_m":2},"scores":{"arena_elo":{"raw":1493.5,"norm":95.32,"trust":3,"source_url":"https://lmarena.ai/leaderboard","config":"text","measured_date":"2026-10-03"},"gpqa_diamond":{"raw":90.4,"norm":92.11,"trust":2,"source_url":"https://artificialanalysis.ai/models/muse-spark-1-2","config":"artificial analysis eval, muse spark 1.2 (xhigh)","measured_date":null},"hle":{"raw":45.46,"norm":63.91,"trust":2,"source_url":"https://artificialanalysis.ai/models/muse-spark-1-2","config":"artificial analysis eval, muse spark 1.2 (xhigh)","measured_date":null},"livebench":{"raw":77.95,"norm":84.33,"trust":3,"source_url":"https://livebench.ai/","config":"livebench-2026-06-25 release, run: xhigh effort","measured_date":null},"mmlu_pro":{"raw":88.28,"norm":80.47,"trust":3,"source_url":"https://www.vals.ai/benchmarks/mmlu_pro","config":"overall, xhigh reasoning effort","measured_date":"2026-08-15"},"swe_bench_verified":{"raw":86.6,"norm":85.11,"trust":3,"source_url":"https://www.vals.ai/benchmarks/swebench","config":"overall, xhigh reasoning effort","measured_date":"2026-08-14"},"terminal_bench":{"raw":69.66,"norm":76.07,"trust":3,"source_url":"https://www.vals.ai/benchmarks/terminal-bench-2-1","config":"overall, terminal-bench 2.1, xhigh reasoning effort","measured_date":"2026-08-13"}}},{"id":"glm-5.3","display_name":"GLM 5.3","family_id":"glm","vendor":"Zhipu AI (Z.ai)","status":"current","kind":"model","superseded_by":null,"release_date":"2026-08-18","intelligence_index":83.15,"coverage":0.6746,"index_subset_bias":{"offset":1.14,"peers":10,"method":"subset-knn-v1"},"params_total_b":753.33,"params_active_b":null,"vram_est":{"bf16_gb":1507,"int8_gb":799,"int4_gb":452,"method":"linear-rom-v1","approximate":true,"basis":"params_total_b"},"vram_frontier":{"efficiency":0.71,"expected_int8_gb":565,"method":"frontier-residual-v1","approximate":true},"fits_on":{},"is_moe":true,"is_open_weights":true,"context_window_tok":1048576,"pricing":{"prompt_usd_per_m":0.07,"completion_usd_per_m":7,"blended_usd_per_m":1.8025},"scores":{"arena_elo":{"raw":1486.9,"norm":92.38,"trust":3,"source_url":"https://arena.ai/leaderboard/text","config":"3751 votes, arena entry glm-5.3, leaderboard text-overall-style_control, rank 13, run: max, style control, text/overall, vote cutoff 2026-08-21","measured_date":"2026-08-21"},"gpqa_diamond":{"raw":88.13,"norm":88.92,"trust":3,"source_url":"https://www.vals.ai/benchmarks/gpqa","config":"edition=gpqa diamond v1, reasoning_effort=max, runner=platform, stderr=1.851, task=overall, updated=2026-08-19","measured_date":"2026-08-19"},"hle":{"raw":42.26,"norm":59.21,"trust":2,"source_url":"https://artificialanalysis.ai/models/glm-5-3","config":"aa field hle, artificial analysis intelligence index v4.1.1 suite, effort=max, humanity's last exam, reasoning=true, run: max, source value 0.422613531047266 is a 0-1 fraction, x100 at harvest","measured_date":null},"mmlu_pro":{"raw":86.77,"norm":77.95,"trust":3,"source_url":"https://www.vals.ai/benchmarks/mmlu_pro","config":"edition=mmlu pro v1, reasoning_effort=max, runner=platform, stderr=0.335, task=overall, updated=2026-08-19","measured_date":"2026-08-19"},"swe_bench_verified":{"raw":95.4,"norm":94.89,"trust":3,"source_url":"https://www.vals.ai/benchmarks/swebench","config":"edition=swe-bench verified v1, reasoning_effort=max, runner=external, stderr=0.938, task=overall, updated=2026-08-19","measured_date":"2026-08-19"},"terminal_bench":{"raw":71.54,"norm":78.28,"trust":3,"source_url":"https://www.vals.ai/benchmarks/terminal-bench-2-1","config":"edition=terminal-bench 2.1, reasoning_effort=max, runner=external, stderr=1.982, task=overall, updated=2026-08-19","measured_date":"2026-08-19"}}},{"id":"qwen-3.8-max-2.4t","display_name":"Qwen3.8-Max","family_id":"qwen","vendor":"Alibaba","status":"current","kind":"model","superseded_by":null,"release_date":"2026-08-02","intelligence_index":82.98,"coverage":0.7936,"index_subset_bias":{"offset":0.4,"peers":10,"method":"subset-knn-v1"},"params_total_b":2400,"params_active_b":95,"vram_est":{"bf16_gb":4800,"int8_gb":2544,"int4_gb":1440,"method":"linear-rom-v1","approximate":true,"basis":"params_total_b"},"vram_frontier":{"efficiency":0.22,"expected_int8_gb":560,"method":"frontier-residual-v1","approximate":true},"fits_on":{},"is_moe":true,"is_open_weights":true,"context_window_tok":1000000,"pricing":{"prompt_usd_per_m":2,"completion_usd_per_m":6,"blended_usd_per_m":3},"scores":{"arena_elo":{"raw":1481.6,"norm":90.02,"trust":3,"source_url":"https://lmarena.ai/leaderboard","config":"text","measured_date":"2026-10-03"},"gpqa_diamond":{"raw":93.69,"norm":96.75,"trust":3,"source_url":"https://www.vals.ai/benchmarks/gpqa","config":"edition=gpqa diamond v1, run: max, runner=platform, stderr=1.221, task=overall, updated=2026-08-19","measured_date":"2026-08-19"},"hle":{"raw":43.05,"norm":60.37,"trust":2,"source_url":"https://artificialanalysis.ai/models","config":"artificial analysis eval, qwen3.8 max","measured_date":null},"livebench":{"raw":78.46,"norm":85.47,"trust":3,"source_url":"https://livebench.ai/","config":"livebench-2026-06-25 release, run: max","measured_date":null},"mmlu_pro":{"raw":88.6,"norm":81,"trust":3,"source_url":"https://www.vals.ai/benchmarks/mmlu_pro","config":"edition=mmlu pro v1, run: max, runner=platform, stderr=0.313, task=overall, updated=2026-08-19","measured_date":"2026-08-19"},"swe_bench_verified":{"raw":85.6,"norm":84,"trust":3,"source_url":"https://www.vals.ai/benchmarks/swebench","config":"edition=swe-bench verified v1, run: max, runner=external, stderr=1.572, task=overall, updated=2026-08-19","measured_date":"2026-08-19"},"terminal_bench":{"raw":67.42,"norm":73.44,"trust":3,"source_url":"https://www.vals.ai/benchmarks/terminal-bench-2-1","config":"edition=terminal-bench 2.1, run: max, runner=external, stderr=0.649, task=overall, updated=2026-08-19","measured_date":"2026-08-19"}}},{"id":"hy-4","display_name":"Hy4 preview","family_id":"hy","vendor":"tencent","status":"current","kind":"model","superseded_by":null,"release_date":"2026-08-28","intelligence_index":82.9,"coverage":0.3174,"index_subset_bias":{"offset":-0.05,"peers":10,"method":"subset-knn-v1"},"params_total_b":779.96,"params_active_b":null,"vram_est":{"bf16_gb":1560,"int8_gb":827,"int4_gb":468,"method":"linear-rom-v1","approximate":true,"basis":"params_total_b"},"vram_frontier":{"efficiency":0.67,"expected_int8_gb":557,"method":"frontier-residual-v1","approximate":true},"fits_on":{},"is_moe":true,"is_open_weights":true,"context_window_tok":1048576,"pricing":{"prompt_usd_per_m":0.834,"completion_usd_per_m":2.501,"blended_usd_per_m":1.25075},"scores":{"gpqa_diamond":{"raw":92.3,"norm":94.79,"trust":1,"source_url":"https://huggingface.co/tencent/Hy4-preview","config":"highest available reasoning setting, tencent benchmark appendix","measured_date":null},"hle":{"raw":43.4,"norm":60.88,"trust":1,"source_url":"https://huggingface.co/tencent/Hy4-preview","config":"no tools, text-only","measured_date":null},"terminal_bench":{"raw":85.4,"norm":94.59,"trust":1,"source_url":"https://huggingface.co/tencent/Hy4-preview","config":"12h timeout, 500 turns, claude code harness, v2.1","measured_date":null}}},{"id":"qwen-3.8-2.4t-a95b","display_name":"Qwen3.8-2.4T-A95B","family_id":"qwen","vendor":"Alibaba","status":"current","kind":"model","superseded_by":null,"release_date":"2026-08-12","intelligence_index":82.69,"coverage":0.3174,"index_subset_bias":{"offset":-0.05,"peers":10,"method":"subset-knn-v1"},"params_total_b":2446.18,"params_active_b":95,"vram_est":{"bf16_gb":4892,"int8_gb":2593,"int4_gb":1468,"method":"linear-rom-v1","approximate":true,"basis":"params_total_b"},"vram_frontier":{"efficiency":0.21,"expected_int8_gb":551,"method":"frontier-residual-v1","approximate":true},"fits_on":{},"is_moe":true,"is_open_weights":true,"context_window_tok":1048576,"pricing":{"prompt_usd_per_m":2,"completion_usd_per_m":6,"blended_usd_per_m":3},"scores":{"gpqa_diamond":{"raw":93.54,"norm":96.54,"trust":2,"source_url":"https://artificialanalysis.ai/models/qwen3-8-2-4t-a95b","config":"aa field gpqa, artificial analysis intelligence index v4.1.1 suite, effort=none, gpqa diamond, reasoning=true, source value 0.935353535353535 is a 0-1 fraction, x100 at harvest","measured_date":null},"hle":{"raw":42.45,"norm":59.49,"trust":2,"source_url":"https://artificialanalysis.ai/models/qwen3-8-2-4t-a95b","config":"aa field hle, artificial analysis intelligence index v4.1.1 suite, effort=none, humanity's last exam, reasoning=true, source value 0.424467099165894 is a 0-1 fraction, x100 at harvest","measured_date":null},"terminal_bench":{"raw":82.02,"norm":90.61,"trust":2,"source_url":"https://artificialanalysis.ai/models/qwen3-8-2-4t-a95b","config":"aa field terminalbenchv21, artificial analysis intelligence index v4.1.1 suite, effort=none, reasoning=true, source value 0.820224719101124 is a 0-1 fraction, terminal-bench 2.1, x100 at harvest","measured_date":null}}},{"id":"gpt-5.4","display_name":"GPT-5.4","family_id":"gpt","vendor":"OpenAI","status":"superseded","kind":"model","superseded_by":"gpt-5.5","release_date":"2026-03-05","intelligence_index":81.82,"coverage":1,"index_subset_bias":null,"params_total_b":null,"params_active_b":null,"vram_est":null,"vram_frontier":null,"fits_on":null,"is_moe":false,"is_open_weights":false,"context_window_tok":1050000,"pricing":{"prompt_usd_per_m":2.5,"completion_usd_per_m":15,"blended_usd_per_m":5.625},"scores":{"aime":{"raw":96.67,"norm":95.84,"trust":3,"source_url":"https://www.vals.ai/benchmarks/aime","config":"archived=true, edition=aime v1, reasoning_effort=xhigh, runner=platform, stderr=0.534, task=overall, updated=2026-04-16","measured_date":"2026-08-19"},"arc_agi_2":{"raw":73.95,"norm":76.61,"trust":3,"source_url":"https://arcprize.org/leaderboard","config":"cost_per_task_usd=1.52, eval=arc-agi-2 semi-private (v2_semi_private), model_group=gpt-5-4, org=openai, run: xhigh, system_type=cot","measured_date":"2026-08-21"},"arena_elo":{"raw":1464.8,"norm":82.53,"trust":3,"source_url":"https://lmarena.ai/leaderboard","config":"text","measured_date":"2026-10-06"},"gpqa_diamond":{"raw":91.67,"norm":93.9,"trust":3,"source_url":"https://www.vals.ai/benchmarks/gpqa","config":"edition=gpqa diamond v1, reasoning_effort=xhigh, runner=platform, stderr=1.908, task=overall, updated=2026-08-19","measured_date":"2026-08-19"},"hle":{"raw":43.74,"norm":61.38,"trust":2,"source_url":"https://artificialanalysis.ai/models","config":"artificial analysis eval, gpt-5.4 (xhigh)","measured_date":null},"livebench":{"raw":77.97,"norm":84.38,"trust":3,"source_url":"https://livebench.ai/","config":"livebench-2026-06-25 release, run: xhigh effort","measured_date":null},"mmlu_pro":{"raw":87.48,"norm":79.13,"trust":3,"source_url":"https://www.vals.ai/benchmarks/mmlu_pro","config":"edition=mmlu pro v1, reasoning_effort=xhigh, runner=platform, stderr=0.421, task=overall, updated=2026-08-19","measured_date":"2026-08-19"},"swe_bench_verified":{"raw":78.2,"norm":75.78,"trust":3,"source_url":"https://www.vals.ai/benchmarks/swebench","config":"edition=swe-bench verified v1, reasoning_effort=xhigh, runner=external, stderr=1.848, task=overall, updated=2026-08-19","measured_date":"2026-08-19"},"tau_bench":{"raw":87.13,"norm":89.51,"trust":2,"source_url":"https://artificialanalysis.ai/models/gpt-5-4","config":"aa field tau2, aa field tau2 (not mapped to tau_bench), artificial analysis intelligence index v4.1.1 suite, effort=xhigh, reasoning=true, run: xhigh, source value 0.871345029239766 is a 0-1 fraction, x100 at harvest","measured_date":null},"terminal_bench":{"raw":78.28,"norm":86.21,"trust":2,"source_url":"https://artificialanalysis.ai/models","config":"artificial analysis eval, gpt-5.4 (xhigh), terminal-bench 2.1","measured_date":null}}},{"id":"muse-spark-1.1","display_name":"Muse Spark 1.1","family_id":"muse","vendor":"Meta","status":"superseded","kind":"model","superseded_by":"muse-spark-1.3","release_date":"2026-07-16","intelligence_index":81.66,"coverage":0.7936,"index_subset_bias":{"offset":0.31,"peers":10,"method":"subset-knn-v1"},"params_total_b":null,"params_active_b":null,"vram_est":null,"vram_frontier":null,"fits_on":null,"is_moe":false,"is_open_weights":false,"context_window_tok":1048576,"pricing":{"prompt_usd_per_m":1.25,"completion_usd_per_m":4.25,"blended_usd_per_m":2},"scores":{"arena_elo":{"raw":1491.3,"norm":94.34,"trust":3,"source_url":"https://lmarena.ai/leaderboard","config":"text","measured_date":"2026-10-03"},"gpqa_diamond":{"raw":91.16,"norm":93.18,"trust":3,"source_url":"https://www.vals.ai/benchmarks/gpqa","config":"overall, xhigh reasoning effort","measured_date":"2026-08-15"},"hle":{"raw":46.2,"norm":65,"trust":2,"source_url":"https://artificialanalysis.ai/models/muse-spark-1-1","config":"artificial analysis eval, muse spark 1.1 (xhigh)","measured_date":null},"livebench":{"raw":75.3,"norm":78.44,"trust":3,"source_url":"https://livebench.ai/","config":"livebench-2026-06-25 release, run: xhigh effort","measured_date":null},"mmlu_pro":{"raw":88.73,"norm":81.22,"trust":3,"source_url":"https://www.vals.ai/benchmarks/mmlu_pro","config":"overall, xhigh reasoning effort","measured_date":"2026-08-15"},"swe_bench_verified":{"raw":82,"norm":80,"trust":3,"source_url":"https://www.vals.ai/benchmarks/swebench","config":"overall, xhigh reasoning effort","measured_date":"2026-08-14"},"terminal_bench":{"raw":69.29,"norm":75.64,"trust":3,"source_url":"https://www.vals.ai/benchmarks/terminal-bench-2-1","config":"overall, terminal-bench 2.1, xhigh reasoning effort","measured_date":"2026-08-13"}}},{"id":"gemini-3.7-flash","display_name":"Gemini 3.7 Flash","family_id":"gemini","vendor":"Google","status":"superseded","kind":"model","superseded_by":"gemini-3.8-flash","release_date":"2026-08-13","intelligence_index":81.31,"coverage":0.9207,"index_subset_bias":null,"params_total_b":null,"params_active_b":null,"vram_est":null,"vram_frontier":null,"fits_on":null,"is_moe":false,"is_open_weights":false,"context_window_tok":1048576,"pricing":{"prompt_usd_per_m":0.75,"completion_usd_per_m":3.75,"blended_usd_per_m":1.5},"scores":{"arc_agi_2":{"raw":84.58,"norm":88.42,"trust":3,"source_url":"https://arcprize.org/results/google-gemini-3-7-flash","config":"cost_per_task_usd=0.24944951875000002, eval=arc-agi-2 semi-private (v2_semi_private), model_group=google-gemini-3-7-flash, org=google, run: high, setting=evaluation conducted with 'high' reasoning effort., system_type=cot","measured_date":"2026-08-21"},"arena_elo":{"raw":1487.7,"norm":92.74,"trust":3,"source_url":"https://lmarena.ai/leaderboard","config":"text","measured_date":"2026-10-03"},"gpqa_diamond":{"raw":93.94,"norm":97.1,"trust":3,"source_url":"https://www.vals.ai/benchmarks/gpqa","config":"edition=gpqa diamond v1, reasoning_effort=high, runner=platform, stderr=1.488, task=overall, updated=2026-08-19","measured_date":"2026-08-19"},"hle":{"raw":47.87,"norm":67.46,"trust":2,"source_url":"https://artificialanalysis.ai/models/gemini-3-7-flash","config":"gemini 3.7 flash (high), no tools","measured_date":null},"livebench":{"raw":78.83,"norm":86.29,"trust":3,"source_url":"https://livebench.ai/table_2026_06_25.csv","config":"2026-06-25 question release, gemini-3.7-flash-high, global average of 7 category averages","measured_date":"2026-06-25"},"mmlu_pro":{"raw":90.12,"norm":83.53,"trust":3,"source_url":"https://www.vals.ai/benchmarks/mmlu_pro","config":"edition=mmlu pro v1, reasoning_effort=high, runner=platform, stderr=0.296, task=overall, updated=2026-08-19","measured_date":"2026-08-19"},"swe_bench_verified":{"raw":80.8,"norm":78.67,"trust":3,"source_url":"https://www.vals.ai/benchmarks/swebench","config":"edition=swe-bench verified v1, reasoning_effort=high, runner=external, stderr=1.763, task=overall, updated=2026-08-19","measured_date":"2026-08-19"},"tau_bench":{"raw":32.78,"norm":17.04,"trust":2,"source_url":"https://artificialanalysis.ai/models/gemini-3-7-flash","config":"gemini 3.7 flash (high), tau^3-banking (artificial analysis edition)","measured_date":null},"terminal_bench":{"raw":77.53,"norm":85.33,"trust":3,"source_url":"https://www.vals.ai/benchmarks/terminal-bench-2-1","config":"edition=terminal-bench 2.1, reasoning_effort=high, runner=external, stderr=0.649, task=overall, updated=2026-08-19","measured_date":"2026-08-19"}}},{"id":"claude-opus-4.7","display_name":"Claude Opus 4.7","family_id":"claude","vendor":"Anthropic","status":"superseded","kind":"model","superseded_by":"claude-opus-5.5","release_date":"2026-04-16","intelligence_index":80.92,"coverage":0.9207,"index_subset_bias":null,"params_total_b":null,"params_active_b":null,"vram_est":null,"vram_frontier":null,"fits_on":null,"is_moe":false,"is_open_weights":false,"context_window_tok":1000000,"pricing":{"prompt_usd_per_m":5,"completion_usd_per_m":25,"blended_usd_per_m":10},"scores":{"arc_agi_2":{"raw":68.33,"norm":70.37,"trust":3,"source_url":"https://arcprize.org/leaderboard","config":"cost_per_task_usd=3.17, eval=arc-agi-2 semi-private (v2_semi_private), model_group=claude-4-7, org=anthropic, run: high, system_type=cot","measured_date":"2026-08-21"},"arena_elo":{"raw":1494.1,"norm":95.59,"trust":3,"source_url":"https://lmarena.ai/leaderboard","config":"text","measured_date":"2026-10-06"},"gpqa_diamond":{"raw":90.152,"norm":91.76,"trust":3,"source_url":"https://www.vals.ai/benchmarks/gpqa","config":"overall","measured_date":"2026-08-15"},"hle":{"raw":42.31,"norm":59.28,"trust":2,"source_url":"https://artificialanalysis.ai/models","config":"artificial analysis eval, claude opus 4.7 (adaptive reasoning, max effort)","measured_date":null},"livebench":{"raw":76.53,"norm":81.18,"trust":3,"source_url":"https://livebench.ai/","config":"livebench-2026-06-25 release, run: xhigh effort","measured_date":null},"mmlu_pro":{"raw":89.871,"norm":83.12,"trust":3,"source_url":"https://www.vals.ai/benchmarks/mmlu_pro","config":"overall","measured_date":"2026-08-15"},"swe_bench_verified":{"raw":82,"norm":80,"trust":3,"source_url":"https://www.vals.ai/benchmarks/swebench","config":"overall","measured_date":"2026-08-14"},"tau_bench":{"raw":88.6,"norm":91.47,"trust":2,"source_url":"https://artificialanalysis.ai/models/claude-opus-4-7","config":"aa field tau2, aa field tau2 (not mapped to tau_bench), artificial analysis intelligence index v4.1.1 suite, effort=max, max effort, reasoning=true, run: adaptive reasoning, source value 0.885964912280702 is a 0-1 fraction, x100 at harvest","measured_date":null},"terminal_bench":{"raw":68.539,"norm":74.75,"trust":3,"source_url":"https://www.vals.ai/benchmarks/terminal-bench-2-1","config":"overall, v2.1","measured_date":"2026-08-13"}}},{"id":"gemini-3.5-flash","display_name":"Gemini 3.5 Flash","family_id":"gemini","vendor":"Google","status":"superseded","kind":"model","superseded_by":"gemini-3.8-flash","release_date":"2026-05","intelligence_index":80.82,"coverage":0.9207,"index_subset_bias":null,"params_total_b":null,"params_active_b":null,"vram_est":null,"vram_frontier":null,"fits_on":null,"is_moe":false,"is_open_weights":false,"context_window_tok":1048576,"pricing":{"prompt_usd_per_m":1.5,"completion_usd_per_m":9,"blended_usd_per_m":3.375},"scores":{"arc_agi_2":{"raw":72.08,"norm":74.53,"trust":3,"source_url":"https://arcprize.org/leaderboard","config":"cost_per_task_usd=0.8503, eval=arc-agi-2 semi-private (v2_semi_private), model_group=gemini-3-5-flash, org=google, run: high, system_type=cot","measured_date":"2026-08-21"},"arena_elo":{"raw":1476.1,"norm":87.57,"trust":3,"source_url":"https://lmarena.ai/leaderboard","config":"text","measured_date":"2026-10-06"},"gpqa_diamond":{"raw":92.68,"norm":95.32,"trust":3,"source_url":"https://www.vals.ai/benchmarks/gpqa","config":"edition=gpqa diamond v1, reasoning_effort=high, runner=platform, stderr=1.462, task=overall, updated=2026-08-19","measured_date":"2026-08-19"},"hle":{"raw":42.68,"norm":59.82,"trust":2,"source_url":"https://artificialanalysis.ai/models/gemini-3-5-flash","config":"aa field hle, artificial analysis intelligence index v4.1.1 suite, effort=high, humanity's last exam, reasoning=true, run: high, source value 0.42678405931418 is a 0-1 fraction, x100 at harvest","measured_date":null},"livebench":{"raw":74.64,"norm":76.98,"trust":3,"source_url":"https://livebench.ai/","config":"global average, livebench-2026-06-25 release, run gemini-3.5-flash-high","measured_date":null},"mmlu_pro":{"raw":89.52,"norm":82.53,"trust":3,"source_url":"https://www.vals.ai/benchmarks/mmlu_pro","config":"edition=mmlu pro v1, reasoning_effort=high, runner=platform, stderr=0.306, task=overall, updated=2026-08-19","measured_date":"2026-08-19"},"swe_bench_verified":{"raw":78.8,"norm":76.44,"trust":3,"source_url":"https://www.vals.ai/benchmarks/swebench","config":"edition=swe-bench verified v1, reasoning_effort=high, runner=external, stderr=1.83, task=overall, updated=2026-08-19","measured_date":"2026-08-19"},"tau_bench":{"raw":95.61,"norm":100,"trust":2,"source_url":"https://artificialanalysis.ai/models/gemini-3-5-flash-medium","config":"aa field tau2, aa field tau2 (not mapped to tau_bench), artificial analysis intelligence index v4.1.1 suite, effort=medium, reasoning=true, run: medium, source value 0.956140350877193 is a 0-1 fraction, x100 at harvest","measured_date":null},"terminal_bench":{"raw":74.16,"norm":81.36,"trust":3,"source_url":"https://www.vals.ai/benchmarks/terminal-bench-2-1","config":"edition=terminal-bench 2.1, reasoning_effort=high, runner=external, stderr=1.124, task=overall, updated=2026-08-19","measured_date":"2026-08-19"}}},{"id":"dots-3-note","display_name":"Dots3-Note Preview","family_id":"dots","vendor":"dots-studio","status":"current","kind":"model","superseded_by":null,"release_date":"2026-08-14","intelligence_index":79.55,"coverage":0.2857,"index_subset_bias":{"offset":-1.72,"peers":10,"method":"subset-knn-v1"},"params_total_b":null,"params_active_b":null,"vram_est":null,"vram_frontier":null,"fits_on":null,"is_moe":false,"is_open_weights":false,"context_window_tok":512000,"pricing":{"prompt_usd_per_m":0,"completion_usd_per_m":0,"blended_usd_per_m":0},"scores":{"arc_agi_2":{"raw":81.4,"norm":84.89,"trust":1,"source_url":"https://huggingface.co/dots-studio/dots3-note-prev","config":"public evaluation set","measured_date":null},"hle":{"raw":52.6,"norm":74.41,"trust":1,"source_url":"https://huggingface.co/dots-studio/dots3-note-prev","config":"with tools","measured_date":null},"swe_bench_verified":{"raw":78.4,"norm":76,"trust":1,"source_url":"https://huggingface.co/dots-studio/dots3-note-prev","config":"live-swe-agent harness, with tools","measured_date":null},"terminal_bench":{"raw":75.1,"norm":82.47,"trust":1,"source_url":"https://huggingface.co/dots-studio/dots3-note-prev","config":"terminal-bench 2.1, terminus-2 harness","measured_date":null}}},{"id":"deepseek-v4-pro","display_name":"DeepSeek-V4-Pro","family_id":"deepseek","vendor":"DeepSeek","status":"current","kind":"model","superseded_by":null,"release_date":"2026-08-13","intelligence_index":79.4,"coverage":0.9207,"index_subset_bias":null,"params_total_b":1598.84,"params_active_b":49,"vram_est":{"bf16_gb":3198,"int8_gb":1695,"int4_gb":959,"method":"linear-rom-v1","approximate":true,"basis":"params_total_b"},"vram_frontier":{"efficiency":0.28,"expected_int8_gb":471,"method":"frontier-residual-v1","approximate":true},"fits_on":{},"is_moe":true,"is_open_weights":true,"context_window_tok":1048576,"pricing":{"prompt_usd_per_m":0.2088,"completion_usd_per_m":0.4176,"blended_usd_per_m":0.261},"scores":{"arc_agi_2":{"raw":59.72,"norm":60.8,"trust":3,"source_url":"https://arcprize.org/results/deepseek-v4-pro-0813","config":"cost_per_task_usd=0.5969432040000002, eval=arc-agi-2 semi-private (v2_semi_private), model_group=deepseek-v4-pro-0813, org=deepseek, run: high, setting=evaluation conducted with 'high' reasoning effort., system_type=cot","measured_date":"2026-08-21"},"arena_elo":{"raw":1457.8,"norm":79.41,"trust":3,"source_url":"https://lmarena.ai/leaderboard","config":"text","measured_date":"2026-10-03"},"gpqa_diamond":{"raw":92.42,"norm":94.96,"trust":3,"source_url":"https://www.vals.ai/benchmarks/gpqa","config":"edition=gpqa diamond v1, reasoning_effort=max, run: deepseek/deepseek-v4-pro-0813, runner=platform, stderr=2.02, task=overall, updated=2026-08-19","measured_date":"2026-08-19"},"hle":{"raw":41.01,"norm":57.37,"trust":2,"source_url":"https://artificialanalysis.ai/models","config":"artificial analysis eval, deepseek v4 pro 0813 (reasoning, max effort)","measured_date":null},"livebench":{"raw":71.6,"norm":70.22,"trust":3,"source_url":"https://livebench.ai/","config":"global average, livebench leaderboard row \"deepseek v4 pro\" (open)","measured_date":"2026-08-17"},"mmlu_pro":{"raw":87.25,"norm":78.75,"trust":3,"source_url":"https://www.vals.ai/benchmarks/mmlu_pro","config":"edition=mmlu pro v1, reasoning_effort=max, run: deepseek/deepseek-v4-pro, runner=platform, stderr=0.335, task=overall, updated=2026-08-19","measured_date":"2026-08-19"},"swe_bench_verified":{"raw":96.4,"norm":96,"trust":3,"source_url":"https://www.vals.ai/benchmarks/swebench","config":"edition=swe-bench verified v1, reasoning_effort=max, run: deepseek/deepseek-v4-pro-0813, runner=external, stderr=0.834, task=overall, updated=2026-08-19","measured_date":"2026-08-19"},"tau_bench":{"raw":96.2,"norm":100,"trust":2,"source_url":"https://artificialanalysis.ai/models/deepseek-v4-pro-0424","config":"aa field tau2, aa field tau2 (not mapped to tau_bench), artificial analysis intelligence index v4.1.1 suite, effort=max, max effort, reasoning=true, run: reasoning, source value 0.961988304093567 is a 0-1 fraction, x100 at harvest","measured_date":null},"terminal_bench":{"raw":54.68,"norm":58.45,"trust":3,"source_url":"https://www.vals.ai/benchmarks/terminal-bench-2-1","config":"edition=terminal-bench 2.1, reasoning_effort=max, run: deepseek/deepseek-v4-pro-0813, runner=external, stderr=1.498, task=overall, updated=2026-08-19","measured_date":"2026-08-19"}}},{"id":"deepseek-v4.1-flash","display_name":"DeepSeek V4.1 Flash","family_id":"deepseek","vendor":"DeepSeek","status":"current","kind":"model","superseded_by":null,"release_date":"2026-09-10","intelligence_index":79.33,"coverage":0.3174,"index_subset_bias":{"offset":-0.68,"peers":10,"method":"subset-knn-v1"},"params_total_b":763.21,"params_active_b":16,"vram_est":{"bf16_gb":1526,"int8_gb":809,"int4_gb":458,"method":"linear-rom-v1","approximate":true,"basis":"params_total_b"},"vram_frontier":{"efficiency":0.58,"expected_int8_gb":469,"method":"frontier-residual-v1","approximate":true},"fits_on":{},"is_moe":true,"is_open_weights":true,"context_window_tok":1048576,"pricing":{"prompt_usd_per_m":0.003,"completion_usd_per_m":2.4,"blended_usd_per_m":0.60225},"scores":{"gpqa_diamond":{"raw":90.9,"norm":92.82,"trust":1,"source_url":"https://huggingface.co/deepseek-ai/DeepSeek-V4.1-Flash","config":null,"measured_date":null},"hle":{"raw":36.8,"norm":51.18,"trust":1,"source_url":"https://huggingface.co/deepseek-ai/DeepSeek-V4.1-Flash","config":null,"measured_date":null},"terminal_bench":{"raw":90.6,"norm":100,"trust":1,"source_url":"https://huggingface.co/deepseek-ai/DeepSeek-V4.1-Flash","config":"1m-token context., 2.1, deepseek harness, minimal mode","measured_date":null}}},{"id":"grok-4.5","display_name":"Grok 4.5","family_id":"grok","vendor":"xAI","status":"superseded","kind":"model","superseded_by":"grok-4.7","release_date":"2026-07-16","intelligence_index":78.9,"coverage":0.873,"index_subset_bias":null,"params_total_b":null,"params_active_b":null,"vram_est":null,"vram_frontier":null,"fits_on":null,"is_moe":false,"is_open_weights":false,"context_window_tok":500000,"pricing":{"prompt_usd_per_m":2,"completion_usd_per_m":6,"blended_usd_per_m":3},"scores":{"arc_agi_2":{"raw":52.64,"norm":52.93,"trust":3,"source_url":"https://arcprize.org/results/xai-grok-4-5","config":"cost_per_task_usd=0.78, eval=arc-agi-2 semi-private (v2_semi_private), model_group=xai-grok-4-5, org=xai, run: high, system_type=cot","measured_date":"2026-08-21"},"arena_elo":{"raw":1465.8,"norm":82.98,"trust":3,"source_url":"https://lmarena.ai/leaderboard","config":"text","measured_date":"2026-10-01"},"gpqa_diamond":{"raw":92.93,"norm":95.68,"trust":3,"source_url":"https://www.vals.ai/benchmarks/gpqa","config":"edition=gpqa diamond v1, reasoning_effort=high, runner=platform, stderr=1.288, task=overall, updated=2026-08-19","measured_date":"2026-08-19"},"hle":{"raw":42.68,"norm":59.82,"trust":2,"source_url":"https://artificialanalysis.ai/models/grok-4-5","config":"aa field hle, artificial analysis intelligence index v4.1.1 suite, effort=high, humanity's last exam, reasoning=true, run: high, source value 0.42678405931418 is a 0-1 fraction, x100 at harvest","measured_date":null},"livebench":{"raw":75.77,"norm":79.49,"trust":3,"source_url":"https://livebench.ai/","config":"livebench-2026-06-25 release","measured_date":null},"mmlu_pro":{"raw":89.22,"norm":82.03,"trust":3,"source_url":"https://www.vals.ai/benchmarks/mmlu_pro","config":"edition=mmlu pro v1, reasoning_effort=high, runner=platform, stderr=0.31, task=overall, updated=2026-08-19","measured_date":"2026-08-19"},"swe_bench_verified":{"raw":86.6,"norm":85.11,"trust":3,"source_url":"https://www.vals.ai/benchmarks/swebench","config":"edition=swe-bench verified v1, reasoning_effort=high, runner=external, stderr=1.525, task=overall, updated=2026-08-19","measured_date":"2026-08-19"},"terminal_bench":{"raw":67.79,"norm":73.87,"trust":3,"source_url":"https://www.vals.ai/benchmarks/terminal-bench-2-1","config":"edition=terminal-bench 2.1, reasoning_effort=high, runner=external, stderr=4.416, task=overall, updated=2026-08-19","measured_date":"2026-08-19"}}},{"id":"glm-5.3-flash","display_name":"GLM 5.3 Flash","family_id":"glm","vendor":"Zhipu AI (Z.ai)","status":"current","kind":"model","superseded_by":null,"release_date":"2026-08-26","intelligence_index":78.84,"coverage":0.365,"index_subset_bias":{"offset":0.93,"peers":10,"method":"subset-knn-v1"},"params_total_b":321.32,"params_active_b":18,"vram_est":{"bf16_gb":643,"int8_gb":341,"int4_gb":193,"method":"linear-rom-v1","approximate":true,"basis":"params_total_b"},"vram_frontier":{"efficiency":1.35,"expected_int8_gb":459,"method":"frontier-residual-v1","approximate":true},"fits_on":{},"is_moe":true,"is_open_weights":true,"context_window_tok":1048576,"pricing":{"prompt_usd_per_m":0.15,"completion_usd_per_m":0.5,"blended_usd_per_m":0.2375},"scores":{"arena_elo":{"raw":1473,"norm":86.19,"trust":3,"source_url":"https://lmarena.ai/leaderboard","config":"text","measured_date":"2026-10-03"},"hle":{"raw":55.3,"norm":78.38,"trust":1,"source_url":"https://huggingface.co/zai-org/GLM-5.3-Flash","config":"full set, hle w/ tools","measured_date":null},"livebench":{"raw":71.6,"norm":70.22,"trust":3,"source_url":"https://livebench.ai/#/","config":"livebench-2026-06-25 release","measured_date":"2026-06-25"},"mmlu_pro":{"raw":86.06,"norm":76.77,"trust":3,"source_url":"https://www.vals.ai/benchmarks/mmlu_pro","config":"accuracy +/-0.34, vals.ai independent eval","measured_date":null},"terminal_bench":{"raw":84.3,"norm":93.29,"trust":1,"source_url":"https://huggingface.co/zai-org/GLM-5.3-Flash","config":"terminal bench 2.1","measured_date":null}}},{"id":"gpt-5.6-luna","display_name":"GPT-5.6 Luna","family_id":"gpt","vendor":"OpenAI","status":"current","kind":"model","superseded_by":null,"release_date":"2026-07-09","intelligence_index":78.79,"coverage":0.8016,"index_subset_bias":null,"params_total_b":null,"params_active_b":null,"vram_est":null,"vram_frontier":null,"fits_on":null,"is_moe":false,"is_open_weights":false,"context_window_tok":1050000,"pricing":{"prompt_usd_per_m":0.2,"completion_usd_per_m":1.2,"blended_usd_per_m":0.45},"scores":{"arc_agi_2":{"raw":59.54,"norm":60.6,"trust":3,"source_url":"https://arcprize.org/results/openai-gpt-5-6-luna","config":"cost_per_task_usd=0.67, eval=arc-agi-2 semi-private (v2_semi_private), model_group=openai-gpt-5-6-luna, org=openai, run: max, system_type=cot","measured_date":"2026-08-21"},"arena_elo":{"raw":1453.1,"norm":77.32,"trust":3,"source_url":"https://lmarena.ai/leaderboard","config":"text","measured_date":"2026-10-03"},"gpqa_diamond":{"raw":91.67,"norm":93.9,"trust":3,"source_url":"https://www.vals.ai/benchmarks/gpqa","config":"edition=gpqa diamond v1, reasoning_effort=max, runner=platform, stderr=1.736, task=overall, updated=2026-08-19","measured_date":"2026-08-19"},"hle":{"raw":39.48,"norm":55.12,"trust":2,"source_url":"https://artificialanalysis.ai/models/gpt-5-6-luna","config":"aa field hle, artificial analysis intelligence index v4.1.1 suite, effort=max, humanity's last exam, reasoning=true, run: max, source value 0.394810009267841 is a 0-1 fraction, x100 at harvest","measured_date":null},"mmlu_pro":{"raw":86.04,"norm":76.73,"trust":3,"source_url":"https://www.vals.ai/benchmarks/mmlu_pro","config":"edition=mmlu pro v1, reasoning_effort=max, runner=platform, stderr=0.35, task=overall, updated=2026-08-19","measured_date":"2026-08-19"},"swe_bench_verified":{"raw":93,"norm":92.22,"trust":3,"source_url":"https://www.vals.ai/benchmarks/swebench","config":"edition=swe-bench verified v1, reasoning_effort=max, runner=external, stderr=1.142, task=overall, updated=2026-08-19","measured_date":"2026-08-19"},"tau_bench":{"raw":71.3,"norm":68.4,"trust":2,"source_url":"https://openrouter.ai/openai/gpt-5.6-luna","config":"openrouter exacto, provider=openai","measured_date":"2026-08-17"},"terminal_bench":{"raw":79.03,"norm":87.09,"trust":3,"source_url":"https://www.vals.ai/benchmarks/terminal-bench-2-1","config":"edition=terminal-bench 2.1, reasoning_effort=max, runner=external, stderr=0.991, task=overall, updated=2026-08-19","measured_date":"2026-08-19"}}},{"id":"gemini-3.6-flash","display_name":"Gemini 3.6 Flash","family_id":"gemini","vendor":"Google","status":"superseded","kind":"model","superseded_by":"gemini-3.8-flash","release_date":"2026-07-21","intelligence_index":78.48,"coverage":0.873,"index_subset_bias":null,"params_total_b":null,"params_active_b":null,"vram_est":null,"vram_frontier":null,"fits_on":null,"is_moe":false,"is_open_weights":false,"context_window_tok":1048576,"pricing":{"prompt_usd_per_m":0.75,"completion_usd_per_m":3.75,"blended_usd_per_m":1.5},"scores":{"arc_agi_2":{"raw":60.42,"norm":61.58,"trust":3,"source_url":"https://arcprize.org/results/gemini-3-6-flash","config":"cost_per_task_usd=0.6060796625000002, eval=arc-agi-2 semi-private (v2_semi_private), model_group=gemini-3-6-flash, org=google, run: high, setting=evaluation conducted with 'high' reasoning effort., system_type=cot","measured_date":"2026-08-21"},"arena_elo":{"raw":1483,"norm":90.64,"trust":3,"source_url":"https://lmarena.ai/leaderboard","config":"text","measured_date":"2026-10-03"},"gpqa_diamond":{"raw":93.43,"norm":96.38,"trust":3,"source_url":"https://www.vals.ai/benchmarks/gpqa","config":"edition=gpqa diamond v1, reasoning_effort=high, runner=platform, stderr=1.329, task=overall, updated=2026-08-19","measured_date":"2026-08-19"},"hle":{"raw":40.82,"norm":57.09,"trust":2,"source_url":"https://artificialanalysis.ai/models","config":"artificial analysis eval, gemini 3.6 flash (high)","measured_date":null},"livebench":{"raw":73.59,"norm":74.64,"trust":3,"source_url":"https://livebench.ai/","config":"livebench-2026-06-25 release, run: high","measured_date":null},"mmlu_pro":{"raw":89.28,"norm":82.13,"trust":3,"source_url":"https://www.vals.ai/benchmarks/mmlu_pro","config":"edition=mmlu pro v1, reasoning_effort=high, runner=platform, stderr=0.305, task=overall, updated=2026-08-19","measured_date":"2026-08-19"},"swe_bench_verified":{"raw":79.6,"norm":77.33,"trust":3,"source_url":"https://www.vals.ai/benchmarks/swebench","config":"edition=swe-bench verified v1, reasoning_effort=high, runner=external, stderr=1.804, task=overall, updated=2026-08-19","measured_date":"2026-08-19"},"terminal_bench":{"raw":73.78,"norm":80.92,"trust":3,"source_url":"https://www.vals.ai/benchmarks/terminal-bench-2-1","config":"edition=terminal-bench 2.1, reasoning_effort=high, runner=external, stderr=1.633, task=overall, updated=2026-08-19","measured_date":"2026-08-19"}}},{"id":"inkling-1","display_name":"Inkling","family_id":"inkling","vendor":"thinkingmachines","status":"current","kind":"model","superseded_by":null,"release_date":"2026-07-17","intelligence_index":78.25,"coverage":0.6349,"index_subset_bias":{"offset":-0.24,"peers":10,"method":"subset-knn-v1"},"params_total_b":952.38,"params_active_b":null,"vram_est":{"bf16_gb":1905,"int8_gb":1010,"int4_gb":571,"method":"linear-rom-v1","approximate":true,"basis":"params_total_b"},"vram_frontier":{"efficiency":0.44,"expected_int8_gb":447,"method":"frontier-residual-v1","approximate":true},"fits_on":{},"is_moe":true,"is_open_weights":true,"context_window_tok":524288,"pricing":{"prompt_usd_per_m":0.95,"completion_usd_per_m":4.05,"blended_usd_per_m":1.7249999999999999},"scores":{"aime":{"raw":97.1,"norm":96.37,"trust":1,"source_url":"https://huggingface.co/thinkingmachines/Inkling","config":"aime 2026","measured_date":null},"arena_elo":{"raw":1441.4,"norm":72.1,"trust":3,"source_url":"https://lmarena.ai/leaderboard","config":"text","measured_date":"2026-10-03"},"gpqa_diamond":{"raw":87.2,"norm":87.61,"trust":1,"source_url":"https://huggingface.co/thinkingmachines/Inkling","config":null,"measured_date":null},"hle":{"raw":46,"norm":64.71,"trust":1,"source_url":"https://huggingface.co/thinkingmachines/Inkling","config":null,"measured_date":null},"swe_bench_verified":{"raw":77.6,"norm":75.11,"trust":1,"source_url":"https://huggingface.co/thinkingmachines/Inkling","config":null,"measured_date":null},"terminal_bench":{"raw":63.8,"norm":69.18,"trust":1,"source_url":"https://huggingface.co/thinkingmachines/Inkling","config":"best harness, v2.1","measured_date":null}}},{"id":"claude-opus-4.6","display_name":"Claude Opus 4.6","family_id":"claude","vendor":"Anthropic","status":"superseded","kind":"model","superseded_by":"claude-opus-5.5","release_date":"2026-02-04","intelligence_index":78.13,"coverage":0.9207,"index_subset_bias":null,"params_total_b":null,"params_active_b":null,"vram_est":null,"vram_frontier":null,"fits_on":null,"is_moe":false,"is_open_weights":false,"context_window_tok":1000000,"pricing":{"prompt_usd_per_m":5,"completion_usd_per_m":25,"blended_usd_per_m":10},"scores":{"arc_agi_2":{"raw":69.17,"norm":71.3,"trust":3,"source_url":"https://arcprize.org/leaderboard","config":"cost_per_task_usd=3.4719, eval=arc-agi-2 semi-private (v2_semi_private), high, model_group=claude-opus-4-6-thinking, org=anthropic, run: 120k, setting=evaluation conducted with a 120k thinking budget and a maximum context window of 128k tokens and 'high' output effort., system_type=cot","measured_date":"2026-08-21"},"arena_elo":{"raw":1497.3,"norm":97.02,"trust":3,"source_url":"https://lmarena.ai/leaderboard","config":"text","measured_date":"2026-10-06"},"gpqa_diamond":{"raw":89.646,"norm":91.05,"trust":3,"source_url":"https://www.vals.ai/benchmarks/gpqa","config":"overall","measured_date":"2026-08-15"},"hle":{"raw":39.94,"norm":55.79,"trust":2,"source_url":"https://artificialanalysis.ai/models","config":"artificial analysis eval, claude opus 4.6 (adaptive reasoning, max effort)","measured_date":null},"livebench":{"raw":74.52,"norm":76.71,"trust":3,"source_url":"https://livebench.ai/","config":"global average, livebench-2026-06-25 release, run claude-opus-4-6-thinking-auto-high-effort","measured_date":null},"mmlu_pro":{"raw":89.107,"norm":81.85,"trust":3,"source_url":"https://www.vals.ai/benchmarks/mmlu_pro","config":"overall","measured_date":"2026-08-15"},"swe_bench_verified":{"raw":78.2,"norm":75.78,"trust":3,"source_url":"https://www.vals.ai/benchmarks/swebench","config":"overall","measured_date":"2026-08-14"},"tau_bench":{"raw":92.11,"norm":96.15,"trust":2,"source_url":"https://artificialanalysis.ai/models/claude-opus-4-6-adaptive","config":"aa field tau2, aa field tau2 (not mapped to tau_bench), artificial analysis intelligence index v4.1.1 suite, effort=max, max effort, reasoning=true, run: adaptive reasoning, source value 0.921052631578947 is a 0-1 fraction, x100 at harvest","measured_date":null},"terminal_bench":{"raw":48.48,"norm":51.15,"trust":2,"source_url":"https://artificialanalysis.ai/models/claude-opus-4-6","config":"aa field terminalbenchhard, artificial analysis intelligence index v4.1.1 suite, effort=high, high effort, reasoning=false, run: non-reasoning, source value 0.484848484848485 is a 0-1 fraction, terminal-bench hard, x100 at harvest","measured_date":null}}},{"id":"gpt-5.2-pro","display_name":"GPT-5.2 Pro","family_id":"gpt","vendor":"OpenAI","status":"superseded","kind":"model","superseded_by":"gpt-5.5-pro","release_date":"2025-12-10","intelligence_index":77.41,"coverage":0.4285,"index_subset_bias":{"offset":-2.16,"peers":10,"method":"subset-knn-v1"},"params_total_b":null,"params_active_b":null,"vram_est":null,"vram_frontier":null,"fits_on":null,"is_moe":false,"is_open_weights":false,"context_window_tok":400000,"pricing":{"prompt_usd_per_m":21,"completion_usd_per_m":168,"blended_usd_per_m":57.75},"scores":{"aime":{"raw":100,"norm":100,"trust":1,"source_url":"https://openai.com/index/introducing-gpt-5-2/","config":"2025, no tools, xhigh reasoning effort","measured_date":"2025-12-11"},"arc_agi_2":{"raw":54.16,"norm":54.62,"trust":3,"source_url":"https://arcprize.org/leaderboard","config":"cost_per_task_usd=15.721, eval=arc-agi-2 semi-private (v2_semi_private), model_group=gpt-5-2-pro-2025-12-11-thinking, org=openai, run: high, system_type=cot","measured_date":"2026-08-21"},"gpqa_diamond":{"raw":93.2,"norm":96.06,"trust":1,"source_url":"https://openai.com/index/introducing-gpt-5-2/","config":"no tools, xhigh reasoning effort","measured_date":"2025-12-11"},"hle":{"raw":36.6,"norm":50.88,"trust":1,"source_url":"https://openai.com/index/introducing-gpt-5-2/","config":"no tools, xhigh reasoning effort","measured_date":"2025-12-11"}}},{"id":"deepseek-v4-flash-vision","display_name":"DeepSeek V4 Flash Vision Exp","family_id":"deepseek","vendor":"DeepSeek","status":"current","kind":"model","superseded_by":null,"release_date":"2026-08-21","intelligence_index":77.28,"coverage":0.4365,"index_subset_bias":{"offset":-1.09,"peers":10,"method":"subset-knn-v1"},"params_total_b":304.65,"params_active_b":null,"vram_est":{"bf16_gb":609,"int8_gb":323,"int4_gb":183,"method":"linear-rom-v1","approximate":true,"basis":"params_total_b"},"vram_frontier":{"efficiency":1.33,"expected_int8_gb":429,"method":"frontier-residual-v1","approximate":true},"fits_on":{},"is_moe":true,"is_open_weights":true,"context_window_tok":1048576,"pricing":{"prompt_usd_per_m":0.2156,"completion_usd_per_m":0.6468,"blended_usd_per_m":0.3234},"scores":{"gpqa_diamond":{"raw":91.31,"norm":93.39,"trust":2,"source_url":"https://artificialanalysis.ai/models/deepseek-v4-flash-vision","config":"artificial analysis independent evaluation","measured_date":null},"hle":{"raw":34.48,"norm":47.76,"trust":2,"source_url":"https://artificialanalysis.ai/models/deepseek-v4-flash-vision","config":"artificial analysis independent evaluation","measured_date":null},"livebench":{"raw":76.76,"norm":81.69,"trust":3,"source_url":"https://livebench.ai/","config":"livebench-2026-06-25 release","measured_date":null},"terminal_bench":{"raw":74.16,"norm":81.36,"trust":2,"source_url":"https://artificialanalysis.ai/models/deepseek-v4-flash-vision","config":"2.1, artificial analysis independent evaluation","measured_date":null}}},{"id":"qwen-3.8-flash","display_name":"Qwen3.8 Flash","family_id":"qwen","vendor":"Alibaba","status":"current","kind":"model","superseded_by":null,"release_date":"2026-08-26","intelligence_index":77.22,"coverage":0.3889,"index_subset_bias":{"offset":-0.25,"peers":10,"method":"subset-knn-v1"},"params_total_b":180,"params_active_b":null,"vram_est":{"bf16_gb":360,"int8_gb":191,"int4_gb":108,"method":"linear-rom-v1","approximate":true,"basis":"params_total_b"},"vram_frontier":{"efficiency":2.24,"expected_int8_gb":428,"method":"frontier-residual-v1","approximate":true},"fits_on":{"nvidia_dgx_spark":"int4"},"is_moe":true,"is_open_weights":true,"context_window_tok":1000000,"pricing":{"prompt_usd_per_m":0.15,"completion_usd_per_m":0.47,"blended_usd_per_m":0.22999999999999998},"scores":{"gpqa_diamond":{"raw":91.7,"norm":93.94,"trust":1,"source_url":"https://huggingface.co/Qwen/Qwen3.8-Flash-Next","config":null,"measured_date":null},"hle":{"raw":35.9,"norm":49.85,"trust":1,"source_url":"https://huggingface.co/Qwen/Qwen3.8-Flash-Next","config":"judged by gpt-4o","measured_date":null},"livebench":{"raw":76.2,"norm":80.44,"trust":3,"source_url":"https://livebench.ai/#/","config":"livebench-2026-06-25 release, overall","measured_date":"2026-06-25"}}},{"id":"gpt-5.3-codex","display_name":"GPT-5.3-Codex","family_id":"gpt","vendor":"OpenAI","status":"current","kind":"model","superseded_by":null,"release_date":"2026-02-24","intelligence_index":77.06,"coverage":0.5239,"index_subset_bias":{"offset":-0.35,"peers":10,"method":"subset-knn-v1"},"params_total_b":null,"params_active_b":null,"vram_est":null,"vram_frontier":null,"fits_on":null,"is_moe":false,"is_open_weights":false,"context_window_tok":400000,"pricing":{"prompt_usd_per_m":1.75,"completion_usd_per_m":14,"blended_usd_per_m":4.8125},"scores":{"gpqa_diamond":{"raw":91.52,"norm":93.69,"trust":2,"source_url":"https://artificialanalysis.ai/models/gpt-5-3-codex","config":"aa field gpqa, artificial analysis intelligence index v4.1.1 suite, effort=xhigh, gpqa diamond, reasoning=true, run: xhigh, source value 0.915151515151515 is a 0-1 fraction, x100 at harvest","measured_date":null},"hle":{"raw":42.49,"norm":59.54,"trust":2,"source_url":"https://artificialanalysis.ai/models/gpt-5-3-codex","config":"aa field hle, artificial analysis intelligence index v4.1.1 suite, effort=xhigh, humanity's last exam, reasoning=true, run: xhigh, source value 0.424930491195551 is a 0-1 fraction, x100 at harvest","measured_date":null},"swe_bench_verified":{"raw":78,"norm":75.56,"trust":3,"source_url":"https://www.vals.ai/benchmarks/swebench","config":"edition=swe-bench verified v1, reasoning_effort=xhigh, runner=external, stderr=1.854, task=overall, updated=2026-08-19","measured_date":"2026-08-19"},"tau_bench":{"raw":85.96,"norm":87.95,"trust":2,"source_url":"https://artificialanalysis.ai/models/gpt-5-3-codex","config":"aa field tau2, aa field tau2 (not mapped to tau_bench), artificial analysis intelligence index v4.1.1 suite, effort=xhigh, reasoning=true, run: xhigh, source value 0.859649122807018 is a 0-1 fraction, x100 at harvest","measured_date":null},"terminal_bench":{"raw":53.03,"norm":56.51,"trust":2,"source_url":"https://artificialanalysis.ai/models/gpt-5-3-codex","config":"aa field terminalbenchhard, artificial analysis intelligence index v4.1.1 suite, effort=xhigh, reasoning=true, run: xhigh, source value 0.53030303030303 is a 0-1 fraction, terminal-bench hard, x100 at harvest","measured_date":null}}},{"id":"deepseek-v4-flash","display_name":"DeepSeek-V4-Flash","family_id":"deepseek","vendor":"DeepSeek","status":"current","kind":"model","superseded_by":null,"release_date":"2026-07-31","intelligence_index":76.97,"coverage":0.9207,"index_subset_bias":null,"params_total_b":290.94,"params_active_b":13,"vram_est":{"bf16_gb":582,"int8_gb":308,"int4_gb":175,"method":"linear-rom-v1","approximate":true,"basis":"params_total_b"},"vram_frontier":{"efficiency":1.37,"expected_int8_gb":424,"method":"frontier-residual-v1","approximate":true},"fits_on":{},"is_moe":true,"is_open_weights":true,"context_window_tok":1048576,"pricing":{"prompt_usd_per_m":0.0063,"completion_usd_per_m":1.28,"blended_usd_per_m":0.324725},"scores":{"arc_agi_2":{"raw":55.97,"norm":56.63,"trust":3,"source_url":"https://arcprize.org/results/deepseek-v4-flash-0731","config":"cost_per_task_usd=0.0453381305, eval=arc-agi-2 semi-private (v2_semi_private), model_group=deepseek-v4-flash-0731, org=deepseek, run: high, setting=evaluation conducted with 'high' reasoning effort., system_type=cot","measured_date":"2026-08-21"},"arena_elo":{"raw":1436,"norm":69.7,"trust":3,"source_url":"https://lmarena.ai/leaderboard","config":"text","measured_date":"2026-10-03"},"gpqa_diamond":{"raw":89.9,"norm":91.41,"trust":3,"source_url":"https://www.vals.ai/benchmarks/gpqa","config":"edition=gpqa diamond v1, reasoning_effort=high, runner=platform, stderr=1.694, task=overall, updated=2026-08-19","measured_date":"2026-08-19"},"hle":{"raw":38.55,"norm":53.75,"trust":2,"source_url":"https://artificialanalysis.ai/models","config":"artificial analysis eval, deepseek v4 flash 0731 (reasoning, max effort)","measured_date":null},"livebench":{"raw":74.17,"norm":75.93,"trust":3,"source_url":"https://livebench.ai/","config":"global average, livebench-2026-06-25 release, run deepseek-v4-flash-0731","measured_date":null},"mmlu_pro":{"raw":86.21,"norm":77.02,"trust":3,"source_url":"https://www.vals.ai/benchmarks/mmlu_pro","config":"edition=mmlu pro v1, reasoning_effort=high, runner=platform, stderr=0.339, task=overall, updated=2026-08-19","measured_date":"2026-08-19"},"swe_bench_verified":{"raw":88.8,"norm":87.56,"trust":3,"source_url":"https://www.vals.ai/benchmarks/swebench","config":"edition=swe-bench verified v1, reasoning_effort=high, runner=external, stderr=1.412, task=overall, updated=2026-08-19","measured_date":"2026-08-19"},"tau_bench":{"raw":95.61,"norm":100,"trust":2,"source_url":"https://artificialanalysis.ai/models/deepseek-v4-flash-0420-high","config":"aa field tau2, aa field tau2 (not mapped to tau_bench), artificial analysis intelligence index v4.1.1 suite, effort=high, high effort, reasoning=true, run: reasoning, source value 0.956140350877193 is a 0-1 fraction, x100 at harvest","measured_date":null},"terminal_bench":{"raw":67.04,"norm":72.99,"trust":3,"source_url":"https://www.vals.ai/benchmarks/terminal-bench-2-1","config":"edition=terminal-bench 2.1, reasoning=false, runner=external, stderr=1.35, task=overall, updated=2026-08-19","measured_date":"2026-08-19"}}},{"id":"kimi-k2.6","display_name":"Kimi K2.6","family_id":"kimi","vendor":"Moonshot AI","status":"superseded","kind":"model","superseded_by":"kimi-k3","release_date":"2026-04","intelligence_index":76.92,"coverage":0.9207,"index_subset_bias":null,"params_total_b":1026.88,"params_active_b":32,"vram_est":{"bf16_gb":2054,"int8_gb":1088,"int4_gb":616,"method":"linear-rom-v1","approximate":true,"basis":"params_total_b"},"vram_frontier":null,"fits_on":{},"is_moe":true,"is_open_weights":true,"context_window_tok":262144,"pricing":{"prompt_usd_per_m":0.95,"completion_usd_per_m":4,"blended_usd_per_m":1.7125},"scores":{"aime":{"raw":96.4,"norm":95.5,"trust":1,"source_url":"https://huggingface.co/moonshotai/Kimi-K2.6","config":"thinking mode; aime 2026","measured_date":"2026-04-20"},"arena_elo":{"raw":1461,"norm":80.84,"trust":3,"source_url":"https://lmarena.ai/leaderboard","config":"text","measured_date":"2026-10-01"},"gpqa_diamond":{"raw":89.14,"norm":90.34,"trust":3,"source_url":"https://www.vals.ai/benchmarks/gpqa","config":"edition=gpqa diamond v1, runner=platform, stderr=1.997, task=overall, updated=2026-08-19","measured_date":"2026-08-19"},"hle":{"raw":37.49,"norm":52.19,"trust":2,"source_url":"https://artificialanalysis.ai/models/kimi-k2-6","config":"aa field hle, artificial analysis intelligence index v4.1.1 suite, effort=none, humanity's last exam, reasoning=true, run: kimi k2.6, source value 0.374884151992586 is a 0-1 fraction, x100 at harvest","measured_date":null},"livebench":{"raw":70.54,"norm":67.87,"trust":3,"source_url":"https://livebench.ai/","config":"livebench-2026-06-25 release","measured_date":null},"mmlu_pro":{"raw":87.57,"norm":79.28,"trust":3,"source_url":"https://www.vals.ai/benchmarks/mmlu_pro","config":"edition=mmlu pro v1, runner=platform, stderr=0.33, task=overall, updated=2026-08-19","measured_date":"2026-08-19"},"swe_bench_verified":{"raw":76.2,"norm":73.56,"trust":3,"source_url":"https://www.vals.ai/benchmarks/swebench","config":"edition=swe-bench verified v1, runner=external, stderr=1.906, task=overall, updated=2026-08-19","measured_date":"2026-08-19"},"tau_bench":{"raw":95.91,"norm":100,"trust":2,"source_url":"https://artificialanalysis.ai/models/kimi-k2-6","config":"aa field tau2, aa field tau2 (not mapped to tau_bench), artificial analysis intelligence index v4.1.1 suite, effort=none, reasoning=true, run: kimi k2.6, source value 0.95906432748538 is a 0-1 fraction, x100 at harvest","measured_date":null},"terminal_bench":{"raw":53.56,"norm":57.13,"trust":3,"source_url":"https://www.vals.ai/benchmarks/terminal-bench-2-1","config":"edition=terminal-bench 2.1, runner=external, stderr=2.085, task=overall, updated=2026-08-19","measured_date":"2026-08-19"}}},{"id":"qwen-3.7-plus","display_name":"Qwen3.7-Plus","family_id":"qwen","vendor":"Alibaba","status":"current","kind":"model","superseded_by":null,"release_date":"2026-06-03","intelligence_index":76.34,"coverage":0.7223,"index_subset_bias":{"offset":0.24,"peers":10,"method":"subset-knn-v1"},"params_total_b":null,"params_active_b":null,"vram_est":null,"vram_frontier":null,"fits_on":null,"is_moe":false,"is_open_weights":false,"context_window_tok":1000000,"pricing":{"prompt_usd_per_m":0.32,"completion_usd_per_m":1.28,"blended_usd_per_m":0.56},"scores":{"arena_elo":{"raw":1455.8,"norm":78.52,"trust":3,"source_url":"https://lmarena.ai/leaderboard","config":"text","measured_date":"2026-10-03"},"gpqa_diamond":{"raw":90,"norm":91.55,"trust":2,"source_url":"https://artificialanalysis.ai/models/qwen3-7-plus","config":"aa field gpqa, artificial analysis intelligence index v4.1.1 suite, effort=none, gpqa diamond, reasoning=true, source value 0.9 is a 0-1 fraction, x100 at harvest","measured_date":null},"hle":{"raw":35.63,"norm":49.46,"trust":2,"source_url":"https://artificialanalysis.ai/models/qwen3-7-plus","config":"aa field hle, artificial analysis intelligence index v4.1.1 suite, effort=none, humanity's last exam, reasoning=true, source value 0.356348470806302 is a 0-1 fraction, x100 at harvest","measured_date":null},"mmlu_pro":{"raw":88.5,"norm":80.83,"trust":1,"source_url":"https://qwen.ai/blog?id=qwen3.7-plus","config":"recommended system prompt sets reasoning effort to xhigh, vendor-reported","measured_date":"2026-05-31"},"swe_bench_verified":{"raw":77.7,"norm":75.22,"trust":1,"source_url":"https://qwen.ai/blog?id=qwen3.7-plus","config":"200k context window, internal agent scaffold (bash + file-edit tools), temp=1.0, top_p=0.95, vendor-reported","measured_date":"2026-05-31"},"tau_bench":{"raw":92.98,"norm":97.31,"trust":2,"source_url":"https://artificialanalysis.ai/models/qwen3-7-plus","config":"aa field tau2, aa field tau2 (not mapped to tau_bench), artificial analysis intelligence index v4.1.1 suite, effort=none, reasoning=true, source value 0.929824561403509 is a 0-1 fraction, x100 at harvest","measured_date":null},"terminal_bench":{"raw":52.81,"norm":56.25,"trust":3,"source_url":"https://www.vals.ai/benchmarks/terminal-bench-2-1","config":"edition=terminal-bench 2.1, runner=external, stderr=0.649, task=overall, updated=2026-08-19","measured_date":"2026-08-19"}}},{"id":"claude-sonnet-4.6","display_name":"Claude Sonnet 4.6","family_id":"claude","vendor":"Anthropic","status":"superseded","kind":"model","superseded_by":"claude-sonnet-5","release_date":"2026-02-17","intelligence_index":75.85,"coverage":0.8809,"index_subset_bias":null,"params_total_b":null,"params_active_b":null,"vram_est":null,"vram_frontier":null,"fits_on":null,"is_moe":false,"is_open_weights":false,"context_window_tok":1000000,"pricing":{"prompt_usd_per_m":3,"completion_usd_per_m":15,"blended_usd_per_m":6},"scores":{"aime":{"raw":95.6,"norm":94.5,"trust":1,"source_url":"https://www.anthropic.com/claude-sonnet-4-6-system-card","config":"adaptive thinking, aime 2025, avg of 10 trials [raw: aime 2025], max effort, no tools","measured_date":null},"arc_agi_2":{"raw":60.42,"norm":61.58,"trust":3,"source_url":"https://arcprize.org/leaderboard","config":"cost_per_task_usd=2.6966, eval=arc-agi-2 semi-private (v2_semi_private), model_group=claude-sonnet-4-6, org=anthropic, run: high, setting=evaluation conducted with a 120k thinking budget and a maximum context window of 128k tokens and 'high' output effort., system_type=cot","measured_date":"2026-08-21"},"arena_elo":{"raw":1472.2,"norm":85.83,"trust":3,"source_url":"https://lmarena.ai/leaderboard","config":"text","measured_date":"2026-10-03"},"gpqa_diamond":{"raw":87.47,"norm":87.99,"trust":2,"source_url":"https://artificialanalysis.ai/models/claude-sonnet-4-6-adaptive","config":"aa field gpqa, artificial analysis intelligence index v4.1.1 suite, effort=max, gpqa diamond, max effort, reasoning=true, run: adaptive reasoning, source value 0.874747474747475 is a 0-1 fraction, x100 at harvest","measured_date":null},"hle":{"raw":33.6,"norm":46.47,"trust":2,"source_url":"https://artificialanalysis.ai/models/claude-sonnet-4-6-adaptive","config":"aa field hle, artificial analysis intelligence index v4.1.1 suite, effort=max, humanity's last exam, max effort, reasoning=true, run: adaptive reasoning, source value 0.33595922150139 is a 0-1 fraction, x100 at harvest","measured_date":null},"livebench":{"raw":73,"norm":73.33,"trust":3,"source_url":"https://livebench.ai/","config":"2026-06-25 release, global average (overall), row 'claude 4.6 sonnet thinking medium effort' [raw: livebench]","measured_date":null},"swe_bench_verified":{"raw":79.6,"norm":77.33,"trust":1,"source_url":"https://www.anthropic.com/claude-sonnet-4-6-system-card","config":"500 problems, adaptive thinking, averaged over 10 trials (table footnote says 25), max effort, no prompt modification [raw: swe-bench verified]","measured_date":null},"tau_bench":{"raw":79.53,"norm":79.37,"trust":2,"source_url":"https://artificialanalysis.ai/models/claude-sonnet-4-6","config":"aa field tau2, aa field tau2 (not mapped to tau_bench), artificial analysis intelligence index v4.1.1 suite, effort=high, high effort, reasoning=false, run: non-reasoning, source value 0.795321637426901 is a 0-1 fraction, x100 at harvest","measured_date":null},"terminal_bench":{"raw":71.16,"norm":77.84,"trust":2,"source_url":"https://artificialanalysis.ai/models/claude-sonnet-4-6-adaptive","config":"aa field terminalbenchv21, artificial analysis intelligence index v4.1.1 suite, effort=max, max effort, reasoning=true, run: adaptive reasoning, source value 0.711610486891386 is a 0-1 fraction, terminal-bench 2.1, x100 at harvest","measured_date":null}}},{"id":"qwen-3.7-max","display_name":"Qwen3.7-Max","family_id":"qwen","vendor":"Alibaba","status":"current","kind":"model","superseded_by":null,"release_date":"2026-05-16","intelligence_index":75.68,"coverage":0.762,"index_subset_bias":{"offset":-0.2,"peers":10,"method":"subset-knn-v1"},"params_total_b":null,"params_active_b":null,"vram_est":null,"vram_frontier":null,"fits_on":null,"is_moe":false,"is_open_weights":false,"context_window_tok":1000000,"pricing":{"prompt_usd_per_m":1.475,"completion_usd_per_m":4.425,"blended_usd_per_m":2.2125000000000004},"scores":{"gpqa_diamond":{"raw":90.15,"norm":91.76,"trust":3,"source_url":"https://www.vals.ai/benchmarks/gpqa","config":"edition=gpqa diamond v1, run: max, runner=platform, stderr=1.497, task=overall, updated=2026-08-19","measured_date":"2026-08-19"},"hle":{"raw":40.5,"norm":56.62,"trust":2,"source_url":"https://artificialanalysis.ai/models/qwen3-7-max","config":"aa field hle, artificial analysis intelligence index v4.1.1 suite, effort=none, humanity's last exam, reasoning=true, run: max, source value 0.405004633920297 is a 0-1 fraction, x100 at harvest","measured_date":null},"livebench":{"raw":73.14,"norm":73.64,"trust":3,"source_url":"https://livebench.ai/","config":"livebench-2026-06-25 release, run: max","measured_date":null},"mmlu_pro":{"raw":89.31,"norm":82.18,"trust":3,"source_url":"https://www.vals.ai/benchmarks/mmlu_pro","config":"edition=mmlu pro v1, run: max, runner=platform, stderr=0.305, task=overall, updated=2026-08-19","measured_date":"2026-08-19"},"swe_bench_verified":{"raw":68.8,"norm":65.33,"trust":3,"source_url":"https://www.vals.ai/benchmarks/swebench","config":"edition=swe-bench verified v1, run: max, runner=external, stderr=2.074, task=overall, updated=2026-08-19","measured_date":"2026-08-19"},"tau_bench":{"raw":94.74,"norm":99.65,"trust":2,"source_url":"https://artificialanalysis.ai/models/qwen3-7-max","config":"aa field tau2, aa field tau2 (not mapped to tau_bench), artificial analysis intelligence index v4.1.1 suite, effort=none, reasoning=true, run: max, source value 0.947368421052632 is a 0-1 fraction, x100 at harvest","measured_date":null},"terminal_bench":{"raw":61.05,"norm":65.94,"trust":3,"source_url":"https://www.vals.ai/benchmarks/terminal-bench-2-1","config":"edition=terminal-bench 2.1, run: max, runner=external, stderr=0.375, task=overall, updated=2026-08-19","measured_date":"2026-08-19"}}},{"id":"grok-4.20","display_name":"Grok 4.20","family_id":"grok","vendor":"xAI","status":"superseded","kind":"model","superseded_by":"grok-4.7","release_date":"2026-03-31","intelligence_index":75.41,"coverage":0.8809,"index_subset_bias":null,"params_total_b":null,"params_active_b":null,"vram_est":null,"vram_frontier":null,"fits_on":null,"is_moe":false,"is_open_weights":false,"context_window_tok":2000000,"pricing":{"prompt_usd_per_m":1.25,"completion_usd_per_m":2.5,"blended_usd_per_m":1.5625},"scores":{"aime":{"raw":96.46,"norm":95.57,"trust":3,"source_url":"https://www.vals.ai/benchmarks/aime","config":"archived=true, edition=aime v1, runner=platform, stderr=0.516, task=overall, updated=2026-04-16","measured_date":"2026-08-19"},"arc_agi_2":{"raw":65.14,"norm":66.82,"trust":3,"source_url":"https://arcprize.org/leaderboard","config":"cost_per_task_usd=0.92, eval=arc-agi-2 semi-private (v2_semi_private), model_group=grok-4.20-beta-0309b-reasoning, org=xai, run: reasoning, system_type=cot","measured_date":"2026-08-21"},"arena_elo":{"raw":1474.6,"norm":86.9,"trust":3,"source_url":"https://arena.ai/leaderboard/text","config":"26770 votes, arena entry clanker-text, leaderboard text-overall-style_control, rank 25, run: grok-4.20-beta1, style control, text/overall, vote cutoff 2026-08-21","measured_date":"2026-08-21"},"gpqa_diamond":{"raw":88.64,"norm":89.63,"trust":3,"source_url":"https://www.vals.ai/benchmarks/gpqa","config":"edition=gpqa diamond v1, runner=platform, stderr=1.594, task=overall, updated=2026-08-19","measured_date":"2026-08-19"},"hle":{"raw":34.52,"norm":47.82,"trust":2,"source_url":"https://artificialanalysis.ai/models/grok-4-20","config":"grok 4.20 0309 v2 (reasoning), no tools","measured_date":null},"mmlu_pro":{"raw":86.25,"norm":77.08,"trust":3,"source_url":"https://www.vals.ai/benchmarks/mmlu_pro","config":"edition=mmlu pro v1, runner=platform, stderr=0.34, task=overall, updated=2026-08-19","measured_date":"2026-08-19"},"swe_bench_verified":{"raw":72.2,"norm":69.11,"trust":3,"source_url":"https://www.vals.ai/benchmarks/swebench","config":"edition=swe-bench verified v1, runner=external, stderr=2.006, task=overall, updated=2026-08-19","measured_date":"2026-08-19"},"tau_bench":{"raw":96.49,"norm":100,"trust":2,"source_url":"https://artificialanalysis.ai/models/grok-4-20-0309","config":"aa field tau2, aa field tau2 (not mapped to tau_bench), artificial analysis intelligence index v4.1.1 suite, effort=none, reasoning=true, run: reasoning, source value 0.964912280701754 is a 0-1 fraction, x100 at harvest","measured_date":null},"terminal_bench":{"raw":44.2,"norm":46.12,"trust":3,"source_url":"https://www.vals.ai/benchmarks/terminal-bench-2-1","config":"edition=terminal-bench 2.1, runner=external, stderr=0.991, task=overall, updated=2026-08-19","measured_date":"2026-08-19"}}},{"id":"claude-sonnet-5","display_name":"Claude Sonnet 5","family_id":"claude","vendor":"Anthropic","status":"current","kind":"model","superseded_by":null,"release_date":"2026-06-30","intelligence_index":75.34,"coverage":0.8413,"index_subset_bias":null,"params_total_b":null,"params_active_b":null,"vram_est":null,"vram_frontier":null,"fits_on":null,"is_moe":false,"is_open_weights":false,"context_window_tok":1000000,"pricing":{"prompt_usd_per_m":2,"completion_usd_per_m":10,"blended_usd_per_m":4},"scores":{"arena_elo":{"raw":1461.8,"norm":81.2,"trust":3,"source_url":"https://lmarena.ai/leaderboard","config":"text","measured_date":"2026-10-01"},"gpqa_diamond":{"raw":88.89,"norm":89.99,"trust":3,"source_url":"https://www.vals.ai/benchmarks/gpqa","config":"compute_effort=max, edition=gpqa diamond v1, runner=platform, stderr=2.224, task=overall, updated=2026-08-19","measured_date":"2026-08-19"},"hle":{"raw":41.29,"norm":57.78,"trust":2,"source_url":"https://artificialanalysis.ai/models/claude-sonnet-5","config":"aa field hle, artificial analysis intelligence index v4.1.1 suite, effort=max, humanity's last exam, max effort, reasoning=true, run: adaptive reasoning, source value 0.412882298424467 is a 0-1 fraction, x100 at harvest","measured_date":null},"livebench":{"raw":76.04,"norm":80.09,"trust":3,"source_url":"https://livebench.ai/table_2026_06_25.csv","config":"2026-06-25 question release, claude-sonnet-5-xhigh-effort, global average of 7 category averages","measured_date":"2026-06-25"},"mmlu_pro":{"raw":87.55,"norm":79.25,"trust":3,"source_url":"https://www.vals.ai/benchmarks/mmlu_pro","config":"compute_effort=max, edition=mmlu pro v1, runner=platform, stderr=0.368, task=overall, updated=2026-08-19","measured_date":"2026-08-19"},"swe_bench_verified":{"raw":79.6,"norm":77.33,"trust":3,"source_url":"https://www.vals.ai/benchmarks/swebench","config":"compute_effort=max, edition=swe-bench verified v1, runner=external, stderr=1.804, task=overall, updated=2026-08-19","measured_date":"2026-08-19"},"tau_bench":{"raw":37.32,"norm":23.09,"trust":2,"source_url":"https://artificialanalysis.ai/models/claude-sonnet-5","config":"adaptive reasoning, max effort, tau^3-banking (artificial analysis edition)","measured_date":null},"terminal_bench":{"raw":74.53,"norm":81.8,"trust":3,"source_url":"https://www.vals.ai/benchmarks/terminal-bench-2-1","config":"compute_effort=max, edition=terminal-bench 2.1, runner=external, stderr=2.085, task=overall, updated=2026-08-19","measured_date":"2026-08-19"}}},{"id":"solar-pro-4","display_name":"Solar Pro 4","family_id":"solar","vendor":"upstage","status":"current","kind":"model","superseded_by":null,"release_date":"2026-08-10","intelligence_index":75.19,"coverage":0.6428,"index_subset_bias":{"offset":5.92,"peers":10,"method":"subset-knn-v1"},"params_total_b":null,"params_active_b":null,"vram_est":null,"vram_frontier":null,"fits_on":null,"is_moe":false,"is_open_weights":false,"context_window_tok":524288,"pricing":{"prompt_usd_per_m":0.09,"completion_usd_per_m":0.36,"blended_usd_per_m":0.1575},"scores":{"aime":{"raw":95.3,"norm":94.12,"trust":1,"source_url":"https://www.upstage.ai/blog/en/solar-pro-4","config":"aime 2026, in-house evaluation","measured_date":"2026-08-11"},"arena_elo":{"raw":1386.2,"norm":47.5,"trust":3,"source_url":"https://lmarena.ai/leaderboard","config":"text","measured_date":"2026-10-03"},"gpqa_diamond":{"raw":89,"norm":90.14,"trust":1,"source_url":"https://www.upstage.ai/blog/en/solar-pro-4","config":null,"measured_date":"2026-08-11"},"mmlu_pro":{"raw":86.3,"norm":77.17,"trust":1,"source_url":"https://www.upstage.ai/blog/en/solar-pro-4","config":"in-house internal evaluation environment","measured_date":"2026-08-11"},"swe_bench_verified":{"raw":70.6,"norm":67.33,"trust":1,"source_url":"https://www.upstage.ai/blog/en/solar-pro-4","config":"in-house evaluation, openhands harness","measured_date":"2026-08-11"},"terminal_bench":{"raw":57,"norm":61.18,"trust":1,"source_url":"https://www.upstage.ai/blog/en/solar-pro-4","config":"v2.1","measured_date":"2026-08-11"}}},{"id":"glm-5.1","display_name":"GLM-5.1","family_id":"glm","vendor":"Zhipu AI (Z.ai)","status":"superseded","kind":"model","superseded_by":"glm-5.3","release_date":"2026-04-07","intelligence_index":75.17,"coverage":0.8016,"index_subset_bias":null,"params_total_b":753.86,"params_active_b":39,"vram_est":{"bf16_gb":1508,"int8_gb":799,"int4_gb":452,"method":"linear-rom-v1","approximate":true,"basis":"params_total_b"},"vram_frontier":null,"fits_on":{},"is_moe":true,"is_open_weights":true,"context_window_tok":204800,"pricing":{"prompt_usd_per_m":1.4,"completion_usd_per_m":4.4,"blended_usd_per_m":2.15},"scores":{"aime":{"raw":91.88,"norm":89.85,"trust":3,"source_url":"https://www.vals.ai/benchmarks/aime","config":"archived=true, edition=aime v1, runner=platform, stderr=0.438, task=overall, updated=2026-04-16","measured_date":"2026-08-19"},"arena_elo":{"raw":1464.6,"norm":82.44,"trust":3,"source_url":"https://lmarena.ai/leaderboard","config":"text","measured_date":"2026-10-03"},"gpqa_diamond":{"raw":84.52,"norm":83.83,"trust":3,"source_url":"https://www.vals.ai/benchmarks/gpqa","config":"edition=gpqa diamond v1, runner=platform, stderr=1.821, task=overall, updated=2026-08-19","measured_date":"2026-08-19"},"hle":{"raw":30.07,"norm":41.28,"trust":2,"source_url":"https://artificialanalysis.ai/models/glm-5-1","config":"artificial analysis eval, glm-5.1 (reasoning)","measured_date":null},"mmlu_pro":{"raw":86.9,"norm":78.17,"trust":3,"source_url":"https://www.vals.ai/benchmarks/mmlu_pro","config":"edition=mmlu pro v1, runner=platform, stderr=0.334, task=overall, updated=2026-08-19","measured_date":"2026-08-19"},"swe_bench_verified":{"raw":76.4,"norm":73.78,"trust":3,"source_url":"https://www.vals.ai/benchmarks/swebench","config":"edition=swe-bench verified v1, runner=external, stderr=1.901, task=overall, updated=2026-08-19","measured_date":"2026-08-19"},"tau_bench":{"raw":97.66,"norm":100,"trust":2,"source_url":"https://artificialanalysis.ai/models/glm-5-1","config":"aa field tau2, aa field tau2 (not mapped to tau_bench), artificial analysis intelligence index v4.1.1 suite, effort=none, reasoning=true, run: reasoning, source value 0.976608187134503 is a 0-1 fraction, x100 at harvest","measured_date":null},"terminal_bench":{"raw":56.93,"norm":61.09,"trust":3,"source_url":"https://www.vals.ai/benchmarks/terminal-bench-2-1","config":"edition=terminal-bench 2.1, runner=external, stderr=1.35, task=overall, updated=2026-08-19","measured_date":"2026-08-19"}}},{"id":"qwen-3.8-27b","display_name":"Qwen3.8 27B","family_id":"qwen","vendor":"Alibaba","status":"current","kind":"model","superseded_by":null,"release_date":"2026-08-14","intelligence_index":75.12,"coverage":0.7936,"index_subset_bias":{"offset":-0.13,"peers":10,"method":"subset-knn-v1"},"params_total_b":27.78,"params_active_b":27.78,"vram_est":{"bf16_gb":55.6,"int8_gb":29.4,"int4_gb":16.7,"method":"linear-rom-v1","approximate":true,"basis":"params_total_b"},"vram_frontier":{"efficiency":3.01,"expected_int8_gb":88.7,"method":"frontier-residual-v1","approximate":true},"fits_on":{"intel_b70":"fp8","nvidia_h100_sxm_80g":"fp8","nvidia_dgx_spark":"fp8"},"is_moe":false,"is_open_weights":true,"context_window_tok":1000000,"pricing":{"prompt_usd_per_m":0.425,"completion_usd_per_m":2.55,"blended_usd_per_m":0.9562499999999999},"scores":{"arena_elo":{"raw":1437.7,"norm":70.45,"trust":3,"source_url":"https://lmarena.ai/leaderboard","config":"text","measured_date":"2026-10-03"},"gpqa_diamond":{"raw":88.89,"norm":89.99,"trust":3,"source_url":"https://www.vals.ai/benchmarks/gpqa","config":"edition=gpqa diamond v1, reasoning_effort=xhigh, runner=platform, stderr=1.579, task=overall, updated=2026-08-19","measured_date":"2026-08-19"},"hle":{"raw":33.92,"norm":46.94,"trust":2,"source_url":"https://artificialanalysis.ai/models/qwen3-8-27b","config":"aa field hle, artificial analysis intelligence index v4.1.1 suite, effort=xhigh, humanity's last exam, reasoning=true, run: xhigh, source value 0.33920296570899 is a 0-1 fraction, x100 at harvest","measured_date":null},"livebench":{"raw":75.27,"norm":78.38,"trust":3,"source_url":"https://livebench.ai/","config":"livebench-2026-06-25 release","measured_date":null},"mmlu_pro":{"raw":84.34,"norm":73.9,"trust":3,"source_url":"https://www.vals.ai/benchmarks/mmlu_pro","config":"edition=mmlu pro v1, reasoning_effort=xhigh, runner=platform, stderr=0.356, task=overall, updated=2026-08-19","measured_date":"2026-08-19"},"swe_bench_verified":{"raw":86,"norm":84.44,"trust":3,"source_url":"https://www.vals.ai/benchmarks/swebench","config":"edition=swe-bench verified v1, reasoning_effort=xhigh, runner=external, stderr=1.553, task=overall, updated=2026-08-19","measured_date":"2026-08-19"},"terminal_bench":{"raw":58.43,"norm":62.86,"trust":3,"source_url":"https://www.vals.ai/benchmarks/terminal-bench-2-1","config":"edition=terminal-bench 2.1, reasoning_effort=xhigh, runner=external, stderr=5.254, task=overall, updated=2026-08-19","measured_date":"2026-08-19"}}},{"id":"qwen-3.5-397b-a17b","display_name":"Qwen3.5 397B A17B","family_id":"qwen","vendor":"Alibaba","status":"current","kind":"model","superseded_by":null,"release_date":"2026-02-16","intelligence_index":75.03,"coverage":0.8016,"index_subset_bias":null,"params_total_b":403.4,"params_active_b":17,"vram_est":{"bf16_gb":807,"int8_gb":428,"int4_gb":242,"method":"linear-rom-v1","approximate":true,"basis":"params_total_b"},"vram_frontier":{"efficiency":0.92,"expected_int8_gb":392,"method":"frontier-residual-v1","approximate":true},"fits_on":{},"is_moe":true,"is_open_weights":true,"context_window_tok":262144,"pricing":{"prompt_usd_per_m":0.45,"completion_usd_per_m":3,"blended_usd_per_m":1.0875},"scores":{"aime":{"raw":91.3,"norm":89.13,"trust":1,"source_url":"https://huggingface.co/Qwen/Qwen3.5-397B-A17B","config":"aime 2026, no tools, reasoning mode. model-card row \"aime26\". note: the hf model-index eval-results block separately lists a matharena aime 2026 figure of 93.33 for the same model. [raw: aime26]","measured_date":null},"arena_elo":{"raw":1441.8,"norm":72.28,"trust":3,"source_url":"https://lmarena.ai/leaderboard","config":"text","measured_date":"2026-10-03"},"gpqa_diamond":{"raw":89.29,"norm":90.55,"trust":2,"source_url":"https://artificialanalysis.ai/models/qwen3-5-397b-a17b","config":"aa field gpqa, artificial analysis intelligence index v4.1.1 suite, effort=none, gpqa diamond, reasoning=true, run: reasoning, source value 0.892929292929293 is a 0-1 fraction, x100 at harvest","measured_date":null},"hle":{"raw":28.96,"norm":39.65,"trust":2,"source_url":"https://artificialanalysis.ai/models/qwen3-5-397b-a17b","config":"aa field hle, artificial analysis intelligence index v4.1.1 suite, effort=none, humanity's last exam, reasoning=true, run: reasoning, source value 0.289620018535681 is a 0-1 fraction, x100 at harvest","measured_date":null},"mmlu_pro":{"raw":87.8,"norm":79.67,"trust":1,"source_url":"https://huggingface.co/Qwen/Qwen3.5-397B-A17B","config":"reasoning mode. official qwen model card language-benchmark table. [raw: mmlu-pro]","measured_date":null},"swe_bench_verified":{"raw":76.4,"norm":73.78,"trust":1,"source_url":"https://huggingface.co/Qwen/Qwen3.5-397B-A17B","config":"hf eval-results section repeats it as \"swe bench resolved\" 76.4. [raw: swe-bench verified], qwen internal bash + file-edit agent scaffold, resolved rate on the full verified set. model-card row \"swe-bench verified\"","measured_date":null},"tau_bench":{"raw":95.61,"norm":100,"trust":2,"source_url":"https://artificialanalysis.ai/models/qwen3-5-397b-a17b","config":"aa field tau2, aa field tau2 (not mapped to tau_bench), artificial analysis intelligence index v4.1.1 suite, effort=none, reasoning=true, run: reasoning, source value 0.956140350877193 is a 0-1 fraction, x100 at harvest","measured_date":null},"terminal_bench":{"raw":51.31,"norm":54.48,"trust":2,"source_url":"https://artificialanalysis.ai/models/qwen3-5-397b-a17b","config":"aa field terminalbenchv21, artificial analysis intelligence index v4.1.1 suite, effort=none, reasoning=true, run: reasoning, source value 0.51310861423221 is a 0-1 fraction, terminal-bench 2.1, x100 at harvest","measured_date":null}}},{"id":"nex-n2-mini","display_name":"nex-n2-mini","family_id":"nex","vendor":"nex-agi","status":"current","kind":"model","superseded_by":null,"release_date":"2026-06-24","intelligence_index":74.94,"coverage":0.3651,"index_subset_bias":{"offset":5.93,"peers":10,"method":"subset-knn-v1"},"params_total_b":35.11,"params_active_b":null,"vram_est":{"bf16_gb":70.2,"int8_gb":37.2,"int4_gb":21.1,"method":"linear-rom-v1","approximate":true,"basis":"params_total_b"},"vram_frontier":{"efficiency":10.49,"expected_int8_gb":390,"method":"frontier-residual-v1","approximate":true},"fits_on":{"intel_b70":"int4","nvidia_h100_sxm_80g":"fp8","nvidia_dgx_spark":"fp8"},"is_moe":true,"is_open_weights":true,"context_window_tok":262144,"pricing":{"prompt_usd_per_m":null,"completion_usd_per_m":null,"blended_usd_per_m":null},"scores":{"gpqa_diamond":{"raw":82.6,"norm":81.13,"trust":1,"source_url":"https://huggingface.co/nex-agi/Nex-N2-mini","config":"agentic eval suite","measured_date":null},"swe_bench_verified":{"raw":74.4,"norm":71.56,"trust":1,"source_url":"https://huggingface.co/nex-agi/Nex-N2-mini","config":"with tools (agentic)","measured_date":null},"terminal_bench":{"raw":60.7,"norm":65.53,"trust":1,"source_url":"https://huggingface.co/nex-agi/Nex-N2-mini","config":"terminal-bench 2.1","measured_date":null}}},{"id":"gpt-5.1-codex-max","display_name":"GPT-5.1-Codex-Max","family_id":"gpt","vendor":"OpenAI","status":"current","kind":"model","superseded_by":null,"release_date":"2025-11-19","intelligence_index":74.89,"coverage":0.3254,"index_subset_bias":{"offset":-1.66,"peers":10,"method":"subset-knn-v1"},"params_total_b":null,"params_active_b":null,"vram_est":null,"vram_frontier":null,"fits_on":null,"is_moe":false,"is_open_weights":false,"context_window_tok":400000,"pricing":{"prompt_usd_per_m":1.25,"completion_usd_per_m":10,"blended_usd_per_m":3.4375},"scores":{"livebench":{"raw":75.6,"norm":79.11,"trust":3,"source_url":"https://livebench.ai/table_2025_12_23.csv","config":"global average of the 7 category averages, leaderboard row gpt-5.1-codex-max (default effort), livebench 2025-12-23 release","measured_date":"2025-12-23"},"swe_bench_verified":{"raw":77.9,"norm":75.44,"trust":1,"source_url":"https://venturebeat.com/technology/openai-debuts-gpt-5-1-codex-max-coding-model-and-it-already-completed-a-24","config":"extra-high reasoning effort, n=500, with compaction","measured_date":"2025-11-19"},"terminal_bench":{"raw":58.1,"norm":62.47,"trust":1,"source_url":"https://venturebeat.com/technology/openai-debuts-gpt-5-1-codex-max-coding-model-and-it-already-completed-a-24","config":"extra-high reasoning effort, n=89, v2.0, with compaction","measured_date":"2025-11-19"}}},{"id":"gpt-5.2","display_name":"GPT-5.2","family_id":"gpt","vendor":"OpenAI","status":"superseded","kind":"model","superseded_by":"gpt-5.5","release_date":"2025-12-10","intelligence_index":74.51,"coverage":1,"index_subset_bias":null,"params_total_b":null,"params_active_b":null,"vram_est":null,"vram_frontier":null,"fits_on":null,"is_moe":false,"is_open_weights":false,"context_window_tok":400000,"pricing":{"prompt_usd_per_m":1.75,"completion_usd_per_m":14,"blended_usd_per_m":4.8125},"scores":{"aime":{"raw":96.88,"norm":96.1,"trust":3,"source_url":"https://www.vals.ai/benchmarks/aime","config":"archived=true, edition=aime v1, reasoning_effort=xhigh, runner=platform, stderr=0.208, task=overall, updated=2026-04-16","measured_date":"2026-08-19"},"arc_agi_2":{"raw":52.91,"norm":53.23,"trust":3,"source_url":"https://arcprize.org/leaderboard","config":"cost_per_task_usd=1.8982, eval=arc-agi-2 semi-private (v2_semi_private), model_group=gpt-5-2-2025-12-11-thinking, org=openai, run: xhigh, system_type=cot","measured_date":"2026-08-21"},"arena_elo":{"raw":1435.6,"norm":69.52,"trust":3,"source_url":"https://lmarena.ai/leaderboard","config":"text","measured_date":"2026-10-06"},"gpqa_diamond":{"raw":91.67,"norm":93.9,"trust":3,"source_url":"https://www.vals.ai/benchmarks/gpqa","config":"edition=gpqa diamond v1, reasoning_effort=xhigh, runner=platform, stderr=1.837, task=overall, updated=2026-08-19","measured_date":"2026-08-19"},"hle":{"raw":37.67,"norm":52.46,"trust":2,"source_url":"https://artificialanalysis.ai/models","config":"artificial analysis eval, gpt-5.2 (xhigh)","measured_date":null},"livebench":{"raw":74.63,"norm":76.96,"trust":3,"source_url":"https://livebench.ai/","config":"livebench-2026-06-25 release, run: high","measured_date":null},"mmlu_pro":{"raw":86.23,"norm":77.05,"trust":3,"source_url":"https://www.vals.ai/benchmarks/mmlu_pro","config":"edition=mmlu pro v1, reasoning_effort=xhigh, runner=platform, stderr=0.344, task=overall, updated=2026-08-19","measured_date":"2026-08-19"},"swe_bench_verified":{"raw":75.8,"norm":73.11,"trust":3,"source_url":"https://www.vals.ai/benchmarks/swebench","config":"edition=swe-bench verified v1, reasoning_effort=xhigh, runner=external, stderr=1.917, task=overall, updated=2026-08-19","measured_date":"2026-08-19"},"tau_bench":{"raw":84.8,"norm":86.4,"trust":2,"source_url":"https://artificialanalysis.ai/models/gpt-5-2","config":"aa field tau2, aa field tau2 (not mapped to tau_bench), artificial analysis intelligence index v4.1.1 suite, effort=xhigh, reasoning=true, run: xhigh, source value 0.847953216374269 is a 0-1 fraction, x100 at harvest","measured_date":null},"terminal_bench":{"raw":46.97,"norm":49.38,"trust":2,"source_url":"https://artificialanalysis.ai/models/gpt-5-2","config":"aa field terminalbenchhard, artificial analysis intelligence index v4.1.1 suite, effort=xhigh, reasoning=true, run: xhigh, source value 0.46969696969697 is a 0-1 fraction, terminal-bench hard, x100 at harvest","measured_date":null}}},{"id":"glm-5.2","display_name":"GLM-5.2","family_id":"glm","vendor":"Zhipu AI (Z.ai)","status":"superseded","kind":"model","superseded_by":"glm-5.3","release_date":"2026-06-17","intelligence_index":74.45,"coverage":0.9207,"index_subset_bias":null,"params_total_b":753.33,"params_active_b":39,"vram_est":{"bf16_gb":1507,"int8_gb":799,"int4_gb":452,"method":"linear-rom-v1","approximate":true,"basis":"params_total_b"},"vram_frontier":null,"fits_on":{},"is_moe":true,"is_open_weights":true,"context_window_tok":1048576,"pricing":{"prompt_usd_per_m":0.152,"completion_usd_per_m":12,"blended_usd_per_m":3.114},"scores":{"aime":{"raw":99.2,"norm":99,"trust":1,"source_url":"https://huggingface.co/zai-org/GLM-5.2","config":"judge model gpt-5.5 (medium), answer-format system prompt","measured_date":"2026-06-17"},"arc_agi_2":{"raw":22.78,"norm":19.76,"trust":3,"source_url":"https://arcprize.org/leaderboard","config":"cost_per_task_usd=0.2501, eval=arc-agi-2 semi-private (v2_semi_private), org=z.ai, system_type=cot","measured_date":"2026-08-21"},"gpqa_diamond":{"raw":85.61,"norm":85.37,"trust":3,"source_url":"https://www.vals.ai/benchmarks/gpqa","config":"edition=gpqa diamond v1, runner=platform, stderr=1.774, task=overall, updated=2026-08-19","measured_date":"2026-08-19"},"hle":{"raw":41.15,"norm":57.57,"trust":2,"source_url":"https://artificialanalysis.ai/models/glm-5-2","config":"aa field hle, artificial analysis intelligence index v4.1.1 suite, effort=max, humanity's last exam, reasoning=true, run: max, source value 0.411492122335496 is a 0-1 fraction, x100 at harvest","measured_date":null},"livebench":{"raw":73.16,"norm":73.69,"trust":3,"source_url":"https://livebench.ai/","config":"livebench-2026-06-25 release","measured_date":null},"mmlu_pro":{"raw":86.71,"norm":77.85,"trust":3,"source_url":"https://www.vals.ai/benchmarks/mmlu_pro","config":"edition=mmlu pro v1, runner=platform, stderr=0.334, task=overall, updated=2026-08-19","measured_date":"2026-08-19"},"swe_bench_verified":{"raw":82.8,"norm":80.89,"trust":3,"source_url":"https://www.vals.ai/benchmarks/swebench","config":"edition=swe-bench verified v1, reasoning_effort=max, runner=external, stderr=1.689, task=overall, updated=2026-08-19","measured_date":"2026-08-19"},"tau_bench":{"raw":99.12,"norm":100,"trust":2,"source_url":"https://artificialanalysis.ai/models/glm-5-2","config":"aa field tau2, aa field tau2 (not mapped to tau_bench), artificial analysis intelligence index v4.1.1 suite, effort=max, reasoning=true, run: max, source value 0.991228070175439 is a 0-1 fraction, x100 at harvest","measured_date":null},"terminal_bench":{"raw":67.79,"norm":73.87,"trust":3,"source_url":"https://www.vals.ai/benchmarks/terminal-bench-2-1","config":"edition=terminal-bench 2.1, reasoning_effort=max, runner=external, stderr=0.991, task=overall, updated=2026-08-19","measured_date":"2026-08-19"}}},{"id":"qwen-3.8-max-0902-2.4t","display_name":"Qwen3.8-Max-0902","family_id":"qwen","vendor":"Alibaba","status":"current","kind":"model","superseded_by":null,"release_date":"2026-09-02","intelligence_index":74.35,"coverage":0.3174,"index_subset_bias":{"offset":-1.53,"peers":10,"method":"subset-knn-v1"},"params_total_b":2400,"params_active_b":95,"vram_est":{"bf16_gb":4800,"int8_gb":2544,"int4_gb":1440,"method":"linear-rom-v1","approximate":true,"basis":"params_total_b"},"vram_frontier":null,"fits_on":null,"is_moe":true,"is_open_weights":false,"context_window_tok":1000000,"pricing":{"prompt_usd_per_m":2,"completion_usd_per_m":6,"blended_usd_per_m":3},"scores":{"gpqa_diamond":{"raw":92,"norm":94.37,"trust":2,"source_url":"https://epoch.ai/models/qwen3-8-max-0902","config":null,"measured_date":null},"hle":{"raw":43.1,"norm":60.44,"trust":2,"source_url":"https://openrouter.ai/qwen/qwen3.8-max-0902","config":null,"measured_date":null},"terminal_bench":{"raw":39,"norm":40,"trust":1,"source_url":"https://www.intelligentliving.co/qwen3-8-max-update-smarter/","config":"4.0","measured_date":"2026-09-17"}}},{"id":"qwen-3-235b-a22b-reasoning-vision","display_name":"Qwen3-VL-235B-A22B-Thinking","family_id":"qwen","vendor":"Alibaba","status":"superseded","kind":"model","superseded_by":"qwen-3-235b-a22b-instruct-vision","release_date":"2025-05-14","intelligence_index":74.26,"coverage":0.6032,"index_subset_bias":{"offset":9.59,"peers":9,"method":"subset-knn-v1"},"params_total_b":235.67,"params_active_b":22,"vram_est":{"bf16_gb":471,"int8_gb":250,"int4_gb":141,"method":"linear-rom-v1","approximate":true,"basis":"params_total_b"},"vram_frontier":null,"fits_on":{},"is_moe":true,"is_open_weights":true,"context_window_tok":131072,"pricing":{"prompt_usd_per_m":0.4,"completion_usd_per_m":4,"blended_usd_per_m":1.3},"scores":{"aime":{"raw":89.7,"norm":87.13,"trust":2,"source_url":"https://arxiv.org/html/2511.21631v2","config":"aime 2025. qwen3-vl technical report table 3, claude-opus-4 thinking 75.5. thinking mode, first data column (qwen3-vl-235b-a22b-thinking), no tools. [raw: aime-25], o3 medium 88.9(high), siblings: thinking-2507 92.3","measured_date":null},"arena_elo":{"raw":1395,"norm":51.42,"trust":3,"source_url":"https://lmarena.ai/leaderboard","config":"text","measured_date":"2026-10-03"},"gpqa_diamond":{"raw":77.1,"norm":73.38,"trust":2,"source_url":"https://arxiv.org/html/2511.21631v2","config":"claude-opus-4 thinking 79.6. note: row is labeled only 'g [raw: gpqa], first data column (qwen3-vl-235b-a22b-thinking), o3 medium 83.3(high), qwen3-vl technical report table 3, siblings in row: thinking-2507 81.1","measured_date":null},"livebench":{"raw":79.6,"norm":88,"trust":2,"source_url":"https://arxiv.org/html/2511.21631v2","config":"claude-opus-4 thinking 7 [raw: livebench 2024-11-25], first data column (qwen3-vl-235b-a22b-thinking), global average. qwen3-vl technical report table 3, livebench 2024-11-25 release, o3 medium 78.3, siblings: thinking-2507 78.4","measured_date":null},"mmlu_pro":{"raw":83.8,"norm":73,"trust":2,"source_url":"https://arxiv.org/html/2511.21631v2","config":"'comparison among qwen3-vl-235b-a22b (thinking) and other reasoning baselines', qwen3-vl technical report (arxiv:2511.21631) table 3, value read from the first data column = qwen3-vl-235b-a22b-thinkin [raw: mmlu-pro]","measured_date":null},"tau_bench":{"raw":67,"norm":62.67,"trust":2,"source_url":"https://arxiv.org/html/2511.21631v2","config":"retail domain only. the report publishes three separate domain rows for this model and no average: tau2-retail 67.0, tau-2 (τ2-bench), tau2-airline 62.0, tau2-telecom 44.7. retail reported here becaus [raw: tau2-retail]","measured_date":null}}},{"id":"hy-3","display_name":"Hy3","family_id":"hy","vendor":"tencent","status":"current","kind":"model","superseded_by":null,"release_date":"2026-07-06","intelligence_index":74.12,"coverage":0.5555,"index_subset_bias":{"offset":-1.13,"peers":10,"method":"subset-knn-v1"},"params_total_b":298.79,"params_active_b":null,"vram_est":{"bf16_gb":598,"int8_gb":317,"int4_gb":179,"method":"linear-rom-v1","approximate":true,"basis":"params_total_b"},"vram_frontier":{"efficiency":1.19,"expected_int8_gb":378,"method":"frontier-residual-v1","approximate":true},"fits_on":{},"is_moe":true,"is_open_weights":true,"context_window_tok":262144,"pricing":{"prompt_usd_per_m":0.18,"completion_usd_per_m":0.6,"blended_usd_per_m":0.28500000000000003},"scores":{"arena_elo":{"raw":1456,"norm":78.61,"trust":3,"source_url":"https://lmarena.ai/leaderboard","config":"text","measured_date":"2026-10-03"},"gpqa_diamond":{"raw":89.7,"norm":91.13,"trust":2,"source_url":"https://artificialanalysis.ai/models/hy3","config":"aa field gpqa, artificial analysis intelligence index v4.1.1 suite, effort=none, gpqa diamond, reasoning=true, source value 0.896969696969697 is a 0-1 fraction, x100 at harvest","measured_date":null},"hle":{"raw":33.5,"norm":46.32,"trust":2,"source_url":"https://artificialanalysis.ai/models/hy3","config":"hle as run in aa intelligence index v4.1.1 (text-only, model slug 'hy3', no tools), page data field hle = 0.334569045412419 [raw: humanity's last exam (artificial analysis independent run)]","measured_date":null},"swe_bench_verified":{"raw":78,"norm":75.56,"trust":1,"source_url":"https://huggingface.co/tencent/Hy3","config":"resolved; official hy3 model card","measured_date":null},"terminal_bench":{"raw":64.42,"norm":69.91,"trust":2,"source_url":"https://artificialanalysis.ai/models/hy3","config":"aa field terminalbenchv21, artificial analysis intelligence index v4.1.1 suite, effort=none, reasoning=true, source value 0.644194756554307 is a 0-1 fraction, terminal-bench 2.1, x100 at harvest","measured_date":null}}},{"id":"nex-n2-pro","display_name":"nex-n2-pro","family_id":"nex","vendor":"nex-agi","status":"current","kind":"model","superseded_by":null,"release_date":"2026-06-08","intelligence_index":73.86,"coverage":0.3651,"index_subset_bias":{"offset":-1.1,"peers":10,"method":"subset-knn-v1"},"params_total_b":396.8,"params_active_b":null,"vram_est":{"bf16_gb":794,"int8_gb":421,"int4_gb":238,"method":"linear-rom-v1","approximate":true,"basis":"params_total_b"},"vram_frontier":{"efficiency":0.89,"expected_int8_gb":374,"method":"frontier-residual-v1","approximate":true},"fits_on":{},"is_moe":true,"is_open_weights":true,"context_window_tok":262144,"pricing":{"prompt_usd_per_m":null,"completion_usd_per_m":null,"blended_usd_per_m":null},"scores":{"gpqa_diamond":{"raw":89.19,"norm":90.41,"trust":2,"source_url":"https://artificialanalysis.ai/models/nex-n2-pro","config":"artificial analysis independent run","measured_date":null},"hle":{"raw":33.73,"norm":46.66,"trust":2,"source_url":"https://artificialanalysis.ai/models/nex-n2-pro","config":"artificial analysis independent run, no tools","measured_date":null},"tau_bench":{"raw":81.58,"norm":82.11,"trust":2,"source_url":"https://artificialanalysis.ai/models/nex-n2-pro","config":"artificial analysis independent run, tau2, with tools","measured_date":null},"terminal_bench":{"raw":67.79,"norm":73.87,"trust":2,"source_url":"https://artificialanalysis.ai/models/nex-n2-pro","config":"2.1, artificial analysis independent run","measured_date":null}}},{"id":"kimi-k2.7-code","display_name":"Kimi K2.7 Code","family_id":"kimi","vendor":"Moonshot AI","status":"current","kind":"model","superseded_by":null,"release_date":"2026-06-12","intelligence_index":73.59,"coverage":0.643,"index_subset_bias":{"offset":-1.32,"peers":10,"method":"subset-knn-v1"},"params_total_b":1026.88,"params_active_b":32,"vram_est":{"bf16_gb":2054,"int8_gb":1088,"int4_gb":616,"method":"linear-rom-v1","approximate":true,"basis":"params_total_b"},"vram_frontier":{"efficiency":0.34,"expected_int8_gb":371,"method":"frontier-residual-v1","approximate":true},"fits_on":{},"is_moe":true,"is_open_weights":true,"context_window_tok":262144,"pricing":{"prompt_usd_per_m":0.6712,"completion_usd_per_m":3.35,"blended_usd_per_m":1.3409},"scores":{"gpqa_diamond":{"raw":89.6,"norm":90.99,"trust":2,"source_url":"https://artificialanalysis.ai/models/kimi-k2-7-code","config":"aa field gpqa, artificial analysis intelligence index v4.1.1 suite, effort=none, gpqa diamond, reasoning=true, source value 0.895959595959596 is a 0-1 fraction, x100 at harvest","measured_date":null},"hle":{"raw":35.03,"norm":48.57,"trust":2,"source_url":"https://artificialanalysis.ai/models/kimi-k2-7-code","config":"aa field hle, artificial analysis intelligence index v4.1.1 suite, effort=none, humanity's last exam, reasoning=true, source value 0.35032437442076 is a 0-1 fraction, x100 at harvest","measured_date":null},"livebench":{"raw":68.41,"norm":63.13,"trust":3,"source_url":"https://livebench.ai/","config":"livebench-2026-06-25 release","measured_date":null},"swe_bench_verified":{"raw":78.2,"norm":75.78,"trust":3,"source_url":"https://www.vals.ai/benchmarks/swebench","config":"edition=swe-bench verified v1, runner=external, stderr=1.848, task=overall, updated=2026-08-19","measured_date":"2026-08-19"},"tau_bench":{"raw":90.06,"norm":93.41,"trust":2,"source_url":"https://artificialanalysis.ai/models/kimi-k2-7-code","config":"aa field tau2, aa field tau2 (not mapped to tau_bench), artificial analysis intelligence index v4.1.1 suite, effort=none, reasoning=true, source value 0.900584795321637 is a 0-1 fraction, x100 at harvest","measured_date":null},"terminal_bench":{"raw":67.04,"norm":72.99,"trust":3,"source_url":"https://www.vals.ai/benchmarks/terminal-bench-2-1","config":"edition=terminal-bench 2.1, runner=external, stderr=0.375, task=overall, updated=2026-08-19","measured_date":"2026-08-19"}}},{"id":"grok-4.7","display_name":"Grok 4.7","family_id":"grok","vendor":"xAI","status":"current","kind":"model","superseded_by":null,"release_date":"2026-09-21","intelligence_index":73.39,"coverage":0.357,"index_subset_bias":{"offset":-5.7,"peers":10,"method":"subset-knn-v1"},"params_total_b":null,"params_active_b":null,"vram_est":null,"vram_frontier":null,"fits_on":null,"is_moe":false,"is_open_weights":false,"context_window_tok":500000,"pricing":{"prompt_usd_per_m":2,"completion_usd_per_m":6,"blended_usd_per_m":3},"scores":{"arena_elo":{"raw":1442.5,"norm":72.59,"trust":3,"source_url":"https://lmarena.ai/leaderboard","config":"text","measured_date":"2026-10-01"},"hle":{"raw":43.14,"norm":60.5,"trust":2,"source_url":"https://artificialanalysis.ai/models/grok-4-7","config":"effort=xhigh, reasoning=on, run: xhigh, tools=off","measured_date":"2026-09-21"},"livebench":{"raw":77.4,"norm":83.11,"trust":3,"source_url":"https://livebench.ai/","config":"effort=xhigh, livebench-2026-06-25 release, run: xhigh","measured_date":null},"terminal_bench":{"raw":73.408,"norm":80.48,"trust":3,"source_url":"https://www.vals.ai/benchmarks/terminal-bench-2-1","config":"effort=xhigh, v2.1","measured_date":"2026-09-22"}}},{"id":"minimax-m3-reasoning","display_name":"MiniMax-M3","family_id":"minimax","vendor":"MiniMax","status":"current","kind":"model","superseded_by":null,"release_date":"2026-06-01","intelligence_index":72.98,"coverage":0.8413,"index_subset_bias":null,"params_total_b":427.04,"params_active_b":null,"vram_est":{"bf16_gb":854,"int8_gb":453,"int4_gb":256,"method":"linear-rom-v1","approximate":true,"basis":"params_total_b"},"vram_frontier":{"efficiency":0.8,"expected_int8_gb":362,"method":"frontier-residual-v1","approximate":true},"fits_on":{},"is_moe":true,"is_open_weights":true,"context_window_tok":1048576,"pricing":{"prompt_usd_per_m":0.3,"completion_usd_per_m":1.2,"blended_usd_per_m":0.5249999999999999},"scores":{"arena_elo":{"raw":1440.1,"norm":71.52,"trust":3,"source_url":"https://lmarena.ai/leaderboard","config":"text","measured_date":"2026-10-03"},"gpqa_diamond":{"raw":92.68,"norm":95.32,"trust":3,"source_url":"https://www.vals.ai/benchmarks/gpqa","config":"edition=gpqa diamond v1, runner=platform, stderr=1.443, task=overall, updated=2026-08-19","measured_date":"2026-08-19"},"hle":{"raw":38.97,"norm":54.37,"trust":2,"source_url":"https://artificialanalysis.ai/models/minimax-m3","config":"aa field hle, artificial analysis intelligence index v4.1.1 suite, effort=none, humanity's last exam, reasoning=true, source value 0.389712696941613 is a 0-1 fraction, x100 at harvest","measured_date":null},"livebench":{"raw":67.26,"norm":60.58,"trust":3,"source_url":"https://livebench.ai/","config":"livebench-2026-06-25 release","measured_date":null},"mmlu_pro":{"raw":84.22,"norm":73.7,"trust":3,"source_url":"https://www.vals.ai/benchmarks/mmlu_pro","config":"edition=mmlu pro v1, runner=platform, stderr=0.364, task=overall, updated=2026-08-19","measured_date":"2026-08-19"},"swe_bench_verified":{"raw":75,"norm":72.22,"trust":3,"source_url":"https://www.vals.ai/benchmarks/swebench","config":"edition=swe-bench verified v1, runner=external, stderr=1.938, task=overall, updated=2026-08-19","measured_date":"2026-08-19"},"tau_bench":{"raw":88.89,"norm":91.85,"trust":2,"source_url":"https://artificialanalysis.ai/models/minimax-m3","config":"aa field tau2, aa field tau2 (not mapped to tau_bench), artificial analysis intelligence index v4.1.1 suite, effort=none, reasoning=true, source value 0.888888888888889 is a 0-1 fraction, x100 at harvest","measured_date":null},"terminal_bench":{"raw":53.56,"norm":57.13,"trust":3,"source_url":"https://www.vals.ai/benchmarks/terminal-bench-2-1","config":"edition=terminal-bench 2.1, runner=external, stderr=0.749, task=overall, updated=2026-08-19","measured_date":"2026-08-19"}}},{"id":"gemini-3-flash","display_name":"Gemini 3 Flash Preview","family_id":"gemini","vendor":"Google","status":"superseded","kind":"model","superseded_by":"gemini-3.8-flash","release_date":"2025-12-17","intelligence_index":72.93,"coverage":0.8809,"index_subset_bias":null,"params_total_b":null,"params_active_b":null,"vram_est":null,"vram_frontier":null,"fits_on":null,"is_moe":false,"is_open_weights":false,"context_window_tok":1048576,"pricing":{"prompt_usd_per_m":0.5,"completion_usd_per_m":3,"blended_usd_per_m":1.125},"scores":{"aime":{"raw":95.62,"norm":94.53,"trust":3,"source_url":"https://www.vals.ai/benchmarks/aime","config":"archived=true, edition=aime v1, reasoning_effort=high, runner=platform, stderr=0.516, task=overall, updated=2026-04-16","measured_date":"2026-08-19"},"arc_agi_2":{"raw":33.61,"norm":31.79,"trust":3,"source_url":"https://arcprize.org/leaderboard","config":"cost_per_task_usd=0.2314, eval=arc-agi-2 semi-private (v2_semi_private), model_group=gemini-3-flash-preview-thinking, org=google, run: high, system_type=cot","measured_date":"2026-08-21"},"arena_elo":{"raw":1472.8,"norm":86.1,"trust":3,"source_url":"https://arena.ai/leaderboard/text","config":"30852 votes, arena entry gemini-3-flash, leaderboard text-overall-style_control, rank 30, run: gemini-3-flash, style control, text/overall, vote cutoff 2026-08-21","measured_date":"2026-08-21"},"gpqa_diamond":{"raw":87.88,"norm":88.56,"trust":3,"source_url":"https://www.vals.ai/benchmarks/gpqa","config":"edition=gpqa diamond v1, reasoning_effort=high, runner=platform, stderr=1.638, task=overall, updated=2026-08-19","measured_date":"2026-08-19"},"hle":{"raw":36.56,"norm":50.82,"trust":2,"source_url":"https://artificialanalysis.ai/models/gemini-3-flash-reasoning","config":"aa field hle, artificial analysis intelligence index v4.1.1 suite, effort=none, humanity's last exam, reasoning=true, run: reasoning, source value 0.365616311399444 is a 0-1 fraction, x100 at harvest","measured_date":null},"mmlu_pro":{"raw":88.59,"norm":80.98,"trust":3,"source_url":"https://www.vals.ai/benchmarks/mmlu_pro","config":"edition=mmlu pro v1, reasoning_effort=high, runner=platform, stderr=0.315, task=overall, updated=2026-08-19","measured_date":"2026-08-19"},"swe_bench_verified":{"raw":75,"norm":72.22,"trust":3,"source_url":"https://www.vals.ai/benchmarks/swebench","config":"edition=swe-bench verified v1, reasoning_effort=high, runner=external, stderr=1.938, task=overall, updated=2026-08-19","measured_date":"2026-08-19"},"tau_bench":{"raw":80.41,"norm":80.55,"trust":2,"source_url":"https://artificialanalysis.ai/models/gemini-3-flash-reasoning","config":"aa field tau2, aa field tau2 (not mapped to tau_bench), artificial analysis intelligence index v4.1.1 suite, effort=none, reasoning=true, run: reasoning, source value 0.804093567251462 is a 0-1 fraction, x100 at harvest","measured_date":null},"terminal_bench":{"raw":53.93,"norm":57.56,"trust":3,"source_url":"https://www.vals.ai/benchmarks/terminal-bench-2-1","config":"edition=terminal-bench 2.1, reasoning_effort=high, runner=external, stderr=1.297, task=overall, updated=2026-08-19","measured_date":"2026-08-19"}}},{"id":"qwen-3.6-plus-04-02","display_name":"Qwen3.6 Plus","family_id":"qwen","vendor":"Alibaba","status":"superseded","kind":"model","superseded_by":"qwen-3.7-plus","release_date":"2026-04-02","intelligence_index":72.9,"coverage":0.9207,"index_subset_bias":null,"params_total_b":null,"params_active_b":null,"vram_est":null,"vram_frontier":null,"fits_on":null,"is_moe":false,"is_open_weights":false,"context_window_tok":1000000,"pricing":{"prompt_usd_per_m":0.325,"completion_usd_per_m":1.95,"blended_usd_per_m":0.73125},"scores":{"aime":{"raw":94.58,"norm":93.23,"trust":3,"source_url":"https://www.vals.ai/benchmarks/aime","config":"archived=true, edition=aime v1, runner=platform, stderr=0.579, task=overall, updated=2026-04-16","measured_date":"2026-08-19"},"arena_elo":{"raw":1443.4,"norm":72.99,"trust":3,"source_url":"https://lmarena.ai/leaderboard","config":"text","measured_date":"2026-09-27"},"gpqa_diamond":{"raw":87.37,"norm":87.85,"trust":3,"source_url":"https://www.vals.ai/benchmarks/gpqa","config":"edition=gpqa diamond v1, runner=platform, stderr=1.668, task=overall, updated=2026-08-19","measured_date":"2026-08-19"},"hle":{"raw":27.85,"norm":38.01,"trust":2,"source_url":"https://artificialanalysis.ai/models/qwen3-6-plus","config":"aa field hle, artificial analysis intelligence index v4.1.1 suite, effort=none, humanity's last exam, reasoning=true, source value 0.278498609823911 is a 0-1 fraction, x100 at harvest","measured_date":null},"livebench":{"raw":68.91,"norm":64.24,"trust":3,"source_url":"https://livebench.ai/","config":"livebench-2026-06-25 release","measured_date":null},"mmlu_pro":{"raw":87.67,"norm":79.45,"trust":3,"source_url":"https://www.vals.ai/benchmarks/mmlu_pro","config":"edition=mmlu pro v1, runner=platform, stderr=0.323, task=overall, updated=2026-08-19","measured_date":"2026-08-19"},"swe_bench_verified":{"raw":73.4,"norm":70.44,"trust":3,"source_url":"https://www.vals.ai/benchmarks/swebench","config":"edition=swe-bench verified v1, runner=external, stderr=1.978, task=overall, updated=2026-08-19","measured_date":"2026-08-19"},"tau_bench":{"raw":97.66,"norm":100,"trust":2,"source_url":"https://artificialanalysis.ai/models/qwen3-6-plus","config":"aa field tau2, aa field tau2 (not mapped to tau_bench), artificial analysis intelligence index v4.1.1 suite, effort=none, reasoning=true, source value 0.976608187134503 is a 0-1 fraction, x100 at harvest","measured_date":null},"terminal_bench":{"raw":53.18,"norm":56.68,"trust":3,"source_url":"https://www.vals.ai/benchmarks/terminal-bench-2-1","config":"edition=terminal-bench 2.1, runner=external, stderr=1.633, task=overall, updated=2026-08-19","measured_date":"2026-08-19"}}},{"id":"gpt-5.2-codex","display_name":"GPT-5.2-Codex","family_id":"gpt","vendor":"OpenAI","status":"superseded","kind":"model","superseded_by":"gpt-5.3-codex","release_date":"2025-12-18","intelligence_index":72.17,"coverage":0.643,"index_subset_bias":{"offset":-1.32,"peers":10,"method":"subset-knn-v1"},"params_total_b":null,"params_active_b":null,"vram_est":null,"vram_frontier":null,"fits_on":null,"is_moe":false,"is_open_weights":false,"context_window_tok":400000,"pricing":{"prompt_usd_per_m":1.75,"completion_usd_per_m":14,"blended_usd_per_m":4.8125},"scores":{"gpqa_diamond":{"raw":89.9,"norm":91.41,"trust":2,"source_url":"https://artificialanalysis.ai/models/gpt-5-2-codex","config":"aa field gpqa, artificial analysis intelligence index v4.1.1 suite, effort=xhigh, gpqa diamond, reasoning=true, run: xhigh, source value 0.898989898989899 is a 0-1 fraction, x100 at harvest","measured_date":null},"hle":{"raw":35.73,"norm":49.6,"trust":2,"source_url":"https://artificialanalysis.ai/models/gpt-5-2-codex","config":"aa field hle, artificial analysis intelligence index v4.1.1 suite, effort=xhigh, humanity's last exam, reasoning=true, run: xhigh, source value 0.357275254865616 is a 0-1 fraction, x100 at harvest","measured_date":null},"livebench":{"raw":73.98,"norm":75.51,"trust":3,"source_url":"https://livebench.ai/","config":"livebench-2026-06-25 release","measured_date":null},"swe_bench_verified":{"raw":72.4,"norm":69.33,"trust":3,"source_url":"https://www.vals.ai/benchmarks/swebench","config":"edition=swe-bench verified v1, reasoning_effort=high, runner=external, stderr=2.001, task=overall, updated=2026-08-19","measured_date":"2026-08-19"},"tau_bench":{"raw":92.11,"norm":96.15,"trust":2,"source_url":"https://artificialanalysis.ai/models/gpt-5-2-codex","config":"aa field tau2, aa field tau2 (not mapped to tau_bench), artificial analysis intelligence index v4.1.1 suite, effort=xhigh, reasoning=true, run: xhigh, source value 0.921052631578947 is a 0-1 fraction, x100 at harvest","measured_date":null},"terminal_bench":{"raw":37.12,"norm":37.79,"trust":2,"source_url":"https://artificialanalysis.ai/models/gpt-5-2-codex","config":"aa field terminalbenchhard, artificial analysis intelligence index v4.1.1 suite, effort=xhigh, reasoning=true, run: xhigh, source value 0.371212121212121 is a 0-1 fraction, terminal-bench hard, x100 at harvest","measured_date":null}}},{"id":"qwen-3.6-max","display_name":"Qwen3.6 Max Preview","family_id":"qwen","vendor":"Alibaba","status":"superseded","kind":"model","superseded_by":"qwen-3.7-max","release_date":"2026-04-27","intelligence_index":71.93,"coverage":0.6032,"index_subset_bias":{"offset":-0.1,"peers":10,"method":"subset-knn-v1"},"params_total_b":null,"params_active_b":null,"vram_est":null,"vram_frontier":null,"fits_on":null,"is_moe":false,"is_open_weights":false,"context_window_tok":262144,"pricing":{"prompt_usd_per_m":1.027,"completion_usd_per_m":6.162,"blended_usd_per_m":2.3107499999999996},"scores":{"arena_elo":{"raw":1460.3,"norm":80.53,"trust":3,"source_url":"https://lmarena.ai/leaderboard","config":"text","measured_date":"2026-10-03"},"gpqa_diamond":{"raw":88.79,"norm":89.85,"trust":2,"source_url":"https://artificialanalysis.ai/models/qwen3-6-max","config":"artificial analysis eval, qwen3.6 max preview","measured_date":null},"hle":{"raw":30.82,"norm":42.38,"trust":2,"source_url":"https://artificialanalysis.ai/models/qwen3-6-max","config":"artificial analysis eval, qwen3.6 max preview","measured_date":null},"swe_bench_verified":{"raw":72.8,"norm":69.78,"trust":3,"source_url":"https://www.vals.ai/benchmarks/swebench","config":"edition=swe-bench verified v1, runner=external, stderr=1.992, task=overall, updated=2026-08-19","measured_date":"2026-08-19"},"tau_bench":{"raw":95.91,"norm":100,"trust":2,"source_url":"https://artificialanalysis.ai/models/qwen3-6-max","config":"aa field tau2, aa field tau2 (not mapped to tau_bench), artificial analysis intelligence index v4.1.1 suite, effort=none, reasoning=true, source value 0.95906432748538 is a 0-1 fraction, x100 at harvest","measured_date":null},"terminal_bench":{"raw":43.94,"norm":45.81,"trust":2,"source_url":"https://artificialanalysis.ai/models/qwen3-6-max","config":"aa field terminalbenchhard, artificial analysis intelligence index v4.1.1 suite, effort=none, reasoning=true, source value 0.439393939393939 is a 0-1 fraction, terminal-bench hard, x100 at harvest","measured_date":null}}},{"id":"qwen-3-30b-a3b-2507-reasoning","display_name":"Qwen3 30B A3B Thinking 2507","family_id":"qwen","vendor":"Alibaba","status":"current","kind":"model","superseded_by":null,"release_date":"2025-08-28","intelligence_index":71.75,"coverage":0.5239,"index_subset_bias":{"offset":10.74,"peers":10,"method":"subset-knn-v1"},"params_total_b":30.53,"params_active_b":3,"vram_est":{"bf16_gb":61.1,"int8_gb":32.4,"int4_gb":18.3,"method":"linear-rom-v1","approximate":true,"basis":"params_total_b"},"vram_frontier":{"efficiency":10.7,"expected_int8_gb":346,"method":"frontier-residual-v1","approximate":true},"fits_on":{"intel_b70":"int4","nvidia_h100_sxm_80g":"fp8","nvidia_dgx_spark":"fp8"},"is_moe":true,"is_open_weights":true,"context_window_tok":81920,"pricing":{"prompt_usd_per_m":0.2,"completion_usd_per_m":2.4,"blended_usd_per_m":0.75},"scores":{"aime":{"raw":85,"norm":81.25,"trust":1,"source_url":"https://huggingface.co/Qwen/Qwen3-30B-A3B-Thinking-2507","config":"aime25, thinking mode","measured_date":null},"gpqa_diamond":{"raw":73.4,"norm":68.17,"trust":1,"source_url":"https://huggingface.co/Qwen/Qwen3-30B-A3B-Thinking-2507","config":"thinking mode","measured_date":null},"livebench":{"raw":76.8,"norm":81.78,"trust":1,"source_url":"https://huggingface.co/Qwen/Qwen3-30B-A3B-Thinking-2507","config":"livebench 20241125, thinking mode","measured_date":"2024-11-25"},"mmlu_pro":{"raw":80.9,"norm":68.17,"trust":1,"source_url":"https://huggingface.co/Qwen/Qwen3-30B-A3B-Thinking-2507","config":"thinking mode","measured_date":null},"tau_bench":{"raw":58.8,"norm":51.73,"trust":1,"source_url":"https://huggingface.co/Qwen/Qwen3-30B-A3B-Thinking-2507","config":"tau2-retail, with tools","measured_date":null}}},{"id":"qwen-3-next-80b-a3b-2509-reasoning","display_name":"Qwen3 Next 80B A3B Thinking","family_id":"qwen","vendor":"Alibaba","status":"current","kind":"model","superseded_by":null,"release_date":"2025-09-11","intelligence_index":70.89,"coverage":0.6032,"index_subset_bias":{"offset":9.59,"peers":9,"method":"subset-knn-v1"},"params_total_b":81.32,"params_active_b":3,"vram_est":{"bf16_gb":163,"int8_gb":86.2,"int4_gb":48.8,"method":"linear-rom-v1","approximate":true,"basis":"params_total_b"},"vram_frontier":{"efficiency":3.89,"expected_int8_gb":336,"method":"frontier-residual-v1","approximate":true},"fits_on":{"nvidia_h100_sxm_80g":"int4","nvidia_dgx_spark":"fp8"},"is_moe":true,"is_open_weights":true,"context_window_tok":262144,"pricing":{"prompt_usd_per_m":0.15,"completion_usd_per_m":1.2,"blended_usd_per_m":0.4125},"scores":{"aime":{"raw":87.8,"norm":84.75,"trust":1,"source_url":"https://huggingface.co/Qwen/Qwen3-Next-80B-A3B-Thinking","config":"aime 2025, no tools, standard thinking mode [raw: aime25]","measured_date":null},"arena_elo":{"raw":1369.4,"norm":40.01,"trust":3,"source_url":"https://lmarena.ai/leaderboard","config":"text","measured_date":"2026-10-01"},"gpqa_diamond":{"raw":77.2,"norm":73.52,"trust":1,"source_url":"https://huggingface.co/Qwen/Qwen3-Next-80B-A3B-Thinking","config":"labeled simply 'gpqa' (qwen's convention is the gpqa-diamond subset), no tools, official qwen model card 'knowledge' row, standard thinking mode [raw: gpqa]","measured_date":null},"livebench":{"raw":76.6,"norm":81.33,"trust":1,"source_url":"https://huggingface.co/Qwen/Qwen3-Next-80B-A3B-Thinking","config":"global average, livebench 2024-11-25 release, vendor self-reported (not the live livebench.ai leaderboard) [raw: livebench 241125]","measured_date":null},"mmlu_pro":{"raw":82.7,"norm":71.17,"trust":1,"source_url":"https://huggingface.co/Qwen/Qwen3-Next-80B-A3B-Thinking","config":"no tools, official qwen model card 'knowledge' row, standard thinking mode [raw: mmlu-pro]","measured_date":null},"tau_bench":{"raw":67.8,"norm":63.73,"trust":1,"source_url":"https://huggingface.co/Qwen/Qwen3-Next-80B-A3B-Thinking","config":"card also lists tau2-airline 60.5 and tau2-telecom 43.9 (and tau1-retail 69.6 / tau1-airline 49.0) [raw: tau2-retail], retail domain only — no average is published, tau2-bench","measured_date":null}}},{"id":"qwen-3.6-35b-a3b","display_name":"Qwen3.6 35B A3B","family_id":"qwen","vendor":"Alibaba","status":"current","kind":"model","superseded_by":null,"release_date":"2026-04-27","intelligence_index":70.47,"coverage":0.7223,"index_subset_bias":{"offset":3.02,"peers":10,"method":"subset-knn-v1"},"params_total_b":35.95,"params_active_b":3,"vram_est":{"bf16_gb":71.9,"int8_gb":38.1,"int4_gb":21.6,"method":"linear-rom-v1","approximate":true,"basis":"params_total_b"},"vram_frontier":{"efficiency":8.68,"expected_int8_gb":331,"method":"frontier-residual-v1","approximate":true},"fits_on":{"intel_b70":"int4","nvidia_h100_sxm_80g":"fp8","nvidia_dgx_spark":"fp8"},"is_moe":true,"is_open_weights":true,"context_window_tok":262144,"pricing":{"prompt_usd_per_m":0.15,"completion_usd_per_m":1,"blended_usd_per_m":0.3625},"scores":{"aime":{"raw":92.7,"norm":90.88,"trust":1,"source_url":"https://huggingface.co/Qwen/Qwen3.6-35B-A3B","config":"2026","measured_date":null},"gpqa_diamond":{"raw":84.14,"norm":83.3,"trust":2,"source_url":"https://artificialanalysis.ai/models/qwen3-6-35b-a3b","config":"aa field gpqa, artificial analysis intelligence index v4.1.1 suite, effort=none, gpqa diamond, reasoning=true, run: reasoning, source value 0.841414141414142 is a 0-1 fraction, x100 at harvest","measured_date":null},"hle":{"raw":22.24,"norm":29.76,"trust":2,"source_url":"https://artificialanalysis.ai/models/qwen3-6-35b-a3b","config":"aa field hle, artificial analysis intelligence index v4.1.1 suite, effort=none, humanity's last exam, reasoning=true, run: reasoning, source value 0.222428174235403 is a 0-1 fraction, x100 at harvest","measured_date":null},"mmlu_pro":{"raw":85.2,"norm":75.33,"trust":1,"source_url":"https://huggingface.co/Qwen/Qwen3.6-35B-A3B","config":null,"measured_date":null},"swe_bench_verified":{"raw":73.4,"norm":70.44,"trust":1,"source_url":"https://huggingface.co/Qwen/Qwen3.6-35B-A3B","config":null,"measured_date":null},"tau_bench":{"raw":95.32,"norm":100,"trust":2,"source_url":"https://artificialanalysis.ai/models/qwen3-6-35b-a3b","config":"aa field tau2, aa field tau2 (not mapped to tau_bench), artificial analysis intelligence index v4.1.1 suite, effort=none, reasoning=true, run: reasoning, source value 0.953216374269006 is a 0-1 fraction, x100 at harvest","measured_date":null},"terminal_bench":{"raw":44.94,"norm":46.99,"trust":2,"source_url":"https://artificialanalysis.ai/models/qwen3-6-35b-a3b","config":"aa field terminalbenchv21, artificial analysis intelligence index v4.1.1 suite, effort=none, reasoning=true, run: reasoning, source value 0.449438202247191 is a 0-1 fraction, terminal-bench 2.1, x100 at harvest","measured_date":null}}},{"id":"gpt-5-codex","display_name":"gpt-5-codex","family_id":"gpt","vendor":"OpenAI","status":"superseded","kind":"model","superseded_by":"gpt-5.3-codex","release_date":"2025-09-15","intelligence_index":70.31,"coverage":0.4445,"index_subset_bias":{"offset":2.09,"peers":10,"method":"subset-knn-v1"},"params_total_b":null,"params_active_b":null,"vram_est":null,"vram_frontier":null,"fits_on":null,"is_moe":false,"is_open_weights":false,"context_window_tok":400000,"pricing":{"prompt_usd_per_m":null,"completion_usd_per_m":null,"blended_usd_per_m":null},"scores":{"aime":{"raw":98.67,"norm":98.34,"trust":2,"source_url":"https://artificialanalysis.ai/models/gpt-5-codex","config":"aa field aime25, aime-2025, artificial analysis intelligence index v4.1.1 suite, effort=high, reasoning=true, run: high, source value 0.986666666666667 is a 0-1 fraction, x100 at harvest","measured_date":null},"gpqa_diamond":{"raw":83.74,"norm":82.73,"trust":2,"source_url":"https://artificialanalysis.ai/models/gpt-5-codex","config":"aa field gpqa, artificial analysis intelligence index v4.1.1 suite, effort=high, gpqa diamond, reasoning=true, run: high, source value 0.837373737373737 is a 0-1 fraction, x100 at harvest","measured_date":null},"hle":{"raw":27.85,"norm":38.01,"trust":2,"source_url":"https://artificialanalysis.ai/models/gpt-5-codex","config":"aa field hle, artificial analysis intelligence index v4.1.1 suite, effort=high, humanity's last exam, reasoning=true, run: high, source value 0.278498609823911 is a 0-1 fraction, x100 at harvest","measured_date":null},"tau_bench":{"raw":86.84,"norm":89.12,"trust":2,"source_url":"https://artificialanalysis.ai/models/gpt-5-codex","config":"aa field tau2, aa field tau2 (not mapped to tau_bench), artificial analysis intelligence index v4.1.1 suite, effort=high, reasoning=true, run: high, source value 0.868421052631579 is a 0-1 fraction, x100 at harvest","measured_date":null},"terminal_bench":{"raw":37.88,"norm":38.68,"trust":2,"source_url":"https://artificialanalysis.ai/models/gpt-5-codex","config":"aa field terminalbenchhard, artificial analysis intelligence index v4.1.1 suite, effort=high, reasoning=true, run: high, source value 0.378787878787879 is a 0-1 fraction, terminal-bench hard, x100 at harvest","measured_date":null}}},{"id":"grok-4.3","display_name":"Grok 4.3","family_id":"grok","vendor":"xAI","status":"superseded","kind":"model","superseded_by":"grok-4.7","release_date":"2026-04-30","intelligence_index":70.1,"coverage":0.8413,"index_subset_bias":null,"params_total_b":null,"params_active_b":null,"vram_est":null,"vram_frontier":null,"fits_on":null,"is_moe":false,"is_open_weights":false,"context_window_tok":1000000,"pricing":{"prompt_usd_per_m":1.25,"completion_usd_per_m":2.5,"blended_usd_per_m":1.5625},"scores":{"arena_elo":{"raw":1441.4,"norm":72.1,"trust":3,"source_url":"https://lmarena.ai/leaderboard","config":"text","measured_date":"2026-10-03"},"gpqa_diamond":{"raw":91.41,"norm":93.54,"trust":3,"source_url":"https://www.vals.ai/benchmarks/gpqa","config":"edition=gpqa diamond v1, runner=platform, stderr=1.406, task=overall, updated=2026-08-19","measured_date":"2026-08-19"},"hle":{"raw":37.21,"norm":51.78,"trust":2,"source_url":"https://artificialanalysis.ai/models/grok-4-3","config":"aa field hle, artificial analysis intelligence index v4.1.1 suite, effort=high, humanity's last exam, reasoning=true, run: high, source value 0.372103799814643 is a 0-1 fraction, x100 at harvest","measured_date":null},"livebench":{"raw":62.25,"norm":49.44,"trust":3,"source_url":"https://livebench.ai/","config":"livebench-2026-06-25 release","measured_date":null},"mmlu_pro":{"raw":85.84,"norm":76.4,"trust":3,"source_url":"https://www.vals.ai/benchmarks/mmlu_pro","config":"edition=mmlu pro v1, reasoning_effort=high, runner=platform, stderr=0.33, task=overall, updated=2026-08-19","measured_date":"2026-08-19"},"swe_bench_verified":{"raw":71.4,"norm":68.22,"trust":3,"source_url":"https://www.vals.ai/benchmarks/swebench","config":"edition=swe-bench verified v1, reasoning_effort=high, runner=external, stderr=2.023, task=overall, updated=2026-08-19","measured_date":"2026-08-19"},"tau_bench":{"raw":97.66,"norm":100,"trust":2,"source_url":"https://artificialanalysis.ai/models/grok-4-3","config":"aa field tau2, aa field tau2 (not mapped to tau_bench), artificial analysis intelligence index v4.1.1 suite, effort=high, reasoning=true, run: high, source value 0.976608187134503 is a 0-1 fraction, x100 at harvest","measured_date":null},"terminal_bench":{"raw":41.95,"norm":43.47,"trust":3,"source_url":"https://www.vals.ai/benchmarks/terminal-bench-2-1","config":"edition=terminal-bench 2.1, reasoning_effort=high, runner=external, stderr=2.622, task=overall, updated=2026-08-19","measured_date":"2026-08-19"}}},{"id":"qwen-3-30b-a3b-reasoning-vision","display_name":"Qwen3 VL 30B A3B Thinking","family_id":"qwen","vendor":"Alibaba","status":"current","kind":"model","superseded_by":null,"release_date":"2025-10-06","intelligence_index":69.92,"coverage":0.5239,"index_subset_bias":{"offset":10.74,"peers":10,"method":"subset-knn-v1"},"params_total_b":31.07,"params_active_b":3,"vram_est":{"bf16_gb":62.1,"int8_gb":32.9,"int4_gb":18.6,"method":"linear-rom-v1","approximate":true,"basis":"params_total_b"},"vram_frontier":{"efficiency":9.85,"expected_int8_gb":324,"method":"frontier-residual-v1","approximate":true},"fits_on":{"intel_b70":"int4","nvidia_h100_sxm_80g":"fp8","nvidia_dgx_spark":"fp8"},"is_moe":true,"is_open_weights":true,"context_window_tok":262144,"pricing":{"prompt_usd_per_m":0.2,"completion_usd_per_m":2.4,"blended_usd_per_m":0.75},"scores":{"aime":{"raw":83.1,"norm":78.88,"trust":2,"source_url":"https://arxiv.org/pdf/2511.21631","config":"aime-25, thinking mode","measured_date":null},"gpqa_diamond":{"raw":74.4,"norm":69.58,"trust":2,"source_url":"https://arxiv.org/pdf/2511.21631","config":"thinking mode","measured_date":null},"livebench":{"raw":72.1,"norm":71.33,"trust":2,"source_url":"https://arxiv.org/pdf/2511.21631","config":"livebench 2024-11-25, thinking mode","measured_date":"2024-11-25"},"mmlu_pro":{"raw":80.5,"norm":67.5,"trust":2,"source_url":"https://arxiv.org/pdf/2511.21631","config":"thinking mode","measured_date":null},"tau_bench":{"raw":64,"norm":58.67,"trust":2,"source_url":"https://arxiv.org/pdf/2511.21631","config":"tau2-retail, with tools","measured_date":null}}},{"id":"mimo-2.5-pro","display_name":"MiMo-V2.5-Pro","family_id":"mimo","vendor":"xiaomi","status":"current","kind":"model","superseded_by":null,"release_date":"2026-04-22","intelligence_index":69.83,"coverage":0.6746,"index_subset_bias":{"offset":0.7,"peers":10,"method":"subset-knn-v1"},"params_total_b":1023.18,"params_active_b":null,"vram_est":{"bf16_gb":2046,"int8_gb":1085,"int4_gb":614,"method":"linear-rom-v1","approximate":true,"basis":"params_total_b"},"vram_frontier":{"efficiency":0.3,"expected_int8_gb":323,"method":"frontier-residual-v1","approximate":true},"fits_on":{},"is_moe":true,"is_open_weights":true,"context_window_tok":1050000,"pricing":{"prompt_usd_per_m":0.435,"completion_usd_per_m":0.87,"blended_usd_per_m":0.54375},"scores":{"arena_elo":{"raw":1467.5,"norm":83.74,"trust":3,"source_url":"https://lmarena.ai/leaderboard","config":"text","measured_date":"2026-10-03"},"gpqa_diamond":{"raw":86.6,"norm":86.76,"trust":2,"source_url":"https://artificialanalysis.ai/evaluations/gpqa-diamond?models=mimo-v2-5-pro","config":"artificial analysis harness, gpqa diamond, reasoning","measured_date":null},"hle":{"raw":35.7,"norm":49.56,"trust":2,"source_url":"https://artificialanalysis.ai/evaluations/humanitys-last-exam?models=mimo-v2-5-pro","config":"artificial analysis harness, humanity's last exam, reasoning","measured_date":null},"mmlu_pro":{"raw":68.5,"norm":47.5,"trust":1,"source_url":"https://huggingface.co/XiaomiMiMo/MiMo-V2.5-Pro","config":null,"measured_date":null},"swe_bench_verified":{"raw":78.9,"norm":76.56,"trust":1,"source_url":"https://huggingface.co/XiaomiMiMo/MiMo-V2.5-Pro","config":null,"measured_date":null},"terminal_bench":{"raw":65.2,"norm":70.82,"trust":2,"source_url":"https://artificialanalysis.ai/evaluations/terminalbench-v2-1?models=mimo-v2-5-pro","config":"artificial analysis harness, reasoning, terminal-bench v2.1","measured_date":null}}},{"id":"minimax-m2.7","display_name":"MiniMax-M2.7","family_id":"minimax","vendor":"MiniMax","status":"current","kind":"model","superseded_by":null,"release_date":"2026-03-18","intelligence_index":69.82,"coverage":0.8016,"index_subset_bias":null,"params_total_b":228.69,"params_active_b":null,"vram_est":{"bf16_gb":457,"int8_gb":242,"int4_gb":137,"method":"linear-rom-v1","approximate":true,"basis":"params_total_b"},"vram_frontier":{"efficiency":1.33,"expected_int8_gb":323,"method":"frontier-residual-v1","approximate":true},"fits_on":{},"is_moe":true,"is_open_weights":true,"context_window_tok":204800,"pricing":{"prompt_usd_per_m":0.21,"completion_usd_per_m":0.84,"blended_usd_per_m":0.3675},"scores":{"aime":{"raw":91.04,"norm":88.8,"trust":3,"source_url":"https://www.vals.ai/benchmarks/aime","config":"archived=true, edition=aime v1, runner=platform, stderr=0.734, task=overall, updated=2026-04-16","measured_date":"2026-08-19"},"arena_elo":{"raw":1415,"norm":60.34,"trust":3,"source_url":"https://lmarena.ai/leaderboard","config":"text","measured_date":"2026-10-03"},"gpqa_diamond":{"raw":86.62,"norm":86.79,"trust":3,"source_url":"https://www.vals.ai/benchmarks/gpqa","config":"edition=gpqa diamond v1, runner=platform, stderr=1.953, task=overall, updated=2026-08-19","measured_date":"2026-08-19"},"hle":{"raw":29.61,"norm":40.6,"trust":2,"source_url":"https://artificialanalysis.ai/models/minimax-m2-7","config":"aa field hle, artificial analysis intelligence index v4.1.1 suite, effort=none, humanity's last exam, reasoning=true, source value 0.29610750695088 is a 0-1 fraction, x100 at harvest","measured_date":null},"mmlu_pro":{"raw":80.43,"norm":67.38,"trust":3,"source_url":"https://www.vals.ai/benchmarks/mmlu_pro","config":"edition=mmlu pro v1, runner=platform, stderr=0.39, task=overall, updated=2026-08-19","measured_date":"2026-08-19"},"swe_bench_verified":{"raw":73.8,"norm":70.89,"trust":3,"source_url":"https://www.vals.ai/benchmarks/swebench","config":"edition=swe-bench verified v1, runner=external, stderr=1.968, task=overall, updated=2026-08-19","measured_date":"2026-08-19"},"tau_bench":{"raw":84.8,"norm":86.4,"trust":2,"source_url":"https://artificialanalysis.ai/models/minimax-m2-7","config":"aa field tau2, aa field tau2 (not mapped to tau_bench), artificial analysis intelligence index v4.1.1 suite, effort=none, reasoning=true, source value 0.847953216374269 is a 0-1 fraction, x100 at harvest","measured_date":null},"terminal_bench":{"raw":48.69,"norm":51.4,"trust":3,"source_url":"https://www.vals.ai/benchmarks/terminal-bench-2-1","config":"edition=terminal-bench 2.1, runner=external, stderr=3.066, task=overall, updated=2026-08-19","measured_date":"2026-08-19"}}},{"id":"trinity-1-large-reasoning","display_name":"Trinity Large Thinking","family_id":"trinity","vendor":"arcee-ai","status":"current","kind":"model","superseded_by":null,"release_date":"2026-04-01","intelligence_index":69.81,"coverage":0.643,"index_subset_bias":{"offset":11.26,"peers":10,"method":"subset-knn-v1"},"params_total_b":398.64,"params_active_b":null,"vram_est":{"bf16_gb":797,"int8_gb":423,"int4_gb":239,"method":"linear-rom-v1","approximate":true,"basis":"params_total_b"},"vram_frontier":{"efficiency":0.76,"expected_int8_gb":323,"method":"frontier-residual-v1","approximate":true},"fits_on":{},"is_moe":true,"is_open_weights":true,"context_window_tok":262144,"pricing":{"prompt_usd_per_m":0.25,"completion_usd_per_m":0.8,"blended_usd_per_m":0.3875},"scores":{"aime":{"raw":96.3,"norm":95.38,"trust":1,"source_url":"https://huggingface.co/arcee-ai/Trinity-Large-Thinking","config":"aime25","measured_date":null},"arena_elo":{"raw":1367.3,"norm":39.08,"trust":3,"source_url":"https://lmarena.ai/leaderboard","config":"text","measured_date":"2026-10-03"},"gpqa_diamond":{"raw":76.3,"norm":72.25,"trust":1,"source_url":"https://huggingface.co/arcee-ai/Trinity-Large-Thinking","config":null,"measured_date":null},"mmlu_pro":{"raw":83.4,"norm":72.33,"trust":1,"source_url":"https://huggingface.co/arcee-ai/Trinity-Large-Thinking","config":null,"measured_date":null},"swe_bench_verified":{"raw":63.2,"norm":59.11,"trust":1,"source_url":"https://huggingface.co/arcee-ai/Trinity-Large-Thinking","config":"mini-swe-agent-v2 scaffold","measured_date":null},"tau_bench":{"raw":94.7,"norm":99.6,"trust":1,"source_url":"https://huggingface.co/arcee-ai/Trinity-Large-Thinking","config":"tau2-telecom","measured_date":null}}},{"id":"inkling-1-small","display_name":"Inkling Small","family_id":"inkling","vendor":"thinkingmachines","status":"current","kind":"model","superseded_by":null,"release_date":"2026-07-30","intelligence_index":69.65,"coverage":0.7142,"index_subset_bias":{"offset":-2.06,"peers":10,"method":"subset-knn-v1"},"params_total_b":265.96,"params_active_b":null,"vram_est":{"bf16_gb":532,"int8_gb":282,"int4_gb":160,"method":"linear-rom-v1","approximate":true,"basis":"params_total_b"},"vram_frontier":{"efficiency":1.14,"expected_int8_gb":321,"method":"frontier-residual-v1","approximate":true},"fits_on":{},"is_moe":true,"is_open_weights":true,"context_window_tok":524288,"pricing":{"prompt_usd_per_m":0.45,"completion_usd_per_m":1.2,"blended_usd_per_m":0.6375},"scores":{"aime":{"raw":95.5,"norm":94.38,"trust":1,"source_url":"https://huggingface.co/thinkingmachines/Inkling-Small","config":"aime 2026","measured_date":null},"arc_agi_2":{"raw":40.1,"norm":39,"trust":1,"source_url":"https://huggingface.co/thinkingmachines/Inkling-Small","config":"reasoning (abstract)","measured_date":null},"arena_elo":{"raw":1405.2,"norm":55.97,"trust":3,"source_url":"https://lmarena.ai/leaderboard","config":"text","measured_date":"2026-10-03"},"gpqa_diamond":{"raw":89.49,"norm":90.83,"trust":2,"source_url":"https://artificialanalysis.ai/models/inkling-small","config":"artificial analysis harness","measured_date":null},"hle":{"raw":33.32,"norm":46.06,"trust":2,"source_url":"https://artificialanalysis.ai/models/inkling-small","config":"artificial analysis harness, no tools","measured_date":null},"swe_bench_verified":{"raw":80.2,"norm":78,"trust":1,"source_url":"https://huggingface.co/thinkingmachines/Inkling-Small","config":"bash-only harness","measured_date":null},"terminal_bench":{"raw":55.06,"norm":58.89,"trust":2,"source_url":"https://artificialanalysis.ai/models/inkling-small","config":"artificial analysis harness, v2.1","measured_date":null}}},{"id":"grok-0.1-build","display_name":"Grok Build 0.1","family_id":"grok","vendor":"xAI","status":"current","kind":"model","superseded_by":null,"release_date":"2026-05-20","intelligence_index":69.49,"coverage":0.4365,"index_subset_bias":{"offset":-3.52,"peers":10,"method":"subset-knn-v1"},"params_total_b":null,"params_active_b":null,"vram_est":null,"vram_frontier":null,"fits_on":null,"is_moe":false,"is_open_weights":false,"context_window_tok":256000,"pricing":{"prompt_usd_per_m":1,"completion_usd_per_m":2,"blended_usd_per_m":1.25},"scores":{"gpqa_diamond":{"raw":89.49,"norm":90.83,"trust":2,"source_url":"https://artificialanalysis.ai/models/grok-build-0-1-06-16","config":"aa field gpqa, artificial analysis intelligence index v4.1.1 suite, effort=none, gpqa diamond, reasoning=true, source value 0.894949494949495 is a 0-1 fraction, x100 at harvest","measured_date":null},"hle":{"raw":38.28,"norm":53.35,"trust":2,"source_url":"https://artificialanalysis.ai/models/grok-build-0-1-06-16","config":"aa field hle, artificial analysis intelligence index v4.1.1 suite, effort=none, humanity's last exam, reasoning=true, source value 0.382761816496756 is a 0-1 fraction, x100 at harvest","measured_date":null},"livebench":{"raw":67.78,"norm":61.73,"trust":3,"source_url":"https://livebench.ai/","config":"livebench-2026-06-25 release","measured_date":null},"terminal_bench":{"raw":52.06,"norm":55.36,"trust":2,"source_url":"https://artificialanalysis.ai/models/grok-build-0-1-06-16","config":"aa field terminalbenchv21, artificial analysis intelligence index v4.1.1 suite, effort=none, reasoning=true, source value 0.52059925093633 is a 0-1 fraction, terminal-bench 2.1, x100 at harvest","measured_date":null}}},{"id":"gpt-5.1-codex","display_name":"GPT-5.1-Codex","family_id":"gpt","vendor":"OpenAI","status":"superseded","kind":"model","superseded_by":"gpt-5.3-codex","release_date":"2025-11-13","intelligence_index":69.05,"coverage":0.4445,"index_subset_bias":{"offset":3.26,"peers":10,"method":"subset-knn-v1"},"params_total_b":null,"params_active_b":null,"vram_est":null,"vram_frontier":null,"fits_on":null,"is_moe":false,"is_open_weights":false,"context_window_tok":400000,"pricing":{"prompt_usd_per_m":1.25,"completion_usd_per_m":10,"blended_usd_per_m":3.4375},"scores":{"aime":{"raw":95.67,"norm":94.59,"trust":2,"source_url":"https://artificialanalysis.ai/models/gpt-5-1-codex","config":"aa field aime25, aime-2025, artificial analysis intelligence index v4.1.1 suite, effort=high, reasoning=true, run: high, source value 0.956666666666667 is a 0-1 fraction, x100 at harvest","measured_date":null},"gpqa_diamond":{"raw":85.96,"norm":85.86,"trust":2,"source_url":"https://artificialanalysis.ai/models/gpt-5-1-codex","config":"aa field gpqa, artificial analysis intelligence index v4.1.1 suite, effort=high, gpqa diamond, reasoning=true, run: high, source value 0.85959595959596 is a 0-1 fraction, x100 at harvest","measured_date":null},"hle":{"raw":25.72,"norm":34.88,"trust":2,"source_url":"https://artificialanalysis.ai/models/gpt-5-1-codex","config":"aa field hle, artificial analysis intelligence index v4.1.1 suite, effort=high, humanity's last exam, reasoning=true, run: high, source value 0.257182576459685 is a 0-1 fraction, x100 at harvest","measured_date":null},"tau_bench":{"raw":83.04,"norm":84.05,"trust":2,"source_url":"https://artificialanalysis.ai/models/gpt-5-1-codex","config":"aa field tau2, aa field tau2 (not mapped to tau_bench), artificial analysis intelligence index v4.1.1 suite, effort=high, reasoning=true, run: high, source value 0.830409356725146 is a 0-1 fraction, x100 at harvest","measured_date":null},"terminal_bench":{"raw":34.85,"norm":35.12,"trust":2,"source_url":"https://artificialanalysis.ai/models/gpt-5-1-codex","config":"aa field terminalbenchhard, artificial analysis intelligence index v4.1.1 suite, effort=high, reasoning=true, run: high, source value 0.348484848484849 is a 0-1 fraction, terminal-bench hard, x100 at harvest","measured_date":null}}},{"id":"qwen-3-max-reasoning","display_name":"Qwen3 Max Thinking","family_id":"qwen","vendor":"Alibaba","status":"current","kind":"model","superseded_by":null,"release_date":"2026-02-09","intelligence_index":68.95,"coverage":0.7223,"index_subset_bias":{"offset":4.12,"peers":10,"method":"subset-knn-v1"},"params_total_b":null,"params_active_b":null,"vram_est":null,"vram_frontier":null,"fits_on":null,"is_moe":false,"is_open_weights":false,"context_window_tok":262144,"pricing":{"prompt_usd_per_m":0.78,"completion_usd_per_m":3.9,"blended_usd_per_m":1.56},"scores":{"aime":{"raw":82.33,"norm":77.91,"trust":2,"source_url":"https://artificialanalysis.ai/models/qwen3-max-thinking-preview","config":"aa field aime25, aime-2025, artificial analysis intelligence index v4.1.1 suite, effort=none, reasoning=true, run: preview, source value 0.823333333333333 is a 0-1 fraction, x100 at harvest","measured_date":null},"gpqa_diamond":{"raw":86.1,"norm":86.06,"trust":2,"source_url":"https://artificialanalysis.ai/models/qwen3-max-thinking","config":"artificial analysis independent run, no tools","measured_date":null},"hle":{"raw":28,"norm":38.24,"trust":2,"source_url":"https://artificialanalysis.ai/models/qwen3-max-thinking","config":"artificial analysis independent run, no tools","measured_date":null},"mmlu_pro":{"raw":85.7,"norm":76.17,"trust":1,"source_url":"https://qwen.ai/blog?id=qwen3-max-thinking","config":"qwen3-max-thinking, vendor-reported","measured_date":"2026-01-25"},"swe_bench_verified":{"raw":75.3,"norm":72.56,"trust":1,"source_url":"https://qwen.ai/blog?id=qwen3-max-thinking","config":"reported as 'swe verified' (agentic coding)","measured_date":"2026-01-25"},"tau_bench":{"raw":83.63,"norm":84.84,"trust":2,"source_url":"https://artificialanalysis.ai/models/qwen3-max-thinking","config":"aa field tau2, aa field tau2 (not mapped to tau_bench), artificial analysis intelligence index v4.1.1 suite, effort=none, reasoning=true, run: max thinking, source value 0.836257309941521 is a 0-1 fraction, x100 at harvest","measured_date":null},"terminal_bench":{"raw":24.24,"norm":22.64,"trust":2,"source_url":"https://artificialanalysis.ai/models/qwen3-max-thinking","config":"aa field terminalbenchhard, artificial analysis intelligence index v4.1.1 suite, effort=none, reasoning=true, run: max thinking, source value 0.242424242424242 is a 0-1 fraction, terminal-bench hard, x100 at harvest","measured_date":null}}},{"id":"qwen-3.6-27b","display_name":"Qwen3.6 27B","family_id":"qwen","vendor":"Alibaba","status":"superseded","kind":"model","superseded_by":"qwen-3.8-27b","release_date":"2026-04-27","intelligence_index":68.92,"coverage":0.8413,"index_subset_bias":null,"params_total_b":27.78,"params_active_b":27.78,"vram_est":{"bf16_gb":55.6,"int8_gb":29.4,"int4_gb":16.7,"method":"linear-rom-v1","approximate":true,"basis":"params_total_b"},"vram_frontier":null,"fits_on":{"intel_b70":"fp8","nvidia_h100_sxm_80g":"fp8","nvidia_dgx_spark":"fp8"},"is_moe":false,"is_open_weights":true,"context_window_tok":262144,"pricing":{"prompt_usd_per_m":0.32,"completion_usd_per_m":3.25,"blended_usd_per_m":1.0525},"scores":{"aime":{"raw":94.1,"norm":92.62,"trust":1,"source_url":"https://huggingface.co/Qwen/Qwen3.6-27B","config":"2026","measured_date":null},"gpqa_diamond":{"raw":84.24,"norm":83.44,"trust":2,"source_url":"https://artificialanalysis.ai/models/qwen3-6-27b","config":"aa field gpqa, artificial analysis intelligence index v4.1.1 suite, effort=none, gpqa diamond, reasoning=true, run: reasoning, source value 0.842424242424242 is a 0-1 fraction, x100 at harvest","measured_date":null},"hle":{"raw":23.08,"norm":31,"trust":2,"source_url":"https://artificialanalysis.ai/models/qwen3-6-27b","config":"aa field hle, artificial analysis intelligence index v4.1.1 suite, effort=none, humanity's last exam, reasoning=true, run: reasoning, source value 0.230769230769231 is a 0-1 fraction, x100 at harvest","measured_date":null},"livebench":{"raw":64.03,"norm":53.4,"trust":3,"source_url":"https://livebench.ai/","config":"livebench-2026-06-25 release","measured_date":null},"mmlu_pro":{"raw":86.2,"norm":77,"trust":1,"source_url":"https://huggingface.co/Qwen/Qwen3.6-27B","config":null,"measured_date":null},"swe_bench_verified":{"raw":70,"norm":66.67,"trust":3,"source_url":"https://www.vals.ai/benchmarks/swebench","config":"edition=swe-bench verified v1, runner=external, stderr=2.051, task=overall, updated=2026-08-19","measured_date":"2026-08-19"},"tau_bench":{"raw":94.15,"norm":98.87,"trust":2,"source_url":"https://artificialanalysis.ai/models/qwen3-6-27b","config":"aa field tau2, aa field tau2 (not mapped to tau_bench), artificial analysis intelligence index v4.1.1 suite, effort=none, reasoning=true, run: reasoning, source value 0.941520467836257 is a 0-1 fraction, x100 at harvest","measured_date":null},"terminal_bench":{"raw":60.67,"norm":65.49,"trust":2,"source_url":"https://artificialanalysis.ai/models/qwen3-6-27b","config":"aa field terminalbenchv21, artificial analysis intelligence index v4.1.1 suite, effort=none, reasoning=true, run: reasoning, source value 0.606741573033708 is a 0-1 fraction, terminal-bench 2.1, x100 at harvest","measured_date":null}}},{"id":"qwen-3.5-122b-a10b","display_name":"Qwen3.5-122B-A10B","family_id":"qwen","vendor":"Alibaba","status":"current","kind":"model","superseded_by":null,"release_date":"2026-02-25","intelligence_index":68.46,"coverage":0.7223,"index_subset_bias":{"offset":1.05,"peers":10,"method":"subset-knn-v1"},"params_total_b":125.09,"params_active_b":10,"vram_est":{"bf16_gb":250,"int8_gb":133,"int4_gb":75.1,"method":"linear-rom-v1","approximate":true,"basis":"params_total_b"},"vram_frontier":{"efficiency":2.33,"expected_int8_gb":308,"method":"frontier-residual-v1","approximate":true},"fits_on":{"nvidia_h100_sxm_80g":"int4","nvidia_dgx_spark":"int4"},"is_moe":true,"is_open_weights":true,"context_window_tok":262144,"pricing":{"prompt_usd_per_m":0.26,"completion_usd_per_m":2.08,"blended_usd_per_m":0.7150000000000001},"scores":{"arena_elo":{"raw":1416.1,"norm":60.83,"trust":3,"source_url":"https://lmarena.ai/leaderboard","config":"text","measured_date":"2026-10-01"},"gpqa_diamond":{"raw":85.66,"norm":85.44,"trust":2,"source_url":"https://artificialanalysis.ai/models/qwen3-5-122b-a10b","config":"aa field gpqa, artificial analysis intelligence index v4.1.1 suite, effort=none, gpqa diamond, reasoning=true, run: reasoning, source value 0.856565656565657 is a 0-1 fraction, x100 at harvest","measured_date":null},"hle":{"raw":25.21,"norm":34.13,"trust":2,"source_url":"https://artificialanalysis.ai/models/qwen3-5-122b-a10b","config":"aa field hle, artificial analysis intelligence index v4.1.1 suite, effort=none, humanity's last exam, reasoning=true, run: reasoning, source value 0.252085264133457 is a 0-1 fraction, x100 at harvest","measured_date":null},"mmlu_pro":{"raw":86.7,"norm":77.83,"trust":1,"source_url":"https://huggingface.co/Qwen/Qwen3.5-122B-A10B","config":"official model card language table, thinking mode [raw: mmlu-pro]","measured_date":null},"swe_bench_verified":{"raw":72,"norm":68.89,"trust":1,"source_url":"https://huggingface.co/Qwen/Qwen3.5-122B-A10B","config":"official model card language table [raw: swe-bench verified], resolved rate","measured_date":null},"tau_bench":{"raw":93.57,"norm":98.09,"trust":2,"source_url":"https://artificialanalysis.ai/models/qwen3-5-122b-a10b","config":"aa field tau2, aa field tau2 (not mapped to tau_bench), artificial analysis intelligence index v4.1.1 suite, effort=none, reasoning=true, run: reasoning, source value 0.935672514619883 is a 0-1 fraction, x100 at harvest","measured_date":null},"terminal_bench":{"raw":47.57,"norm":50.08,"trust":2,"source_url":"https://artificialanalysis.ai/models/qwen3-5-122b-a10b","config":"aa field terminalbenchv21, artificial analysis intelligence index v4.1.1 suite, effort=none, reasoning=true, run: reasoning, source value 0.47565543071161 is a 0-1 fraction, terminal-bench 2.1, x100 at harvest","measured_date":null}}},{"id":"qwen-3-235b-a22b-2507-reasoning","display_name":"Qwen3-235B-A22B-Thinking-2507","family_id":"qwen","vendor":"Alibaba","status":"current","kind":"model","superseded_by":null,"release_date":"2025-07-25","intelligence_index":68.44,"coverage":0.7143,"index_subset_bias":{"offset":4.18,"peers":9,"method":"subset-knn-v1"},"params_total_b":235.09,"params_active_b":22,"vram_est":{"bf16_gb":470,"int8_gb":249,"int4_gb":141,"method":"linear-rom-v1","approximate":true,"basis":"params_total_b"},"vram_frontier":{"efficiency":1.24,"expected_int8_gb":308,"method":"frontier-residual-v1","approximate":true},"fits_on":{},"is_moe":true,"is_open_weights":true,"context_window_tok":131072,"pricing":{"prompt_usd_per_m":0.23,"completion_usd_per_m":2.3,"blended_usd_per_m":0.7474999999999999},"scores":{"aime":{"raw":92.3,"norm":90.38,"trust":1,"source_url":"https://huggingface.co/Qwen/Qwen3-235B-A22B-Thinking-2507","config":"81, 920 max output tokens. [raw: aime25], aime 2025. official model card \"reasoning\" section, no tools","measured_date":null},"arena_elo":{"raw":1400,"norm":53.65,"trust":3,"source_url":"https://lmarena.ai/leaderboard","config":"text","measured_date":"2026-09-27"},"gpqa_diamond":{"raw":81.1,"norm":79.01,"trust":1,"source_url":"https://huggingface.co/Qwen/Qwen3-235B-A22B-Thinking-2507","config":"81, 920 max o [raw: gpqa], no tools, official model card table, qwen's gpqa rows are conventionally the diamond subset). thinking mode, row labeled \"gpqa\" (no subset label printed, temp 0.6 / top-p 0.95 / top-k 20","measured_date":null},"hle":{"raw":18.2,"norm":23.82,"trust":1,"source_url":"https://huggingface.co/Qwen/Qwen3-235B-A22B-Thinking-2507","config":"card footnote: \"scores marked with # refer to models that are not multi-modal and were evaluated only on the text-only subset\". text-only, no tools. [raw: hle], printed as \"18.2#\"","measured_date":null},"livebench":{"raw":78.4,"norm":85.33,"trust":1,"source_url":"https://huggingface.co/Qwen/Qwen3-235B-A22B-Thinking-2507","config":"global average as printed on the official model card. no tools. [raw: livebench 20241125], livebench 2024-11-25 release","measured_date":null},"mmlu_pro":{"raw":84.4,"norm":74,"trust":1,"source_url":"https://huggingface.co/Qwen/Qwen3-235B-A22B-Thinking-2507","config":"\"knowledge\" section. thinking mode, no tools. [raw: mmlu-pro], official model card table","measured_date":null},"tau_bench":{"raw":71.9,"norm":69.2,"trust":1,"source_url":"https://huggingface.co/Qwen/Qwen3-235B-A22B-Thinking-2507","config":"ta [raw: tau2-retail], tau-2 (τ2-bench) retail domain only — no cross-domain average is published anywhere for this model. other published domains on the same card: tau2-airline 58.0, tau1-retail 67.8, tau2-telecom 45.6","measured_date":null}}},{"id":"muse-glimmer-1-30b","display_name":"Muse Glimmer 30B","family_id":"muse","vendor":"Meta","status":"current","kind":"model","superseded_by":null,"release_date":"2026-08-09","intelligence_index":68.43,"coverage":0.5555,"index_subset_bias":{"offset":-0.43,"peers":10,"method":"subset-knn-v1"},"params_total_b":29.78,"params_active_b":29.78,"vram_est":{"bf16_gb":59.6,"int8_gb":31.6,"int4_gb":17.9,"method":"linear-rom-v1","approximate":true,"basis":"params_total_b"},"vram_frontier":{"efficiency":2.2,"expected_int8_gb":69.5,"method":"frontier-residual-v1","approximate":true},"fits_on":{"intel_b70":"int4","nvidia_h100_sxm_80g":"fp8","nvidia_dgx_spark":"fp8"},"is_moe":false,"is_open_weights":true,"context_window_tok":131072,"pricing":{"prompt_usd_per_m":0.35,"completion_usd_per_m":1.5,"blended_usd_per_m":0.6375},"scores":{"aime":{"raw":94.7,"norm":93.38,"trust":1,"source_url":"https://huggingface.co/meta-models/Muse-Glimmer-30B","config":"aime 2026, high reasoning","measured_date":null},"gpqa_diamond":{"raw":83.5,"norm":82.39,"trust":1,"source_url":"https://huggingface.co/meta-models/Muse-Glimmer-30B","config":"artificial analysis harness, high reasoning","measured_date":null},"hle":{"raw":22,"norm":29.41,"trust":1,"source_url":"https://huggingface.co/meta-models/Muse-Glimmer-30B","config":"artificial analysis harness, text only","measured_date":null},"swe_bench_verified":{"raw":76,"norm":73.33,"trust":1,"source_url":"https://huggingface.co/meta-models/Muse-Glimmer-30B","config":null,"measured_date":null},"terminal_bench":{"raw":51.7,"norm":54.94,"trust":1,"source_url":"https://huggingface.co/meta-models/Muse-Glimmer-30B","config":"terminalbench 2.1, terminus2 harness","measured_date":null}}},{"id":"step-3.5-flash","display_name":"Step 3.5 Flash","family_id":"step","vendor":"stepfun","status":"current","kind":"model","superseded_by":null,"release_date":"2026-01-29","intelligence_index":68.37,"coverage":0.8016,"index_subset_bias":null,"params_total_b":199.38,"params_active_b":null,"vram_est":{"bf16_gb":399,"int8_gb":211,"int4_gb":120,"method":"linear-rom-v1","approximate":true,"basis":"params_total_b"},"vram_frontier":{"efficiency":1.45,"expected_int8_gb":307,"method":"frontier-residual-v1","approximate":true},"fits_on":{},"is_moe":true,"is_open_weights":true,"context_window_tok":262144,"pricing":{"prompt_usd_per_m":0.1,"completion_usd_per_m":0.3,"blended_usd_per_m":0.15000000000000002},"scores":{"aime":{"raw":97.3,"norm":96.63,"trust":2,"source_url":"https://arxiv.org/pdf/2602.10604","config":"aime 2025, no tools, repeat@64 [raw: aime 2025], table 5 step 3.5 flash 'vanilla' column (non-pacore)","measured_date":null},"arena_elo":{"raw":1393.3,"norm":50.66,"trust":3,"source_url":"https://lmarena.ai/leaderboard","config":"text","measured_date":"2026-10-03"},"gpqa_diamond":{"raw":83.13,"norm":81.87,"trust":2,"source_url":"https://artificialanalysis.ai/models/step-3-5-flash-0202","config":"aa field gpqa, artificial analysis intelligence index v4.1.1 suite, effort=none, gpqa diamond, reasoning=true, run: step 3.5 flash, source value 0.831313131313131 is a 0-1 fraction, x100 at harvest","measured_date":null},"hle":{"raw":24.47,"norm":33.04,"trust":2,"source_url":"https://artificialanalysis.ai/models/step-3-5-flash","config":"aa field hle, artificial analysis intelligence index v4.1.1 suite, effort=none, humanity's last exam, reasoning=true, run: step 3.5 flash 2603, source value 0.244670991658943 is a 0-1 fraction, x100 at harvest","measured_date":null},"mmlu_pro":{"raw":84.4,"norm":74,"trust":2,"source_url":"https://arxiv.org/abs/2602.10604","config":null,"measured_date":"2026-02-11"},"swe_bench_verified":{"raw":74.4,"norm":71.56,"trust":2,"source_url":"https://arxiv.org/abs/2602.10604","config":null,"measured_date":"2026-02-11"},"tau_bench":{"raw":94.44,"norm":99.25,"trust":2,"source_url":"https://artificialanalysis.ai/models/step-3-5-flash-0202","config":"aa field tau2, aa field tau2 (not mapped to tau_bench), artificial analysis intelligence index v4.1.1 suite, effort=none, reasoning=true, run: step 3.5 flash, source value 0.944444444444444 is a 0-1 fraction, x100 at harvest","measured_date":null},"terminal_bench":{"raw":32.58,"norm":32.45,"trust":2,"source_url":"https://artificialanalysis.ai/models/step-3-5-flash","config":"aa field terminalbenchhard, artificial analysis intelligence index v4.1.1 suite, effort=none, reasoning=true, run: step 3.5 flash 2603, source value 0.325757575757576 is a 0-1 fraction, terminal-bench hard, x100 at harvest","measured_date":null}}},{"id":"glm-4.7","display_name":"GLM 4.7","family_id":"glm","vendor":"Zhipu AI (Z.ai)","status":"superseded","kind":"model","superseded_by":"glm-5.3","release_date":"2025-12-22","intelligence_index":68.33,"coverage":0.8016,"index_subset_bias":null,"params_total_b":358.34,"params_active_b":32,"vram_est":{"bf16_gb":717,"int8_gb":380,"int4_gb":215,"method":"linear-rom-v1","approximate":true,"basis":"params_total_b"},"vram_frontier":null,"fits_on":{},"is_moe":true,"is_open_weights":true,"context_window_tok":204800,"pricing":{"prompt_usd_per_m":0.6,"completion_usd_per_m":2.2,"blended_usd_per_m":1},"scores":{"aime":{"raw":93.33,"norm":91.66,"trust":3,"source_url":"https://www.vals.ai/benchmarks/aime","config":"archived=true, edition=aime v1, runner=platform, stderr=0.445, task=overall, updated=2026-04-16","measured_date":"2026-08-19"},"arena_elo":{"raw":1441.5,"norm":72.15,"trust":3,"source_url":"https://lmarena.ai/leaderboard","config":"text","measured_date":"2026-10-01"},"gpqa_diamond":{"raw":80.05,"norm":77.54,"trust":3,"source_url":"https://www.vals.ai/benchmarks/gpqa","config":"edition=gpqa diamond v1, runner=platform, stderr=2.006, task=overall, updated=2026-08-19","measured_date":"2026-08-19"},"hle":{"raw":27.39,"norm":37.34,"trust":2,"source_url":"https://artificialanalysis.ai/models/glm-4-7","config":"aa field hle, artificial analysis intelligence index v4.1.1 suite, effort=none, humanity's last exam, reasoning=true, run: reasoning, source value 0.27386468952734 is a 0-1 fraction, x100 at harvest","measured_date":null},"mmlu_pro":{"raw":82.74,"norm":71.23,"trust":3,"source_url":"https://www.vals.ai/benchmarks/mmlu_pro","config":"edition=mmlu pro v1, runner=platform, stderr=0.371, task=overall, updated=2026-08-19","measured_date":"2026-08-19"},"swe_bench_verified":{"raw":69.4,"norm":66,"trust":3,"source_url":"https://www.vals.ai/benchmarks/swebench","config":"edition=swe-bench verified v1, runner=external, stderr=2.063, task=overall, updated=2026-08-19","measured_date":"2026-08-19"},"tau_bench":{"raw":95.91,"norm":100,"trust":2,"source_url":"https://artificialanalysis.ai/models/glm-4-7","config":"aa field tau2, aa field tau2 (not mapped to tau_bench), artificial analysis intelligence index v4.1.1 suite, effort=none, reasoning=true, run: reasoning, source value 0.95906432748538 is a 0-1 fraction, x100 at harvest","measured_date":null},"terminal_bench":{"raw":33.4,"norm":33.41,"trust":2,"source_url":"https://www.tbench.ai/leaderboard/terminal-bench/2.0","config":"2.0, agent: terminus 2","measured_date":"2026-01-28"}}},{"id":"mimo-2.5","display_name":"MiMo-V2.5","family_id":"mimo","vendor":"xiaomi","status":"current","kind":"model","superseded_by":null,"release_date":"2026-04-22","intelligence_index":68.33,"coverage":0.5635,"index_subset_bias":{"offset":2.37,"peers":10,"method":"subset-knn-v1"},"params_total_b":310.78,"params_active_b":null,"vram_est":{"bf16_gb":622,"int8_gb":329,"int4_gb":186,"method":"linear-rom-v1","approximate":true,"basis":"params_total_b"},"vram_frontier":{"efficiency":0.93,"expected_int8_gb":307,"method":"frontier-residual-v1","approximate":true},"fits_on":{},"is_moe":true,"is_open_weights":true,"context_window_tok":1050000,"pricing":{"prompt_usd_per_m":0.14,"completion_usd_per_m":0.28,"blended_usd_per_m":0.17500000000000002},"scores":{"arena_elo":{"raw":1433.6,"norm":68.63,"trust":3,"source_url":"https://lmarena.ai/leaderboard","config":"text","measured_date":"2026-10-03"},"gpqa_diamond":{"raw":81.57,"norm":79.68,"trust":3,"source_url":"https://www.vals.ai/benchmarks/gpqa","config":"overall, vals ai independent run","measured_date":null},"hle":{"raw":27.2,"norm":37.06,"trust":2,"source_url":"https://artificialanalysis.ai/models/mimo-v2-5-0424","config":"artificial analysis independent run, no tools","measured_date":null},"mmlu_pro":{"raw":82.93,"norm":71.55,"trust":3,"source_url":"https://www.vals.ai/benchmarks/mmlu_pro","config":"overall, vals ai independent run","measured_date":null},"tau_bench":{"raw":90.64,"norm":94.19,"trust":2,"source_url":"https://artificialanalysis.ai/models/mimo-v2-5-0424","config":"artificial analysis independent run, tau2, with tools","measured_date":null},"terminal_bench":{"raw":63.67,"norm":69.02,"trust":2,"source_url":"https://artificialanalysis.ai/models/mimo-v2-5-0424","config":"2.1, artificial analysis independent run","measured_date":null}}},{"id":"nemotron-3-ultra-550b-a55b","display_name":"Nemotron 3 Ultra","family_id":"nemotron","vendor":"NVIDIA","status":"current","kind":"model","superseded_by":null,"release_date":"2026-06-04","intelligence_index":68.19,"coverage":0.7223,"index_subset_bias":{"offset":1.59,"peers":10,"method":"subset-knn-v1"},"params_total_b":560.52,"params_active_b":55,"vram_est":{"bf16_gb":1121,"int8_gb":594,"int4_gb":336,"method":"linear-rom-v1","approximate":true,"basis":"params_total_b"},"vram_frontier":{"efficiency":0.51,"expected_int8_gb":306,"method":"frontier-residual-v1","approximate":true},"fits_on":{},"is_moe":true,"is_open_weights":true,"context_window_tok":262144,"pricing":{"prompt_usd_per_m":0.5,"completion_usd_per_m":2.2,"blended_usd_per_m":0.925},"scores":{"arena_elo":{"raw":1426.2,"norm":65.33,"trust":3,"source_url":"https://lmarena.ai/leaderboard","config":"text","measured_date":"2026-10-03"},"gpqa_diamond":{"raw":86.11,"norm":86.07,"trust":3,"source_url":"https://www.vals.ai/benchmarks/gpqa","config":"edition=gpqa diamond v1, runner=platform, stderr=1.738, task=overall, updated=2026-08-19","measured_date":"2026-08-19"},"hle":{"raw":28.41,"norm":38.84,"trust":2,"source_url":"https://artificialanalysis.ai/models/nvidia-nemotron-3-ultra-550b-a55b","config":"aa field hle, artificial analysis intelligence index v4.1.1 suite, effort=none, humanity's last exam, reasoning=true, run: reasoning, source value 0.284059314179796 is a 0-1 fraction, x100 at harvest","measured_date":null},"mmlu_pro":{"raw":85.76,"norm":76.27,"trust":3,"source_url":"https://www.vals.ai/benchmarks/mmlu_pro","config":"edition=mmlu pro v1, runner=platform, stderr=0.345, task=overall, updated=2026-08-19","measured_date":"2026-08-19"},"swe_bench_verified":{"raw":69,"norm":65.56,"trust":3,"source_url":"https://www.vals.ai/benchmarks/swebench","config":"edition=swe-bench verified v1, runner=external, stderr=2.07, task=overall, updated=2026-08-19","measured_date":"2026-08-19"},"tau_bench":{"raw":83.33,"norm":84.44,"trust":2,"source_url":"https://artificialanalysis.ai/models/nvidia-nemotron-3-ultra-550b-a55b","config":"aa field tau2, aa field tau2 (not mapped to tau_bench), artificial analysis intelligence index v4.1.1 suite, effort=none, reasoning=true, run: reasoning, source value 0.833333333333333 is a 0-1 fraction, x100 at harvest","measured_date":null},"terminal_bench":{"raw":50.94,"norm":54.05,"trust":3,"source_url":"https://www.vals.ai/benchmarks/terminal-bench-2-1","config":"edition=terminal-bench 2.1, runner=external, stderr=2.925, task=overall, updated=2026-08-19","measured_date":"2026-08-19"}}},{"id":"claude-opus-4.5","display_name":"Claude Opus 4.5","family_id":"claude","vendor":"Anthropic","status":"superseded","kind":"model","superseded_by":"claude-opus-5.5","release_date":"2025-11-24","intelligence_index":67.98,"coverage":0.6428,"index_subset_bias":{"offset":-1.8,"peers":9,"method":"subset-knn-v1"},"params_total_b":null,"params_active_b":null,"vram_est":null,"vram_frontier":null,"fits_on":null,"is_moe":false,"is_open_weights":false,"context_window_tok":200000,"pricing":{"prompt_usd_per_m":5,"completion_usd_per_m":25,"blended_usd_per_m":10},"scores":{"aime":{"raw":91.33,"norm":89.16,"trust":2,"source_url":"https://artificialanalysis.ai/models/claude-opus-4-5-thinking","config":"aa field aime25, aime-2025, artificial analysis intelligence index v4.1.1 suite, effort=none, reasoning=true, run: reasoning, source value 0.913333333333333 is a 0-1 fraction, x100 at harvest","measured_date":null},"arc_agi_2":{"raw":37.64,"norm":36.27,"trust":3,"source_url":"https://arcprize.org/leaderboard","config":"64k, cost_per_task_usd=2.4, eval=arc-agi-2 semi-private (v2_semi_private), model_group=opus-4-5-thinking, org=anthropic, run: thinking, system_type=cot","measured_date":"2026-08-21"},"gpqa_diamond":{"raw":86.57,"norm":86.72,"trust":2,"source_url":"https://artificialanalysis.ai/models/claude-opus-4-5-thinking","config":"aa field gpqa, artificial analysis intelligence index v4.1.1 suite, effort=none, gpqa diamond, reasoning=true, run: reasoning, source value 0.865656565656566 is a 0-1 fraction, x100 at harvest","measured_date":null},"hle":{"raw":30.12,"norm":41.35,"trust":2,"source_url":"https://artificialanalysis.ai/models/claude-opus-4-5-thinking","config":"aa field hle, artificial analysis intelligence index v4.1.1 suite, effort=none, humanity's last exam, reasoning=true, run: reasoning, source value 0.301204819277108 is a 0-1 fraction, x100 at harvest","measured_date":null},"livebench":{"raw":72.58,"norm":72.4,"trust":3,"source_url":"https://livebench.ai/","config":"livebench-2026-06-25 release, run: high effort","measured_date":null},"tau_bench":{"raw":89.47,"norm":92.63,"trust":2,"source_url":"https://artificialanalysis.ai/models/claude-opus-4-5-thinking","config":"aa field tau2, aa field tau2 (not mapped to tau_bench), artificial analysis intelligence index v4.1.1 suite, effort=none, reasoning=true, run: reasoning, source value 0.894736842105263 is a 0-1 fraction, x100 at harvest","measured_date":null},"terminal_bench":{"raw":46.97,"norm":49.38,"trust":2,"source_url":"https://artificialanalysis.ai/models/claude-opus-4-5-thinking","config":"aa field terminalbenchhard, artificial analysis intelligence index v4.1.1 suite, effort=none, reasoning=true, run: reasoning, source value 0.46969696969697 is a 0-1 fraction, terminal-bench hard, x100 at harvest","measured_date":null}}},{"id":"hunyuan-1-a13b-instruct","display_name":"Hunyuan A13B Instruct","family_id":"hunyuan","vendor":"Tencent","status":"current","kind":"model","superseded_by":null,"release_date":"2025-07-08","intelligence_index":67.22,"coverage":0.2858,"index_subset_bias":{"offset":15.46,"peers":10,"method":"subset-knn-v1"},"params_total_b":80.39,"params_active_b":13,"vram_est":{"bf16_gb":161,"int8_gb":85.2,"int4_gb":48.2,"method":"linear-rom-v1","approximate":true,"basis":"params_total_b"},"vram_frontier":{"efficiency":3.47,"expected_int8_gb":296,"method":"frontier-residual-v1","approximate":true},"fits_on":{"nvidia_h100_sxm_80g":"int4","nvidia_dgx_spark":"fp8"},"is_moe":true,"is_open_weights":true,"context_window_tok":131072,"pricing":{"prompt_usd_per_m":0.14,"completion_usd_per_m":0.57,"blended_usd_per_m":0.2475},"scores":{"aime":{"raw":87.3,"norm":84.13,"trust":1,"source_url":"https://huggingface.co/tencent/Hunyuan-A13B-Instruct","config":"aime 2024, default slow-thinking reasoning","measured_date":null},"gpqa_diamond":{"raw":71.2,"norm":65.07,"trust":1,"source_url":"https://huggingface.co/tencent/Hunyuan-A13B-Instruct","config":"default slow-thinking reasoning","measured_date":null},"tau_bench":{"raw":54.7,"norm":46.27,"trust":1,"source_url":"https://huggingface.co/tencent/Hunyuan-A13B-Instruct","config":"default slow-thinking reasoning, tau-bench (v1)","measured_date":null}}},{"id":"ling-3.0-flash","display_name":"Ling 3.0 Flash","family_id":"ling","vendor":"inclusionAI","status":"current","kind":"model","superseded_by":null,"release_date":"2026-07-23","intelligence_index":66.39,"coverage":0.6746,"index_subset_bias":{"offset":2.08,"peers":10,"method":"subset-knn-v1"},"params_total_b":127.49,"params_active_b":null,"vram_est":{"bf16_gb":255,"int8_gb":135,"int4_gb":76.5,"method":"linear-rom-v1","approximate":true,"basis":"params_total_b"},"vram_frontier":{"efficiency":2.13,"expected_int8_gb":288,"method":"frontier-residual-v1","approximate":true},"fits_on":{"nvidia_dgx_spark":"int4"},"is_moe":true,"is_open_weights":true,"context_window_tok":262144,"pricing":{"prompt_usd_per_m":0.021,"completion_usd_per_m":0.063,"blended_usd_per_m":0.0315},"scores":{"aime":{"raw":93.2,"norm":91.5,"trust":1,"source_url":"https://huggingface.co/inclusionAI/Ling-3.0-flash","config":"2026","measured_date":null},"gpqa_diamond":{"raw":84.85,"norm":84.3,"trust":3,"source_url":"https://www.vals.ai/benchmarks/gpqa","config":"edition=gpqa diamond v1, runner=platform, stderr=2.197, task=overall, updated=2026-08-19","measured_date":"2026-08-19"},"hle":{"raw":23.68,"norm":31.88,"trust":2,"source_url":"https://artificialanalysis.ai/models/ling-3-0-flash","config":"aa field hle, artificial analysis intelligence index v4.1.1 suite, effort=none, humanity's last exam, reasoning=true, source value 0.236793327154773 is a 0-1 fraction, x100 at harvest","measured_date":null},"mmlu_pro":{"raw":82.01,"norm":70.02,"trust":3,"source_url":"https://www.vals.ai/benchmarks/mmlu_pro","config":"edition=mmlu pro v1, runner=platform, stderr=0.375, task=overall, updated=2026-08-19","measured_date":"2026-08-19"},"swe_bench_verified":{"raw":65.2,"norm":61.33,"trust":3,"source_url":"https://www.vals.ai/benchmarks/swebench","config":"edition=swe-bench verified v1, runner=external, stderr=2.132, task=overall, updated=2026-08-19","measured_date":"2026-08-19"},"terminal_bench":{"raw":50.19,"norm":53.16,"trust":3,"source_url":"https://www.vals.ai/benchmarks/terminal-bench-2-1","config":"edition=terminal-bench 2.1, runner=external, stderr=2.456, task=overall, updated=2026-08-19","measured_date":"2026-08-19"}}},{"id":"gpt-5.1","display_name":"GPT-5.1","family_id":"gpt","vendor":"OpenAI","status":"superseded","kind":"model","superseded_by":"gpt-5.5","release_date":"2025-11-13","intelligence_index":66.35,"coverage":0.8809,"index_subset_bias":null,"params_total_b":null,"params_active_b":null,"vram_est":null,"vram_frontier":null,"fits_on":null,"is_moe":false,"is_open_weights":false,"context_window_tok":400000,"pricing":{"prompt_usd_per_m":1.25,"completion_usd_per_m":10,"blended_usd_per_m":3.4375},"scores":{"aime":{"raw":93.33,"norm":91.66,"trust":3,"source_url":"https://www.vals.ai/benchmarks/aime","config":"archived=true, edition=aime v1, reasoning_effort=high, runner=platform, stderr=0.62, task=overall, updated=2026-04-16","measured_date":"2026-08-19"},"arc_agi_2":{"raw":17.64,"norm":14.04,"trust":3,"source_url":"https://arcprize.org/leaderboard","config":"cost_per_task_usd=1.1704, eval=arc-agi-2 semi-private (v2_semi_private), high, model_group=gpt-5-1-reasoning, org=openai, run: thinking, system_type=cot","measured_date":"2026-08-21"},"arena_elo":{"raw":1438.5,"norm":70.81,"trust":3,"source_url":"https://lmarena.ai/leaderboard","config":"text","measured_date":"2026-10-06"},"gpqa_diamond":{"raw":86.62,"norm":86.79,"trust":3,"source_url":"https://www.vals.ai/benchmarks/gpqa","config":"edition=gpqa diamond v1, reasoning_effort=high, runner=platform, stderr=1.711, task=overall, updated=2026-08-19","measured_date":"2026-08-19"},"hle":{"raw":28.5,"norm":38.97,"trust":2,"source_url":"https://artificialanalysis.ai/models/gpt-5-1","config":"aa field hle, artificial analysis intelligence index v4.1.1 suite, effort=high, humanity's last exam, reasoning=true, run: high, source value 0.28498609823911 is a 0-1 fraction, x100 at harvest","measured_date":null},"mmlu_pro":{"raw":86.38,"norm":77.3,"trust":3,"source_url":"https://www.vals.ai/benchmarks/mmlu_pro","config":"edition=mmlu pro v1, reasoning_effort=high, runner=platform, stderr=0.337, task=overall, updated=2026-08-19","measured_date":"2026-08-19"},"swe_bench_verified":{"raw":69.8,"norm":66.44,"trust":3,"source_url":"https://www.vals.ai/benchmarks/swebench","config":"edition=swe-bench verified v1, reasoning_effort=high, runner=external, stderr=2.055, task=overall, updated=2026-08-19","measured_date":"2026-08-19"},"tau_bench":{"raw":81.87,"norm":82.49,"trust":2,"source_url":"https://artificialanalysis.ai/models/gpt-5-1","config":"aa field tau2, aa field tau2 (not mapped to tau_bench), artificial analysis intelligence index v4.1.1 suite, effort=high, reasoning=true, run: high, source value 0.818713450292398 is a 0-1 fraction, x100 at harvest","measured_date":null},"terminal_bench":{"raw":52.43,"norm":55.8,"trust":2,"source_url":"https://artificialanalysis.ai/models/gpt-5-1","config":"aa field terminalbenchv21, artificial analysis intelligence index v4.1.1 suite, effort=high, reasoning=true, run: high, source value 0.524344569288389 is a 0-1 fraction, terminal-bench 2.1, x100 at harvest","measured_date":null}}},{"id":"qwen-3-8b-reasoning-vision","display_name":"Qwen3 VL 8B Thinking","family_id":"qwen","vendor":"Alibaba","status":"current","kind":"model","superseded_by":null,"release_date":"2025-10-14","intelligence_index":65.74,"coverage":0.4762,"index_subset_bias":{"offset":11.41,"peers":10,"method":"subset-knn-v1"},"params_total_b":8.77,"params_active_b":8.77,"vram_est":{"bf16_gb":17.5,"int8_gb":9.3,"int4_gb":5.3,"method":"linear-rom-v1","approximate":true,"basis":"params_total_b"},"vram_frontier":{"efficiency":6.83,"expected_int8_gb":63.5,"method":"frontier-residual-v1","approximate":true},"fits_on":{"intel_b70":"fp8","nvidia_h100_sxm_80g":"fp8","nvidia_dgx_spark":"fp8"},"is_moe":false,"is_open_weights":true,"context_window_tok":131072,"pricing":{"prompt_usd_per_m":0.18,"completion_usd_per_m":2.1,"blended_usd_per_m":0.66},"scores":{"aime":{"raw":80.3,"norm":75.37,"trust":2,"source_url":"https://arxiv.org/html/2511.21631v1","config":"25, thinking mode","measured_date":null},"gpqa_diamond":{"raw":69.9,"norm":63.24,"trust":2,"source_url":"https://arxiv.org/html/2511.21631v1","config":"thinking mode","measured_date":null},"livebench":{"raw":69.8,"norm":66.22,"trust":2,"source_url":"https://arxiv.org/html/2511.21631v1","config":"2024.11.25, thinking mode","measured_date":null},"mmlu_pro":{"raw":77.3,"norm":62.17,"trust":2,"source_url":"https://arxiv.org/html/2511.21631v1","config":"thinking mode","measured_date":null}}},{"id":"minimax-m2.1","display_name":"MiniMax M2.1","family_id":"minimax","vendor":"MiniMax","status":"superseded","kind":"model","superseded_by":"minimax-m2.7","release_date":"2025-12-23","intelligence_index":65.7,"coverage":0.7223,"index_subset_bias":{"offset":4.09,"peers":10,"method":"subset-knn-v1"},"params_total_b":228.69,"params_active_b":null,"vram_est":{"bf16_gb":457,"int8_gb":242,"int4_gb":137,"method":"linear-rom-v1","approximate":true,"basis":"params_total_b"},"vram_frontier":null,"fits_on":{},"is_moe":true,"is_open_weights":true,"context_window_tok":204800,"pricing":{"prompt_usd_per_m":0.3,"completion_usd_per_m":1.2,"blended_usd_per_m":0.5249999999999999},"scores":{"aime":{"raw":77.92,"norm":72.4,"trust":3,"source_url":"https://www.vals.ai/benchmarks/aime","config":"archived=true, edition=aime v1, runner=platform, stderr=1.289, task=overall, updated=2026-04-16","measured_date":"2026-08-19"},"gpqa_diamond":{"raw":78.54,"norm":75.41,"trust":3,"source_url":"https://www.vals.ai/benchmarks/gpqa","config":"edition=gpqa diamond v1, runner=platform, stderr=2.128, task=overall, updated=2026-08-19","measured_date":"2026-08-19"},"hle":{"raw":23.17,"norm":31.13,"trust":2,"source_url":"https://artificialanalysis.ai/models/minimax-m2-1","config":"aa field hle, artificial analysis intelligence index v4.1.1 suite, effort=none, humanity's last exam, reasoning=true, source value 0.231696014828545 is a 0-1 fraction, x100 at harvest","measured_date":null},"mmlu_pro":{"raw":87.05,"norm":78.42,"trust":3,"source_url":"https://www.vals.ai/benchmarks/mmlu_pro","config":"edition=mmlu pro v1, runner=platform, stderr=0.333, task=overall, updated=2026-08-19","measured_date":"2026-08-19"},"swe_bench_verified":{"raw":74.8,"norm":72,"trust":3,"source_url":"https://www.vals.ai/benchmarks/swebench","config":"edition=swe-bench verified v1, runner=external, stderr=1.944, task=overall, updated=2026-08-19","measured_date":"2026-08-19"},"tau_bench":{"raw":85.38,"norm":87.17,"trust":2,"source_url":"https://artificialanalysis.ai/models/minimax-m2-1","config":"aa field tau2, aa field tau2 (not mapped to tau_bench), artificial analysis intelligence index v4.1.1 suite, effort=none, reasoning=true, source value 0.853801169590643 is a 0-1 fraction, x100 at harvest","measured_date":null},"terminal_bench":{"raw":29.2,"norm":28.47,"trust":2,"source_url":"https://www.tbench.ai/leaderboard/terminal-bench/2.0","config":"2.0, agent: terminus 2","measured_date":"2025-12-23"}}},{"id":"gpt-5.4-mini","display_name":"GPT-5.4 Mini","family_id":"gpt","vendor":"OpenAI","status":"current","kind":"model","superseded_by":null,"release_date":"2026-03-17","intelligence_index":65.64,"coverage":1,"index_subset_bias":null,"params_total_b":null,"params_active_b":null,"vram_est":null,"vram_frontier":null,"fits_on":null,"is_moe":false,"is_open_weights":false,"context_window_tok":400000,"pricing":{"prompt_usd_per_m":0.75,"completion_usd_per_m":4.5,"blended_usd_per_m":1.6875},"scores":{"aime":{"raw":95.62,"norm":94.53,"trust":3,"source_url":"https://www.vals.ai/benchmarks/aime","config":"archived=true, edition=aime v1, reasoning_effort=xhigh, runner=platform, stderr=0.409, task=overall, updated=2026-04-16","measured_date":"2026-08-19"},"arc_agi_2":{"raw":18.9,"norm":15.44,"trust":3,"source_url":"https://arcprize.org/leaderboard","config":"cost_per_task_usd=0.75, eval=arc-agi-2 semi-private (v2_semi_private), model_group=gpt-5-4-mini-reasoning, org=openai, run: xhigh, system_type=cot","measured_date":"2026-08-21"},"arena_elo":{"raw":1447.1,"norm":74.64,"trust":3,"source_url":"https://lmarena.ai/leaderboard","config":"text","measured_date":"2026-10-03"},"gpqa_diamond":{"raw":83.08,"norm":81.8,"trust":3,"source_url":"https://www.vals.ai/benchmarks/gpqa","config":"edition=gpqa diamond v1, reasoning_effort=xhigh, runner=platform, stderr=2.457, task=overall, updated=2026-08-19","measured_date":"2026-08-19"},"hle":{"raw":28.13,"norm":38.43,"trust":2,"source_url":"https://artificialanalysis.ai/models","config":"artificial analysis eval, gpt-5.4 mini (xhigh)","measured_date":null},"livebench":{"raw":66.37,"norm":58.6,"trust":3,"source_url":"https://livebench.ai/","config":"global average, livebench-2026-06-25 release, run gpt-5.4-mini-xhigh","measured_date":null},"mmlu_pro":{"raw":84.55,"norm":74.25,"trust":3,"source_url":"https://www.vals.ai/benchmarks/mmlu_pro","config":"edition=mmlu pro v1, reasoning_effort=xhigh, runner=platform, stderr=0.359, task=overall, updated=2026-08-19","measured_date":"2026-08-19"},"swe_bench_verified":{"raw":73,"norm":70,"trust":3,"source_url":"https://www.vals.ai/benchmarks/swebench","config":"edition=swe-bench verified v1, reasoning_effort=xhigh, runner=external, stderr=1.987, task=overall, updated=2026-08-19","measured_date":"2026-08-19"},"tau_bench":{"raw":83.33,"norm":84.44,"trust":2,"source_url":"https://artificialanalysis.ai/models/gpt-5-4-mini","config":"aa field tau2, aa field tau2 (not mapped to tau_bench), artificial analysis intelligence index v4.1.1 suite, effort=xhigh, reasoning=true, run: xhigh, source value 0.833333333333333 is a 0-1 fraction, x100 at harvest","measured_date":null},"terminal_bench":{"raw":54.68,"norm":58.45,"trust":3,"source_url":"https://www.vals.ai/benchmarks/terminal-bench-2-1","config":"edition=terminal-bench 2.1, reasoning_effort=high, runner=external, stderr=4.556, task=overall, updated=2026-08-19","measured_date":"2026-08-19"}}},{"id":"glm-5-turbo","display_name":"GLM 5 Turbo","family_id":"glm","vendor":"Zhipu AI (Z.ai)","status":"current","kind":"model","superseded_by":null,"release_date":"2026-03-15","intelligence_index":65.52,"coverage":0.3651,"index_subset_bias":{"offset":-1.46,"peers":10,"method":"subset-knn-v1"},"params_total_b":null,"params_active_b":null,"vram_est":null,"vram_frontier":null,"fits_on":null,"is_moe":false,"is_open_weights":false,"context_window_tok":202752,"pricing":{"prompt_usd_per_m":1.2,"completion_usd_per_m":4,"blended_usd_per_m":1.9},"scores":{"gpqa_diamond":{"raw":84.75,"norm":84.15,"trust":2,"source_url":"https://artificialanalysis.ai/models","config":"artificial analysis eval, glm-5-turbo","measured_date":null},"hle":{"raw":27.76,"norm":37.88,"trust":2,"source_url":"https://artificialanalysis.ai/models","config":"artificial analysis eval, glm-5-turbo","measured_date":null},"tau_bench":{"raw":98.54,"norm":100,"trust":2,"source_url":"https://artificialanalysis.ai/models/glm-5-turbo","config":"aa field tau2, aa field tau2 (not mapped to tau_bench), artificial analysis intelligence index v4.1.1 suite, effort=none, reasoning=true, source value 0.985380116959064 is a 0-1 fraction, x100 at harvest","measured_date":null},"terminal_bench":{"raw":33.33,"norm":33.33,"trust":2,"source_url":"https://artificialanalysis.ai/models/glm-5-turbo","config":"aa field terminalbenchhard, artificial analysis intelligence index v4.1.1 suite, effort=none, reasoning=true, source value 0.333333333333333 is a 0-1 fraction, terminal-bench hard, x100 at harvest","measured_date":null}}},{"id":"kat-coder-2-pro","display_name":"kat-coder-pro-v2","family_id":"kat-coder","vendor":"kwaipilot","status":"current","kind":"model","superseded_by":null,"release_date":"2026-03-27","intelligence_index":65.42,"coverage":0.3651,"index_subset_bias":{"offset":-1.46,"peers":10,"method":"subset-knn-v1"},"params_total_b":null,"params_active_b":null,"vram_est":null,"vram_frontier":null,"fits_on":null,"is_moe":false,"is_open_weights":false,"context_window_tok":262144,"pricing":{"prompt_usd_per_m":null,"completion_usd_per_m":null,"blended_usd_per_m":null},"scores":{"gpqa_diamond":{"raw":85.45,"norm":85.14,"trust":2,"source_url":"https://artificialanalysis.ai/models/kat-coder-pro-v2","config":"artificial analysis independent run","measured_date":null},"hle":{"raw":16.13,"norm":20.78,"trust":2,"source_url":"https://artificialanalysis.ai/models/kat-coder-pro-v2","config":"artificial analysis independent run, no tools","measured_date":null},"tau_bench":{"raw":89.47,"norm":92.63,"trust":2,"source_url":"https://artificialanalysis.ai/models/kat-coder-pro-v2","config":"artificial analysis independent run, tau2, with tools","measured_date":null},"terminal_bench":{"raw":70.04,"norm":76.52,"trust":2,"source_url":"https://artificialanalysis.ai/models/kat-coder-pro-v2","config":"2.1, artificial analysis independent run","measured_date":null}}},{"id":"kimi-k2.5-0127","display_name":"Kimi K2.5","family_id":"kimi","vendor":"Moonshot AI","status":"superseded","kind":"model","superseded_by":"kimi-k3","release_date":"2026-01-27","intelligence_index":65.32,"coverage":0.8016,"index_subset_bias":null,"params_total_b":1026.88,"params_active_b":32,"vram_est":{"bf16_gb":2054,"int8_gb":1088,"int4_gb":616,"method":"linear-rom-v1","approximate":true,"basis":"params_total_b"},"vram_frontier":null,"fits_on":{},"is_moe":true,"is_open_weights":true,"context_window_tok":262144,"pricing":{"prompt_usd_per_m":0.45,"completion_usd_per_m":2.25,"blended_usd_per_m":0.9},"scores":{"arc_agi_2":{"raw":11.81,"norm":7.57,"trust":3,"source_url":"https://arcprize.org/leaderboard","config":"cost_per_task_usd=0.28, eval=arc-agi-2 semi-private (v2_semi_private), org=moonshot ai, system_type=cot","measured_date":"2026-08-21"},"arena_elo":{"raw":1450,"norm":75.94,"trust":3,"source_url":"https://arena.ai/leaderboard/text","config":"70943 votes, arena entry kimi-k2.5-text, leaderboard text-overall-style_control, rank 64, style control, text/overall, vote cutoff 2026-08-21","measured_date":"2026-08-21"},"gpqa_diamond":{"raw":87.88,"norm":88.56,"trust":2,"source_url":"https://artificialanalysis.ai/models/kimi-k2-5","config":"aa field gpqa, artificial analysis intelligence index v4.1.1 suite, effort=none, gpqa diamond, reasoning=true, run: reasoning, source value 0.878787878787879 is a 0-1 fraction, x100 at harvest","measured_date":null},"hle":{"raw":30.72,"norm":42.24,"trust":2,"source_url":"https://artificialanalysis.ai/models/kimi-k2-5","config":"aa field hle, artificial analysis intelligence index v4.1.1 suite, effort=none, humanity's last exam, reasoning=true, run: reasoning, source value 0.307228915662651 is a 0-1 fraction, x100 at harvest","measured_date":null},"mmlu_pro":{"raw":87.1,"norm":78.5,"trust":1,"source_url":"https://huggingface.co/moonshotai/Kimi-K2.5","config":null,"measured_date":null},"swe_bench_verified":{"raw":70.8,"norm":67.56,"trust":2,"source_url":"https://www.swebench.com/","config":"high reasoning","measured_date":"2026-03-02"},"tau_bench":{"raw":95.91,"norm":100,"trust":2,"source_url":"https://artificialanalysis.ai/models/kimi-k2-5","config":"aa field tau2, aa field tau2 (not mapped to tau_bench), artificial analysis intelligence index v4.1.1 suite, effort=none, reasoning=true, run: reasoning, source value 0.95906432748538 is a 0-1 fraction, x100 at harvest","measured_date":null},"terminal_bench":{"raw":43.2,"norm":44.94,"trust":2,"source_url":"https://www.tbench.ai/leaderboard/terminal-bench/2.0","config":"2.0, agent: terminus 2","measured_date":"2026-02-04"}}},{"id":"gpt-5-pro","display_name":"GPT-5 Pro","family_id":"gpt","vendor":"OpenAI","status":"superseded","kind":"model","superseded_by":"gpt-5.5-pro","release_date":"2025-10-06","intelligence_index":65.23,"coverage":0.5475,"index_subset_bias":{"offset":-1.49,"peers":9,"method":"subset-knn-v1"},"params_total_b":null,"params_active_b":null,"vram_est":null,"vram_frontier":null,"fits_on":null,"is_moe":false,"is_open_weights":false,"context_window_tok":400000,"pricing":{"prompt_usd_per_m":15,"completion_usd_per_m":120,"blended_usd_per_m":41.25},"scores":{"aime":{"raw":96.7,"norm":95.88,"trust":1,"source_url":"https://openai.com/index/introducing-gpt-5/","config":"aime 2025, no tools","measured_date":null},"arc_agi_2":{"raw":18.33,"norm":14.81,"trust":3,"source_url":"https://arcprize.org/leaderboard","config":"cost_per_task_usd=7.1432, eval=arc-agi-2 semi-private (v2_semi_private), org=openai, system_type=cot","measured_date":"2026-08-21"},"gpqa_diamond":{"raw":88.4,"norm":89.3,"trust":1,"source_url":"https://openai.com/index/introducing-gpt-5/","config":"no tools","measured_date":null},"hle":{"raw":30.7,"norm":42.21,"trust":1,"source_url":"https://openai.com/index/introducing-gpt-5/","config":"full set, no tools","measured_date":null},"livebench":{"raw":70.5,"norm":67.78,"trust":3,"source_url":"https://livebench.ai/#/","config":"livebench-2026-01-08 release","measured_date":"2026-01-08"}}},{"id":"glm-5","display_name":"GLM-5","family_id":"glm","vendor":"Zhipu AI (Z.ai)","status":"superseded","kind":"model","superseded_by":"glm-5.3","release_date":"2026-02-12","intelligence_index":65,"coverage":0.7619,"index_subset_bias":{"offset":-1.41,"peers":10,"method":"subset-knn-v1"},"params_total_b":753.86,"params_active_b":40,"vram_est":{"bf16_gb":1508,"int8_gb":799,"int4_gb":452,"method":"linear-rom-v1","approximate":true,"basis":"params_total_b"},"vram_frontier":null,"fits_on":{},"is_moe":true,"is_open_weights":true,"context_window_tok":204800,"pricing":{"prompt_usd_per_m":0.6,"completion_usd_per_m":1.92,"blended_usd_per_m":0.9299999999999999},"scores":{"aime":{"raw":95.83,"norm":94.79,"trust":1,"source_url":"https://matharena.ai/?comp=aime--aime_2026","config":"2026","measured_date":"2026-02-18"},"arc_agi_2":{"raw":4.86,"norm":0,"trust":3,"source_url":"https://arcprize.org/leaderboard","config":"cost_per_task_usd=0.27, eval=arc-agi-2 semi-private (v2_semi_private), org=z.ai, system_type=cot","measured_date":"2026-08-21"},"arena_elo":{"raw":1457.6,"norm":79.32,"trust":3,"source_url":"https://lmarena.ai/leaderboard","config":"text","measured_date":"2026-10-03"},"gpqa_diamond":{"raw":82.02,"norm":80.31,"trust":2,"source_url":"https://artificialanalysis.ai/models/glm-5","config":"aa field gpqa, artificial analysis intelligence index v4.1.1 suite, effort=none, gpqa diamond, reasoning=true, run: reasoning, source value 0.82020202020202 is a 0-1 fraction, x100 at harvest","measured_date":null},"hle":{"raw":29.29,"norm":40.13,"trust":2,"source_url":"https://artificialanalysis.ai/models/glm-5","config":"aa field hle, artificial analysis intelligence index v4.1.1 suite, effort=none, humanity's last exam, reasoning=true, run: reasoning, source value 0.292863762743281 is a 0-1 fraction, x100 at harvest","measured_date":null},"swe_bench_verified":{"raw":72.8,"norm":69.78,"trust":2,"source_url":"https://www.swebench.com/","config":"high reasoning, official","measured_date":"2026-03-24"},"tau_bench":{"raw":98.25,"norm":100,"trust":2,"source_url":"https://artificialanalysis.ai/models/glm-5","config":"aa field tau2, aa field tau2 (not mapped to tau_bench), artificial analysis intelligence index v4.1.1 suite, effort=none, reasoning=true, run: reasoning, source value 0.982456140350877 is a 0-1 fraction, x100 at harvest","measured_date":null},"terminal_bench":{"raw":52.4,"norm":55.76,"trust":2,"source_url":"https://www.tbench.ai/leaderboard/terminal-bench/2.0","config":"2.0, agent: terminus 2","measured_date":"2026-02-23"}}},{"id":"gemma-4-31b-instruct","display_name":"Gemma 4 31B","family_id":"gemma","vendor":"Google DeepMind","status":"current","kind":"model","superseded_by":null,"release_date":"2026-04-02","intelligence_index":64.68,"coverage":0.8016,"index_subset_bias":null,"params_total_b":31.27,"params_active_b":31.27,"vram_est":{"bf16_gb":62.5,"int8_gb":33.1,"int4_gb":18.8,"method":"linear-rom-v1","approximate":true,"basis":"params_total_b"},"vram_frontier":{"efficiency":1.85,"expected_int8_gb":61.4,"method":"frontier-residual-v1","approximate":true},"fits_on":{"intel_b70":"int4","nvidia_h100_sxm_80g":"fp8","nvidia_dgx_spark":"fp8"},"is_moe":false,"is_open_weights":true,"context_window_tok":262144,"pricing":{"prompt_usd_per_m":0.09,"completion_usd_per_m":0.34,"blended_usd_per_m":0.15250000000000002},"scores":{"aime":{"raw":89.2,"norm":86.5,"trust":2,"source_url":"https://arxiv.org/html/2607.02770v1","config":"aime 2026, gemma 4 technical report table 5 (gemma 4 31b column) [raw: aime 2026 no tools], no tools","measured_date":null},"arena_elo":{"raw":1452.8,"norm":77.18,"trust":3,"source_url":"https://lmarena.ai/leaderboard","config":"text","measured_date":"2026-10-03"},"gpqa_diamond":{"raw":85.66,"norm":85.44,"trust":2,"source_url":"https://artificialanalysis.ai/models/gemma-4-31b","config":"aa field gpqa, artificial analysis intelligence index v4.1.1 suite, effort=none, gpqa diamond, reasoning=true, run: reasoning, source value 0.856565656565657 is a 0-1 fraction, x100 at harvest","measured_date":null},"hle":{"raw":23.63,"norm":31.81,"trust":2,"source_url":"https://artificialanalysis.ai/models/gemma-4-31b","config":"aa field hle, artificial analysis intelligence index v4.1.1 suite, effort=none, humanity's last exam, reasoning=true, run: reasoning, source value 0.236329935125116 is a 0-1 fraction, x100 at harvest","measured_date":null},"mmlu_pro":{"raw":85.2,"norm":75.33,"trust":2,"source_url":"https://arxiv.org/html/2607.02770v1","config":"gemma 4 technical report table 5 (gemma 4 31b column) [raw: mmlu pro], no tools, thinking mode","measured_date":null},"swe_bench_verified":{"raw":53.92,"norm":48.8,"trust":3,"source_url":"https://www.vals.ai/models/google_gemma-4-31b-it","config":"not the full swe-bench verified set - not comparable to full-set numbers, vals.ai-run subset","measured_date":"2026-04-09"},"tau_bench":{"raw":65.5,"norm":60.67,"trust":2,"source_url":"https://artificialanalysis.ai/models/gemma-4-31b-non-reasoning","config":"aa field tau2, aa field tau2 (not mapped to tau_bench), artificial analysis intelligence index v4.1.1 suite, effort=none, reasoning=false, run: non-reasoning, source value 0.654970760233918 is a 0-1 fraction, x100 at harvest","measured_date":null},"terminal_bench":{"raw":43.45,"norm":45.24,"trust":2,"source_url":"https://artificialanalysis.ai/models/gemma-4-31b","config":"aa field terminalbenchv21, artificial analysis intelligence index v4.1.1 suite, effort=none, reasoning=true, run: reasoning, source value 0.434456928838951 is a 0-1 fraction, terminal-bench 2.1, x100 at harvest","measured_date":null}}},{"id":"qwen-3.5-27b","display_name":"Qwen3.5-27B","family_id":"qwen","vendor":"Alibaba","status":"superseded","kind":"model","superseded_by":"qwen-3.8-27b","release_date":"2026-02-25","intelligence_index":64.62,"coverage":0.6032,"index_subset_bias":{"offset":0.32,"peers":10,"method":"subset-knn-v1"},"params_total_b":27.78,"params_active_b":27.78,"vram_est":{"bf16_gb":55.6,"int8_gb":29.4,"int4_gb":16.7,"method":"linear-rom-v1","approximate":true,"basis":"params_total_b"},"vram_frontier":null,"fits_on":{"intel_b70":"fp8","nvidia_h100_sxm_80g":"fp8","nvidia_dgx_spark":"fp8"},"is_moe":false,"is_open_weights":true,"context_window_tok":262144,"pricing":{"prompt_usd_per_m":0.195,"completion_usd_per_m":1.56,"blended_usd_per_m":0.53625},"scores":{"arena_elo":{"raw":1408.7,"norm":57.53,"trust":3,"source_url":"https://lmarena.ai/leaderboard","config":"text","measured_date":"2026-10-03"},"gpqa_diamond":{"raw":85.76,"norm":85.58,"trust":2,"source_url":"https://artificialanalysis.ai/models/qwen3-5-27b","config":"aa field gpqa, artificial analysis intelligence index v4.1.1 suite, effort=none, gpqa diamond, reasoning=true, run: reasoning, source value 0.857575757575758 is a 0-1 fraction, x100 at harvest","measured_date":null},"hle":{"raw":23.91,"norm":32.22,"trust":2,"source_url":"https://artificialanalysis.ai/models/qwen3-5-27b","config":"aa field hle, artificial analysis intelligence index v4.1.1 suite, effort=none, humanity's last exam, reasoning=true, run: reasoning, source value 0.239110287303058 is a 0-1 fraction, x100 at harvest","measured_date":null},"swe_bench_verified":{"raw":72.4,"norm":69.33,"trust":1,"source_url":"https://huggingface.co/Qwen/Qwen3.5-27B","config":null,"measured_date":null},"tau_bench":{"raw":93.86,"norm":98.48,"trust":2,"source_url":"https://artificialanalysis.ai/models/qwen3-5-27b","config":"aa field tau2, aa field tau2 (not mapped to tau_bench), artificial analysis intelligence index v4.1.1 suite, effort=none, reasoning=true, run: reasoning, source value 0.93859649122807 is a 0-1 fraction, x100 at harvest","measured_date":null},"terminal_bench":{"raw":32.58,"norm":32.45,"trust":2,"source_url":"https://artificialanalysis.ai/models/qwen3-5-27b","config":"aa field terminalbenchhard, artificial analysis intelligence index v4.1.1 suite, effort=none, reasoning=true, run: reasoning, source value 0.325757575757576 is a 0-1 fraction, terminal-bench hard, x100 at harvest","measured_date":null}}},{"id":"gpt-5","display_name":"GPT-5","family_id":"gpt","vendor":"OpenAI","status":"superseded","kind":"model","superseded_by":"gpt-5.5","release_date":"2025-08-07","intelligence_index":64.45,"coverage":0.8809,"index_subset_bias":null,"params_total_b":null,"params_active_b":null,"vram_est":null,"vram_frontier":null,"fits_on":null,"is_moe":false,"is_open_weights":false,"context_window_tok":400000,"pricing":{"prompt_usd_per_m":1.25,"completion_usd_per_m":10,"blended_usd_per_m":3.4375},"scores":{"aime":{"raw":93.37,"norm":91.71,"trust":3,"source_url":"https://www.vals.ai/benchmarks/aime","config":"archived=true, edition=aime v1, reasoning_effort=high, runner=platform, stderr=1.305, task=overall, updated=2026-04-16, verbosity=medium","measured_date":"2026-08-19"},"arc_agi_2":{"raw":9.86,"norm":5.4,"trust":3,"source_url":"https://arcprize.org/leaderboard","config":"cost_per_task_usd=0.7302, eval=arc-agi-2 semi-private (v2_semi_private), model_group=gpt-5-reasoning, org=openai, run: high, system_type=cot","measured_date":"2026-08-21"},"arena_elo":{"raw":1434.5,"norm":69.03,"trust":3,"source_url":"https://lmarena.ai/leaderboard","config":"text","measured_date":"2026-10-03"},"gpqa_diamond":{"raw":85.61,"norm":85.37,"trust":3,"source_url":"https://www.vals.ai/benchmarks/gpqa","config":"edition=gpqa diamond v1, reasoning_effort=high, runner=platform, stderr=1.764, task=overall, updated=2026-08-19, verbosity=medium","measured_date":"2026-08-19"},"hle":{"raw":28.5,"norm":38.97,"trust":2,"source_url":"https://artificialanalysis.ai/models/gpt-5","config":"aa field hle, artificial analysis intelligence index v4.1.1 suite, effort=high, humanity's last exam, reasoning=true, run: high, source value 0.28498609823911 is a 0-1 fraction, x100 at harvest","measured_date":null},"mmlu_pro":{"raw":86.54,"norm":77.57,"trust":3,"source_url":"https://www.vals.ai/benchmarks/mmlu_pro","config":"edition=mmlu pro v1, reasoning_effort=high, runner=platform, stderr=0.336, task=overall, updated=2026-08-19, verbosity=medium","measured_date":"2026-08-19"},"swe_bench_verified":{"raw":69,"norm":65.56,"trust":3,"source_url":"https://www.vals.ai/benchmarks/swebench","config":"edition=swe-bench verified v1, reasoning_effort=high, runner=external, stderr=2.07, task=overall, updated=2026-08-19","measured_date":"2026-08-19"},"tau_bench":{"raw":86.55,"norm":88.73,"trust":2,"source_url":"https://artificialanalysis.ai/models/gpt-5-medium","config":"aa field tau2, aa field tau2 (not mapped to tau_bench), artificial analysis intelligence index v4.1.1 suite, effort=medium, reasoning=true, run: medium, source value 0.865497076023392 is a 0-1 fraction, x100 at harvest","measured_date":null},"terminal_bench":{"raw":37.88,"norm":38.68,"trust":2,"source_url":"https://artificialanalysis.ai/models/gpt-5-medium","config":"aa field terminalbenchhard, artificial analysis intelligence index v4.1.1 suite, effort=medium, reasoning=true, run: medium, source value 0.378787878787879 is a 0-1 fraction, terminal-bench hard, x100 at harvest","measured_date":null}}},{"id":"ring-2.6-1t","display_name":"ring-2.6-1t","family_id":"ring","vendor":"inclusionai","status":"current","kind":"model","superseded_by":null,"release_date":"2026-05-08","intelligence_index":64.36,"coverage":0.3651,"index_subset_bias":{"offset":-1.35,"peers":10,"method":"subset-knn-v1"},"params_total_b":1000,"params_active_b":1000,"vram_est":{"bf16_gb":2000,"int8_gb":1060,"int4_gb":600,"method":"linear-rom-v1","approximate":true,"basis":"params_total_b"},"vram_frontier":null,"fits_on":null,"is_moe":false,"is_open_weights":false,"context_window_tok":262144,"pricing":{"prompt_usd_per_m":null,"completion_usd_per_m":null,"blended_usd_per_m":null},"scores":{"gpqa_diamond":{"raw":85.66,"norm":85.44,"trust":2,"source_url":"https://artificialanalysis.ai/models/ring-2-6-1t","config":"aa field gpqa, artificial analysis intelligence index v4.1.1 suite, effort=xhigh, gpqa diamond, reasoning=true, source value 0.856565656565657 is a 0-1 fraction, x100 at harvest","measured_date":null},"hle":{"raw":21.59,"norm":28.81,"trust":2,"source_url":"https://artificialanalysis.ai/models/ring-2-6-1t","config":"aa field hle, artificial analysis intelligence index v4.1.1 suite, effort=xhigh, humanity's last exam, reasoning=true, source value 0.215940685820204 is a 0-1 fraction, x100 at harvest","measured_date":null},"tau_bench":{"raw":92.4,"norm":96.53,"trust":2,"source_url":"https://artificialanalysis.ai/models/ring-2-6-1t","config":"aa field tau2, aa field tau2 (not mapped to tau_bench), artificial analysis intelligence index v4.1.1 suite, effort=xhigh, reasoning=true, source value 0.923976608187135 is a 0-1 fraction, x100 at harvest","measured_date":null},"terminal_bench":{"raw":43.07,"norm":44.79,"trust":2,"source_url":"https://artificialanalysis.ai/models/ring-2-6-1t","config":"aa field terminalbenchv21, artificial analysis intelligence index v4.1.1 suite, effort=xhigh, reasoning=true, source value 0.430711610486891 is a 0-1 fraction, terminal-bench 2.1, x100 at harvest","measured_date":null}}},{"id":"gpt-o3-pro","display_name":"OpenAI o3 Pro","family_id":"gpt","vendor":"OpenAI","status":"current","kind":"model","superseded_by":null,"release_date":"2025-06-10","intelligence_index":63.82,"coverage":0.3174,"index_subset_bias":{"offset":2.2,"peers":10,"method":"subset-knn-v1"},"params_total_b":null,"params_active_b":null,"vram_est":null,"vram_frontier":null,"fits_on":null,"is_moe":false,"is_open_weights":false,"context_window_tok":200000,"pricing":{"prompt_usd_per_m":20,"completion_usd_per_m":80,"blended_usd_per_m":35},"scores":{"aime":{"raw":90,"norm":87.5,"trust":1,"source_url":"https://help.openai.com/en/articles/9624314-model-release-notes","config":"4/4 reliability, aime 2024, default medium chatgpt thinking time","measured_date":"2025-06-10"},"arc_agi_2":{"raw":4.86,"norm":0,"trust":3,"source_url":"https://arcprize.org/leaderboard","config":"cost_per_task_usd=7.5516, eval=arc-agi-2 semi-private (v2_semi_private), model_group=o3-pro, org=openai, run: high, system_type=cot + synthesis","measured_date":"2026-08-21"},"gpqa_diamond":{"raw":84.55,"norm":83.87,"trust":2,"source_url":"https://artificialanalysis.ai/models/o3-pro","config":"aa field gpqa, artificial analysis intelligence index v4.1.1 suite, effort=none, gpqa diamond, reasoning=true, source value 0.845454545454545 is a 0-1 fraction, x100 at harvest","measured_date":null}}},{"id":"gemini-2.5-pro-03-25","display_name":"gemini-2.5-pro-preview-03-25","family_id":"gemini","vendor":"Google","status":"current","kind":"model","superseded_by":null,"release_date":"2025-05-07","intelligence_index":63.79,"coverage":0.3889,"index_subset_bias":{"offset":1.72,"peers":10,"method":"subset-knn-v1"},"params_total_b":null,"params_active_b":null,"vram_est":null,"vram_frontier":null,"fits_on":null,"is_moe":false,"is_open_weights":false,"context_window_tok":1048576,"pricing":{"prompt_usd_per_m":null,"completion_usd_per_m":null,"blended_usd_per_m":null},"scores":{"gpqa_diamond":{"raw":83.64,"norm":82.59,"trust":2,"source_url":"https://artificialanalysis.ai/models/gemini-2-5-pro-03-25","config":"artificial analysis independent evaluation","measured_date":null},"hle":{"raw":18.03,"norm":23.57,"trust":2,"source_url":"https://artificialanalysis.ai/models/gemini-2-5-pro-03-25","config":"artificial analysis independent evaluation","measured_date":null},"mmlu_pro":{"raw":85.75,"norm":76.25,"trust":2,"source_url":"https://artificialanalysis.ai/models/gemini-2-5-pro-03-25","config":"artificial analysis independent evaluation","measured_date":null}}},{"id":"seed-2.0-lite","display_name":"Seed-2.0-Lite","family_id":"seed","vendor":"bytedance-seed","status":"current","kind":"model","superseded_by":null,"release_date":"2026-03-10","intelligence_index":63.62,"coverage":0.3174,"index_subset_bias":{"offset":-4.48,"peers":10,"method":"subset-knn-v1"},"params_total_b":null,"params_active_b":null,"vram_est":null,"vram_frontier":null,"fits_on":null,"is_moe":false,"is_open_weights":false,"context_window_tok":262144,"pricing":{"prompt_usd_per_m":0.25,"completion_usd_per_m":2,"blended_usd_per_m":0.6875},"scores":{"gpqa_diamond":{"raw":88.4,"norm":89.3,"trust":1,"source_url":"https://seed.bytedance.com/en/seed2","config":"seed2.0 lite 0428 snapshot","measured_date":null},"hle":{"raw":25.7,"norm":34.85,"trust":1,"source_url":"https://seed.bytedance.com/en/seed2","config":"no tool, seed2.0 lite 0428 snapshot, text only","measured_date":null},"terminal_bench":{"raw":43.3,"norm":45.06,"trust":1,"source_url":"https://seed.bytedance.com/en/seed2","config":"seed2.0 lite 0428 snapshot","measured_date":null}}},{"id":"kimi-k2-reasoning","display_name":"Kimi K2 Thinking","family_id":"kimi","vendor":"Moonshot AI","status":"current","kind":"model","superseded_by":null,"release_date":"2025-11-06","intelligence_index":62.84,"coverage":0.7223,"index_subset_bias":{"offset":3.62,"peers":10,"method":"subset-knn-v1"},"params_total_b":1026.41,"params_active_b":32,"vram_est":{"bf16_gb":2053,"int8_gb":1088,"int4_gb":616,"method":"linear-rom-v1","approximate":true,"basis":"params_total_b"},"vram_frontier":{"efficiency":0.24,"expected_int8_gb":257,"method":"frontier-residual-v1","approximate":true},"fits_on":{},"is_moe":true,"is_open_weights":true,"context_window_tok":262144,"pricing":{"prompt_usd_per_m":0.6,"completion_usd_per_m":2.5,"blended_usd_per_m":1.075},"scores":{"aime":{"raw":85.42,"norm":81.77,"trust":3,"source_url":"https://www.vals.ai/benchmarks/aime","config":"archived=true, edition=aime v1, runner=platform, stderr=1.327, task=overall, updated=2026-04-16","measured_date":"2026-08-19"},"gpqa_diamond":{"raw":78.54,"norm":75.41,"trust":3,"source_url":"https://www.vals.ai/benchmarks/gpqa","config":"edition=gpqa diamond v1, runner=platform, stderr=2.183, task=overall, updated=2026-08-19","measured_date":"2026-08-19"},"hle":{"raw":23.82,"norm":32.09,"trust":2,"source_url":"https://artificialanalysis.ai/models/kimi-k2-thinking","config":"aa field hle, artificial analysis intelligence index v4.1.1 suite, effort=none, humanity's last exam, reasoning=true, source value 0.238183503243744 is a 0-1 fraction, x100 at harvest","measured_date":null},"mmlu_pro":{"raw":81.07,"norm":68.45,"trust":3,"source_url":"https://www.vals.ai/benchmarks/mmlu_pro","config":"edition=mmlu pro v1, runner=platform, stderr=0.396, task=overall, updated=2026-08-19","measured_date":"2026-08-19"},"swe_bench_verified":{"raw":60.2,"norm":55.78,"trust":3,"source_url":"https://www.vals.ai/benchmarks/swebench","config":"edition=swe-bench verified v1, runner=external, stderr=2.191, task=overall, updated=2026-08-19","measured_date":"2026-08-19"},"tau_bench":{"raw":92.98,"norm":97.31,"trust":2,"source_url":"https://artificialanalysis.ai/models/kimi-k2-thinking","config":"aa field tau2, aa field tau2 (not mapped to tau_bench), artificial analysis intelligence index v4.1.1 suite, effort=none, reasoning=true, source value 0.929824561403509 is a 0-1 fraction, x100 at harvest","measured_date":null},"terminal_bench":{"raw":35.7,"norm":36.12,"trust":2,"source_url":"https://www.tbench.ai/leaderboard/terminal-bench/2.0","config":"2.0, agent: terminus 2","measured_date":"2025-11-11"}}},{"id":"qwen-3.5-35b-a3b","display_name":"Qwen3.5-35B-A3B","family_id":"qwen","vendor":"Alibaba","status":"superseded","kind":"model","superseded_by":"qwen-3.6-35b-a3b","release_date":"2026-02-25","intelligence_index":61.85,"coverage":0.6032,"index_subset_bias":{"offset":-0.43,"peers":10,"method":"subset-knn-v1"},"params_total_b":35.95,"params_active_b":3,"vram_est":{"bf16_gb":71.9,"int8_gb":38.1,"int4_gb":21.6,"method":"linear-rom-v1","approximate":true,"basis":"params_total_b"},"vram_frontier":null,"fits_on":{"intel_b70":"int4","nvidia_h100_sxm_80g":"fp8","nvidia_dgx_spark":"fp8"},"is_moe":true,"is_open_weights":true,"context_window_tok":262144,"pricing":{"prompt_usd_per_m":0.15,"completion_usd_per_m":1,"blended_usd_per_m":0.3625},"scores":{"arena_elo":{"raw":1393.8,"norm":50.89,"trust":3,"source_url":"https://lmarena.ai/leaderboard","config":"text","measured_date":"2026-10-03"},"gpqa_diamond":{"raw":84.55,"norm":83.87,"trust":2,"source_url":"https://artificialanalysis.ai/models/qwen3-5-35b-a3b","config":"aa field gpqa, artificial analysis intelligence index v4.1.1 suite, effort=none, gpqa diamond, reasoning=true, run: reasoning, source value 0.845454545454545 is a 0-1 fraction, x100 at harvest","measured_date":null},"hle":{"raw":21.04,"norm":28,"trust":2,"source_url":"https://artificialanalysis.ai/models/qwen3-5-35b-a3b","config":"aa field hle, artificial analysis intelligence index v4.1.1 suite, effort=none, humanity's last exam, reasoning=true, run: reasoning, source value 0.210379981464319 is a 0-1 fraction, x100 at harvest","measured_date":null},"swe_bench_verified":{"raw":69.2,"norm":65.78,"trust":1,"source_url":"https://huggingface.co/Qwen/Qwen3.5-35B-A3B","config":null,"measured_date":null},"tau_bench":{"raw":89.18,"norm":92.24,"trust":2,"source_url":"https://artificialanalysis.ai/models/qwen3-5-35b-a3b","config":"aa field tau2, aa field tau2 (not mapped to tau_bench), artificial analysis intelligence index v4.1.1 suite, effort=none, reasoning=true, run: reasoning, source value 0.891812865497076 is a 0-1 fraction, x100 at harvest","measured_date":null},"terminal_bench":{"raw":40.82,"norm":42.14,"trust":2,"source_url":"https://artificialanalysis.ai/models/qwen3-5-35b-a3b-non-reasoning","config":"aa field terminalbenchv21, artificial analysis intelligence index v4.1.1 suite, effort=none, reasoning=false, run: non-reasoning, source value 0.408239700374532 is a 0-1 fraction, terminal-bench 2.1, x100 at harvest","measured_date":null}}},{"id":"longcat-2.0","display_name":"LongCat 2.0","family_id":"longcat","vendor":"meituan","status":"current","kind":"model","superseded_by":null,"release_date":"2026-07-20","intelligence_index":61.6,"coverage":0.3174,"index_subset_bias":{"offset":-4.09,"peers":10,"method":"subset-knn-v1"},"params_total_b":1775.56,"params_active_b":null,"vram_est":{"bf16_gb":3551,"int8_gb":1882,"int4_gb":1065,"method":"linear-rom-v1","approximate":true,"basis":"params_total_b"},"vram_frontier":{"efficiency":0.13,"expected_int8_gb":247,"method":"frontier-residual-v1","approximate":true},"fits_on":{},"is_moe":true,"is_open_weights":true,"context_window_tok":1048756,"pricing":{"prompt_usd_per_m":0.3,"completion_usd_per_m":1.2,"blended_usd_per_m":0.5249999999999999},"scores":{"gpqa_diamond":{"raw":77.98,"norm":74.62,"trust":2,"source_url":"https://artificialanalysis.ai/models/longcat-2-0","config":"aa field gpqa, artificial analysis intelligence index v4.1.1 suite, effort=none, gpqa diamond, reasoning=true, source value 0.77979797979798 is a 0-1 fraction, x100 at harvest","measured_date":null},"hle":{"raw":33.69,"norm":46.6,"trust":2,"source_url":"https://artificialanalysis.ai/models/longcat-2-0","config":"aa field hle, artificial analysis intelligence index v4.1.1 suite, effort=none, humanity's last exam, reasoning=true, source value 0.336886005560704 is a 0-1 fraction, x100 at harvest","measured_date":null},"terminal_bench":{"raw":50.19,"norm":53.16,"trust":2,"source_url":"https://artificialanalysis.ai/models/longcat-2-0","config":"aa field terminalbenchv21, artificial analysis intelligence index v4.1.1 suite, effort=none, reasoning=true, source value 0.50187265917603 is a 0-1 fraction, terminal-bench 2.1, x100 at harvest","measured_date":null}}},{"id":"step-3.7-flash","display_name":"Step 3.7 Flash","family_id":"step","vendor":"stepfun","status":"current","kind":"model","superseded_by":null,"release_date":"2026-05-28","intelligence_index":61.25,"coverage":0.3651,"index_subset_bias":{"offset":-0.94,"peers":10,"method":"subset-knn-v1"},"params_total_b":201.37,"params_active_b":null,"vram_est":{"bf16_gb":403,"int8_gb":213,"int4_gb":121,"method":"linear-rom-v1","approximate":true,"basis":"params_total_b"},"vram_frontier":{"efficiency":1.14,"expected_int8_gb":244,"method":"frontier-residual-v1","approximate":true},"fits_on":{},"is_moe":true,"is_open_weights":true,"context_window_tok":262144,"pricing":{"prompt_usd_per_m":0.2,"completion_usd_per_m":1.15,"blended_usd_per_m":0.4375},"scores":{"gpqa_diamond":{"raw":80.91,"norm":78.75,"trust":2,"source_url":"https://artificialanalysis.ai/models/step-3-7-flash","config":"aa field gpqa, artificial analysis intelligence index v4.1.1 suite, effort=high, gpqa diamond, reasoning=true, source value 0.809090909090909 is a 0-1 fraction, x100 at harvest","measured_date":null},"hle":{"raw":21.41,"norm":28.54,"trust":2,"source_url":"https://artificialanalysis.ai/models/step-3-7-flash","config":"aa field hle, artificial analysis intelligence index v4.1.1 suite, effort=high, humanity's last exam, reasoning=true, source value 0.214087117701576 is a 0-1 fraction, x100 at harvest","measured_date":null},"tau_bench":{"raw":98.54,"norm":100,"trust":2,"source_url":"https://artificialanalysis.ai/models/step-3-7-flash","config":"aa field tau2, aa field tau2 (not mapped to tau_bench), artificial analysis intelligence index v4.1.1 suite, effort=high, reasoning=true, source value 0.985380116959064 is a 0-1 fraction, x100 at harvest","measured_date":null},"terminal_bench":{"raw":39.33,"norm":40.39,"trust":2,"source_url":"https://artificialanalysis.ai/models/step-3-7-flash","config":"aa field terminalbenchv21, artificial analysis intelligence index v4.1.1 suite, effort=high, reasoning=true, source value 0.393258426966292 is a 0-1 fraction, terminal-bench 2.1, x100 at harvest","measured_date":null}}},{"id":"gemma-4-26b-a4b-instruct","display_name":"Gemma 4 26B-A4B","family_id":"gemma","vendor":"Google DeepMind","status":"current","kind":"model","superseded_by":null,"release_date":"2026-04-02","intelligence_index":60.91,"coverage":0.6428,"index_subset_bias":{"offset":2.78,"peers":10,"method":"subset-knn-v1"},"params_total_b":25.81,"params_active_b":4,"vram_est":{"bf16_gb":51.6,"int8_gb":27.4,"int4_gb":15.5,"method":"linear-rom-v1","approximate":true,"basis":"params_total_b"},"vram_frontier":{"efficiency":8.83,"expected_int8_gb":242,"method":"frontier-residual-v1","approximate":true},"fits_on":{"intel_b70":"fp8","nvidia_h100_sxm_80g":"fp8","nvidia_dgx_spark":"fp8"},"is_moe":true,"is_open_weights":true,"context_window_tok":262144,"pricing":{"prompt_usd_per_m":0.0765,"completion_usd_per_m":0.255,"blended_usd_per_m":0.121125},"scores":{"aime":{"raw":88.3,"norm":85.38,"trust":2,"source_url":"https://arxiv.org/html/2607.02770v2","config":"26b-a4b column [raw: aime 2026 no tools], aime 2026, gemma 4 technical report table 5, no tools","measured_date":null},"arena_elo":{"raw":1437.5,"norm":70.36,"trust":3,"source_url":"https://lmarena.ai/leaderboard","config":"text","measured_date":"2026-10-01"},"gpqa_diamond":{"raw":79.19,"norm":76.32,"trust":2,"source_url":"https://artificialanalysis.ai/models/gemma-4-26b-a4b","config":"aa field gpqa, artificial analysis intelligence index v4.1.1 suite, effort=none, gpqa diamond, reasoning=true, run: reasoning, source value 0.791919191919192 is a 0-1 fraction, x100 at harvest","measured_date":null},"hle":{"raw":19.32,"norm":25.47,"trust":2,"source_url":"https://artificialanalysis.ai/models/gemma-4-26b-a4b","config":"aa field hle, artificial analysis intelligence index v4.1.1 suite, effort=none, humanity's last exam, reasoning=true, run: reasoning, source value 0.193234476367006 is a 0-1 fraction, x100 at harvest","measured_date":null},"mmlu_pro":{"raw":82.6,"norm":71,"trust":2,"source_url":"https://arxiv.org/html/2607.02770v2","config":"26b-a4b column [raw: mmlu pro], gemma 4 technical report table 5","measured_date":null},"tau_bench":{"raw":43.57,"norm":31.43,"trust":2,"source_url":"https://artificialanalysis.ai/models/gemma-4-26b-a4b","config":"aa field tau2, aa field tau2 (not mapped to tau_bench), artificial analysis intelligence index v4.1.1 suite, effort=none, reasoning=true, run: reasoning, source value 0.435672514619883 is a 0-1 fraction, x100 at harvest","measured_date":null},"terminal_bench":{"raw":38.95,"norm":39.94,"trust":2,"source_url":"https://artificialanalysis.ai/models/gemma-4-26b-a4b","config":"aa field terminalbenchv21, artificial analysis intelligence index v4.1.1 suite, effort=none, reasoning=true, run: reasoning, source value 0.389513108614232 is a 0-1 fraction, terminal-bench 2.1, x100 at harvest","measured_date":null}}},{"id":"deepseek-r1-0528","display_name":"DeepSeek R1 0528","family_id":"deepseek","vendor":"DeepSeek","status":"current","kind":"model","superseded_by":null,"release_date":"2025-05-28","intelligence_index":60.31,"coverage":0.754,"index_subset_bias":{"offset":4.11,"peers":10,"method":"subset-knn-v1"},"params_total_b":684.53,"params_active_b":37,"vram_est":{"bf16_gb":1369,"int8_gb":726,"int4_gb":411,"method":"linear-rom-v1","approximate":true,"basis":"params_total_b"},"vram_frontier":{"efficiency":0.33,"expected_int8_gb":237,"method":"frontier-residual-v1","approximate":true},"fits_on":{},"is_moe":true,"is_open_weights":true,"context_window_tok":163840,"pricing":{"prompt_usd_per_m":0.5,"completion_usd_per_m":2.15,"blended_usd_per_m":0.9125},"scores":{"aime":{"raw":76,"norm":70,"trust":2,"source_url":"https://artificialanalysis.ai/models/deepseek-r1","config":"2025, artificial analysis independent run","measured_date":null},"arena_elo":{"raw":1421.6,"norm":63.28,"trust":3,"source_url":"https://lmarena.ai/leaderboard","config":"text","measured_date":"2026-09-27"},"gpqa_diamond":{"raw":81,"norm":78.87,"trust":1,"source_url":"https://huggingface.co/deepseek-ai/DeepSeek-R1-0528","config":"16 samples, max gen 64k, pass@1, temp 0.6, top-p 0.95","measured_date":"2025-05-28"},"hle":{"raw":15.85,"norm":20.37,"trust":2,"source_url":"https://artificialanalysis.ai/models/deepseek-r1","config":"artificial analysis independent run, no tools","measured_date":null},"mmlu_pro":{"raw":85,"norm":75,"trust":1,"source_url":"https://huggingface.co/deepseek-ai/DeepSeek-R1-0528","config":"em, max gen 64k","measured_date":"2025-05-28"},"swe_bench_verified":{"raw":57.6,"norm":52.89,"trust":1,"source_url":"https://huggingface.co/deepseek-ai/DeepSeek-R1-0528","config":"agentless framework, resolved rate","measured_date":"2025-05-28"},"tau_bench":{"raw":63.9,"norm":58.53,"trust":1,"source_url":"https://huggingface.co/deepseek-ai/DeepSeek-R1-0528","config":"gpt-4.1 as user simulator, pass@1, tau-bench retail","measured_date":null}}},{"id":"glm-5-v-turbo","display_name":"GLM 5V Turbo","family_id":"glm","vendor":"Zhipu AI (Z.ai)","status":"current","kind":"model","superseded_by":null,"release_date":"2026-04-01","intelligence_index":60.15,"coverage":0.4445,"index_subset_bias":{"offset":-1.19,"peers":10,"method":"subset-knn-v1"},"params_total_b":null,"params_active_b":null,"vram_est":null,"vram_frontier":null,"fits_on":null,"is_moe":false,"is_open_weights":false,"context_window_tok":202752,"pricing":{"prompt_usd_per_m":1.2,"completion_usd_per_m":4,"blended_usd_per_m":1.9},"scores":{"arena_elo":{"raw":1433.5,"norm":68.58,"trust":3,"source_url":"https://lmarena.ai/leaderboard","config":"text","measured_date":"2026-10-03"},"gpqa_diamond":{"raw":80.91,"norm":78.75,"trust":2,"source_url":"https://artificialanalysis.ai/models/glm-5v-turbo","config":"aa field gpqa, artificial analysis intelligence index v4.1.1 suite, effort=none, gpqa diamond, reasoning=true, run: reasoning, source value 0.809090909090909 is a 0-1 fraction, x100 at harvest","measured_date":null},"hle":{"raw":17.15,"norm":22.28,"trust":2,"source_url":"https://artificialanalysis.ai/models/glm-5v-turbo","config":"aa field hle, artificial analysis intelligence index v4.1.1 suite, effort=none, humanity's last exam, reasoning=true, run: reasoning, source value 0.171455050973123 is a 0-1 fraction, x100 at harvest","measured_date":null},"tau_bench":{"raw":98.54,"norm":100,"trust":2,"source_url":"https://artificialanalysis.ai/models/glm-5v-turbo","config":"aa field tau2, aa field tau2 (not mapped to tau_bench), artificial analysis intelligence index v4.1.1 suite, effort=none, reasoning=true, run: reasoning, source value 0.985380116959064 is a 0-1 fraction, x100 at harvest","measured_date":null},"terminal_bench":{"raw":32.58,"norm":32.45,"trust":2,"source_url":"https://artificialanalysis.ai/models/glm-5v-turbo","config":"aa field terminalbenchhard, artificial analysis intelligence index v4.1.1 suite, effort=none, reasoning=true, run: reasoning, source value 0.325757575757576 is a 0-1 fraction, terminal-bench hard, x100 at harvest","measured_date":null}}},{"id":"gpt-5.1-codex-mini","display_name":"GPT-5.1-Codex-Mini","family_id":"gpt","vendor":"OpenAI","status":"current","kind":"model","superseded_by":null,"release_date":"2025-11-13","intelligence_index":60.09,"coverage":0.4445,"index_subset_bias":{"offset":3.51,"peers":10,"method":"subset-knn-v1"},"params_total_b":null,"params_active_b":null,"vram_est":null,"vram_frontier":null,"fits_on":null,"is_moe":false,"is_open_weights":false,"context_window_tok":400000,"pricing":{"prompt_usd_per_m":0.25,"completion_usd_per_m":2,"blended_usd_per_m":0.6875},"scores":{"aime":{"raw":91.67,"norm":89.59,"trust":2,"source_url":"https://artificialanalysis.ai/models/gpt-5-1-codex-mini","config":"aa field aime25, aime-2025, artificial analysis intelligence index v4.1.1 suite, effort=high, reasoning=true, run: high, source value 0.916666666666667 is a 0-1 fraction, x100 at harvest","measured_date":null},"gpqa_diamond":{"raw":81.31,"norm":79.31,"trust":2,"source_url":"https://artificialanalysis.ai/models/gpt-5-1-codex-mini","config":"aa field gpqa, artificial analysis intelligence index v4.1.1 suite, effort=high, gpqa diamond, reasoning=true, run: high, source value 0.813131313131313 is a 0-1 fraction, x100 at harvest","measured_date":null},"hle":{"raw":18.49,"norm":24.25,"trust":2,"source_url":"https://artificialanalysis.ai/models/gpt-5-1-codex-mini","config":"aa field hle, artificial analysis intelligence index v4.1.1 suite, effort=high, humanity's last exam, reasoning=true, run: high, source value 0.184893419833179 is a 0-1 fraction, x100 at harvest","measured_date":null},"tau_bench":{"raw":62.87,"norm":57.16,"trust":2,"source_url":"https://artificialanalysis.ai/models/gpt-5-1-codex-mini","config":"aa field tau2, aa field tau2 (not mapped to tau_bench), artificial analysis intelligence index v4.1.1 suite, effort=high, reasoning=true, run: high, source value 0.628654970760234 is a 0-1 fraction, x100 at harvest","measured_date":null},"terminal_bench":{"raw":33.33,"norm":33.33,"trust":2,"source_url":"https://artificialanalysis.ai/models/gpt-5-1-codex-mini","config":"aa field terminalbenchhard, artificial analysis intelligence index v4.1.1 suite, effort=high, reasoning=true, run: high, source value 0.333333333333333 is a 0-1 fraction, terminal-bench hard, x100 at harvest","measured_date":null}}},{"id":"deepseek-v3.2","display_name":"DeepSeek-V3.2","family_id":"deepseek","vendor":"DeepSeek","status":"current","kind":"model","superseded_by":null,"release_date":"2025-12-01","intelligence_index":59.95,"coverage":0.8809,"index_subset_bias":null,"params_total_b":685.36,"params_active_b":37,"vram_est":{"bf16_gb":1371,"int8_gb":726,"int4_gb":411,"method":"linear-rom-v1","approximate":true,"basis":"params_total_b"},"vram_frontier":{"efficiency":0.32,"expected_int8_gb":234,"method":"frontier-residual-v1","approximate":true},"fits_on":{},"is_moe":true,"is_open_weights":true,"context_window_tok":163840,"pricing":{"prompt_usd_per_m":0.27,"completion_usd_per_m":0.41,"blended_usd_per_m":0.305},"scores":{"aime":{"raw":84.58,"norm":80.73,"trust":3,"source_url":"https://www.vals.ai/benchmarks/aime","config":"archived=true, edition=aime v1, reasoning_effort=high, run: fireworks/deepseek-v3p2-thinking, runner=platform, stderr=1.125, task=overall, updated=2026-04-16","measured_date":"2026-08-19"},"arc_agi_2":{"raw":4.03,"norm":0,"trust":3,"source_url":"https://arcprize.org/leaderboard","config":"cost_per_task_usd=0.12, eval=arc-agi-2 semi-private (v2_semi_private), org=deepseek, system_type=base llm","measured_date":"2026-08-21"},"arena_elo":{"raw":1422.1,"norm":63.5,"trust":3,"source_url":"https://lmarena.ai/leaderboard","config":"text","measured_date":"2026-10-06"},"gpqa_diamond":{"raw":80.3,"norm":77.89,"trust":3,"source_url":"https://www.vals.ai/benchmarks/gpqa","config":"edition=gpqa diamond v1, reasoning_effort=high, run: fireworks/deepseek-v3p2-thinking, runner=platform, stderr=1.997, task=overall, updated=2026-08-19","measured_date":"2026-08-19"},"hle":{"raw":25.1,"norm":33.97,"trust":3,"source_url":"https://arxiv.org/html/2512.02556v1","config":"text-only, pass@1, thinking mode, boxed-answer template (23.9 with official template)","measured_date":null},"mmlu_pro":{"raw":84.92,"norm":74.87,"trust":3,"source_url":"https://www.vals.ai/benchmarks/mmlu_pro","config":"edition=mmlu pro v1, run: fireworks/deepseek-v3p2-thinking, runner=platform, stderr=0.353, task=overall, updated=2026-08-19","measured_date":"2026-08-19"},"swe_bench_verified":{"raw":67.6,"norm":64,"trust":3,"source_url":"https://www.vals.ai/benchmarks/swebench","config":"edition=swe-bench verified v1, reasoning_effort=high, runner=external, stderr=2.095, task=overall, updated=2026-08-19","measured_date":"2026-08-19"},"tau_bench":{"raw":80.3,"norm":80.4,"trust":3,"source_url":"https://arxiv.org/html/2512.02556v1","config":"pass@1 overall, thinking mode","measured_date":null},"terminal_bench":{"raw":46.4,"norm":48.71,"trust":3,"source_url":"https://arxiv.org/html/2512.02556v1","config":"accuracy, thinking mode, claude code framework (39.3 non-thinking w/ terminus)","measured_date":null}}},{"id":"phi-4-14b-reasoning","display_name":"Phi-4-reasoning","family_id":"phi","vendor":"Microsoft","status":"current","kind":"model","superseded_by":null,"release_date":"2025-04","intelligence_index":59.95,"coverage":0.3572,"index_subset_bias":{"offset":16.01,"peers":10,"method":"subset-knn-v1"},"params_total_b":14,"params_active_b":14,"vram_est":{"bf16_gb":28,"int8_gb":14.8,"int4_gb":8.4,"method":"linear-rom-v1","approximate":true,"basis":"params_total_b"},"vram_frontier":{"efficiency":3.56,"expected_int8_gb":52.9,"method":"frontier-residual-v1","approximate":true},"fits_on":{"intel_b70":"fp8","nvidia_h100_sxm_80g":"fp8","nvidia_dgx_spark":"fp8"},"is_moe":false,"is_open_weights":true,"context_window_tok":null,"pricing":{"prompt_usd_per_m":null,"completion_usd_per_m":null,"blended_usd_per_m":null},"scores":{"aime":{"raw":75.3,"norm":69.12,"trust":1,"source_url":"https://huggingface.co/microsoft/Phi-4-reasoning","config":"aime 24, phi-4-reasoning column","measured_date":null},"gpqa_diamond":{"raw":65.8,"norm":57.46,"trust":1,"source_url":"https://huggingface.co/microsoft/Phi-4-reasoning","config":"gpqa-d, phi-4-reasoning column","measured_date":null},"mmlu_pro":{"raw":74.3,"norm":57.17,"trust":1,"source_url":"https://huggingface.co/microsoft/Phi-4-reasoning","config":"mmlupro, phi-4-reasoning column","measured_date":null}}},{"id":"glm-4.6","display_name":"GLM 4.6","family_id":"glm","vendor":"Zhipu AI (Z.ai)","status":"superseded","kind":"model","superseded_by":"glm-5.3","release_date":"2025-09-30","intelligence_index":59.9,"coverage":0.6428,"index_subset_bias":{"offset":2.78,"peers":10,"method":"subset-knn-v1"},"params_total_b":356.79,"params_active_b":32,"vram_est":{"bf16_gb":714,"int8_gb":378,"int4_gb":214,"method":"linear-rom-v1","approximate":true,"basis":"params_total_b"},"vram_frontier":null,"fits_on":{},"is_moe":true,"is_open_weights":true,"context_window_tok":204800,"pricing":{"prompt_usd_per_m":0.43,"completion_usd_per_m":1.75,"blended_usd_per_m":0.76},"scores":{"aime":{"raw":92.71,"norm":90.89,"trust":3,"source_url":"https://www.vals.ai/benchmarks/aime","config":"archived=true, edition=aime v1, runner=platform, stderr=0.605, task=overall, updated=2026-04-16","measured_date":"2026-08-19"},"arena_elo":{"raw":1424.1,"norm":64.39,"trust":3,"source_url":"https://lmarena.ai/leaderboard","config":"text","measured_date":"2026-10-03"},"gpqa_diamond":{"raw":74.5,"norm":69.72,"trust":3,"source_url":"https://www.vals.ai/benchmarks/gpqa","config":"edition=gpqa diamond v1, runner=platform, stderr=2.197, task=overall, updated=2026-08-19","measured_date":"2026-08-19"},"hle":{"raw":14.46,"norm":18.32,"trust":2,"source_url":"https://artificialanalysis.ai/models/glm-4-6-reasoning","config":"aa field hle, artificial analysis intelligence index v4.1.1 suite, effort=none, humanity's last exam, reasoning=true, run: reasoning, source value 0.144578313253012 is a 0-1 fraction, x100 at harvest","measured_date":null},"mmlu_pro":{"raw":82.2,"norm":70.33,"trust":3,"source_url":"https://www.vals.ai/benchmarks/mmlu_pro","config":"edition=mmlu pro v1, runner=platform, stderr=0.375, task=overall, updated=2026-08-19","measured_date":"2026-08-19"},"tau_bench":{"raw":76.9,"norm":75.87,"trust":2,"source_url":"https://artificialanalysis.ai/models/glm-4-6","config":"aa field tau2, aa field tau2 (not mapped to tau_bench), artificial analysis intelligence index v4.1.1 suite, effort=none, reasoning=false, run: non-reasoning, source value 0.769005847953216 is a 0-1 fraction, x100 at harvest","measured_date":null},"terminal_bench":{"raw":24.5,"norm":22.94,"trust":2,"source_url":"https://www.tbench.ai/leaderboard/terminal-bench/2.0","config":"2.0, agent: terminus 2","measured_date":"2025-11-01"}}},{"id":"gemini-3.5-flash-lite","display_name":"Gemini 3.5 Flash-Lite","family_id":"gemini","vendor":"Google","status":"current","kind":"model","superseded_by":null,"release_date":"2026-07-21","intelligence_index":59.56,"coverage":0.873,"index_subset_bias":null,"params_total_b":null,"params_active_b":null,"vram_est":null,"vram_frontier":null,"fits_on":null,"is_moe":false,"is_open_weights":false,"context_window_tok":1048576,"pricing":{"prompt_usd_per_m":0.3,"completion_usd_per_m":2.5,"blended_usd_per_m":0.85},"scores":{"arc_agi_2":{"raw":10.28,"norm":5.87,"trust":3,"source_url":"https://arcprize.org/results/gemini-3-5-flash-lite","config":"cost_per_task_usd=0.13899638250000004, eval=arc-agi-2 semi-private (v2_semi_private), model_group=gemini-3-5-flash-lite, org=google, run: high, setting=evaluation conducted with 'high' reasoning effort., system_type=cot","measured_date":"2026-08-21"},"arena_elo":{"raw":1455,"norm":78.16,"trust":3,"source_url":"https://lmarena.ai/leaderboard","config":"text","measured_date":"2026-10-03"},"gpqa_diamond":{"raw":83.84,"norm":82.87,"trust":3,"source_url":"https://www.vals.ai/benchmarks/gpqa","config":"edition=gpqa diamond v1, reasoning_effort=high, runner=platform, stderr=1.847, task=overall, updated=2026-08-19","measured_date":"2026-08-19"},"hle":{"raw":18.81,"norm":24.72,"trust":2,"source_url":"https://artificialanalysis.ai/models","config":"artificial analysis eval, gemini 3.5 flash-lite","measured_date":null},"livebench":{"raw":63.94,"norm":53.2,"trust":3,"source_url":"https://livebench.ai/","config":"livebench-2026-06-25 release, run: high","measured_date":null},"mmlu_pro":{"raw":85.84,"norm":76.4,"trust":3,"source_url":"https://www.vals.ai/benchmarks/mmlu_pro","config":"edition=mmlu pro v1, reasoning_effort=high, runner=platform, stderr=0.344, task=overall, updated=2026-08-19","measured_date":"2026-08-19"},"swe_bench_verified":{"raw":75,"norm":72.22,"trust":3,"source_url":"https://www.vals.ai/benchmarks/swebench","config":"edition=swe-bench verified v1, reasoning_effort=high, runner=external, stderr=1.938, task=overall, updated=2026-08-19","measured_date":"2026-08-19"},"terminal_bench":{"raw":50.19,"norm":53.16,"trust":3,"source_url":"https://www.vals.ai/benchmarks/terminal-bench-2-1","config":"edition=terminal-bench 2.1, reasoning_effort=high, runner=external, stderr=0.991, task=overall, updated=2026-08-19","measured_date":"2026-08-19"}}},{"id":"minimax-m2.5","display_name":"MiniMax-M2.5","family_id":"minimax","vendor":"MiniMax","status":"superseded","kind":"model","superseded_by":"minimax-m2.7","release_date":"2026-01-01","intelligence_index":59.32,"coverage":0.8809,"index_subset_bias":null,"params_total_b":228.7,"params_active_b":10,"vram_est":{"bf16_gb":457,"int8_gb":242,"int4_gb":137,"method":"linear-rom-v1","approximate":true,"basis":"params_total_b"},"vram_frontier":null,"fits_on":{},"is_moe":true,"is_open_weights":true,"context_window_tok":204800,"pricing":{"prompt_usd_per_m":0.27,"completion_usd_per_m":1.08,"blended_usd_per_m":0.47250000000000003},"scores":{"aime":{"raw":88.75,"norm":85.94,"trust":3,"source_url":"https://www.vals.ai/benchmarks/aime","config":"archived=true, edition=aime v1, runner=platform, stderr=0.877, task=overall, updated=2026-04-16","measured_date":"2026-08-19"},"arc_agi_2":{"raw":4.86,"norm":0,"trust":3,"source_url":"https://arcprize.org/leaderboard","config":"cost_per_task_usd=0.17, eval=arc-agi-2 semi-private (v2_semi_private), org=minimax, system_type=cot","measured_date":"2026-08-21"},"arena_elo":{"raw":1390.8,"norm":49.55,"trust":3,"source_url":"https://lmarena.ai/leaderboard","config":"text","measured_date":"2026-09-27"},"gpqa_diamond":{"raw":82.07,"norm":80.38,"trust":3,"source_url":"https://www.vals.ai/benchmarks/gpqa","config":"edition=gpqa diamond v1, runner=platform, stderr=2.258, task=overall, updated=2026-08-19","measured_date":"2026-08-19"},"hle":{"raw":20.53,"norm":27.25,"trust":2,"source_url":"https://artificialanalysis.ai/models/minimax-m2-5","config":"aa field hle, artificial analysis intelligence index v4.1.1 suite, effort=none, humanity's last exam, reasoning=true, source value 0.205282669138091 is a 0-1 fraction, x100 at harvest","measured_date":null},"mmlu_pro":{"raw":80.09,"norm":66.82,"trust":3,"source_url":"https://www.vals.ai/benchmarks/mmlu_pro","config":"edition=mmlu pro v1, runner=platform, stderr=0.39, task=overall, updated=2026-08-19","measured_date":"2026-08-19"},"swe_bench_verified":{"raw":74.2,"norm":71.33,"trust":3,"source_url":"https://www.vals.ai/benchmarks/swebench","config":"edition=swe-bench verified v1, runner=external, stderr=1.959, task=overall, updated=2026-08-19","measured_date":"2026-08-19"},"tau_bench":{"raw":95.32,"norm":100,"trust":2,"source_url":"https://artificialanalysis.ai/models/minimax-m2-5","config":"aa field tau2, aa field tau2 (not mapped to tau_bench), artificial analysis intelligence index v4.1.1 suite, effort=none, reasoning=true, source value 0.953216374269006 is a 0-1 fraction, x100 at harvest","measured_date":null},"terminal_bench":{"raw":34.85,"norm":35.12,"trust":2,"source_url":"https://artificialanalysis.ai/models/minimax-m2-5","config":"aa field terminalbenchhard, artificial analysis intelligence index v4.1.1 suite, effort=none, reasoning=true, source value 0.348484848484849 is a 0-1 fraction, terminal-bench hard, x100 at harvest","measured_date":null}}},{"id":"gpt-o3","display_name":"OpenAI o3","family_id":"gpt","vendor":"OpenAI","status":"current","kind":"model","superseded_by":null,"release_date":"2025-04-16","intelligence_index":59.11,"coverage":0.8809,"index_subset_bias":null,"params_total_b":null,"params_active_b":null,"vram_est":null,"vram_frontier":null,"fits_on":null,"is_moe":false,"is_open_weights":false,"context_window_tok":200000,"pricing":{"prompt_usd_per_m":2,"completion_usd_per_m":8,"blended_usd_per_m":3.5},"scores":{"aime":{"raw":85.28,"norm":81.6,"trust":3,"source_url":"https://www.vals.ai/benchmarks/aime","config":"archived=true, edition=aime v1, reasoning_effort=high, runner=platform, stderr=1.389, task=overall, updated=2026-04-16","measured_date":"2026-08-19"},"arc_agi_2":{"raw":6.53,"norm":1.7,"trust":3,"source_url":"https://arcprize.org/leaderboard","config":"cost_per_task_usd=0.8339, eval=arc-agi-2 semi-private (v2_semi_private), model_group=o3, org=openai, run: high, system_type=cot","measured_date":"2026-08-21"},"arena_elo":{"raw":1431.6,"norm":67.73,"trust":3,"source_url":"https://lmarena.ai/leaderboard","config":"text","measured_date":"2026-09-17"},"gpqa_diamond":{"raw":84.09,"norm":83.23,"trust":3,"source_url":"https://www.vals.ai/benchmarks/gpqa","config":"edition=gpqa diamond v1, reasoning_effort=high, runner=platform, stderr=1.861, task=overall, updated=2026-08-19","measured_date":"2026-08-19"},"hle":{"raw":20.05,"norm":26.54,"trust":2,"source_url":"https://artificialanalysis.ai/models/o3","config":"aa field hle, artificial analysis intelligence index v4.1.1 suite, effort=none, humanity's last exam, reasoning=true, source value 0.2005 is a 0-1 fraction, x100 at harvest","measured_date":null},"mmlu_pro":{"raw":85.59,"norm":75.98,"trust":3,"source_url":"https://www.vals.ai/benchmarks/mmlu_pro","config":"edition=mmlu pro v1, reasoning_effort=high, runner=platform, stderr=0.345, task=overall, updated=2026-08-19","measured_date":"2026-08-19"},"swe_bench_verified":{"raw":62.3,"norm":58.11,"trust":3,"source_url":"https://epoch.ai/models/o3","config":"epoch ai evaluation, o3 at medium reasoning effort","measured_date":null},"tau_bench":{"raw":80.7,"norm":80.93,"trust":2,"source_url":"https://artificialanalysis.ai/models/o3","config":"aa field tau2, aa field tau2 (not mapped to tau_bench), artificial analysis intelligence index v4.1.1 suite, effort=none, reasoning=true, source value 0.807017543859649 is a 0-1 fraction, x100 at harvest","measured_date":null},"terminal_bench":{"raw":37.12,"norm":37.79,"trust":2,"source_url":"https://artificialanalysis.ai/models/o3","config":"aa field terminalbenchhard, artificial analysis intelligence index v4.1.1 suite, effort=none, reasoning=true, source value 0.371212121212121 is a 0-1 fraction, terminal-bench hard, x100 at harvest","measured_date":null}}},{"id":"qwen-3.5-9b","display_name":"Qwen3.5-9B","family_id":"qwen","vendor":"Alibaba","status":"current","kind":"model","superseded_by":null,"release_date":"2026-03-10","intelligence_index":59.04,"coverage":0.4842,"index_subset_bias":{"offset":1.77,"peers":10,"method":"subset-knn-v1"},"params_total_b":9.65,"params_active_b":9.65,"vram_est":{"bf16_gb":19.3,"int8_gb":10.2,"int4_gb":5.8,"method":"linear-rom-v1","approximate":true,"basis":"params_total_b"},"vram_frontier":{"efficiency":5.03,"expected_int8_gb":51.4,"method":"frontier-residual-v1","approximate":true},"fits_on":{"intel_b70":"fp8","nvidia_h100_sxm_80g":"fp8","nvidia_dgx_spark":"fp8"},"is_moe":false,"is_open_weights":true,"context_window_tok":262144,"pricing":{"prompt_usd_per_m":0.1,"completion_usd_per_m":0.15,"blended_usd_per_m":0.11250000000000002},"scores":{"gpqa_diamond":{"raw":80.61,"norm":78.32,"trust":2,"source_url":"https://artificialanalysis.ai/models/qwen3-5-9b","config":"aa field gpqa, artificial analysis intelligence index v4.1.1 suite, effort=none, gpqa diamond, reasoning=true, run: reasoning, source value 0.806060606060606 is a 0-1 fraction, x100 at harvest","measured_date":null},"hle":{"raw":14.92,"norm":19,"trust":2,"source_url":"https://artificialanalysis.ai/models/qwen3-5-9b","config":"aa field hle, artificial analysis intelligence index v4.1.1 suite, effort=none, humanity's last exam, reasoning=true, run: reasoning, source value 0.149212233549583 is a 0-1 fraction, x100 at harvest","measured_date":null},"mmlu_pro":{"raw":82.5,"norm":70.83,"trust":1,"source_url":"https://huggingface.co/Qwen/Qwen3.5-9B","config":null,"measured_date":null},"tau_bench":{"raw":86.84,"norm":89.12,"trust":2,"source_url":"https://artificialanalysis.ai/models/qwen3-5-9b","config":"aa field tau2, aa field tau2 (not mapped to tau_bench), artificial analysis intelligence index v4.1.1 suite, effort=none, reasoning=true, run: reasoning, source value 0.868421052631579 is a 0-1 fraction, x100 at harvest","measured_date":null},"terminal_bench":{"raw":29.21,"norm":28.48,"trust":2,"source_url":"https://artificialanalysis.ai/models/qwen3-5-9b","config":"aa field terminalbenchv21, artificial analysis intelligence index v4.1.1 suite, effort=none, reasoning=true, run: reasoning, source value 0.292134831460674 is a 0-1 fraction, terminal-bench 2.1, x100 at harvest","measured_date":null}}},{"id":"glm-4.5-355b-a32b","display_name":"GLM-4.5","family_id":"glm","vendor":"Zhipu AI (Z.ai)","status":"current","kind":"model","superseded_by":null,"release_date":"2025-07-28","intelligence_index":58.89,"coverage":0.8016,"index_subset_bias":null,"params_total_b":358.34,"params_active_b":32,"vram_est":{"bf16_gb":717,"int8_gb":380,"int4_gb":215,"method":"linear-rom-v1","approximate":true,"basis":"params_total_b"},"vram_frontier":{"efficiency":0.6,"expected_int8_gb":227,"method":"frontier-residual-v1","approximate":true},"fits_on":{},"is_moe":true,"is_open_weights":true,"context_window_tok":131072,"pricing":{"prompt_usd_per_m":0.6,"completion_usd_per_m":2.2,"blended_usd_per_m":1},"scores":{"aime":{"raw":86.67,"norm":83.34,"trust":3,"source_url":"https://www.vals.ai/benchmarks/aime","config":"archived=true, edition=aime v1, runner=platform, stderr=1.332, task=overall, updated=2026-04-16","measured_date":"2026-08-19"},"arena_elo":{"raw":1411.3,"norm":58.69,"trust":3,"source_url":"https://lmarena.ai/leaderboard","config":"text","measured_date":"2026-09-27"},"gpqa_diamond":{"raw":72.22,"norm":66.51,"trust":3,"source_url":"https://www.vals.ai/benchmarks/gpqa","config":"edition=gpqa diamond v1, runner=platform, stderr=2.262, task=overall, updated=2026-08-19","measured_date":"2026-08-19"},"hle":{"raw":14.4,"norm":18.24,"trust":3,"source_url":"https://arxiv.org/html/2508.06471v1","config":null,"measured_date":null},"mmlu_pro":{"raw":81.22,"norm":68.7,"trust":3,"source_url":"https://www.vals.ai/benchmarks/mmlu_pro","config":"edition=mmlu pro v1, runner=platform, stderr=0.378, task=overall, updated=2026-08-19","measured_date":"2026-08-19"},"swe_bench_verified":{"raw":64.2,"norm":60.22,"trust":3,"source_url":"https://arxiv.org/html/2508.06471v1","config":null,"measured_date":null},"tau_bench":{"raw":79.7,"norm":79.6,"trust":3,"source_url":"https://arxiv.org/html/2508.06471v1","config":"retail","measured_date":null},"terminal_bench":{"raw":37.5,"norm":38.24,"trust":3,"source_url":"https://arxiv.org/html/2508.06471v1","config":null,"measured_date":null}}},{"id":"gpt-5.4-nano","display_name":"GPT-5.4 Nano","family_id":"gpt","vendor":"OpenAI","status":"current","kind":"model","superseded_by":null,"release_date":"2026-03-17","intelligence_index":58.58,"coverage":1,"index_subset_bias":null,"params_total_b":null,"params_active_b":null,"vram_est":null,"vram_frontier":null,"fits_on":null,"is_moe":false,"is_open_weights":false,"context_window_tok":400000,"pricing":{"prompt_usd_per_m":0.2,"completion_usd_per_m":1.25,"blended_usd_per_m":0.4625},"scores":{"aime":{"raw":88.75,"norm":85.94,"trust":3,"source_url":"https://www.vals.ai/benchmarks/aime","config":"archived=true, edition=aime v1, reasoning_effort=high, runner=platform, stderr=0.99, task=overall, updated=2026-04-16","measured_date":"2026-08-19"},"arc_agi_2":{"raw":5.69,"norm":0.77,"trust":3,"source_url":"https://arcprize.org/leaderboard","config":"cost_per_task_usd=0.16, eval=arc-agi-2 semi-private (v2_semi_private), model_group=gpt-5-4-nano-reasoning, org=openai, run: xhigh, system_type=cot","measured_date":"2026-08-21"},"arena_elo":{"raw":1401.3,"norm":54.23,"trust":3,"source_url":"https://lmarena.ai/leaderboard","config":"text","measured_date":"2026-10-03"},"gpqa_diamond":{"raw":77.53,"norm":73.99,"trust":3,"source_url":"https://www.vals.ai/benchmarks/gpqa","config":"edition=gpqa diamond v1, reasoning_effort=high, runner=platform, stderr=2.417, task=overall, updated=2026-08-19","measured_date":"2026-08-19"},"hle":{"raw":28.3,"norm":38.68,"trust":2,"source_url":"https://artificialanalysis.ai/models/gpt-5-4-nano","config":"artificial analysis run, gpt-5.4 nano (xhigh), no tools, page data value 0.282669138 rendered as 28.3% [raw: humanity's last exam]","measured_date":null},"livebench":{"raw":69.58,"norm":65.73,"trust":3,"source_url":"https://livebench.ai/","config":"livebench-2026-06-25 release, run: xhigh","measured_date":null},"mmlu_pro":{"raw":77.17,"norm":61.95,"trust":3,"source_url":"https://www.vals.ai/benchmarks/mmlu_pro","config":"edition=mmlu pro v1, reasoning_effort=high, runner=platform, stderr=0.433, task=overall, updated=2026-08-19","measured_date":"2026-08-19"},"swe_bench_verified":{"raw":69.8,"norm":66.44,"trust":3,"source_url":"https://www.vals.ai/benchmarks/swebench","config":"edition=swe-bench verified v1, reasoning_effort=high, runner=external, stderr=2.055, task=overall, updated=2026-08-19","measured_date":"2026-08-19"},"tau_bench":{"raw":76.02,"norm":74.69,"trust":2,"source_url":"https://artificialanalysis.ai/models/gpt-5-4-nano","config":"aa field tau2, aa field tau2 (not mapped to tau_bench), artificial analysis intelligence index v4.1.1 suite, effort=xhigh, reasoning=true, run: xhigh, source value 0.760233918128655 is a 0-1 fraction, x100 at harvest","measured_date":null},"terminal_bench":{"raw":41.57,"norm":43.02,"trust":3,"source_url":"https://www.vals.ai/benchmarks/terminal-bench-2-1","config":"edition=terminal-bench 2.1, reasoning_effort=high, runner=external, stderr=2.973, task=overall, updated=2026-08-19","measured_date":"2026-08-19"}}},{"id":"qwen-3-max","display_name":"Qwen3 Max","family_id":"qwen","vendor":"Alibaba","status":"superseded","kind":"model","superseded_by":"qwen-3.7-max","release_date":"2025-09-23","intelligence_index":58.54,"coverage":0.5635,"index_subset_bias":{"offset":3.71,"peers":10,"method":"subset-knn-v1"},"params_total_b":null,"params_active_b":null,"vram_est":null,"vram_frontier":null,"fits_on":null,"is_moe":false,"is_open_weights":false,"context_window_tok":262144,"pricing":{"prompt_usd_per_m":0.78,"completion_usd_per_m":3.9,"blended_usd_per_m":1.56},"scores":{"aime":{"raw":81.04,"norm":76.3,"trust":3,"source_url":"https://www.vals.ai/benchmarks/aime","config":"archived=true, edition=aime v1, run: max, runner=platform, stderr=1.1, task=overall, updated=2026-04-16","measured_date":"2026-08-19"},"gpqa_diamond":{"raw":79.55,"norm":76.83,"trust":3,"source_url":"https://www.vals.ai/benchmarks/gpqa","config":"edition=gpqa diamond v1, run: max, runner=platform, stderr=2.026, task=overall, updated=2026-08-19","measured_date":"2026-08-19"},"hle":{"raw":11.91,"norm":14.57,"trust":2,"source_url":"https://artificialanalysis.ai/models/qwen3-max","config":"aa field hle, artificial analysis intelligence index v4.1.1 suite, effort=none, humanity's last exam, reasoning=false, run: max, source value 0.119091751621872 is a 0-1 fraction, x100 at harvest","measured_date":null},"mmlu_pro":{"raw":84.36,"norm":73.93,"trust":3,"source_url":"https://www.vals.ai/benchmarks/mmlu_pro","config":"edition=mmlu pro v1, run: max, runner=platform, stderr=0.356, task=overall, updated=2026-08-19","measured_date":"2026-08-19"},"tau_bench":{"raw":74.27,"norm":72.36,"trust":2,"source_url":"https://artificialanalysis.ai/models/qwen3-max","config":"aa field tau2, aa field tau2 (not mapped to tau_bench), artificial analysis intelligence index v4.1.1 suite, effort=none, reasoning=false, run: max, source value 0.742690058479532 is a 0-1 fraction, x100 at harvest","measured_date":null},"terminal_bench":{"raw":20.45,"norm":18.18,"trust":2,"source_url":"https://artificialanalysis.ai/models/qwen3-max","config":"aa field terminalbenchhard, artificial analysis intelligence index v4.1.1 suite, effort=none, reasoning=false, run: max, source value 0.204545454545455 is a 0-1 fraction, terminal-bench hard, x100 at harvest","measured_date":null}}},{"id":"deepseek-3.1-instruct","display_name":"DeepSeek V3.1","family_id":"deepseek","vendor":"DeepSeek","status":"current","kind":"model","superseded_by":null,"release_date":"2025-08-21","intelligence_index":57.85,"coverage":0.8016,"index_subset_bias":null,"params_total_b":684.53,"params_active_b":37,"vram_est":{"bf16_gb":1369,"int8_gb":726,"int4_gb":411,"method":"linear-rom-v1","approximate":true,"basis":"params_total_b"},"vram_frontier":{"efficiency":0.3,"expected_int8_gb":220,"method":"frontier-residual-v1","approximate":true},"fits_on":{},"is_moe":true,"is_open_weights":true,"context_window_tok":163840,"pricing":{"prompt_usd_per_m":0.25,"completion_usd_per_m":0.95,"blended_usd_per_m":0.425},"scores":{"aime":{"raw":89.67,"norm":87.09,"trust":2,"source_url":"https://artificialanalysis.ai/models/deepseek-v3-1-reasoning","config":"aa field aime25, aime-2025, artificial analysis intelligence index v4.1.1 suite, effort=none, reasoning=true, run: reasoning, source value 0.896666666666667 is a 0-1 fraction, x100 at harvest","measured_date":null},"arena_elo":{"raw":1417.1,"norm":61.27,"trust":3,"source_url":"https://lmarena.ai/leaderboard","config":"text","measured_date":"2026-10-03"},"gpqa_diamond":{"raw":77.88,"norm":74.48,"trust":2,"source_url":"https://artificialanalysis.ai/models/deepseek-v3-1-reasoning","config":"aa field gpqa, artificial analysis intelligence index v4.1.1 suite, effort=none, gpqa diamond, reasoning=true, run: reasoning, source value 0.778787878787879 is a 0-1 fraction, x100 at harvest","measured_date":null},"hle":{"raw":14.27,"norm":18.04,"trust":2,"source_url":"https://artificialanalysis.ai/models/deepseek-v3-1-reasoning","config":"aa field hle, artificial analysis intelligence index v4.1.1 suite, effort=none, humanity's last exam, reasoning=true, run: reasoning, source value 0.142724745134384 is a 0-1 fraction, x100 at harvest","measured_date":null},"mmlu_pro":{"raw":83.7,"norm":72.83,"trust":1,"source_url":"https://huggingface.co/deepseek-ai/DeepSeek-V3.1","config":"deepseek-v3.1 nonthinking mode, exact-match — official model-card eval table [raw: mmlu-pro (em)]","measured_date":null},"swe_bench_verified":{"raw":66,"norm":62.22,"trust":1,"source_url":"https://huggingface.co/deepseek-ai/DeepSeek-V3.1","config":"agent mode using deepseek's internal code-agent framework (not a third-party harness) [raw: swe verified (agent mode)], deepseek-v3.1 nonthinking mode, swe-bench verified","measured_date":null},"tau_bench":{"raw":37.43,"norm":23.24,"trust":2,"source_url":"https://artificialanalysis.ai/models/deepseek-v3-1-reasoning","config":"aa field tau2, aa field tau2 (not mapped to tau_bench), artificial analysis intelligence index v4.1.1 suite, effort=none, reasoning=true, run: reasoning, source value 0.374269005847953 is a 0-1 fraction, x100 at harvest","measured_date":null},"terminal_bench":{"raw":25,"norm":23.53,"trust":2,"source_url":"https://artificialanalysis.ai/models/deepseek-v3-1-reasoning","config":"aa field terminalbenchhard, artificial analysis intelligence index v4.1.1 suite, effort=none, reasoning=true, run: reasoning, source value 0.25 is a 0-1 fraction, terminal-bench hard, x100 at harvest","measured_date":null}}},{"id":"mistral-3.5-medium-128b","display_name":"Mistral-Medium-3.5-128B","family_id":"mistral","vendor":"Mistral AI","status":"current","kind":"model","superseded_by":null,"release_date":null,"intelligence_index":57.84,"coverage":0.4762,"index_subset_bias":{"offset":-2.3,"peers":10,"method":"subset-knn-v1"},"params_total_b":127.7,"params_active_b":127.7,"vram_est":{"bf16_gb":255,"int8_gb":135,"int4_gb":76.6,"method":"linear-rom-v1","approximate":true,"basis":"params_total_b"},"vram_frontier":{"efficiency":0.37,"expected_int8_gb":49.6,"method":"frontier-residual-v1","approximate":true},"fits_on":{"nvidia_dgx_spark":"int4"},"is_moe":false,"is_open_weights":true,"context_window_tok":262144,"pricing":{"prompt_usd_per_m":null,"completion_usd_per_m":null,"blended_usd_per_m":null},"scores":{"gpqa_diamond":{"raw":74.85,"norm":70.21,"trust":2,"source_url":"https://artificialanalysis.ai/models/mistral-medium-3-5","config":"aa intelligence index eval","measured_date":null},"hle":{"raw":13.76,"norm":17.29,"trust":2,"source_url":"https://artificialanalysis.ai/models/mistral-medium-3-5","config":"aa intelligence index eval, no tools","measured_date":null},"swe_bench_verified":{"raw":77.6,"norm":75.11,"trust":1,"source_url":"https://huggingface.co/mistralai/Mistral-Medium-3.5-128B","config":null,"measured_date":null},"terminal_bench":{"raw":50.56,"norm":53.6,"trust":2,"source_url":"https://artificialanalysis.ai/models/mistral-medium-3-5","config":"aa eval, terminal-bench 2.1","measured_date":null}}},{"id":"minimax-m2","display_name":"MiniMax M2","family_id":"minimax","vendor":"MiniMax","status":"superseded","kind":"model","superseded_by":"minimax-m2.7","release_date":"2025-10-27","intelligence_index":57.62,"coverage":0.8016,"index_subset_bias":null,"params_total_b":228.69,"params_active_b":10,"vram_est":{"bf16_gb":457,"int8_gb":242,"int4_gb":137,"method":"linear-rom-v1","approximate":true,"basis":"params_total_b"},"vram_frontier":null,"fits_on":{},"is_moe":true,"is_open_weights":true,"context_window_tok":204800,"pricing":{"prompt_usd_per_m":0.3,"completion_usd_per_m":1.2,"blended_usd_per_m":0.5249999999999999},"scores":{"aime":{"raw":78.33,"norm":72.91,"trust":2,"source_url":"https://artificialanalysis.ai/models/minimax-m2","config":"aa field aime25, aime-2025, artificial analysis intelligence index v4.1.1 suite, effort=none, reasoning=true, source value 0.783333333333333 is a 0-1 fraction, x100 at harvest","measured_date":null},"arena_elo":{"raw":1343.4,"norm":28.42,"trust":3,"source_url":"https://lmarena.ai/leaderboard","config":"text","measured_date":"2026-10-03"},"gpqa_diamond":{"raw":77.68,"norm":74.2,"trust":2,"source_url":"https://artificialanalysis.ai/models/minimax-m2","config":"aa field gpqa, artificial analysis intelligence index v4.1.1 suite, effort=none, gpqa diamond, reasoning=true, source value 0.776767676767677 is a 0-1 fraction, x100 at harvest","measured_date":null},"hle":{"raw":13.67,"norm":17.16,"trust":2,"source_url":"https://artificialanalysis.ai/models/minimax-m2","config":"aa field hle, artificial analysis intelligence index v4.1.1 suite, effort=none, humanity's last exam, reasoning=true, source value 0.136700648748842 is a 0-1 fraction, x100 at harvest","measured_date":null},"mmlu_pro":{"raw":82,"norm":70,"trust":1,"source_url":"https://huggingface.co/MiniMaxAI/MiniMax-M2","config":null,"measured_date":null},"swe_bench_verified":{"raw":69.4,"norm":66,"trust":1,"source_url":"https://huggingface.co/MiniMaxAI/MiniMax-M2","config":null,"measured_date":null},"tau_bench":{"raw":86.84,"norm":89.12,"trust":2,"source_url":"https://artificialanalysis.ai/models/minimax-m2","config":"aa field tau2, aa field tau2 (not mapped to tau_bench), artificial analysis intelligence index v4.1.1 suite, effort=none, reasoning=true, source value 0.868421052631579 is a 0-1 fraction, x100 at harvest","measured_date":null},"terminal_bench":{"raw":30,"norm":29.41,"trust":2,"source_url":"https://www.tbench.ai/leaderboard/terminal-bench/2.0","config":"2.0, agent: terminus 2","measured_date":"2025-11-01"}}},{"id":"qwen-3-30b-a3b-2507-instruct","display_name":"Qwen3 30B A3B Instruct 2507","family_id":"qwen","vendor":"Alibaba","status":"current","kind":"model","superseded_by":null,"release_date":"2025-07-29","intelligence_index":57.1,"coverage":0.6032,"index_subset_bias":{"offset":9.59,"peers":9,"method":"subset-knn-v1"},"params_total_b":30.53,"params_active_b":3,"vram_est":{"bf16_gb":61.1,"int8_gb":32.4,"int4_gb":18.3,"method":"linear-rom-v1","approximate":true,"basis":"params_total_b"},"vram_frontier":{"efficiency":6.64,"expected_int8_gb":215,"method":"frontier-residual-v1","approximate":true},"fits_on":{"intel_b70":"int4","nvidia_h100_sxm_80g":"fp8","nvidia_dgx_spark":"fp8"},"is_moe":true,"is_open_weights":true,"context_window_tok":262144,"pricing":{"prompt_usd_per_m":0.1,"completion_usd_per_m":0.3,"blended_usd_per_m":0.15000000000000002},"scores":{"aime":{"raw":61.3,"norm":51.63,"trust":1,"source_url":"https://huggingface.co/Qwen/Qwen3-30B-A3B-Instruct-2507","config":"aime 2025, no tools [raw: aime25], non-thinking mode, official qwen model card 'reasoning' section","measured_date":null},"arena_elo":{"raw":1382.7,"norm":45.94,"trust":3,"source_url":"https://lmarena.ai/leaderboard","config":"text","measured_date":"2026-10-03"},"gpqa_diamond":{"raw":70.4,"norm":63.94,"trust":1,"source_url":"https://huggingface.co/Qwen/Qwen3-30B-A3B-Instruct-2507","config":"no tools [raw: gpqa], non-thinking, official qwen model card 'knowledge' section, row is labeled only 'gpqa' (card does not print the word 'diamond')","measured_date":null},"livebench":{"raw":69,"norm":64.44,"trust":1,"source_url":"https://huggingface.co/Qwen/Qwen3-30B-A3B-Instruct-2507","config":"global average, livebench 2024-11-25 release, non-thinking [raw: livebench 20241125], official qwen model card","measured_date":null},"mmlu_pro":{"raw":78.4,"norm":64,"trust":1,"source_url":"https://huggingface.co/Qwen/Qwen3-30B-A3B-Instruct-2507","config":"no tools [raw: mmlu-pro], non-thinking mode, official qwen model card benchmark table","measured_date":null},"tau_bench":{"raw":39.8,"norm":26.4,"trust":2,"source_url":"https://openrouter.ai/qwen/qwen3-30b-a3b-instruct-2507","config":"auto-routing row, coreweave [raw: tau-bench], openrouter 'exacto benchmarks' per-endpoint table, single aggregate number (tau version/domain mix not stated on page). per-provider values on same table: siliconflow 39.1","measured_date":null}}},{"id":"claude-sonnet-4.5","display_name":"Claude Sonnet 4.5","family_id":"claude","vendor":"Anthropic","status":"superseded","kind":"model","superseded_by":"claude-sonnet-5","release_date":"2025-09-29","intelligence_index":56.68,"coverage":0.5238,"index_subset_bias":{"offset":-4.46,"peers":10,"method":"subset-knn-v1"},"params_total_b":null,"params_active_b":null,"vram_est":null,"vram_frontier":null,"fits_on":null,"is_moe":false,"is_open_weights":false,"context_window_tok":1000000,"pricing":{"prompt_usd_per_m":3,"completion_usd_per_m":15,"blended_usd_per_m":6},"scores":{"aime":{"raw":88,"norm":85,"trust":2,"source_url":"https://artificialanalysis.ai/models/claude-4-5-sonnet-thinking","config":"aa field aime25, aime-2025, artificial analysis intelligence index v4.1.1 suite, effort=none, reasoning=true, run: reasoning, source value 0.88 is a 0-1 fraction, x100 at harvest","measured_date":null},"arc_agi_2":{"raw":13.61,"norm":9.57,"trust":3,"source_url":"https://arcprize.org/leaderboard","config":"cost_per_task_usd=0.7589, eval=arc-agi-2 semi-private (v2_semi_private), model_group=claude-sonnet-4-5-20250929, org=anthropic, run: thinking 32k, system_type=cot","measured_date":"2026-08-21"},"gpqa_diamond":{"raw":83.43,"norm":82.3,"trust":2,"source_url":"https://artificialanalysis.ai/models/claude-4-5-sonnet-thinking","config":"aa field gpqa, artificial analysis intelligence index v4.1.1 suite, effort=none, gpqa diamond, reasoning=true, run: reasoning, source value 0.834343434343434 is a 0-1 fraction, x100 at harvest","measured_date":null},"hle":{"raw":17.79,"norm":23.22,"trust":2,"source_url":"https://artificialanalysis.ai/models/claude-4-5-sonnet-thinking","config":"aa field hle, artificial analysis intelligence index v4.1.1 suite, effort=none, humanity's last exam, reasoning=true, run: reasoning, source value 0.177942539388323 is a 0-1 fraction, x100 at harvest","measured_date":null},"tau_bench":{"raw":78.07,"norm":77.43,"trust":2,"source_url":"https://artificialanalysis.ai/models/claude-4-5-sonnet-thinking","config":"aa field tau2, aa field tau2 (not mapped to tau_bench), artificial analysis intelligence index v4.1.1 suite, effort=none, reasoning=true, run: reasoning, source value 0.780701754385965 is a 0-1 fraction, x100 at harvest","measured_date":null},"terminal_bench":{"raw":55.81,"norm":59.78,"trust":2,"source_url":"https://artificialanalysis.ai/models/claude-4-5-sonnet-thinking","config":"aa field terminalbenchv21, artificial analysis intelligence index v4.1.1 suite, effort=none, reasoning=true, run: reasoning, source value 0.558052434456929 is a 0-1 fraction, terminal-bench 2.1, x100 at harvest","measured_date":null}}},{"id":"claude-opus-4.1","display_name":"Claude Opus 4.1","family_id":"claude","vendor":"Anthropic","status":"superseded","kind":"model","superseded_by":"claude-opus-5.5","release_date":"2025-08-05","intelligence_index":56.48,"coverage":0.4445,"index_subset_bias":{"offset":2.06,"peers":10,"method":"subset-knn-v1"},"params_total_b":null,"params_active_b":null,"vram_est":null,"vram_frontier":null,"fits_on":null,"is_moe":false,"is_open_weights":false,"context_window_tok":200000,"pricing":{"prompt_usd_per_m":15,"completion_usd_per_m":75,"blended_usd_per_m":30},"scores":{"aime":{"raw":80.33,"norm":75.41,"trust":2,"source_url":"https://artificialanalysis.ai/models/claude-4-1-opus-thinking","config":"aa field aime25, aime-2025, artificial analysis intelligence index v4.1.1 suite, effort=none, reasoning=true, run: reasoning, source value 0.803333333333333 is a 0-1 fraction, x100 at harvest","measured_date":null},"gpqa_diamond":{"raw":80.9,"norm":78.73,"trust":2,"source_url":"https://artificialanalysis.ai/models/claude-4-1-opus-thinking","config":"aa field gpqa, artificial analysis intelligence index v4.1.1 suite, effort=none, gpqa diamond, reasoning=true, run: reasoning, source value 0.809 is a 0-1 fraction, x100 at harvest","measured_date":null},"hle":{"raw":12.47,"norm":15.4,"trust":2,"source_url":"https://artificialanalysis.ai/models/claude-4-1-opus-thinking","config":"aa field hle, artificial analysis intelligence index v4.1.1 suite, effort=none, humanity's last exam, reasoning=true, run: reasoning, source value 0.124652455977757 is a 0-1 fraction, x100 at harvest","measured_date":null},"tau_bench":{"raw":71.37,"norm":68.49,"trust":2,"source_url":"https://artificialanalysis.ai/models/claude-4-1-opus-thinking","config":"aa field tau2, aa field tau2 (not mapped to tau_bench), artificial analysis intelligence index v4.1.1 suite, effort=none, reasoning=true, run: reasoning, source value 0.713660933660934 is a 0-1 fraction, x100 at harvest","measured_date":null},"terminal_bench":{"raw":34.34,"norm":34.52,"trust":2,"source_url":"https://artificialanalysis.ai/models/claude-4-1-opus-thinking","config":"aa field terminalbenchhard, artificial analysis intelligence index v4.1.1 suite, effort=none, reasoning=true, run: reasoning, source value 0.343352330715909 is a 0-1 fraction, terminal-bench hard, x100 at harvest","measured_date":null}}},{"id":"qwen-3.5-flash","display_name":"Qwen3.5-Flash","family_id":"qwen","vendor":"Alibaba","status":"superseded","kind":"model","superseded_by":"qwen-3.8-flash","release_date":"2026-02-25","intelligence_index":56.47,"coverage":0.4445,"index_subset_bias":{"offset":3.34,"peers":10,"method":"subset-knn-v1"},"params_total_b":null,"params_active_b":null,"vram_est":null,"vram_frontier":null,"fits_on":null,"is_moe":false,"is_open_weights":false,"context_window_tok":1000000,"pricing":{"prompt_usd_per_m":0.065,"completion_usd_per_m":0.26,"blended_usd_per_m":0.11375},"scores":{"arena_elo":{"raw":1395.9,"norm":51.82,"trust":3,"source_url":"https://lmarena.ai/leaderboard","config":"text","measured_date":"2026-10-03"},"gpqa_diamond":{"raw":78.5,"norm":75.35,"trust":2,"source_url":"https://benchgecko.ai/model/qwen3-5-flash-02-23","config":"benchmark suite mirrors epoch ai benchmarking hub (otis mock aime, chess puzzles), frontiermath v2, model page titled \"qwen3.5-flash\" (api id qwen3-5-flash-02-23), no tools, simpleqa verified, though [raw: gpqa diamond]","measured_date":null},"swe_bench_verified":{"raw":54.9,"norm":49.89,"trust":2,"source_url":"https://www.vals.ai/models/alibaba_qwen3.5-flash","config":"\"qwen 3.5 flash on vals index\" update dated mar 2, 2026, vals ai independent run, vals harness (resolved rate) — verbatim: \"it scores 54.9% on swe-bench verified but struggles on terminal-bench 2.0 (2 [raw: swe-bench verified]","measured_date":null},"terminal_bench":{"raw":24.7,"norm":23.18,"trust":2,"source_url":"https://www.vals.ai/models/alibaba_qwen3.5-flash","config":"2026 vals index update, mar 2, same sentence as the swe-bench verified figure [raw: terminal-bench 2.0], terminal-bench 2.0, vals ai harness","measured_date":null}}},{"id":"mistral-3.5-medium-vision","display_name":"Mistral Medium 3.5","family_id":"mistral","vendor":"Mistral AI","status":"current","kind":"model","superseded_by":null,"release_date":"2026-04","intelligence_index":56.46,"coverage":0.6032,"index_subset_bias":{"offset":-1.29,"peers":10,"method":"subset-knn-v1"},"params_total_b":128,"params_active_b":128,"vram_est":{"bf16_gb":256,"int8_gb":136,"int4_gb":76.8,"method":"linear-rom-v1","approximate":true,"basis":"params_total_b"},"vram_frontier":{"efficiency":0.35,"expected_int8_gb":47.6,"method":"frontier-residual-v1","approximate":true},"fits_on":{"nvidia_dgx_spark":"int4"},"is_moe":false,"is_open_weights":true,"context_window_tok":262144,"pricing":{"prompt_usd_per_m":1.5,"completion_usd_per_m":7.5,"blended_usd_per_m":3},"scores":{"arena_elo":{"raw":1426.9,"norm":65.64,"trust":3,"source_url":"https://lmarena.ai/leaderboard","config":"text","measured_date":"2026-10-01"},"gpqa_diamond":{"raw":74.85,"norm":70.21,"trust":2,"source_url":"https://artificialanalysis.ai/models/mistral-medium-3-5","config":"aa field gpqa, artificial analysis intelligence index v4.1.1 suite, effort=high, gpqa diamond, reasoning=true, source value 0.748484848484849 is a 0-1 fraction, x100 at harvest","measured_date":null},"hle":{"raw":13.76,"norm":17.29,"trust":2,"source_url":"https://artificialanalysis.ai/models/mistral-medium-3-5","config":"aa field hle, artificial analysis intelligence index v4.1.1 suite, effort=high, humanity's last exam, reasoning=true, source value 0.137627432808156 is a 0-1 fraction, x100 at harvest","measured_date":null},"swe_bench_verified":{"raw":64.7,"norm":60.78,"trust":3,"source_url":"https://www.vals.ai/models/mistralai_mistral-medium-3.5","config":"vals.ai independently-run subset","measured_date":"2026-05-01"},"tau_bench":{"raw":94.15,"norm":98.87,"trust":2,"source_url":"https://artificialanalysis.ai/models/mistral-medium-3-5","config":"aa field tau2, aa field tau2 (not mapped to tau_bench), artificial analysis intelligence index v4.1.1 suite, effort=high, reasoning=true, source value 0.941520467836257 is a 0-1 fraction, x100 at harvest","measured_date":null},"terminal_bench":{"raw":30.3,"norm":29.76,"trust":3,"source_url":"https://www.vals.ai/models/mistralai_mistral-medium-3.5","config":"vals.ai independent run","measured_date":"2026-05-01"}}},{"id":"deepseek-v3.1-terminus","display_name":"DeepSeek V3.1 Terminus","family_id":"deepseek","vendor":"DeepSeek","status":"superseded","kind":"model","superseded_by":"deepseek-v3.2","release_date":"2025-09-22","intelligence_index":56.28,"coverage":0.5238,"index_subset_bias":{"offset":0.06,"peers":10,"method":"subset-knn-v1"},"params_total_b":684.53,"params_active_b":37,"vram_est":{"bf16_gb":1369,"int8_gb":726,"int4_gb":411,"method":"linear-rom-v1","approximate":true,"basis":"params_total_b"},"vram_frontier":null,"fits_on":{},"is_moe":true,"is_open_weights":true,"context_window_tok":163840,"pricing":{"prompt_usd_per_m":0.27,"completion_usd_per_m":1,"blended_usd_per_m":0.4525},"scores":{"aime":{"raw":89.67,"norm":87.09,"trust":2,"source_url":"https://artificialanalysis.ai/models/deepseek-v3-1-terminus-reasoning","config":"aa field aime25, aime-2025, artificial analysis intelligence index v4.1.1 suite, effort=none, reasoning=true, run: reasoning, source value 0.896666666666667 is a 0-1 fraction, x100 at harvest","measured_date":null},"arena_elo":{"raw":1414.8,"norm":60.25,"trust":3,"source_url":"https://lmarena.ai/leaderboard","config":"text","measured_date":"2026-10-03"},"gpqa_diamond":{"raw":79.19,"norm":76.32,"trust":2,"source_url":"https://artificialanalysis.ai/models/deepseek-v3-1-terminus-reasoning","config":"aa field gpqa, artificial analysis intelligence index v4.1.1 suite, effort=none, gpqa diamond, reasoning=true, run: reasoning, source value 0.791919191919192 is a 0-1 fraction, x100 at harvest","measured_date":null},"hle":{"raw":16.36,"norm":21.12,"trust":2,"source_url":"https://artificialanalysis.ai/models/deepseek-v3-1-terminus-reasoning","config":"aa field hle, artificial analysis intelligence index v4.1.1 suite, effort=none, humanity's last exam, reasoning=true, run: reasoning, source value 0.163577386468953 is a 0-1 fraction, x100 at harvest","measured_date":null},"tau_bench":{"raw":37.13,"norm":22.84,"trust":2,"source_url":"https://artificialanalysis.ai/models/deepseek-v3-1-terminus","config":"aa field tau2, aa field tau2 (not mapped to tau_bench), artificial analysis intelligence index v4.1.1 suite, effort=none, reasoning=false, run: non-reasoning, source value 0.371345029239766 is a 0-1 fraction, x100 at harvest","measured_date":null},"terminal_bench":{"raw":44.94,"norm":46.99,"trust":2,"source_url":"https://artificialanalysis.ai/models/deepseek-v3-1-terminus-reasoning","config":"aa field terminalbenchv21, artificial analysis intelligence index v4.1.1 suite, effort=none, reasoning=true, run: reasoning, source value 0.449438202247191 is a 0-1 fraction, terminal-bench 2.1, x100 at harvest","measured_date":null}}},{"id":"qwen-3-235b-a22b-07-25","display_name":"Qwen3-235B-A22B-Instruct-2507","family_id":"qwen","vendor":"Alibaba","status":"current","kind":"model","superseded_by":null,"release_date":"2025-07-21","intelligence_index":55.88,"coverage":0.8412,"index_subset_bias":null,"params_total_b":235.09,"params_active_b":22,"vram_est":{"bf16_gb":470,"int8_gb":249,"int4_gb":141,"method":"linear-rom-v1","approximate":true,"basis":"params_total_b"},"vram_frontier":{"efficiency":0.83,"expected_int8_gb":207,"method":"frontier-residual-v1","approximate":true},"fits_on":{},"is_moe":true,"is_open_weights":true,"context_window_tok":262144,"pricing":{"prompt_usd_per_m":0.09,"completion_usd_per_m":0.55,"blended_usd_per_m":0.20500000000000002},"scores":{"aime":{"raw":91,"norm":88.75,"trust":2,"source_url":"https://artificialanalysis.ai/models/qwen3-235b-a22b-instruct-2507-reasoning","config":"aa field aime25, aime-2025, artificial analysis intelligence index v4.1.1 suite, effort=none, reasoning=true, run: reasoning, source value 0.91 is a 0-1 fraction, x100 at harvest","measured_date":null},"arc_agi_2":{"raw":1.25,"norm":0,"trust":3,"source_url":"https://arcprize.org/leaderboard","config":"cost_per_task_usd=0.0044, eval=arc-agi-2 semi-private (v2_semi_private), org=alibaba, run: 25/07, system_type=base llm","measured_date":"2026-08-21"},"arena_elo":{"raw":1422.4,"norm":63.63,"trust":3,"source_url":"https://lmarena.ai/leaderboard","config":"text","measured_date":"2026-09-27"},"gpqa_diamond":{"raw":78.99,"norm":76.04,"trust":2,"source_url":"https://artificialanalysis.ai/models/qwen3-235b-a22b-instruct-2507-reasoning","config":"aa field gpqa, artificial analysis intelligence index v4.1.1 suite, effort=none, gpqa diamond, reasoning=true, run: reasoning, source value 0.78989898989899 is a 0-1 fraction, x100 at harvest","measured_date":null},"hle":{"raw":15.89,"norm":20.43,"trust":2,"source_url":"https://artificialanalysis.ai/models/qwen3-235b-a22b-instruct-2507-reasoning","config":"aa field hle, artificial analysis intelligence index v4.1.1 suite, effort=none, humanity's last exam, reasoning=true, run: reasoning, source value 0.158943466172382 is a 0-1 fraction, x100 at harvest","measured_date":null},"livebench":{"raw":75.4,"norm":78.67,"trust":1,"source_url":"https://huggingface.co/Qwen/Qwen3-235B-A22B-Instruct-2507","config":"global average. label on the official model card is exactly 'livebench 20241125'. [raw: livebench 20241125], livebench 2024-11-25 release","measured_date":null},"mmlu_pro":{"raw":83,"norm":71.67,"trust":1,"source_url":"https://huggingface.co/Qwen/Qwen3-235B-A22B-Instruct-2507","config":"no tools. [raw: mmlu-pro], official model card benchmark table. non-thinking mode","measured_date":null},"tau_bench":{"raw":53.22,"norm":44.29,"trust":2,"source_url":"https://artificialanalysis.ai/models/qwen3-235b-a22b-instruct-2507-reasoning","config":"aa field tau2, aa field tau2 (not mapped to tau_bench), artificial analysis intelligence index v4.1.1 suite, effort=none, reasoning=true, run: reasoning, source value 0.532163742690059 is a 0-1 fraction, x100 at harvest","measured_date":null},"terminal_bench":{"raw":15.15,"norm":11.94,"trust":2,"source_url":"https://artificialanalysis.ai/models/qwen3-235b-a22b-instruct-2507","config":"label confirmed by page title of https://artificialanalysis.ai/evaluations/terminalbench-hard = 'terminal [raw: terminal-bench hard], measured independently by artificial analysis (field 'terminalbenchhard', terminal-bench hard","measured_date":null}}},{"id":"kimi-k2","display_name":"Kimi K2","family_id":"kimi","vendor":"Moonshot AI","status":"superseded","kind":"model","superseded_by":"kimi-k2-0905","release_date":"2025-07","intelligence_index":55.5,"coverage":0.8413,"index_subset_bias":null,"params_total_b":1026.41,"params_active_b":32,"vram_est":{"bf16_gb":2053,"int8_gb":1088,"int4_gb":616,"method":"linear-rom-v1","approximate":true,"basis":"params_total_b"},"vram_frontier":null,"fits_on":{},"is_moe":true,"is_open_weights":true,"context_window_tok":131072,"pricing":{"prompt_usd_per_m":0.57,"completion_usd_per_m":2.3,"blended_usd_per_m":1.0025},"scores":{"aime":{"raw":62.71,"norm":53.39,"trust":3,"source_url":"https://www.vals.ai/benchmarks/aime","config":"archived=true, edition=aime v1, runner=platform, stderr=1.217, task=overall, updated=2026-04-16","measured_date":"2026-08-19"},"gpqa_diamond":{"raw":71.46,"norm":65.44,"trust":3,"source_url":"https://www.vals.ai/benchmarks/gpqa","config":"edition=gpqa diamond v1, runner=platform, stderr=2.266, task=overall, updated=2026-08-19","measured_date":"2026-08-19"},"hle":{"raw":7.41,"norm":7.96,"trust":2,"source_url":"https://artificialanalysis.ai/models/kimi-k2","config":"aa field hle, artificial analysis intelligence index v4.1.1 suite, effort=none, humanity's last exam, reasoning=false, source value 0.0741427247451344 is a 0-1 fraction, x100 at harvest","measured_date":null},"livebench":{"raw":76.4,"norm":80.89,"trust":1,"source_url":"https://huggingface.co/moonshotai/Kimi-K2-Instruct","config":"pass@1","measured_date":null},"mmlu_pro":{"raw":79.39,"norm":65.65,"trust":3,"source_url":"https://www.vals.ai/benchmarks/mmlu_pro","config":"edition=mmlu pro v1, runner=platform, stderr=0.394, task=overall, updated=2026-08-19","measured_date":"2026-08-19"},"swe_bench_verified":{"raw":65.8,"norm":62,"trust":1,"source_url":"https://huggingface.co/moonshotai/Kimi-K2-Instruct","config":"agentic coding, single attempt, bash/editor tools, 8k output limit","measured_date":null},"tau_bench":{"raw":61.11,"norm":54.81,"trust":2,"source_url":"https://artificialanalysis.ai/models/kimi-k2","config":"aa field tau2, aa field tau2 (not mapped to tau_bench), artificial analysis intelligence index v4.1.1 suite, effort=none, reasoning=false, source value 0.611111111111111 is a 0-1 fraction, x100 at harvest","measured_date":null},"terminal_bench":{"raw":27.8,"norm":26.82,"trust":2,"source_url":"https://www.tbench.ai/leaderboard/terminal-bench/2.0","config":"2.0, agent: terminus 2","measured_date":"2025-11-01"}}},{"id":"gpt-5-mini","display_name":"GPT-5 Mini","family_id":"gpt","vendor":"OpenAI","status":"superseded","kind":"model","superseded_by":"gpt-5.4-mini","release_date":"2025-08-07","intelligence_index":55.28,"coverage":0.8809,"index_subset_bias":null,"params_total_b":null,"params_active_b":null,"vram_est":null,"vram_frontier":null,"fits_on":null,"is_moe":false,"is_open_weights":false,"context_window_tok":400000,"pricing":{"prompt_usd_per_m":0.25,"completion_usd_per_m":2,"blended_usd_per_m":0.6875},"scores":{"aime":{"raw":91.46,"norm":89.32,"trust":3,"source_url":"https://www.vals.ai/benchmarks/aime","config":"archived=true, edition=aime v1, reasoning_effort=high, runner=platform, stderr=0.836, task=overall, updated=2026-04-16, verbosity=medium","measured_date":"2026-08-19"},"arc_agi_2":{"raw":4.44,"norm":0,"trust":3,"source_url":"https://arcprize.org/leaderboard","config":"cost_per_task_usd=0.1977, eval=arc-agi-2 semi-private (v2_semi_private), model_group=gpt-5-mini-reasoning, org=openai, run: high, system_type=cot","measured_date":"2026-08-21"},"arena_elo":{"raw":1389.7,"norm":49.06,"trust":3,"source_url":"https://lmarena.ai/leaderboard","config":"text","measured_date":"2026-10-03"},"gpqa_diamond":{"raw":80.3,"norm":77.89,"trust":3,"source_url":"https://www.vals.ai/benchmarks/gpqa","config":"edition=gpqa diamond v1, reasoning_effort=high, runner=platform, stderr=1.996, task=overall, updated=2026-08-19, verbosity=medium","measured_date":"2026-08-19"},"hle":{"raw":21.46,"norm":28.62,"trust":2,"source_url":"https://artificialanalysis.ai/models/gpt-5-mini","config":"aa field hle, artificial analysis intelligence index v4.1.1 suite, effort=high, humanity's last exam, reasoning=true, run: high, source value 0.214550509731233 is a 0-1 fraction, x100 at harvest","measured_date":null},"mmlu_pro":{"raw":82.23,"norm":70.38,"trust":3,"source_url":"https://www.vals.ai/benchmarks/mmlu_pro","config":"edition=mmlu pro v1, reasoning_effort=high, runner=platform, stderr=0.373, task=overall, updated=2026-08-19, verbosity=medium","measured_date":"2026-08-19"},"swe_bench_verified":{"raw":60.8,"norm":56.44,"trust":3,"source_url":"https://www.vals.ai/benchmarks/swebench","config":"edition=swe-bench verified v1, reasoning_effort=high, runner=external, stderr=2.185, task=overall, updated=2026-08-19","measured_date":"2026-08-19"},"tau_bench":{"raw":71.05,"norm":68.07,"trust":2,"source_url":"https://artificialanalysis.ai/models/gpt-5-mini-medium","config":"aa field tau2, aa field tau2 (not mapped to tau_bench), artificial analysis intelligence index v4.1.1 suite, effort=medium, reasoning=true, run: medium, source value 0.710526315789474 is a 0-1 fraction, x100 at harvest","measured_date":null},"terminal_bench":{"raw":33.33,"norm":33.33,"trust":2,"source_url":"https://artificialanalysis.ai/models/gpt-5-mini","config":"aa field terminalbenchhard, artificial analysis intelligence index v4.1.1 suite, effort=high, reasoning=true, run: high, source value 0.333333333333333 is a 0-1 fraction, terminal-bench hard, x100 at harvest","measured_date":null}}},{"id":"nova-2-lite-v1","display_name":"Nova 2 Lite","family_id":"nova","vendor":"Amazon","status":"current","kind":"model","superseded_by":null,"release_date":"2025-12-02","intelligence_index":54.53,"coverage":0.8016,"index_subset_bias":null,"params_total_b":null,"params_active_b":null,"vram_est":null,"vram_frontier":null,"fits_on":null,"is_moe":false,"is_open_weights":false,"context_window_tok":1000000,"pricing":{"prompt_usd_per_m":0.3,"completion_usd_per_m":2.5,"blended_usd_per_m":0.85},"scores":{"aime":{"raw":91,"norm":88.75,"trust":1,"source_url":"https://cdn.amazon.science/c5/3d/84514a224666b5be6de4b43ef4aa/nova-2-0-technical-report2.pdf","config":"acc, aime 2025","measured_date":null},"arena_elo":{"raw":1335.6,"norm":24.95,"trust":3,"source_url":"https://arena.ai/leaderboard/text","config":"12294 votes, arena entry nova-2-lite, leaderboard text-overall-style_control, rank 221, style control, text/overall, vote cutoff 2026-08-21","measured_date":"2026-08-21"},"gpqa_diamond":{"raw":79.6,"norm":76.9,"trust":1,"source_url":"https://cdn.amazon.science/c5/3d/84514a224666b5be6de4b43ef4aa/nova-2-0-technical-report2.pdf","config":"acc","measured_date":null},"hle":{"raw":11.63,"norm":14.16,"trust":2,"source_url":"https://artificialanalysis.ai/models/nova-2-0-lite-reasoning","config":"aa intelligence index eval, nova 2.0 lite (high)","measured_date":null},"mmlu_pro":{"raw":80.9,"norm":68.17,"trust":1,"source_url":"https://cdn.amazon.science/c5/3d/84514a224666b5be6de4b43ef4aa/nova-2-0-technical-report2.pdf","config":"acc","measured_date":null},"swe_bench_verified":{"raw":53.6,"norm":48.44,"trust":1,"source_url":"https://cdn.amazon.science/c5/3d/84514a224666b5be6de4b43ef4aa/nova-2-0-technical-report2.pdf","config":"no inference-time scaling / no internal agentic scaffolding","measured_date":null},"tau_bench":{"raw":76,"norm":74.67,"trust":1,"source_url":"https://cdn.amazon.science/c5/3d/84514a224666b5be6de4b43ef4aa/nova-2-0-technical-report2.pdf","config":"tau2-bench telecom","measured_date":null},"terminal_bench":{"raw":32.5,"norm":32.35,"trust":1,"source_url":"https://cdn.amazon.science/c5/3d/84514a224666b5be6de4b43ef4aa/nova-2-0-technical-report2.pdf","config":"terminal-bench 1.0","measured_date":null}}},{"id":"qwen-3-next-code","display_name":"Qwen3 Coder Next","family_id":"qwen","vendor":"Alibaba","status":"current","kind":"model","superseded_by":null,"release_date":"2026-02-04","intelligence_index":54.53,"coverage":0.5239,"index_subset_bias":{"offset":-3.11,"peers":10,"method":"subset-knn-v1"},"params_total_b":79.67,"params_active_b":null,"vram_est":{"bf16_gb":159,"int8_gb":84.5,"int4_gb":47.8,"method":"linear-rom-v1","approximate":true,"basis":"params_total_b"},"vram_frontier":{"efficiency":2.36,"expected_int8_gb":199,"method":"frontier-residual-v1","approximate":true},"fits_on":{"nvidia_h100_sxm_80g":"int4","nvidia_dgx_spark":"fp8"},"is_moe":true,"is_open_weights":true,"context_window_tok":262144,"pricing":{"prompt_usd_per_m":0.12,"completion_usd_per_m":0.8,"blended_usd_per_m":0.29000000000000004},"scores":{"gpqa_diamond":{"raw":73.74,"norm":68.65,"trust":2,"source_url":"https://artificialanalysis.ai/models/qwen3-coder-next","config":"aa field gpqa, artificial analysis intelligence index v4.1.1 suite, effort=none, gpqa diamond, reasoning=false, source value 0.737373737373737 is a 0-1 fraction, x100 at harvest","measured_date":null},"hle":{"raw":10.15,"norm":11.99,"trust":2,"source_url":"https://artificialanalysis.ai/models/qwen3-coder-next","config":"aa field hle, artificial analysis intelligence index v4.1.1 suite, effort=none, humanity's last exam, reasoning=false, source value 0.101482854494903 is a 0-1 fraction, x100 at harvest","measured_date":null},"swe_bench_verified":{"raw":70.6,"norm":67.33,"trust":2,"source_url":"https://arxiv.org/abs/2603.00729","config":"swe-agent as harness","measured_date":"2026-03-16"},"tau_bench":{"raw":79.53,"norm":79.37,"trust":2,"source_url":"https://artificialanalysis.ai/models/qwen3-coder-next","config":"aa field tau2, aa field tau2 (not mapped to tau_bench), artificial analysis intelligence index v4.1.1 suite, effort=none, reasoning=false, source value 0.795321637426901 is a 0-1 fraction, x100 at harvest","measured_date":null},"terminal_bench":{"raw":38.2,"norm":39.06,"trust":2,"source_url":"https://artificialanalysis.ai/models/qwen3-coder-next","config":"aa field terminalbenchv21, artificial analysis intelligence index v4.1.1 suite, effort=none, reasoning=false, source value 0.382022471910112 is a 0-1 fraction, terminal-bench 2.1, x100 at harvest","measured_date":null}}},{"id":"gemini-2.5-pro-06-05","display_name":"Gemini 2.5 Pro Preview 06-05","family_id":"gemini","vendor":"Google","status":"current","kind":"model","superseded_by":null,"release_date":"2025-06-05","intelligence_index":53.7,"coverage":0.3889,"index_subset_bias":{"offset":-1.5,"peers":10,"method":"subset-knn-v1"},"params_total_b":null,"params_active_b":null,"vram_est":null,"vram_frontier":null,"fits_on":null,"is_moe":false,"is_open_weights":false,"context_window_tok":1048576,"pricing":{"prompt_usd_per_m":1.25,"completion_usd_per_m":10,"blended_usd_per_m":3.4375},"scores":{"gpqa_diamond":{"raw":83.64,"norm":82.59,"trust":2,"source_url":"https://artificialanalysis.ai/models/gemini-2-5-pro-03-25","config":"aa field gpqa, artificial analysis intelligence index v4.1.1 suite, effort=none, gpqa diamond, reasoning=true, run: mar' 25, source value 0.836363636363636 is a 0-1 fraction, x100 at harvest","measured_date":null},"hle":{"raw":19.93,"norm":26.37,"trust":2,"source_url":"https://artificialanalysis.ai/models/gemini-2-5-pro-05-06","config":"aa field hle, artificial analysis intelligence index v4.1.1 suite, effort=none, humanity's last exam, reasoning=true, run: may' 25, source value 0.1993 is a 0-1 fraction, x100 at harvest","measured_date":null},"livebench":{"raw":58.3,"norm":40.67,"trust":3,"source_url":"https://livebench.ai/#/","config":"livebench-2026-01-08 release, max thinking","measured_date":"2026-01-08"}}},{"id":"gemini-2.5-pro","display_name":"Gemini 2.5 Pro","family_id":"gemini","vendor":"Google","status":"current","kind":"model","superseded_by":null,"release_date":"2025-03","intelligence_index":53.62,"coverage":0.7619,"index_subset_bias":{"offset":-2.05,"peers":10,"method":"subset-knn-v1"},"params_total_b":null,"params_active_b":null,"vram_est":null,"vram_frontier":null,"fits_on":null,"is_moe":false,"is_open_weights":false,"context_window_tok":1048576,"pricing":{"prompt_usd_per_m":1.25,"completion_usd_per_m":10,"blended_usd_per_m":3.4375},"scores":{"aime":{"raw":88,"norm":85,"trust":3,"source_url":"https://arxiv.org/html/2507.06261v1","config":"aime 2025, single attempt, pass@1","measured_date":null},"arc_agi_2":{"raw":4.86,"norm":0,"trust":3,"source_url":"https://arcprize.org/leaderboard","config":"cost_per_task_usd=0.757, eval=arc-agi-2 semi-private (v2_semi_private), model_group=gemini-2-5-pro-2025-06-17-thinking, org=google, run: thinking 32k, system_type=cot","measured_date":"2026-08-21"},"arena_elo":{"raw":1445.6,"norm":73.97,"trust":3,"source_url":"https://lmarena.ai/leaderboard","config":"text","measured_date":"2026-10-03"},"gpqa_diamond":{"raw":86.4,"norm":86.48,"trust":3,"source_url":"https://arxiv.org/html/2507.06261v1","config":"single attempt, pass@1","measured_date":null},"hle":{"raw":21.6,"norm":28.82,"trust":3,"source_url":"https://arxiv.org/html/2507.06261v1","config":"no tools, pass@1","measured_date":null},"swe_bench_verified":{"raw":54.4,"norm":49.33,"trust":3,"source_url":"https://www.vals.ai/benchmarks/swebench","config":"edition=swe-bench verified v1, runner=external, stderr=2.23, task=overall, updated=2026-08-19","measured_date":"2026-08-19"},"tau_bench":{"raw":54.09,"norm":45.45,"trust":2,"source_url":"https://artificialanalysis.ai/models/gemini-2-5-pro","config":"aa field tau2, aa field tau2 (not mapped to tau_bench), artificial analysis intelligence index v4.1.1 suite, effort=none, reasoning=true, source value 0.54093567251462 is a 0-1 fraction, x100 at harvest","measured_date":null},"terminal_bench":{"raw":28.46,"norm":27.6,"trust":2,"source_url":"https://artificialanalysis.ai/models/gemini-2-5-pro","config":"aa field terminalbenchv21, artificial analysis intelligence index v4.1.1 suite, effort=none, reasoning=true, source value 0.284644194756554 is a 0-1 fraction, terminal-bench 2.1, x100 at harvest","measured_date":null}}},{"id":"seed-2.0-mini","display_name":"Seed-2.0-Mini","family_id":"seed","vendor":"bytedance-seed","status":"current","kind":"model","superseded_by":null,"release_date":"2026-02-26","intelligence_index":53.36,"coverage":0.5475,"index_subset_bias":{"offset":-1.53,"peers":10,"method":"subset-knn-v1"},"params_total_b":null,"params_active_b":null,"vram_est":null,"vram_frontier":null,"fits_on":null,"is_moe":false,"is_open_weights":false,"context_window_tok":262144,"pricing":{"prompt_usd_per_m":0.1,"completion_usd_per_m":0.4,"blended_usd_per_m":0.17500000000000002},"scores":{"aime":{"raw":87,"norm":83.75,"trust":2,"source_url":"https://arxiv.org/pdf/2607.00248","config":"2025, seed2.0 mini column, seed2.0 model card table 4 (efficient models)","measured_date":null},"arc_agi_2":{"raw":2.3,"norm":0,"trust":2,"source_url":"https://arxiv.org/pdf/2607.00248","config":"seed2.0 mini column, seed2.0 model card table 4 (efficient models)","measured_date":null},"gpqa_diamond":{"raw":79,"norm":76.06,"trust":2,"source_url":"https://arxiv.org/pdf/2607.00248","config":"seed2.0 mini column, seed2.0 model card table 4 (efficient models)","measured_date":null},"hle":{"raw":13.3,"norm":16.62,"trust":2,"source_url":"https://arxiv.org/pdf/2607.00248","config":"no tools, seed2.0 mini column, seed2.0 model card table 4 (efficient models), text only","measured_date":null},"mmlu_pro":{"raw":83.6,"norm":72.67,"trust":2,"source_url":"https://arxiv.org/pdf/2607.00248","config":"seed2.0 mini column, seed2.0 model card table 4 (efficient models)","measured_date":null}}},{"id":"qwen-3-235b-a22b","display_name":"Qwen3-235B-A22B","family_id":"qwen","vendor":"Alibaba","status":"superseded","kind":"model","superseded_by":"qwen-3-235b-a22b-07-25","release_date":"2025-04-29","intelligence_index":52.71,"coverage":0.7619,"index_subset_bias":{"offset":2.81,"peers":9,"method":"subset-knn-v1"},"params_total_b":235.09,"params_active_b":22,"vram_est":{"bf16_gb":470,"int8_gb":249,"int4_gb":141,"method":"linear-rom-v1","approximate":true,"basis":"params_total_b"},"vram_frontier":null,"fits_on":{},"is_moe":true,"is_open_weights":true,"context_window_tok":131072,"pricing":{"prompt_usd_per_m":0.455,"completion_usd_per_m":1.82,"blended_usd_per_m":0.79625},"scores":{"aime":{"raw":83.96,"norm":79.95,"trust":3,"source_url":"https://www.vals.ai/benchmarks/aime","config":"archived=true, edition=aime v1, runner=platform, stderr=0.768, task=overall, updated=2026-04-16","measured_date":"2026-08-19"},"arena_elo":{"raw":1375.2,"norm":42.6,"trust":3,"source_url":"https://lmarena.ai/leaderboard","config":"text","measured_date":"2026-10-01"},"gpqa_diamond":{"raw":70.2,"norm":63.66,"trust":3,"source_url":"https://www.vals.ai/benchmarks/gpqa","config":"edition=gpqa diamond v1, runner=platform, stderr=2.373, task=overall, updated=2026-08-19","measured_date":"2026-08-19"},"hle":{"raw":10.98,"norm":13.21,"trust":2,"source_url":"https://artificialanalysis.ai/models/qwen3-235b-a22b-instruct-reasoning","config":"aa field hle, artificial analysis intelligence index v4.1.1 suite, effort=none, humanity's last exam, reasoning=true, run: reasoning, source value 0.1098 is a 0-1 fraction, x100 at harvest","measured_date":null},"livebench":{"raw":78.4,"norm":85.33,"trust":1,"source_url":"https://huggingface.co/Qwen/Qwen3-235B-A22B-Thinking-2507","config":"livebench 20241125, thinking-2507","measured_date":null},"mmlu_pro":{"raw":81.25,"norm":68.75,"trust":3,"source_url":"https://www.vals.ai/benchmarks/mmlu_pro","config":"edition=mmlu pro v1, runner=platform, stderr=0.387, task=overall, updated=2026-08-19","measured_date":"2026-08-19"},"tau_bench":{"raw":27.19,"norm":9.59,"trust":2,"source_url":"https://artificialanalysis.ai/models/qwen3-235b-a22b-instruct","config":"aa field tau2, aa field tau2 (not mapped to tau_bench), artificial analysis intelligence index v4.1.1 suite, effort=none, reasoning=false, run: non-reasoning, source value 0.271929824561404 is a 0-1 fraction, x100 at harvest","measured_date":null},"terminal_bench":{"raw":6.06,"norm":1.25,"trust":2,"source_url":"https://artificialanalysis.ai/models/qwen3-235b-a22b-instruct","config":"aa field terminalbenchhard, artificial analysis intelligence index v4.1.1 suite, effort=none, reasoning=false, run: non-reasoning, source value 0.0606060606060606 is a 0-1 fraction, terminal-bench hard, x100 at harvest","measured_date":null}}},{"id":"gpt-5.2-instruct","display_name":"GPT-5.2 Chat","family_id":"gpt","vendor":"OpenAI","status":"current","kind":"model","superseded_by":null,"release_date":"2025-12-10","intelligence_index":52.47,"coverage":0.5953,"index_subset_bias":{"offset":3.46,"peers":10,"method":"subset-knn-v1"},"params_total_b":null,"params_active_b":null,"vram_est":null,"vram_frontier":null,"fits_on":null,"is_moe":false,"is_open_weights":false,"context_window_tok":128000,"pricing":{"prompt_usd_per_m":1.75,"completion_usd_per_m":14,"blended_usd_per_m":4.8125},"scores":{"aime":{"raw":51,"norm":38.75,"trust":2,"source_url":"https://artificialanalysis.ai/models/gpt-5-2-non-reasoning","config":"2025, artificial analysis independent evaluation","measured_date":null},"arena_elo":{"raw":1476.2,"norm":87.61,"trust":3,"source_url":"https://arena.ai/leaderboard/text","config":"34339 votes, arena entry gpt-5.2-chat-latest, leaderboard text-overall-style_control, rank 24, style control, text/overall, vote cutoff 2026-08-21","measured_date":"2026-08-21"},"gpqa_diamond":{"raw":71.21,"norm":65.08,"trust":2,"source_url":"https://artificialanalysis.ai/models/gpt-5-2-non-reasoning","config":"artificial analysis independent evaluation","measured_date":null},"hle":{"raw":8.02,"norm":8.85,"trust":2,"source_url":"https://artificialanalysis.ai/models/gpt-5-2-non-reasoning","config":"artificial analysis independent evaluation","measured_date":null},"mmlu_pro":{"raw":81.36,"norm":68.93,"trust":2,"source_url":"https://artificialanalysis.ai/models/gpt-5-2-non-reasoning","config":"artificial analysis independent evaluation","measured_date":null},"tau_bench":{"raw":46.49,"norm":35.32,"trust":2,"source_url":"https://artificialanalysis.ai/models/gpt-5-2-non-reasoning","config":"artificial analysis independent evaluation, tau2/telecom","measured_date":null}}},{"id":"nemotron-3-super-120b-a12b","display_name":"Nemotron 3 Super","family_id":"nemotron","vendor":"NVIDIA","status":"current","kind":"model","superseded_by":null,"release_date":"2026-03-11","intelligence_index":52.06,"coverage":0.4445,"index_subset_bias":{"offset":-5.14,"peers":10,"method":"subset-knn-v1"},"params_total_b":123.61,"params_active_b":12,"vram_est":{"bf16_gb":247,"int8_gb":131,"int4_gb":74.2,"method":"linear-rom-v1","approximate":true,"basis":"params_total_b"},"vram_frontier":{"efficiency":1.41,"expected_int8_gb":185,"method":"frontier-residual-v1","approximate":true},"fits_on":{"nvidia_h100_sxm_80g":"int4","nvidia_dgx_spark":"int4"},"is_moe":true,"is_open_weights":true,"context_window_tok":262144,"pricing":{"prompt_usd_per_m":0.08,"completion_usd_per_m":0.45,"blended_usd_per_m":0.1725},"scores":{"arena_elo":{"raw":1360.3,"norm":35.96,"trust":3,"source_url":"https://arena.ai/leaderboard/text","config":"7535 votes, arena entry march26-chatbot1, leaderboard text-overall-style_control, rank 187, style control, text/overall, vote cutoff 2026-08-21","measured_date":"2026-08-21"},"gpqa_diamond":{"raw":80,"norm":77.46,"trust":2,"source_url":"https://artificialanalysis.ai/models/nvidia-nemotron-3-super-120b-a12b","config":"aa field gpqa, artificial analysis intelligence index v4.1.1 suite, effort=none, gpqa diamond, reasoning=true, run: reasoning, source value 0.8 is a 0-1 fraction, x100 at harvest","measured_date":null},"hle":{"raw":20.76,"norm":27.59,"trust":2,"source_url":"https://artificialanalysis.ai/models/nvidia-nemotron-3-super-120b-a12b","config":"aa field hle, artificial analysis intelligence index v4.1.1 suite, effort=none, humanity's last exam, reasoning=true, run: reasoning, source value 0.207599629286376 is a 0-1 fraction, x100 at harvest","measured_date":null},"tau_bench":{"raw":67.84,"norm":63.79,"trust":2,"source_url":"https://artificialanalysis.ai/models/nvidia-nemotron-3-super-120b-a12b","config":"aa field tau2, aa field tau2 (not mapped to tau_bench), artificial analysis intelligence index v4.1.1 suite, effort=none, reasoning=true, run: reasoning, source value 0.678362573099415 is a 0-1 fraction, x100 at harvest","measured_date":null},"terminal_bench":{"raw":38.58,"norm":39.51,"trust":2,"source_url":"https://artificialanalysis.ai/models/nvidia-nemotron-3-super-120b-a12b","config":"aa field terminalbenchv21, artificial analysis intelligence index v4.1.1 suite, effort=none, reasoning=true, run: reasoning, source value 0.385767790262172 is a 0-1 fraction, terminal-bench 2.1, x100 at harvest","measured_date":null}}},{"id":"qwen-3-235b-a22b-instruct-vision","display_name":"Qwen3 VL 235B A22B Instruct","family_id":"qwen","vendor":"Alibaba","status":"current","kind":"model","superseded_by":null,"release_date":"2025-09-23","intelligence_index":51.72,"coverage":0.7619,"index_subset_bias":{"offset":2.81,"peers":9,"method":"subset-knn-v1"},"params_total_b":235.67,"params_active_b":22,"vram_est":{"bf16_gb":471,"int8_gb":250,"int4_gb":141,"method":"linear-rom-v1","approximate":true,"basis":"params_total_b"},"vram_frontier":{"efficiency":0.73,"expected_int8_gb":183,"method":"frontier-residual-v1","approximate":true},"fits_on":{},"is_moe":true,"is_open_weights":true,"context_window_tok":262144,"pricing":{"prompt_usd_per_m":0.21,"completion_usd_per_m":1.9,"blended_usd_per_m":0.6325},"scores":{"aime":{"raw":70.67,"norm":63.34,"trust":2,"source_url":"https://artificialanalysis.ai/models/qwen3-vl-235b-a22b-instruct","config":"aa field aime25, aime-2025, artificial analysis intelligence index v4.1.1 suite, effort=none, reasoning=false, source value 0.706666666666667 is a 0-1 fraction, x100 at harvest","measured_date":null},"arena_elo":{"raw":1413.4,"norm":59.62,"trust":3,"source_url":"https://lmarena.ai/leaderboard","config":"text","measured_date":"2026-09-27"},"gpqa_diamond":{"raw":71.21,"norm":65.08,"trust":2,"source_url":"https://artificialanalysis.ai/models/qwen3-vl-235b-a22b-instruct","config":"aa field gpqa, artificial analysis intelligence index v4.1.1 suite, effort=none, gpqa diamond, reasoning=false, source value 0.712121212121212 is a 0-1 fraction, x100 at harvest","measured_date":null},"hle":{"raw":6.63,"norm":6.81,"trust":2,"source_url":"https://artificialanalysis.ai/models/qwen3-vl-235b-a22b-instruct","config":"aa field hle, artificial analysis intelligence index v4.1.1 suite, effort=none, humanity's last exam, reasoning=false, source value 0.0662650602409639 is a 0-1 fraction, x100 at harvest","measured_date":null},"livebench":{"raw":74.8,"norm":77.33,"trust":2,"source_url":"https://arxiv.org/html/2511.21631v1","config":"column \"qwen3-vl 235b-a22b instruct\". [raw: livebench 2024-11-25], global/overall average, livebench 2024-11-25 release, qwen3-vl technical report table 2","measured_date":null},"mmlu_pro":{"raw":81.8,"norm":69.67,"trust":2,"source_url":"https://arxiv.org/html/2511.21631v1","config":"column \"qwen3-vl 235b-a22b instruct\" (non-thinking). vendor self-reported, no tools. [raw: mmlu-pro], pure-text evaluation, qwen3-vl technical report (arxiv:2511.21631) table 2","measured_date":null},"tau_bench":{"raw":35.09,"norm":20.12,"trust":2,"source_url":"https://artificialanalysis.ai/models/qwen3-vl-235b-a22b-instruct","config":"aa field tau2, aa field tau2 (not mapped to tau_bench), artificial analysis intelligence index v4.1.1 suite, effort=none, reasoning=false, source value 0.350877192982456 is a 0-1 fraction, x100 at harvest","measured_date":null},"terminal_bench":{"raw":6.82,"norm":2.14,"trust":2,"source_url":"https://artificialanalysis.ai/models/qwen3-vl-235b-a22b-instruct","config":"aa field terminalbenchhard, artificial analysis intelligence index v4.1.1 suite, effort=none, reasoning=false, source value 0.0681818181818182 is a 0-1 fraction, terminal-bench hard, x100 at harvest","measured_date":null}}},{"id":"mistral-4-small-instruct","display_name":"Mistral Small 4","family_id":"mistral","vendor":"Mistral AI","status":"current","kind":"model","superseded_by":null,"release_date":"2026-03","intelligence_index":51.49,"coverage":0.5635,"index_subset_bias":{"offset":1.17,"peers":10,"method":"subset-knn-v1"},"params_total_b":null,"params_active_b":null,"vram_est":null,"vram_frontier":null,"fits_on":null,"is_moe":false,"is_open_weights":true,"context_window_tok":256000,"pricing":{"prompt_usd_per_m":null,"completion_usd_per_m":null,"blended_usd_per_m":null},"scores":{"aime":{"raw":84,"norm":80,"trust":2,"source_url":"https://docsbot.ai/models/mistral-small-4","config":"aime 2025, cites mistral.ai/news/mistral-small-4, mistral-reported figure transcribed by aggregator, no tools, non-reasoning (instruct) variant listed as 36 [raw: aime 2025], reasoning_effort=high","measured_date":null},"gpqa_diamond":{"raw":76.87,"norm":73.06,"trust":2,"source_url":"https://artificialanalysis.ai/models/mistral-small-4","config":"aa field gpqa, artificial analysis intelligence index v4.1.1 suite, effort=none, gpqa diamond, reasoning=true, run: reasoning, source value 0.768686868686869 is a 0-1 fraction, x100 at harvest","measured_date":null},"hle":{"raw":9.87,"norm":11.57,"trust":2,"source_url":"https://artificialanalysis.ai/models/mistral-small-4","config":"aa field hle, artificial analysis intelligence index v4.1.1 suite, effort=none, humanity's last exam, reasoning=true, run: reasoning, source value 0.0987025023169602 is a 0-1 fraction, x100 at harvest","measured_date":null},"mmlu_pro":{"raw":78,"norm":63.33,"trust":2,"source_url":"https://docsbot.ai/models/mistral-small-4","config":"cites mistral.ai/news/mistral-small-4, mistral-reported figure transcribed by aggregator, non-reasoning (instruct) variant listed as 73.5 [raw: mmlu pro], reasoning mode (high)","measured_date":null},"tau_bench":{"raw":41.23,"norm":28.31,"trust":2,"source_url":"https://artificialanalysis.ai/models/mistral-small-4","config":"aa field tau2, aa field tau2 (not mapped to tau_bench), artificial analysis intelligence index v4.1.1 suite, effort=none, reasoning=true, run: reasoning, source value 0.412280701754386 is a 0-1 fraction, x100 at harvest","measured_date":null},"terminal_bench":{"raw":20.97,"norm":18.79,"trust":2,"source_url":"https://artificialanalysis.ai/models/mistral-small-4","config":"aa field terminalbenchv21, artificial analysis intelligence index v4.1.1 suite, effort=none, reasoning=true, run: reasoning, source value 0.209737827715356 is a 0-1 fraction, terminal-bench 2.1, x100 at harvest","measured_date":null}}},{"id":"gemini-3.1-flash-lite","display_name":"Gemini 3.1 Flash Lite","family_id":"gemini","vendor":"Google","status":"superseded","kind":"model","superseded_by":"gemini-3.5-flash-lite","release_date":"2026-05-07","intelligence_index":51.45,"coverage":0.4445,"index_subset_bias":{"offset":-5.14,"peers":10,"method":"subset-knn-v1"},"params_total_b":null,"params_active_b":null,"vram_est":null,"vram_frontier":null,"fits_on":null,"is_moe":false,"is_open_weights":false,"context_window_tok":1048576,"pricing":{"prompt_usd_per_m":0.25,"completion_usd_per_m":1.5,"blended_usd_per_m":0.5625},"scores":{"arena_elo":{"raw":1432.7,"norm":68.23,"trust":3,"source_url":"https://lmarena.ai/leaderboard","config":"text","measured_date":"2026-10-01"},"gpqa_diamond":{"raw":82.22,"norm":80.59,"trust":2,"source_url":"https://artificialanalysis.ai/models/gemini-3-1-flash-lite-preview","config":"aa field gpqa, artificial analysis intelligence index v4.1.1 suite, effort=high, gpqa diamond, reasoning=true, source value 0.822222222222222 is a 0-1 fraction, x100 at harvest","measured_date":null},"hle":{"raw":17.19,"norm":22.34,"trust":2,"source_url":"https://artificialanalysis.ai/models/gemini-3-1-flash-lite-preview","config":"aa field hle, artificial analysis intelligence index v4.1.1 suite, effort=high, humanity's last exam, reasoning=true, source value 0.17191844300278 is a 0-1 fraction, x100 at harvest","measured_date":null},"tau_bench":{"raw":31.29,"norm":15.05,"trust":2,"source_url":"https://artificialanalysis.ai/models/gemini-3-1-flash-lite-preview","config":"aa field tau2, aa field tau2 (not mapped to tau_bench), artificial analysis intelligence index v4.1.1 suite, effort=high, reasoning=true, source value 0.312865497076023 is a 0-1 fraction, x100 at harvest","measured_date":null},"terminal_bench":{"raw":31.09,"norm":30.69,"trust":2,"source_url":"https://artificialanalysis.ai/models/gemini-3-1-flash-lite-preview","config":"aa field terminalbenchv21, artificial analysis intelligence index v4.1.1 suite, effort=high, reasoning=true, source value 0.310861423220974 is a 0-1 fraction, terminal-bench 2.1, x100 at harvest","measured_date":null}}},{"id":"gemma-4-12b-unified-instruct","display_name":"Gemma 4 12B Unified","family_id":"gemma","vendor":"Google DeepMind","status":"current","kind":"model","superseded_by":null,"release_date":"2026-04-02","intelligence_index":51.17,"coverage":0.5635,"index_subset_bias":{"offset":1.17,"peers":10,"method":"subset-knn-v1"},"params_total_b":11.96,"params_active_b":11.96,"vram_est":{"bf16_gb":23.9,"int8_gb":12.7,"int4_gb":7.2,"method":"linear-rom-v1","approximate":true,"basis":"params_total_b"},"vram_frontier":{"efficiency":3.21,"expected_int8_gb":40.7,"method":"frontier-residual-v1","approximate":true},"fits_on":{"intel_b70":"fp8","nvidia_h100_sxm_80g":"fp8","nvidia_dgx_spark":"fp8"},"is_moe":false,"is_open_weights":true,"context_window_tok":256000,"pricing":{"prompt_usd_per_m":null,"completion_usd_per_m":null,"blended_usd_per_m":null},"scores":{"aime":{"raw":77.5,"norm":71.88,"trust":1,"source_url":"https://huggingface.co/google/gemma-4-12B","config":"12b unified column, 2026, instruction-tuned, no tools","measured_date":"2026-07-02"},"gpqa_diamond":{"raw":75.25,"norm":70.77,"trust":2,"source_url":"https://artificialanalysis.ai/models/gemma-4-12b","config":"artificial analysis harness, reasoning mode","measured_date":null},"hle":{"raw":15.66,"norm":20.09,"trust":2,"source_url":"https://artificialanalysis.ai/models/gemma-4-12b","config":"artificial analysis harness, no tools, reasoning mode","measured_date":null},"mmlu_pro":{"raw":77.2,"norm":62,"trust":1,"source_url":"https://huggingface.co/google/gemma-4-12B","config":"12b unified column, instruction-tuned (it) checkpoint, vendor cross-size table","measured_date":"2026-07-02"},"tau_bench":{"raw":36.26,"norm":21.68,"trust":2,"source_url":"https://artificialanalysis.ai/models/gemma-4-12b","config":"artificial analysis harness, reasoning mode, tau2","measured_date":null},"terminal_bench":{"raw":27.34,"norm":26.28,"trust":2,"source_url":"https://artificialanalysis.ai/models/gemma-4-12b","config":"artificial analysis harness, reasoning mode, v2.1","measured_date":null}}},{"id":"claude-haiku-4.5","display_name":"Claude Haiku 4.5","family_id":"claude","vendor":"Anthropic","status":"current","kind":"model","superseded_by":null,"release_date":"2025-10-15","intelligence_index":51.06,"coverage":0.8809,"index_subset_bias":null,"params_total_b":null,"params_active_b":null,"vram_est":null,"vram_frontier":null,"fits_on":null,"is_moe":false,"is_open_weights":false,"context_window_tok":200000,"pricing":{"prompt_usd_per_m":1,"completion_usd_per_m":5,"blended_usd_per_m":2},"scores":{"aime":{"raw":82.708,"norm":78.38,"trust":3,"source_url":"https://www.vals.ai/benchmarks/aime","config":"60 questions), claude-haiku-4-5-20251001-thinking, no tools, vals aime (2024+2025","measured_date":"2026-04-16"},"arc_agi_2":{"raw":4.03,"norm":0,"trust":3,"source_url":"https://arcprize.org/leaderboard","config":"cost_per_task_usd=0.3766, eval=arc-agi-2 semi-private (v2_semi_private), model_group=claude-haiku-4-5-20251001, org=anthropic, run: thinking 32k, system_type=cot","measured_date":"2026-08-21"},"arena_elo":{"raw":1413,"norm":59.44,"trust":3,"source_url":"https://arena.ai/leaderboard/text","config":"arena.ai text leaderboard, claude-haiku-4-5-20251001 (+/-3)","measured_date":null},"gpqa_diamond":{"raw":67.17,"norm":59.39,"trust":2,"source_url":"https://artificialanalysis.ai/models/claude-4-5-haiku-reasoning","config":"aa field gpqa, artificial analysis intelligence index v4.1.1 suite, effort=none, gpqa diamond, reasoning=true, run: reasoning, source value 0.671717171717172 is a 0-1 fraction, x100 at harvest","measured_date":null},"hle":{"raw":10.38,"norm":12.32,"trust":2,"source_url":"https://artificialanalysis.ai/models/claude-4-5-haiku","config":"claude 4.5 haiku (reasoning), no tools","measured_date":null},"mmlu_pro":{"raw":78.715,"norm":64.53,"trust":3,"source_url":"https://www.vals.ai/benchmarks/mmlu_pro","config":"claude-haiku-4-5-20251001-thinking (extended thinking), max output 64k, no tools, temp 1","measured_date":"2026-08-15"},"swe_bench_verified":{"raw":73.3,"norm":70.33,"trust":1,"source_url":"https://www.anthropic.com/news/claude-haiku-4-5","config":"averaged over 50 trials, no test-time compute, 128k thinking budget, bash+file-edit scaffold","measured_date":"2025-10-15"},"tau_bench":{"raw":54.68,"norm":46.24,"trust":2,"source_url":"https://artificialanalysis.ai/models/claude-4-5-haiku","config":"artificial analysis tau-squared bench (telecom), claude 4.5 haiku (reasoning), tau2","measured_date":null},"terminal_bench":{"raw":44.19,"norm":46.11,"trust":2,"source_url":"https://artificialanalysis.ai/models/claude-4-5-haiku-reasoning","config":"aa field terminalbenchv21, artificial analysis intelligence index v4.1.1 suite, effort=none, reasoning=true, run: reasoning, source value 0.441947565543071 is a 0-1 fraction, terminal-bench 2.1, x100 at harvest","measured_date":null}}},{"id":"gpt-o1","display_name":"OpenAI o1","family_id":"gpt","vendor":"OpenAI","status":"superseded","kind":"model","superseded_by":"gpt-o3","release_date":"2024-12-17","intelligence_index":51.06,"coverage":0.6428,"index_subset_bias":{"offset":1.09,"peers":10,"method":"subset-knn-v1"},"params_total_b":null,"params_active_b":null,"vram_est":null,"vram_frontier":null,"fits_on":null,"is_moe":false,"is_open_weights":false,"context_window_tok":200000,"pricing":{"prompt_usd_per_m":15,"completion_usd_per_m":60,"blended_usd_per_m":26.25},"scores":{"aime":{"raw":71.46,"norm":64.32,"trust":3,"source_url":"https://www.vals.ai/benchmarks/aime","config":"archived=true, edition=aime v1, reasoning_effort=high, runner=platform, stderr=1.458, task=overall, updated=2026-04-16","measured_date":"2026-08-19"},"arena_elo":{"raw":1402.3,"norm":54.68,"trust":3,"source_url":"https://lmarena.ai/leaderboard","config":"text","measured_date":"2026-09-27"},"gpqa_diamond":{"raw":73.23,"norm":67.93,"trust":3,"source_url":"https://www.vals.ai/benchmarks/gpqa","config":"edition=gpqa diamond v1, reasoning_effort=high, runner=platform, stderr=2.231, task=overall, updated=2026-08-19","measured_date":"2026-08-19"},"hle":{"raw":7.01,"norm":7.37,"trust":2,"source_url":"https://artificialanalysis.ai/models/o1","config":"aa field hle, artificial analysis intelligence index v4.1.1 suite, effort=none, humanity's last exam, reasoning=true, source value 0.0701 is a 0-1 fraction, x100 at harvest","measured_date":null},"mmlu_pro":{"raw":83.49,"norm":72.48,"trust":3,"source_url":"https://www.vals.ai/benchmarks/mmlu_pro","config":"edition=mmlu pro v1, reasoning_effort=high, runner=platform, stderr=0.364, task=overall, updated=2026-08-19","measured_date":"2026-08-19"},"tau_bench":{"raw":62.57,"norm":56.76,"trust":2,"source_url":"https://artificialanalysis.ai/models/o1","config":"aa field tau2, aa field tau2 (not mapped to tau_bench), artificial analysis intelligence index v4.1.1 suite, effort=none, reasoning=true, source value 0.625730994152047 is a 0-1 fraction, x100 at harvest","measured_date":null},"terminal_bench":{"raw":12.88,"norm":9.27,"trust":2,"source_url":"https://artificialanalysis.ai/models/o1","config":"aa field terminalbenchhard, artificial analysis intelligence index v4.1.1 suite, effort=none, reasoning=true, source value 0.128787878787879 is a 0-1 fraction, terminal-bench hard, x100 at harvest","measured_date":null}}},{"id":"qwen-3-next-80b-a3b-2509-instruct","display_name":"Qwen3 Next 80B A3B Instruct","family_id":"qwen","vendor":"Alibaba","status":"current","kind":"model","superseded_by":null,"release_date":"2025-09-17","intelligence_index":50.45,"coverage":0.7619,"index_subset_bias":{"offset":2.81,"peers":9,"method":"subset-knn-v1"},"params_total_b":81.32,"params_active_b":3,"vram_est":{"bf16_gb":163,"int8_gb":86.2,"int4_gb":48.8,"method":"linear-rom-v1","approximate":true,"basis":"params_total_b"},"vram_frontier":{"efficiency":2.05,"expected_int8_gb":176,"method":"frontier-residual-v1","approximate":true},"fits_on":{"nvidia_h100_sxm_80g":"int4","nvidia_dgx_spark":"fp8"},"is_moe":true,"is_open_weights":true,"context_window_tok":262144,"pricing":{"prompt_usd_per_m":0.1,"completion_usd_per_m":1.1,"blended_usd_per_m":0.35000000000000003},"scores":{"aime":{"raw":66.33,"norm":57.91,"trust":2,"source_url":"https://artificialanalysis.ai/models/qwen3-next-80b-a3b-instruct","config":"aa field aime25, aime-2025, artificial analysis intelligence index v4.1.1 suite, effort=none, reasoning=false, source value 0.663333333333333 is a 0-1 fraction, x100 at harvest","measured_date":null},"arena_elo":{"raw":1399,"norm":53.2,"trust":3,"source_url":"https://lmarena.ai/leaderboard","config":"text","measured_date":"2026-10-03"},"gpqa_diamond":{"raw":73.84,"norm":68.79,"trust":2,"source_url":"https://artificialanalysis.ai/models/qwen3-next-80b-a3b-instruct","config":"aa field gpqa, artificial analysis intelligence index v4.1.1 suite, effort=none, gpqa diamond, reasoning=false, source value 0.738383838383838 is a 0-1 fraction, x100 at harvest","measured_date":null},"hle":{"raw":7.65,"norm":8.31,"trust":2,"source_url":"https://artificialanalysis.ai/models/qwen3-next-80b-a3b-instruct","config":"aa field hle, artificial analysis intelligence index v4.1.1 suite, effort=none, humanity's last exam, reasoning=false, source value 0.0764596848934198 is a 0-1 fraction, x100 at harvest","measured_date":null},"livebench":{"raw":75.8,"norm":79.56,"trust":1,"source_url":"https://huggingface.co/Qwen/Qwen3-Next-80B-A3B-Instruct","config":"global average. official qwen model card, livebench 2024-11-25 release, reasoning section. non-thinking instruct mode. [raw: livebench 20241125]","measured_date":null},"mmlu_pro":{"raw":80.6,"norm":67.67,"trust":1,"source_url":"https://huggingface.co/Qwen/Qwen3-Next-80B-A3B-Instruct","config":"knowledge section. non-thinking instruct mode, no tools. [raw: mmlu-pro], official qwen model card","measured_date":null},"tau_bench":{"raw":21.64,"norm":2.19,"trust":2,"source_url":"https://artificialanalysis.ai/models/qwen3-next-80b-a3b-instruct","config":"aa field tau2, aa field tau2 (not mapped to tau_bench), artificial analysis intelligence index v4.1.1 suite, effort=none, reasoning=false, source value 0.216374269005848 is a 0-1 fraction, x100 at harvest","measured_date":null},"terminal_bench":{"raw":7.58,"norm":3.04,"trust":2,"source_url":"https://artificialanalysis.ai/models/qwen3-next-80b-a3b-instruct","config":"aa field terminalbenchhard, artificial analysis intelligence index v4.1.1 suite, effort=none, reasoning=false, source value 0.0757575757575758 is a 0-1 fraction, terminal-bench hard, x100 at harvest","measured_date":null}}},{"id":"llama-3.1-nemotron-ultra-253b-v1","display_name":"Llama-3.1-Nemotron-Ultra-253B-v1","family_id":"llama","vendor":"Meta","status":"current","kind":"model","superseded_by":null,"release_date":"2025-05-02","intelligence_index":50.39,"coverage":0.5475,"index_subset_bias":{"offset":3.59,"peers":10,"method":"subset-knn-v1"},"params_total_b":253.4,"params_active_b":253.4,"vram_est":{"bf16_gb":507,"int8_gb":269,"int4_gb":152,"method":"linear-rom-v1","approximate":true,"basis":"params_total_b"},"vram_frontier":{"efficiency":0.15,"expected_int8_gb":39.7,"method":"frontier-residual-v1","approximate":true},"fits_on":{},"is_moe":false,"is_open_weights":true,"context_window_tok":131072,"pricing":{"prompt_usd_per_m":null,"completion_usd_per_m":null,"blended_usd_per_m":null},"scores":{"aime":{"raw":72.5,"norm":65.63,"trust":2,"source_url":"https://arxiv.org/pdf/2505.00949","config":"aime25, reasoning on","measured_date":"2025-05-02"},"arena_elo":{"raw":1347.6,"norm":30.3,"trust":3,"source_url":"https://lmarena.ai/leaderboard","config":"text","measured_date":"2026-10-01"},"gpqa_diamond":{"raw":73,"norm":67.61,"trust":2,"source_url":"https://artificialanalysis.ai/leaderboards/models","config":"artificial analysis independent eval, leaderboard cell displayed rounded to whole percent","measured_date":null},"hle":{"raw":7,"norm":7.35,"trust":2,"source_url":"https://artificialanalysis.ai/leaderboards/models","config":"artificial analysis independent eval, leaderboard cell displayed rounded to whole percent, no tools","measured_date":null},"mmlu_pro":{"raw":82.5,"norm":70.83,"trust":2,"source_url":"https://artificialanalysis.ai/evaluations/mmlu-pro","config":"artificial analysis independent eval, reasoning on","measured_date":null}}},{"id":"reka-3-flash","display_name":"Reka Flash 3","family_id":"reka","vendor":"rekaai","status":"current","kind":"model","superseded_by":null,"release_date":"2025-03-12","intelligence_index":50.38,"coverage":0.3572,"index_subset_bias":{"offset":15.18,"peers":10,"method":"subset-knn-v1"},"params_total_b":20.91,"params_active_b":20.91,"vram_est":{"bf16_gb":41.8,"int8_gb":22.2,"int4_gb":12.5,"method":"linear-rom-v1","approximate":true,"basis":"params_total_b"},"vram_frontier":{"efficiency":1.79,"expected_int8_gb":39.7,"method":"frontier-residual-v1","approximate":true},"fits_on":{"intel_b70":"fp8","nvidia_h100_sxm_80g":"fp8","nvidia_dgx_spark":"fp8"},"is_moe":false,"is_open_weights":true,"context_window_tok":65536,"pricing":{"prompt_usd_per_m":0.1,"completion_usd_per_m":0.2,"blended_usd_per_m":0.125},"scores":{"aime":{"raw":70,"norm":62.5,"trust":1,"source_url":"https://huggingface.co/RekaAI/reka-flash-3","config":"aime 2024, cons@64","measured_date":null},"gpqa_diamond":{"raw":61.1,"norm":50.85,"trust":1,"source_url":"https://huggingface.co/RekaAI/reka-flash-3","config":"subset not stated, vendor chart labelled gpqa only","measured_date":null},"mmlu_pro":{"raw":65,"norm":41.67,"trust":1,"source_url":"https://huggingface.co/RekaAI/reka-flash-3","config":"general knowledge panel, vendor model-card chart","measured_date":null}}},{"id":"gpt-oss-120-b-120b","display_name":"gpt-oss-120b","family_id":"gpt-oss","vendor":"OpenAI","status":"current","kind":"model","superseded_by":null,"release_date":"2025-08-05","intelligence_index":50.16,"coverage":0.8016,"index_subset_bias":null,"params_total_b":116.83,"params_active_b":5.1,"vram_est":{"bf16_gb":234,"int8_gb":124,"int4_gb":70.1,"method":"linear-rom-v1","approximate":true,"basis":"params_total_b"},"vram_frontier":{"efficiency":1.41,"expected_int8_gb":175,"method":"frontier-residual-v1","approximate":true},"fits_on":{"nvidia_h100_sxm_80g":"int4","nvidia_dgx_spark":"int4"},"is_moe":true,"is_open_weights":true,"context_window_tok":131072,"pricing":{"prompt_usd_per_m":0.037,"completion_usd_per_m":0.17,"blended_usd_per_m":0.07025},"scores":{"aime":{"raw":92.6,"norm":90.75,"trust":3,"source_url":"https://www.vals.ai/benchmarks/aime","config":"archived=true, edition=aime v1, runner=platform, stderr=1.225, task=overall, updated=2026-04-16","measured_date":"2026-08-19"},"arena_elo":{"raw":1351.6,"norm":32.08,"trust":3,"source_url":"https://lmarena.ai/leaderboard","config":"text","measured_date":"2026-10-03"},"gpqa_diamond":{"raw":78.54,"norm":75.41,"trust":3,"source_url":"https://www.vals.ai/benchmarks/gpqa","config":"edition=gpqa diamond v1, runner=platform, stderr=2.253, task=overall, updated=2026-08-19","measured_date":"2026-08-19"},"hle":{"raw":19.6,"norm":25.88,"trust":2,"source_url":"https://artificialanalysis.ai/models/gpt-oss-120b","config":"aa field hle, artificial analysis intelligence index v4.1.1 suite, effort=high, humanity's last exam, reasoning=true, run: high, source value 0.196014828544949 is a 0-1 fraction, x100 at harvest","measured_date":null},"mmlu_pro":{"raw":79.17,"norm":65.28,"trust":3,"source_url":"https://www.vals.ai/benchmarks/mmlu_pro","config":"edition=mmlu pro v1, runner=platform, stderr=0.395, task=overall, updated=2026-08-19","measured_date":"2026-08-19"},"swe_bench_verified":{"raw":33.6,"norm":26.22,"trust":3,"source_url":"https://www.vals.ai/benchmarks/swebench","config":"edition=swe-bench verified v1, runner=external, stderr=2.114, task=overall, updated=2026-08-19","measured_date":"2026-08-19"},"tau_bench":{"raw":65.79,"norm":61.05,"trust":2,"source_url":"https://artificialanalysis.ai/models/gpt-oss-120b","config":"aa field tau2, aa field tau2 (not mapped to tau_bench), artificial analysis intelligence index v4.1.1 suite, effort=high, reasoning=true, run: high, source value 0.657894736842105 is a 0-1 fraction, x100 at harvest","measured_date":null},"terminal_bench":{"raw":18.7,"norm":16.12,"trust":3,"source_url":"https://www.tbench.ai/leaderboard/terminal-bench/2.0","config":"18.7% +/- 2.7, submitted 2025-11-01. same leaderboard also lists mini-swe-agent + gpt-oss-120b at 14.2% +/- 2.3. [raw: terminal-bench 2.0], terminal-bench 2.0, terminus 2 agent scaffold","measured_date":null}}},{"id":"glm-4.5-air-106b-a12b","display_name":"GLM-4.5-Air","family_id":"glm","vendor":"Zhipu AI (Z.ai)","status":"current","kind":"model","superseded_by":null,"release_date":"2025-07-28","intelligence_index":50.05,"coverage":0.8016,"index_subset_bias":null,"params_total_b":110.47,"params_active_b":12,"vram_est":{"bf16_gb":221,"int8_gb":117,"int4_gb":66.3,"method":"linear-rom-v1","approximate":true,"basis":"params_total_b"},"vram_frontier":{"efficiency":1.49,"expected_int8_gb":174,"method":"frontier-residual-v1","approximate":true},"fits_on":{"nvidia_h100_sxm_80g":"int4","nvidia_dgx_spark":"fp8"},"is_moe":true,"is_open_weights":true,"context_window_tok":131072,"pricing":{"prompt_usd_per_m":0.13,"completion_usd_per_m":0.85,"blended_usd_per_m":0.31},"scores":{"aime":{"raw":80.67,"norm":75.84,"trust":2,"source_url":"https://artificialanalysis.ai/models/glm-4-5-air","config":"aa field aime25, aime-2025, artificial analysis intelligence index v4.1.1 suite, effort=none, reasoning=true, source value 0.806666666666667 is a 0-1 fraction, x100 at harvest","measured_date":null},"arena_elo":{"raw":1373.3,"norm":41.75,"trust":3,"source_url":"https://lmarena.ai/leaderboard","config":"text","measured_date":"2026-09-27"},"gpqa_diamond":{"raw":73.33,"norm":68.07,"trust":2,"source_url":"https://artificialanalysis.ai/models/glm-4-5-air","config":"aa field gpqa, artificial analysis intelligence index v4.1.1 suite, effort=none, gpqa diamond, reasoning=true, source value 0.733333333333333 is a 0-1 fraction, x100 at harvest","measured_date":null},"hle":{"raw":7.04,"norm":7.41,"trust":2,"source_url":"https://artificialanalysis.ai/models/glm-4-5-air","config":"aa field hle, artificial analysis intelligence index v4.1.1 suite, effort=none, humanity's last exam, reasoning=true, source value 0.0704355885078777 is a 0-1 fraction, x100 at harvest","measured_date":null},"mmlu_pro":{"raw":81.4,"norm":69,"trust":2,"source_url":"https://arxiv.org/html/2508.06471v1","config":"glm-4.5 tech report (arxiv 2508.06471) table 4 'reasoning benchmarks', glm-4.5-air column (col 2 of glm-4.5 / glm-4.5-air / o3 / claude opus 4 / gemini 2.5 pro / deepseek r1 0528 / qwen3 235b 2507 / g [raw: mmlu-pro]","measured_date":null},"swe_bench_verified":{"raw":57.6,"norm":52.89,"trust":2,"source_url":"https://arxiv.org/html/2508.06471v1","config":"glm-4.5 tech report table 5, glm-4.5-air column (col 2 of glm-4.5 / glm-4.5-air / o3 / gpt-4.1 / claude opus 4 / claude sonnet 4 / gemini 2.5 pro / deepseek r1 0528 / kimi k2). resolved rate. [raw: swe-bench verified]","measured_date":null},"tau_bench":{"raw":46.49,"norm":35.32,"trust":2,"source_url":"https://artificialanalysis.ai/models/glm-4-5-air","config":"aa field tau2, aa field tau2 (not mapped to tau_bench), artificial analysis intelligence index v4.1.1 suite, effort=none, reasoning=true, source value 0.464912280701754 is a 0-1 fraction, x100 at harvest","measured_date":null},"terminal_bench":{"raw":20.45,"norm":18.18,"trust":2,"source_url":"https://artificialanalysis.ai/models/glm-4-5-air","config":"aa field terminalbenchhard, artificial analysis intelligence index v4.1.1 suite, effort=none, reasoning=true, source value 0.204545454545455 is a 0-1 fraction, terminal-bench hard, x100 at harvest","measured_date":null}}},{"id":"ling-2.6-1t","display_name":"ling-2.6-1t","family_id":"ling","vendor":"inclusionAI","status":"current","kind":"model","superseded_by":null,"release_date":"2026-04-23","intelligence_index":49.86,"coverage":0.3651,"index_subset_bias":{"offset":-6.12,"peers":10,"method":"subset-knn-v1"},"params_total_b":1000,"params_active_b":1000,"vram_est":{"bf16_gb":2000,"int8_gb":1060,"int4_gb":600,"method":"linear-rom-v1","approximate":true,"basis":"params_total_b"},"vram_frontier":null,"fits_on":null,"is_moe":false,"is_open_weights":false,"context_window_tok":262144,"pricing":{"prompt_usd_per_m":null,"completion_usd_per_m":null,"blended_usd_per_m":null},"scores":{"gpqa_diamond":{"raw":75.15,"norm":70.63,"trust":2,"source_url":"https://artificialanalysis.ai/models/ling-2-6-1t","config":"aa field gpqa, artificial analysis intelligence index v4.1.1 suite, effort=none, gpqa diamond, reasoning=false, source value 0.751515151515151 is a 0-1 fraction, x100 at harvest","measured_date":null},"hle":{"raw":8.71,"norm":9.87,"trust":2,"source_url":"https://artificialanalysis.ai/models/ling-2-6-1t","config":"aa field hle, artificial analysis intelligence index v4.1.1 suite, effort=none, humanity's last exam, reasoning=false, source value 0.0871177015755329 is a 0-1 fraction, x100 at harvest","measured_date":null},"tau_bench":{"raw":89.77,"norm":93.03,"trust":2,"source_url":"https://artificialanalysis.ai/models/ling-2-6-1t","config":"aa field tau2, aa field tau2 (not mapped to tau_bench), artificial analysis intelligence index v4.1.1 suite, effort=none, reasoning=false, source value 0.89766081871345 is a 0-1 fraction, x100 at harvest","measured_date":null},"terminal_bench":{"raw":31.06,"norm":30.66,"trust":2,"source_url":"https://artificialanalysis.ai/models/ling-2-6-1t","config":"aa field terminalbenchhard, artificial analysis intelligence index v4.1.1 suite, effort=none, reasoning=false, source value 0.310606060606061 is a 0-1 fraction, terminal-bench hard, x100 at harvest","measured_date":null}}},{"id":"command-a-05-plus-2026","display_name":"Command A+","family_id":"command","vendor":"Cohere","status":"current","kind":"model","superseded_by":null,"release_date":"2026-05-20","intelligence_index":49.65,"coverage":0.3651,"index_subset_bias":{"offset":-6.12,"peers":10,"method":"subset-knn-v1"},"params_total_b":218.75,"params_active_b":null,"vram_est":{"bf16_gb":438,"int8_gb":232,"int4_gb":131,"method":"linear-rom-v1","approximate":true,"basis":"params_total_b"},"vram_frontier":{"efficiency":0.74,"expected_int8_gb":172,"method":"frontier-residual-v1","approximate":true},"fits_on":{},"is_moe":true,"is_open_weights":true,"context_window_tok":192000,"pricing":{"prompt_usd_per_m":0.3,"completion_usd_per_m":1.5,"blended_usd_per_m":0.6},"scores":{"gpqa_diamond":{"raw":76,"norm":71.83,"trust":2,"source_url":"https://artificialanalysis.ai/articles/cohere-launches-open-weights-model-command-a-more-than-a-year-since-the-command-a-release","config":"artificial analysis independent eval; reported rounded (~76%)","measured_date":"2026-05-20"},"hle":{"raw":11,"norm":13.24,"trust":2,"source_url":"https://artificialanalysis.ai/articles/cohere-launches-open-weights-model-command-a-more-than-a-year-since-the-command-a-release","config":"artificial analysis independent eval; reported rounded (~11%)","measured_date":"2026-05-20"},"tau_bench":{"raw":85,"norm":86.67,"trust":1,"source_url":"https://cohere.com/blog/command-a-plus","config":"standard settings + user simulation per barres et al. 2025, tau2/telecom","measured_date":"2026-05-20"},"terminal_bench":{"raw":25,"norm":23.53,"trust":1,"source_url":"https://cohere.com/blog/command-a-plus","config":"terminus-2 harness, artificial analysis methodology","measured_date":"2026-05-20"}}},{"id":"hermes-4-405b","display_name":"Hermes 4 405B","family_id":"hermes","vendor":"nousresearch","status":"current","kind":"model","superseded_by":null,"release_date":"2025-08-26","intelligence_index":49.64,"coverage":0.5159,"index_subset_bias":{"offset":2.69,"peers":10,"method":"subset-knn-v1"},"params_total_b":405.85,"params_active_b":405.85,"vram_est":{"bf16_gb":812,"int8_gb":430,"int4_gb":244,"method":"linear-rom-v1","approximate":true,"basis":"params_total_b"},"vram_frontier":{"efficiency":0.09,"expected_int8_gb":38.9,"method":"frontier-residual-v1","approximate":true},"fits_on":{},"is_moe":false,"is_open_weights":true,"context_window_tok":131072,"pricing":{"prompt_usd_per_m":1,"completion_usd_per_m":3,"blended_usd_per_m":1.5},"scores":{"aime":{"raw":78.1,"norm":72.63,"trust":1,"source_url":"https://arxiv.org/abs/2508.18255","config":"aime'25, pass@1 (64 samples), reasoning mode","measured_date":"2025-08-25"},"gpqa_diamond":{"raw":70.6,"norm":64.23,"trust":1,"source_url":"https://arxiv.org/abs/2508.18255","config":"lighteval, pass@1 (8 samples), reasoning mode","measured_date":"2025-08-25"},"hle":{"raw":10.89,"norm":13.07,"trust":2,"source_url":"https://artificialanalysis.ai/models/hermes-4-llama-3-1-405b-reasoning","config":"aa intelligence index eval, hermes 4 405b (reasoning)","measured_date":null},"mmlu_pro":{"raw":80.6,"norm":67.67,"trust":1,"source_url":"https://arxiv.org/abs/2508.18255","config":"lighteval, reasoning mode","measured_date":"2025-08-25"},"tau_bench":{"raw":22.22,"norm":2.96,"trust":2,"source_url":"https://artificialanalysis.ai/models/hermes-4-llama-3-1-405b-reasoning","config":"aa eval, hermes 4 405b (reasoning), tau2-bench telecom","measured_date":null}}},{"id":"claude-sonnet-4","display_name":"Claude Sonnet 4","family_id":"claude","vendor":"Anthropic","status":"superseded","kind":"model","superseded_by":"claude-sonnet-5","release_date":"2025-05-22","intelligence_index":49.58,"coverage":0.7222,"index_subset_bias":{"offset":-1.42,"peers":10,"method":"subset-knn-v1"},"params_total_b":null,"params_active_b":null,"vram_est":null,"vram_frontier":null,"fits_on":null,"is_moe":false,"is_open_weights":false,"context_window_tok":200000,"pricing":{"prompt_usd_per_m":3,"completion_usd_per_m":15,"blended_usd_per_m":6},"scores":{"aime":{"raw":76.25,"norm":70.31,"trust":3,"source_url":"https://www.vals.ai/benchmarks/aime","config":"archived=true, edition=aime v1, run: anthropic/claude-sonnet-4-20250514-thinking, runner=platform, stderr=1.435, task=overall, updated=2026-04-16","measured_date":"2026-08-19"},"arc_agi_2":{"raw":5.93,"norm":1.03,"trust":3,"source_url":"https://arcprize.org/leaderboard","config":"cost_per_task_usd=0.4857, eval=arc-agi-2 semi-private (v2_semi_private), model_group=claude-sonnet-4-20250514-thinking, org=anthropic, run: thinking 16k, system_type=cot","measured_date":"2026-08-21"},"arena_elo":{"raw":1399.8,"norm":53.56,"trust":3,"source_url":"https://arena.ai/leaderboard/text","config":"35220 votes, arena entry claude-sonnet-4-20250514-thinking-32k, leaderboard text-overall-style_control, rank 144, run: claude-sonnet-4-20250514-thinking-32k, style control, text/overall, vote cutoff 2026-08-21","measured_date":"2026-08-21"},"gpqa_diamond":{"raw":75,"norm":70.42,"trust":3,"source_url":"https://www.vals.ai/benchmarks/gpqa","config":"edition=gpqa diamond v1, run: anthropic/claude-sonnet-4-20250514-thinking, runner=platform, stderr=2.191, task=overall, updated=2026-08-19","measured_date":"2026-08-19"},"hle":{"raw":10.7,"norm":12.79,"trust":2,"source_url":"https://artificialanalysis.ai/models/claude-4-sonnet-thinking","config":"aa field hle, artificial analysis intelligence index v4.1.1 suite, effort=none, humanity's last exam, reasoning=true, run: reasoning, source value 0.107043558850788 is a 0-1 fraction, x100 at harvest","measured_date":null},"mmlu_pro":{"raw":83.86,"norm":73.1,"trust":3,"source_url":"https://www.vals.ai/benchmarks/mmlu_pro","config":"edition=mmlu pro v1, run: anthropic/claude-sonnet-4-20250514-thinking, runner=platform, stderr=0.361, task=overall, updated=2026-08-19","measured_date":"2026-08-19"},"tau_bench":{"raw":64.62,"norm":59.49,"trust":2,"source_url":"https://artificialanalysis.ai/models/claude-4-sonnet-thinking","config":"aa field tau2, aa field tau2 (not mapped to tau_bench), artificial analysis intelligence index v4.1.1 suite, effort=none, reasoning=true, run: reasoning, source value 0.646198830409357 is a 0-1 fraction, x100 at harvest","measured_date":null},"terminal_bench":{"raw":36.33,"norm":36.86,"trust":2,"source_url":"https://artificialanalysis.ai/models/claude-4-sonnet-thinking","config":"aa field terminalbenchv21, artificial analysis intelligence index v4.1.1 suite, effort=none, reasoning=true, run: reasoning, source value 0.363295880149813 is a 0-1 fraction, terminal-bench 2.1, x100 at harvest","measured_date":null}}},{"id":"mistral-2512-large","display_name":"Mistral Large 3 2512","family_id":"mistral","vendor":"Mistral AI","status":"current","kind":"model","superseded_by":null,"release_date":"2025-12-01","intelligence_index":49.28,"coverage":0.5159,"index_subset_bias":{"offset":12.3,"peers":10,"method":"subset-knn-v1"},"params_total_b":null,"params_active_b":null,"vram_est":null,"vram_frontier":null,"fits_on":null,"is_moe":false,"is_open_weights":false,"context_window_tok":262144,"pricing":{"prompt_usd_per_m":0.5,"completion_usd_per_m":1.5,"blended_usd_per_m":0.75},"scores":{"aime":{"raw":42.92,"norm":28.65,"trust":3,"source_url":"https://www.vals.ai/benchmarks/aime","config":"archived=true, edition=aime v1, runner=platform, stderr=0.884, task=overall, updated=2026-04-16","measured_date":"2026-08-19"},"gpqa_diamond":{"raw":68.43,"norm":61.17,"trust":3,"source_url":"https://www.vals.ai/benchmarks/gpqa","config":"edition=gpqa diamond v1, runner=platform, stderr=2.372, task=overall, updated=2026-08-19","measured_date":"2026-08-19"},"mmlu_pro":{"raw":79.82,"norm":66.37,"trust":3,"source_url":"https://www.vals.ai/benchmarks/mmlu_pro","config":"edition=mmlu pro v1, runner=platform, stderr=0.472, task=overall, updated=2026-08-19","measured_date":"2026-08-19"},"swe_bench_verified":{"raw":41.4,"norm":34.89,"trust":3,"source_url":"https://www.vals.ai/benchmarks/swebench","config":"edition=swe-bench verified v1, runner=external, stderr=2.205, task=overall, updated=2026-08-19","measured_date":"2026-08-19"}}},{"id":"nemotron-3.5-lightning","display_name":"Nemotron 3.5 Lightning","family_id":"nemotron","vendor":"NVIDIA","status":"current","kind":"model","superseded_by":null,"release_date":"2026-08-11","intelligence_index":49,"coverage":0.5953,"index_subset_bias":{"offset":-1.43,"peers":10,"method":"subset-knn-v1"},"params_total_b":31.58,"params_active_b":3,"vram_est":{"bf16_gb":63.2,"int8_gb":33.5,"int4_gb":18.9,"method":"linear-rom-v1","approximate":true,"basis":"params_total_b"},"vram_frontier":{"efficiency":5.05,"expected_int8_gb":169,"method":"frontier-residual-v1","approximate":true},"fits_on":{"intel_b70":"int4","nvidia_h100_sxm_80g":"fp8","nvidia_dgx_spark":"fp8"},"is_moe":true,"is_open_weights":true,"context_window_tok":262144,"pricing":{"prompt_usd_per_m":0.06,"completion_usd_per_m":0.16,"blended_usd_per_m":0.08499999999999999},"scores":{"gpqa_diamond":{"raw":74.34,"norm":69.49,"trust":2,"source_url":"https://artificialanalysis.ai/models/nemotron-3-5-lightning","config":"aa field gpqa, artificial analysis intelligence index v4.1.1 suite, effort=none, gpqa diamond, reasoning=true, source value 0.743434343434343 is a 0-1 fraction, x100 at harvest","measured_date":null},"hle":{"raw":10.57,"norm":12.6,"trust":2,"source_url":"https://artificialanalysis.ai/models/nemotron-3-5-lightning","config":"aa field hle, artificial analysis intelligence index v4.1.1 suite, effort=none, humanity's last exam, reasoning=true, source value 0.105653382761817 is a 0-1 fraction, x100 at harvest","measured_date":null},"mmlu_pro":{"raw":81.94,"norm":69.9,"trust":1,"source_url":"https://huggingface.co/nvidia/NVIDIA-Nemotron-3.5-Lightning-30B-A3B-BF16","config":"bf16, nvidia nemo gym harness","measured_date":"2026-08-11"},"swe_bench_verified":{"raw":51.56,"norm":46.18,"trust":1,"source_url":"https://huggingface.co/nvidia/NVIDIA-Nemotron-3.5-Lightning-30B-A3B-BF16","config":"bf16","measured_date":"2026-08-11"},"terminal_bench":{"raw":24.34,"norm":22.75,"trust":2,"source_url":"https://artificialanalysis.ai/models/nemotron-3-5-lightning","config":"aa field terminalbenchv21, artificial analysis intelligence index v4.1.1 suite, effort=none, reasoning=true, source value 0.243445692883895 is a 0-1 fraction, terminal-bench 2.1, x100 at harvest","measured_date":null}}},{"id":"glm-4.7-flash","display_name":"GLM 4.7 Flash","family_id":"glm","vendor":"Zhipu AI (Z.ai)","status":"current","kind":"model","superseded_by":null,"release_date":"2026-01-19","intelligence_index":48.1,"coverage":0.6826,"index_subset_bias":{"offset":-0.8,"peers":10,"method":"subset-knn-v1"},"params_total_b":31.22,"params_active_b":null,"vram_est":{"bf16_gb":62.4,"int8_gb":33.1,"int4_gb":18.7,"method":"linear-rom-v1","approximate":true,"basis":"params_total_b"},"vram_frontier":{"efficiency":4.98,"expected_int8_gb":165,"method":"frontier-residual-v1","approximate":true},"fits_on":{"intel_b70":"int4","nvidia_h100_sxm_80g":"fp8","nvidia_dgx_spark":"fp8"},"is_moe":true,"is_open_weights":true,"context_window_tok":200000,"pricing":{"prompt_usd_per_m":0.0605,"completion_usd_per_m":0.4,"blended_usd_per_m":0.145375},"scores":{"aime":{"raw":91.6,"norm":89.5,"trust":1,"source_url":"https://huggingface.co/zai-org/GLM-4.7-Flash","config":"aime 2025, card's recommended eval params temperature 1.0 class reasoning settings [raw: aime 25], glm-4.7-flash column, no tools, official z.ai model card table, thinking mode","measured_date":null},"arena_elo":{"raw":1364.9,"norm":38.01,"trust":3,"source_url":"https://lmarena.ai/leaderboard","config":"text","measured_date":"2026-10-03"},"gpqa_diamond":{"raw":58.08,"norm":46.59,"trust":2,"source_url":"https://artificialanalysis.ai/models/glm-4-7-flash","config":"aa field gpqa, artificial analysis intelligence index v4.1.1 suite, effort=none, gpqa diamond, reasoning=true, run: reasoning, source value 0.580808080808081 is a 0-1 fraction, x100 at harvest","measured_date":null},"hle":{"raw":7.6,"norm":8.24,"trust":2,"source_url":"https://artificialanalysis.ai/models/glm-4-7-flash","config":"aa field hle, artificial analysis intelligence index v4.1.1 suite, effort=none, humanity's last exam, reasoning=true, run: reasoning, source value 0.0759962928637627 is a 0-1 fraction, x100 at harvest","measured_date":null},"swe_bench_verified":{"raw":59.2,"norm":54.67,"trust":1,"source_url":"https://huggingface.co/zai-org/GLM-4.7-Flash","config":"card's recommended eval params: temperature 0.7, glm-4.7-flash column, instance-set size not stated on card [raw: swe-bench verified], max_new_tokens 16384, official z.ai model card table, top_p 1.0","measured_date":null},"tau_bench":{"raw":98.83,"norm":100,"trust":2,"source_url":"https://artificialanalysis.ai/models/glm-4-7-flash","config":"aa field tau2, aa field tau2 (not mapped to tau_bench), artificial analysis intelligence index v4.1.1 suite, effort=none, reasoning=true, run: reasoning, source value 0.988304093567251 is a 0-1 fraction, x100 at harvest","measured_date":null},"terminal_bench":{"raw":21.97,"norm":19.96,"trust":2,"source_url":"https://artificialanalysis.ai/models/glm-4-7-flash","config":"aa field terminalbenchhard, artificial analysis intelligence index v4.1.1 suite, effort=none, reasoning=true, run: reasoning, source value 0.21969696969697 is a 0-1 fraction, terminal-bench hard, x100 at harvest","measured_date":null}}},{"id":"gpt-o4-mini","display_name":"OpenAI o4 Mini","family_id":"gpt","vendor":"OpenAI","status":"current","kind":"model","superseded_by":null,"release_date":"2025-04-16","intelligence_index":47.75,"coverage":0.7222,"index_subset_bias":{"offset":-1.42,"peers":10,"method":"subset-knn-v1"},"params_total_b":null,"params_active_b":null,"vram_est":null,"vram_frontier":null,"fits_on":null,"is_moe":false,"is_open_weights":false,"context_window_tok":200000,"pricing":{"prompt_usd_per_m":1.1,"completion_usd_per_m":4.4,"blended_usd_per_m":1.9250000000000003},"scores":{"aime":{"raw":83.67,"norm":79.59,"trust":3,"source_url":"https://www.vals.ai/benchmarks/aime","config":"archived=true, edition=aime v1, reasoning_effort=high, runner=platform, stderr=1.178, task=overall, updated=2026-04-16","measured_date":"2026-08-19"},"arc_agi_2":{"raw":6.11,"norm":1.23,"trust":3,"source_url":"https://arcprize.org/leaderboard","config":"cost_per_task_usd=0.856, eval=arc-agi-2 semi-private (v2_semi_private), model_group=o4-mini, org=openai, run: high, system_type=cot","measured_date":"2026-08-21"},"arena_elo":{"raw":1390.8,"norm":49.55,"trust":3,"source_url":"https://lmarena.ai/leaderboard","config":"text","measured_date":"2026-10-01"},"gpqa_diamond":{"raw":74.5,"norm":69.72,"trust":3,"source_url":"https://www.vals.ai/benchmarks/gpqa","config":"edition=gpqa diamond v1, reasoning_effort=high, runner=platform, stderr=2.19, task=overall, updated=2026-08-19","measured_date":"2026-08-19"},"hle":{"raw":14.28,"norm":18.06,"trust":3,"source_url":"https://labs.scale.com/leaderboard/humanitys_last_exam","config":"14.28 +/- 1.37. identical to openai's own reported 'o4-mini (no tools)' = 14.28. same leaderboard lists o4-mini (high) = 18.08 +/- 1.51. [raw: humanity's last exam], no tools, o4-mini (medium) (april 2025), text-only hle","measured_date":null},"mmlu_pro":{"raw":80.56,"norm":67.6,"trust":3,"source_url":"https://www.vals.ai/benchmarks/mmlu_pro","config":"edition=mmlu pro v1, reasoning_effort=high, runner=platform, stderr=0.386, task=overall, updated=2026-08-19","measured_date":"2026-08-19"},"tau_bench":{"raw":55.56,"norm":47.41,"trust":2,"source_url":"https://artificialanalysis.ai/models/o4-mini","config":"aa field tau2, aa field tau2 (not mapped to tau_bench), artificial analysis intelligence index v4.1.1 suite, effort=high, reasoning=true, run: high, source value 0.555555555555556 is a 0-1 fraction, x100 at harvest","measured_date":null},"terminal_bench":{"raw":18.5,"norm":15.88,"trust":3,"source_url":"https://www.tbench.ai/leaderboard/terminal-bench/1.0","config":"18.5% +/- 2.7, codex cli 20.0%. [raw: terminal-bench], dated 2025-05-15. other agents on the same board with o4-mini: goose 27.5%, terminal-bench 1.0, terminus 1 agent (stanford reference harness)","measured_date":null}}},{"id":"mercury-2","display_name":"Mercury 2","family_id":"mercury","vendor":"inception","status":"current","kind":"model","superseded_by":null,"release_date":"2026-03-04","intelligence_index":46.86,"coverage":0.4445,"index_subset_bias":{"offset":-6.43,"peers":10,"method":"subset-knn-v1"},"params_total_b":null,"params_active_b":null,"vram_est":null,"vram_frontier":null,"fits_on":null,"is_moe":false,"is_open_weights":false,"context_window_tok":128000,"pricing":{"prompt_usd_per_m":0.25,"completion_usd_per_m":0.75,"blended_usd_per_m":0.375},"scores":{"arena_elo":{"raw":1343.3,"norm":28.38,"trust":3,"source_url":"https://lmarena.ai/leaderboard","config":"text","measured_date":"2026-10-03"},"gpqa_diamond":{"raw":76.97,"norm":73.2,"trust":2,"source_url":"https://artificialanalysis.ai/models/mercury-2","config":"aa field gpqa, artificial analysis intelligence index v4.1.1 suite, effort=high, gpqa diamond, reasoning=true, source value 0.76969696969697 is a 0-1 fraction, x100 at harvest","measured_date":null},"hle":{"raw":17.15,"norm":22.28,"trust":2,"source_url":"https://artificialanalysis.ai/models/mercury-2","config":"aa field hle, artificial analysis intelligence index v4.1.1 suite, effort=high, humanity's last exam, reasoning=true, source value 0.171455050973123 is a 0-1 fraction, x100 at harvest","measured_date":null},"tau_bench":{"raw":70.76,"norm":67.68,"trust":2,"source_url":"https://artificialanalysis.ai/models/mercury-2","config":"aa field tau2, aa field tau2 (not mapped to tau_bench), artificial analysis intelligence index v4.1.1 suite, effort=high, reasoning=true, source value 0.707602339181287 is a 0-1 fraction, x100 at harvest","measured_date":null},"terminal_bench":{"raw":27.34,"norm":26.28,"trust":2,"source_url":"https://artificialanalysis.ai/models/mercury-2","config":"aa field terminalbenchv21, artificial analysis intelligence index v4.1.1 suite, effort=high, reasoning=true, source value 0.273408239700375 is a 0-1 fraction, terminal-bench 2.1, x100 at harvest","measured_date":null}}},{"id":"gpt-oss-20-b-20b","display_name":"gpt-oss-20b","family_id":"gpt-oss","vendor":"OpenAI","status":"current","kind":"model","superseded_by":null,"release_date":"2025-08-05","intelligence_index":46.73,"coverage":0.8016,"index_subset_bias":null,"params_total_b":20.91,"params_active_b":3.6,"vram_est":{"bf16_gb":41.8,"int8_gb":22.2,"int4_gb":12.5,"method":"linear-rom-v1","approximate":true,"basis":"params_total_b"},"vram_frontier":{"efficiency":7.13,"expected_int8_gb":158,"method":"frontier-residual-v1","approximate":true},"fits_on":{"intel_b70":"fp8","nvidia_h100_sxm_80g":"fp8","nvidia_dgx_spark":"fp8"},"is_moe":true,"is_open_weights":true,"context_window_tok":131072,"pricing":{"prompt_usd_per_m":0.018,"completion_usd_per_m":0.09,"blended_usd_per_m":0.036},"scores":{"aime":{"raw":86.04,"norm":82.55,"trust":3,"source_url":"https://www.vals.ai/benchmarks/aime","config":"archived=true, edition=aime v1, runner=platform, stderr=1.133, task=overall, updated=2026-04-16","measured_date":"2026-08-19"},"arena_elo":{"raw":1317.6,"norm":16.92,"trust":3,"source_url":"https://lmarena.ai/leaderboard","config":"text","measured_date":"2026-09-27"},"gpqa_diamond":{"raw":68.94,"norm":61.89,"trust":3,"source_url":"https://www.vals.ai/benchmarks/gpqa","config":"edition=gpqa diamond v1, runner=platform, stderr=2.465, task=overall, updated=2026-08-19","measured_date":"2026-08-19"},"hle":{"raw":10.98,"norm":13.21,"trust":2,"source_url":"https://artificialanalysis.ai/models/gpt-oss-20b","config":"aa field hle, artificial analysis intelligence index v4.1.1 suite, effort=high, humanity's last exam, reasoning=true, run: high, source value 0.10982391102873 is a 0-1 fraction, x100 at harvest","measured_date":null},"mmlu_pro":{"raw":71.64,"norm":52.73,"trust":3,"source_url":"https://www.vals.ai/benchmarks/mmlu_pro","config":"edition=mmlu pro v1, runner=platform, stderr=0.447, task=overall, updated=2026-08-19","measured_date":"2026-08-19"},"swe_bench_verified":{"raw":60.7,"norm":56.33,"trust":2,"source_url":"https://arxiv.org/abs/2508.10925","config":"reasoning: high","measured_date":"2025-08-05"},"tau_bench":{"raw":60.23,"norm":53.64,"trust":2,"source_url":"https://artificialanalysis.ai/models/gpt-oss-20b","config":"aa field tau2, aa field tau2 (not mapped to tau_bench), artificial analysis intelligence index v4.1.1 suite, effort=high, reasoning=true, run: high, source value 0.60233918128655 is a 0-1 fraction, x100 at harvest","measured_date":null},"terminal_bench":{"raw":13.86,"norm":10.42,"trust":2,"source_url":"https://artificialanalysis.ai/models/gpt-oss-20b","config":"aa field terminalbenchv21, artificial analysis intelligence index v4.1.1 suite, effort=high, reasoning=true, run: high, source value 0.138576779026217 is a 0-1 fraction, terminal-bench 2.1, x100 at harvest","measured_date":null}}},{"id":"llama-3.3-nemotron-super-49b-v1.5","display_name":"Llama-3.3-Nemotron-Super-49B-v1.5","family_id":"llama","vendor":"Meta","status":"current","kind":"model","superseded_by":null,"release_date":"2025-07-25","intelligence_index":46.15,"coverage":0.5635,"index_subset_bias":{"offset":0.3,"peers":10,"method":"subset-knn-v1"},"params_total_b":49,"params_active_b":49,"vram_est":{"bf16_gb":98,"int8_gb":51.9,"int4_gb":29.4,"method":"linear-rom-v1","approximate":true,"basis":"params_total_b"},"vram_frontier":{"efficiency":0.68,"expected_int8_gb":35.1,"method":"frontier-residual-v1","approximate":true},"fits_on":{"nvidia_h100_sxm_80g":"fp8","nvidia_dgx_spark":"fp8"},"is_moe":false,"is_open_weights":true,"context_window_tok":131072,"pricing":{"prompt_usd_per_m":null,"completion_usd_per_m":null,"blended_usd_per_m":null},"scores":{"aime":{"raw":76.67,"norm":70.84,"trust":2,"source_url":"https://artificialanalysis.ai/models/llama-nemotron-super-49b-v1-5-reasoning","config":"aime 2025, artificial analysis harness, reasoning mode","measured_date":null},"gpqa_diamond":{"raw":74.85,"norm":70.21,"trust":2,"source_url":"https://artificialanalysis.ai/models/llama-nemotron-super-49b-v1-5-reasoning","config":"artificial analysis harness, reasoning mode","measured_date":null},"hle":{"raw":7.32,"norm":7.82,"trust":2,"source_url":"https://artificialanalysis.ai/models/llama-nemotron-super-49b-v1-5-reasoning","config":"artificial analysis harness, no tools, reasoning mode","measured_date":null},"mmlu_pro":{"raw":79.53,"norm":65.88,"trust":1,"source_url":"https://huggingface.co/nvidia/Llama-3_3-Nemotron-Super-49B-v1_5","config":"cot, pass@1 avg over 1 run, reasoning on","measured_date":null},"tau_bench":{"raw":28.07,"norm":10.76,"trust":2,"source_url":"https://artificialanalysis.ai/models/llama-nemotron-super-49b-v1-5-reasoning","config":"artificial analysis harness, reasoning mode, tau2","measured_date":null},"terminal_bench":{"raw":5.3,"norm":0.35,"trust":2,"source_url":"https://artificialanalysis.ai/models/llama-nemotron-super-49b-v1-5-reasoning","config":"artificial analysis harness, reasoning mode","measured_date":null}}},{"id":"claude-opus-4","display_name":"claude-4-opus","family_id":"claude","vendor":"Anthropic","status":"superseded","kind":"model","superseded_by":"claude-opus-5.5","release_date":"2025-05-22","intelligence_index":46.08,"coverage":0.7222,"index_subset_bias":{"offset":-1.5,"peers":10,"method":"subset-knn-v1"},"params_total_b":null,"params_active_b":null,"vram_est":null,"vram_frontier":null,"fits_on":null,"is_moe":false,"is_open_weights":false,"context_window_tok":200000,"pricing":{"prompt_usd_per_m":null,"completion_usd_per_m":null,"blended_usd_per_m":null},"scores":{"aime":{"raw":41.25,"norm":26.56,"trust":3,"source_url":"https://www.vals.ai/benchmarks/aime","config":"archived=true, edition=aime v1, runner=platform, stderr=1.152, task=overall, updated=2026-04-16","measured_date":"2026-08-19"},"arc_agi_2":{"raw":8.61,"norm":4.01,"trust":3,"source_url":"https://arcprize.org/leaderboard","config":"cost_per_task_usd=1.9284, eval=arc-agi-2 semi-private (v2_semi_private), model_group=claude-opus-4-20250514-thinking, org=anthropic, run: thinking 16k, system_type=cot","measured_date":"2026-08-21"},"arena_elo":{"raw":1412.6,"norm":59.27,"trust":3,"source_url":"https://arena.ai/leaderboard/text","config":"44326 votes, arena entry claude-opus-4-20250514, leaderboard text-overall-style_control, rank 128, style control, text/overall, vote cutoff 2026-08-21","measured_date":"2026-08-21"},"gpqa_diamond":{"raw":71.72,"norm":65.8,"trust":3,"source_url":"https://www.vals.ai/benchmarks/gpqa","config":"edition=gpqa diamond v1, runner=platform, stderr=2.261, task=overall, updated=2026-08-19","measured_date":"2026-08-19"},"hle":{"raw":12.33,"norm":15.19,"trust":2,"source_url":"https://artificialanalysis.ai/models/claude-4-opus-thinking","config":"aa field hle, artificial analysis intelligence index v4.1.1 suite, effort=none, humanity's last exam, reasoning=true, run: reasoning, source value 0.123262279888786 is a 0-1 fraction, x100 at harvest","measured_date":null},"mmlu_pro":{"raw":86.17,"norm":76.95,"trust":3,"source_url":"https://www.vals.ai/benchmarks/mmlu_pro","config":"edition=mmlu pro v1, runner=platform, stderr=0.337, task=overall, updated=2026-08-19","measured_date":"2026-08-19"},"tau_bench":{"raw":73.39,"norm":71.19,"trust":2,"source_url":"https://artificialanalysis.ai/models/claude-4-opus-thinking","config":"aa field tau2, aa field tau2 (not mapped to tau_bench), artificial analysis intelligence index v4.1.1 suite, effort=none, reasoning=true, run: reasoning, source value 0.733918128654971 is a 0-1 fraction, x100 at harvest","measured_date":null},"terminal_bench":{"raw":31.06,"norm":30.66,"trust":2,"source_url":"https://artificialanalysis.ai/models/claude-4-opus-thinking","config":"aa field terminalbenchhard, artificial analysis intelligence index v4.1.1 suite, effort=none, reasoning=true, run: reasoning, source value 0.310606060606061 is a 0-1 fraction, terminal-bench hard, x100 at harvest","measured_date":null}}},{"id":"gpt-o3-mini-high","display_name":"OpenAI o3 Mini High","family_id":"gpt","vendor":"OpenAI","status":"current","kind":"model","superseded_by":null,"release_date":"2025-02-12","intelligence_index":45.94,"coverage":0.7222,"index_subset_bias":{"offset":-1.3,"peers":8,"method":"subset-knn-v1"},"params_total_b":null,"params_active_b":null,"vram_est":null,"vram_frontier":null,"fits_on":null,"is_moe":false,"is_open_weights":false,"context_window_tok":200000,"pricing":{"prompt_usd_per_m":1.1,"completion_usd_per_m":4.4,"blended_usd_per_m":1.9250000000000003},"scores":{"aime":{"raw":86.67,"norm":83.34,"trust":3,"source_url":"https://matharena.ai/?comp=aime--aime_2025","config":"accuracy column 86.67%, aime 2025, leaderboard row \"o3-mini (high)\", no tools (matharena standard harness) [raw: aime 2025]","measured_date":null},"arc_agi_2":{"raw":3,"norm":0,"trust":3,"source_url":"https://arcprize.org/leaderboard","config":"2025-01-31, arc-agi-2 column = 3.0% (arc-agi-1 column = 34.5% on the same row), cost/task $0.547 [raw: arc-agi-2], openai, row \"o3-mini (high)\", system type cot","measured_date":null},"arena_elo":{"raw":1363.6,"norm":37.43,"trust":3,"source_url":"https://lmarena.ai/leaderboard","config":"text","measured_date":"2026-09-27"},"gpqa_diamond":{"raw":77.27,"norm":73.62,"trust":2,"source_url":"https://artificialanalysis.ai/models/o3-mini-high","config":"aa field gpqa, artificial analysis intelligence index v4.1.1 suite, effort=high, gpqa diamond, reasoning=true, run: high, source value 0.772727272727273 is a 0-1 fraction, x100 at harvest","measured_date":null},"hle":{"raw":12.04,"norm":14.76,"trust":2,"source_url":"https://artificialanalysis.ai/models/o3-mini-high","config":"aa field hle, artificial analysis intelligence index v4.1.1 suite, effort=high, humanity's last exam, reasoning=true, run: high, source value 0.1204 is a 0-1 fraction, x100 at harvest","measured_date":null},"livebench":{"raw":75.88,"norm":79.73,"trust":2,"source_url":"https://epoch.ai/data/external_benchmarks/live_bench.csv","config":"epoch ai mirror of the livebench.ai leaderboard (o3-mini rows have s [raw: livebench], global average, livebench version livebench-2024-11-25, row id \"o3-mini-2025-01-31-high\" / model version \"o3-mini-2025-01-31_high\"","measured_date":null},"tau_bench":{"raw":31.29,"norm":15.05,"trust":2,"source_url":"https://artificialanalysis.ai/models/o3-mini-high","config":"aa field tau2, aa field tau2 (not mapped to tau_bench), artificial analysis intelligence index v4.1.1 suite, effort=high, reasoning=true, run: high, source value 0.312865497076023 is a 0-1 fraction, x100 at harvest","measured_date":null},"terminal_bench":{"raw":6.06,"norm":1.25,"trust":2,"source_url":"https://artificialanalysis.ai/models/o3-mini-high","config":"aa field terminalbenchhard, artificial analysis intelligence index v4.1.1 suite, effort=high, reasoning=true, run: high, source value 0.0606060606060606 is a 0-1 fraction, terminal-bench hard, x100 at harvest","measured_date":null}}},{"id":"kimi-k2-0905","display_name":"Kimi K2 0905","family_id":"kimi","vendor":"Moonshot AI","status":"current","kind":"model","superseded_by":null,"release_date":"2025-09-09","intelligence_index":45.91,"coverage":0.4445,"index_subset_bias":{"offset":-2.36,"peers":10,"method":"subset-knn-v1"},"params_total_b":1026.47,"params_active_b":32,"vram_est":{"bf16_gb":2053,"int8_gb":1088,"int4_gb":616,"method":"linear-rom-v1","approximate":true,"basis":"params_total_b"},"vram_frontier":{"efficiency":0.14,"expected_int8_gb":154,"method":"frontier-residual-v1","approximate":true},"fits_on":{},"is_moe":true,"is_open_weights":true,"context_window_tok":262144,"pricing":{"prompt_usd_per_m":0.6,"completion_usd_per_m":2.5,"blended_usd_per_m":1.075},"scores":{"aime":{"raw":57.33,"norm":46.66,"trust":2,"source_url":"https://artificialanalysis.ai/models/kimi-k2-0905","config":"aa field aime25, aime-2025, artificial analysis intelligence index v4.1.1 suite, effort=none, reasoning=false, source value 0.573333333333333 is a 0-1 fraction, x100 at harvest","measured_date":null},"gpqa_diamond":{"raw":76.67,"norm":72.77,"trust":2,"source_url":"https://artificialanalysis.ai/models/kimi-k2-0905","config":"aa field gpqa, artificial analysis intelligence index v4.1.1 suite, effort=none, gpqa diamond, reasoning=false, source value 0.766666666666667 is a 0-1 fraction, x100 at harvest","measured_date":null},"hle":{"raw":6.39,"norm":6.46,"trust":2,"source_url":"https://artificialanalysis.ai/models/kimi-k2-0905","config":"aa field hle, artificial analysis intelligence index v4.1.1 suite, effort=none, humanity's last exam, reasoning=false, source value 0.0639481000926784 is a 0-1 fraction, x100 at harvest","measured_date":null},"tau_bench":{"raw":73.39,"norm":71.19,"trust":2,"source_url":"https://artificialanalysis.ai/models/kimi-k2-0905","config":"aa field tau2, aa field tau2 (not mapped to tau_bench), artificial analysis intelligence index v4.1.1 suite, effort=none, reasoning=false, source value 0.733918128654971 is a 0-1 fraction, x100 at harvest","measured_date":null},"terminal_bench":{"raw":23.48,"norm":21.74,"trust":2,"source_url":"https://artificialanalysis.ai/models/kimi-k2-0905","config":"aa field terminalbenchhard, artificial analysis intelligence index v4.1.1 suite, effort=none, reasoning=false, source value 0.234848484848485 is a 0-1 fraction, terminal-bench hard, x100 at harvest","measured_date":null}}},{"id":"solar-pro-3","display_name":"Solar Pro 3","family_id":"solar","vendor":"upstage","status":"superseded","kind":"model","superseded_by":"solar-pro-4","release_date":"2026-01-27","intelligence_index":45.36,"coverage":0.3651,"index_subset_bias":{"offset":-8.16,"peers":10,"method":"subset-knn-v1"},"params_total_b":null,"params_active_b":null,"vram_est":null,"vram_frontier":null,"fits_on":null,"is_moe":false,"is_open_weights":false,"context_window_tok":131072,"pricing":{"prompt_usd_per_m":0.15,"completion_usd_per_m":0.6,"blended_usd_per_m":0.26249999999999996},"scores":{"gpqa_diamond":{"raw":72.42,"norm":66.79,"trust":2,"source_url":"https://artificialanalysis.ai/models/solar-pro-3","config":"artificial analysis independent evaluation","measured_date":null},"hle":{"raw":10.29,"norm":12.19,"trust":2,"source_url":"https://artificialanalysis.ai/models/solar-pro-3","config":"artificial analysis independent evaluation","measured_date":null},"tau_bench":{"raw":86.26,"norm":88.35,"trust":2,"source_url":"https://artificialanalysis.ai/models/solar-pro-3","config":"artificial analysis independent evaluation, tau2/telecom","measured_date":null},"terminal_bench":{"raw":11.99,"norm":8.22,"trust":2,"source_url":"https://artificialanalysis.ai/models/solar-pro-3","config":"2.1, artificial analysis independent evaluation","measured_date":null}}},{"id":"llama-3.1-nemotron-ultra-253b","display_name":"Llama-3.1-Nemotron-Ultra-253B","family_id":"llama","vendor":"Meta","status":"superseded","kind":"model","superseded_by":"llama-3.1-nemotron-ultra-253b-v1","release_date":"2025-03-18","intelligence_index":45.33,"coverage":0.5635,"index_subset_bias":{"offset":0.3,"peers":10,"method":"subset-knn-v1"},"params_total_b":253,"params_active_b":253,"vram_est":{"bf16_gb":506,"int8_gb":268,"int4_gb":152,"method":"linear-rom-v1","approximate":true,"basis":"params_total_b"},"vram_frontier":null,"fits_on":{},"is_moe":false,"is_open_weights":true,"context_window_tok":131072,"pricing":{"prompt_usd_per_m":null,"completion_usd_per_m":null,"blended_usd_per_m":null},"scores":{"aime":{"raw":74.7,"norm":68.38,"trust":2,"source_url":"https://computeprices.com/models/llama-3-1-nemotron-ultra-253b-v1","config":"artificial analysis independent evaluation, reasoning variant","measured_date":"2026-08"},"gpqa_diamond":{"raw":72.8,"norm":67.32,"trust":2,"source_url":"https://computeprices.com/models/llama-3-1-nemotron-ultra-253b-v1","config":"artificial analysis independent evaluation, reasoning variant","measured_date":"2026-08"},"hle":{"raw":8.1,"norm":8.97,"trust":2,"source_url":"https://computeprices.com/models/llama-3-1-nemotron-ultra-253b-v1","config":"artificial analysis independent evaluation, reasoning variant","measured_date":"2026-08"},"mmlu_pro":{"raw":82.5,"norm":70.83,"trust":2,"source_url":"https://computeprices.com/models/llama-3-1-nemotron-ultra-253b-v1","config":"artificial analysis independent evaluation, reasoning variant","measured_date":"2026-08"},"tau_bench":{"raw":11.4,"norm":0,"trust":2,"source_url":"https://computeprices.com/models/llama-3-1-nemotron-ultra-253b-v1","config":"artificial analysis independent evaluation, domain not stated on page, reasoning variant, tau2","measured_date":"2026-08"},"terminal_bench":{"raw":2.3,"norm":0,"trust":2,"source_url":"https://computeprices.com/models/llama-3-1-nemotron-ultra-253b-v1","config":"artificial analysis independent evaluation, reasoning variant","measured_date":"2026-08"}}},{"id":"deepseek-r1-reasoning","display_name":"DeepSeek-R1","family_id":"deepseek","vendor":"DeepSeek","status":"current","kind":"model","superseded_by":null,"release_date":"2025-01-22","intelligence_index":44.87,"coverage":0.8809,"index_subset_bias":null,"params_total_b":684.49,"params_active_b":37,"vram_est":{"bf16_gb":1369,"int8_gb":726,"int4_gb":411,"method":"linear-rom-v1","approximate":true,"basis":"params_total_b"},"vram_frontier":{"efficiency":0.21,"expected_int8_gb":150,"method":"frontier-residual-v1","approximate":true},"fits_on":{},"is_moe":true,"is_open_weights":true,"context_window_tok":64000,"pricing":{"prompt_usd_per_m":0.7,"completion_usd_per_m":2.5,"blended_usd_per_m":1.15},"scores":{"aime":{"raw":73.96,"norm":67.45,"trust":3,"source_url":"https://www.vals.ai/benchmarks/aime","config":"archived=true, edition=aime v1, runner=platform, stderr=1.343, task=overall, updated=2026-04-16","measured_date":"2026-08-19"},"arc_agi_2":{"raw":1.3,"norm":0,"trust":3,"source_url":"https://arcprize.org/leaderboard","config":"cost_per_task_usd=0.08, eval=arc-agi-2 semi-private (v2_semi_private), org=deepseek, run: deepseek r1, system_type=cot","measured_date":"2026-08-21"},"arena_elo":{"raw":1398.1,"norm":52.8,"trust":3,"source_url":"https://lmarena.ai/leaderboard","config":"text","measured_date":"2026-10-01"},"gpqa_diamond":{"raw":71.5,"norm":65.49,"trust":3,"source_url":"https://arxiv.org/html/2501.12948v1","config":"pass@1","measured_date":"2025-01-22"},"hle":{"raw":15.85,"norm":20.37,"trust":2,"source_url":"https://artificialanalysis.ai/models/deepseek-r1","config":"aa field hle, artificial analysis intelligence index v4.1.1 suite, effort=none, humanity's last exam, reasoning=true, run: may '25, source value 0.158480074142725 is a 0-1 fraction, x100 at harvest","measured_date":null},"mmlu_pro":{"raw":83.18,"norm":71.97,"trust":3,"source_url":"https://www.vals.ai/benchmarks/mmlu_pro","config":"edition=mmlu pro v1, runner=platform, stderr=0.444, task=overall, updated=2026-08-19","measured_date":"2026-08-19"},"swe_bench_verified":{"raw":49.2,"norm":43.56,"trust":3,"source_url":"https://arxiv.org/html/2501.12948v1","config":"resolved %, agentless scaffold","measured_date":"2025-01-22"},"tau_bench":{"raw":36.55,"norm":22.07,"trust":2,"source_url":"https://artificialanalysis.ai/models/deepseek-r1","config":"aa field tau2, aa field tau2 (not mapped to tau_bench), artificial analysis intelligence index v4.1.1 suite, effort=none, reasoning=true, run: may '25, source value 0.365497076023392 is a 0-1 fraction, x100 at harvest","measured_date":null},"terminal_bench":{"raw":19.1,"norm":16.59,"trust":2,"source_url":"https://artificialanalysis.ai/models/deepseek-r1-0120","config":"aa field terminalbenchv21, artificial analysis intelligence index v4.1.1 suite, effort=none, reasoning=true, run: jan '25, source value 0.191011235955056 is a 0-1 fraction, terminal-bench 2.1, x100 at harvest","measured_date":null}}},{"id":"nemotron-3-nano-30b-a3b","display_name":"Nemotron 3 Nano 30B A3B","family_id":"nemotron","vendor":"NVIDIA","status":"current","kind":"model","superseded_by":null,"release_date":"2025-12-14","intelligence_index":43.75,"coverage":0.5238,"index_subset_bias":{"offset":-2.28,"peers":10,"method":"subset-knn-v1"},"params_total_b":31.58,"params_active_b":3,"vram_est":{"bf16_gb":63.2,"int8_gb":33.5,"int4_gb":18.9,"method":"linear-rom-v1","approximate":true,"basis":"params_total_b"},"vram_frontier":{"efficiency":4.32,"expected_int8_gb":145,"method":"frontier-residual-v1","approximate":true},"fits_on":{"intel_b70":"int4","nvidia_h100_sxm_80g":"fp8","nvidia_dgx_spark":"fp8"},"is_moe":true,"is_open_weights":true,"context_window_tok":262144,"pricing":{"prompt_usd_per_m":0.05,"completion_usd_per_m":0.2,"blended_usd_per_m":0.08750000000000001},"scores":{"aime":{"raw":91,"norm":88.75,"trust":2,"source_url":"https://artificialanalysis.ai/models/nvidia-nemotron-3-nano-30b-a3b-reasoning","config":"aa field aime25, aime-2025, artificial analysis intelligence index v4.1.1 suite, effort=none, reasoning=true, run: reasoning, source value 0.91 is a 0-1 fraction, x100 at harvest","measured_date":null},"arena_elo":{"raw":1313.5,"norm":15.1,"trust":3,"source_url":"https://lmarena.ai/leaderboard","config":"text","measured_date":"2026-10-01"},"gpqa_diamond":{"raw":75.66,"norm":71.35,"trust":2,"source_url":"https://artificialanalysis.ai/models/nvidia-nemotron-3-nano-30b-a3b-reasoning","config":"aa field gpqa, artificial analysis intelligence index v4.1.1 suite, effort=none, gpqa diamond, reasoning=true, run: reasoning, source value 0.756565656565657 is a 0-1 fraction, x100 at harvest","measured_date":null},"hle":{"raw":11.4,"norm":13.82,"trust":2,"source_url":"https://artificialanalysis.ai/models/nvidia-nemotron-3-nano-30b-a3b-reasoning","config":"aa field hle, artificial analysis intelligence index v4.1.1 suite, effort=none, humanity's last exam, reasoning=true, run: reasoning, source value 0.113994439295644 is a 0-1 fraction, x100 at harvest","measured_date":null},"tau_bench":{"raw":40.94,"norm":27.92,"trust":2,"source_url":"https://artificialanalysis.ai/models/nvidia-nemotron-3-nano-30b-a3b-reasoning","config":"aa field tau2, aa field tau2 (not mapped to tau_bench), artificial analysis intelligence index v4.1.1 suite, effort=none, reasoning=true, run: reasoning, source value 0.409356725146199 is a 0-1 fraction, x100 at harvest","measured_date":null},"terminal_bench":{"raw":13.64,"norm":10.16,"trust":2,"source_url":"https://artificialanalysis.ai/models/nvidia-nemotron-3-nano-30b-a3b-reasoning","config":"aa field terminalbenchhard, artificial analysis intelligence index v4.1.1 suite, effort=none, reasoning=true, run: reasoning, source value 0.136363636363636 is a 0-1 fraction, terminal-bench hard, x100 at harvest","measured_date":null}}},{"id":"hermes-4-70b","display_name":"hermes-4-70b","family_id":"hermes","vendor":"nousresearch","status":"current","kind":"model","superseded_by":null,"release_date":"2025-08-26","intelligence_index":42.96,"coverage":0.5635,"index_subset_bias":{"offset":0.93,"peers":10,"method":"subset-knn-v1"},"params_total_b":70.55,"params_active_b":70.55,"vram_est":{"bf16_gb":141,"int8_gb":74.8,"int4_gb":42.3,"method":"linear-rom-v1","approximate":true,"basis":"params_total_b"},"vram_frontier":{"efficiency":0.43,"expected_int8_gb":31.9,"method":"frontier-residual-v1","approximate":true},"fits_on":{"nvidia_h100_sxm_80g":"int4","nvidia_dgx_spark":"fp8"},"is_moe":false,"is_open_weights":true,"context_window_tok":131072,"pricing":{"prompt_usd_per_m":null,"completion_usd_per_m":null,"blended_usd_per_m":null},"scores":{"aime":{"raw":68.67,"norm":60.84,"trust":2,"source_url":"https://artificialanalysis.ai/models/hermes-4-llama-3-1-70b-reasoning","config":"aime 2025, artificial analysis harness, reasoning mode","measured_date":null},"gpqa_diamond":{"raw":69.9,"norm":63.24,"trust":2,"source_url":"https://artificialanalysis.ai/models/hermes-4-llama-3-1-70b-reasoning","config":"artificial analysis harness, reasoning mode","measured_date":null},"hle":{"raw":8.76,"norm":9.94,"trust":2,"source_url":"https://artificialanalysis.ai/models/hermes-4-llama-3-1-70b-reasoning","config":"artificial analysis harness, no tools, reasoning mode","measured_date":null},"mmlu_pro":{"raw":80.7,"norm":67.83,"trust":1,"source_url":"https://huggingface.co/NousResearch/Hermes-4-70B","config":"hermes 4 70b, reasoning on (r column)","measured_date":null},"tau_bench":{"raw":22.51,"norm":3.35,"trust":2,"source_url":"https://artificialanalysis.ai/models/hermes-4-llama-3-1-70b-reasoning","config":"artificial analysis harness, reasoning mode, tau2","measured_date":null},"terminal_bench":{"raw":4.55,"norm":0,"trust":2,"source_url":"https://artificialanalysis.ai/models/hermes-4-llama-3-1-70b-reasoning","config":"artificial analysis harness, reasoning mode","measured_date":null}}},{"id":"minimax-m1-reasoning","display_name":"MiniMax-M1","family_id":"minimax","vendor":"MiniMax","status":"current","kind":"model","superseded_by":null,"release_date":"2025-06","intelligence_index":42.35,"coverage":0.6428,"index_subset_bias":{"offset":1.96,"peers":10,"method":"subset-knn-v1"},"params_total_b":456.09,"params_active_b":45.9,"vram_est":{"bf16_gb":912,"int8_gb":483,"int4_gb":274,"method":"linear-rom-v1","approximate":true,"basis":"params_total_b"},"vram_frontier":{"efficiency":0.29,"expected_int8_gb":139,"method":"frontier-residual-v1","approximate":true},"fits_on":{},"is_moe":true,"is_open_weights":true,"context_window_tok":1000000,"pricing":{"prompt_usd_per_m":0.55,"completion_usd_per_m":2.2,"blended_usd_per_m":0.9625000000000001},"scores":{"aime":{"raw":61,"norm":51.25,"trust":2,"source_url":"https://artificialanalysis.ai/models/minimax-m1-80k","config":"aa field aime25, aime-2025, artificial analysis intelligence index v4.1.1 suite, effort=none, reasoning=true, source value 0.61 is a 0-1 fraction, x100 at harvest","measured_date":null},"arena_elo":{"raw":1363.9,"norm":37.56,"trust":3,"source_url":"https://lmarena.ai/leaderboard","config":"text","measured_date":"2026-10-03"},"gpqa_diamond":{"raw":69.7,"norm":62.96,"trust":2,"source_url":"https://artificialanalysis.ai/models/minimax-m1-80k","config":"aa field gpqa, artificial analysis intelligence index v4.1.1 suite, effort=none, gpqa diamond, reasoning=true, source value 0.696969696969697 is a 0-1 fraction, x100 at harvest","measured_date":null},"hle":{"raw":8.9,"norm":10.15,"trust":2,"source_url":"https://artificialanalysis.ai/models/minimax-m1-80k","config":"aa field hle, artificial analysis intelligence index v4.1.1 suite, effort=none, humanity's last exam, reasoning=true, source value 0.0889712696941613 is a 0-1 fraction, x100 at harvest","measured_date":null},"mmlu_pro":{"raw":81.1,"norm":68.5,"trust":2,"source_url":"https://arxiv.org/html/2506.13585v1","config":"minimax-m1-80k, table 2 core benchmarks, temperature=1.0, top_p=0.95 [raw: mmlu-pro]","measured_date":null},"tau_bench":{"raw":34.21,"norm":18.95,"trust":2,"source_url":"https://artificialanalysis.ai/models/minimax-m1-80k","config":"aa field tau2, aa field tau2 (not mapped to tau_bench), artificial analysis intelligence index v4.1.1 suite, effort=none, reasoning=true, source value 0.342105263157895 is a 0-1 fraction, x100 at harvest","measured_date":null},"terminal_bench":{"raw":3.03,"norm":0,"trust":2,"source_url":"https://artificialanalysis.ai/models/minimax-m1-80k","config":"aa field terminalbenchhard, artificial analysis intelligence index v4.1.1 suite, effort=none, reasoning=true, source value 0.0303030303030303 is a 0-1 fraction, terminal-bench hard, x100 at harvest","measured_date":null}}},{"id":"gemma-4-e4b","display_name":"Gemma 4 E4B","family_id":"gemma","vendor":"Google DeepMind","status":"current","kind":"model","superseded_by":null,"release_date":"2026-04-02","intelligence_index":41.97,"coverage":0.4049,"index_subset_bias":{"offset":13.01,"peers":10,"method":"subset-knn-v1"},"params_total_b":8,"params_active_b":8,"vram_est":{"bf16_gb":16,"int8_gb":8.5,"int4_gb":4.8,"method":"linear-rom-v1","approximate":true,"basis":"params_total_b"},"vram_frontier":{"efficiency":3.65,"expected_int8_gb":30.9,"method":"frontier-residual-v1","approximate":true},"fits_on":{"intel_b70":"fp8","nvidia_h100_sxm_80g":"fp8","nvidia_dgx_spark":"fp8"},"is_moe":false,"is_open_weights":true,"context_window_tok":128000,"pricing":{"prompt_usd_per_m":null,"completion_usd_per_m":null,"blended_usd_per_m":null},"scores":{"aime":{"raw":42.5,"norm":28.13,"trust":1,"source_url":"https://huggingface.co/google/gemma-4-E4B-it","config":"aime 2026, no tools","measured_date":null},"gpqa_diamond":{"raw":58.6,"norm":47.32,"trust":1,"source_url":"https://huggingface.co/google/gemma-4-E4B-it","config":null,"measured_date":null},"mmlu_pro":{"raw":69.4,"norm":49,"trust":1,"source_url":"https://huggingface.co/google/gemma-4-E4B-it","config":null,"measured_date":null},"tau_bench":{"raw":42.2,"norm":29.6,"trust":1,"source_url":"https://huggingface.co/google/gemma-4-E4B-it","config":"average over 3, tau2","measured_date":null}}},{"id":"mistral-2603-small","display_name":"Mistral Small 4","family_id":"mistral","vendor":"Mistral AI","status":"current","kind":"model","superseded_by":null,"release_date":"2026-03-16","intelligence_index":41.44,"coverage":0.3651,"index_subset_bias":{"offset":-7.16,"peers":10,"method":"subset-knn-v1"},"params_total_b":119.4,"params_active_b":null,"vram_est":{"bf16_gb":239,"int8_gb":127,"int4_gb":71.6,"method":"linear-rom-v1","approximate":true,"basis":"params_total_b"},"vram_frontier":{"efficiency":1.07,"expected_int8_gb":135,"method":"frontier-residual-v1","approximate":true},"fits_on":{"nvidia_h100_sxm_80g":"int4","nvidia_dgx_spark":"int4"},"is_moe":true,"is_open_weights":true,"context_window_tok":262144,"pricing":{"prompt_usd_per_m":0.15,"completion_usd_per_m":0.6,"blended_usd_per_m":0.26249999999999996},"scores":{"gpqa_diamond":{"raw":76.87,"norm":73.06,"trust":2,"source_url":"https://artificialanalysis.ai/models/mistral-small-4","config":"aa intelligence index eval, reasoning_effort=high","measured_date":null},"hle":{"raw":9.87,"norm":11.57,"trust":2,"source_url":"https://artificialanalysis.ai/models/mistral-small-4","config":"aa eval, no tools, reasoning_effort=high","measured_date":null},"tau_bench":{"raw":41.23,"norm":28.31,"trust":2,"source_url":"https://artificialanalysis.ai/models/mistral-small-4","config":"aa eval, reasoning_effort=high, tau2-bench telecom","measured_date":null},"terminal_bench":{"raw":20.97,"norm":18.79,"trust":2,"source_url":"https://artificialanalysis.ai/models/mistral-small-4","config":"aa eval, reasoning_effort=high, terminal-bench 2.1","measured_date":null}}},{"id":"gemini-2.5-flash","display_name":"Gemini 2.5 Flash","family_id":"gemini","vendor":"Google","status":"superseded","kind":"model","superseded_by":"gemini-3.8-flash","release_date":"2025-04","intelligence_index":41.16,"coverage":0.6031,"index_subset_bias":{"offset":-5.07,"peers":10,"method":"subset-knn-v1"},"params_total_b":null,"params_active_b":null,"vram_est":null,"vram_frontier":null,"fits_on":null,"is_moe":false,"is_open_weights":false,"context_window_tok":1048576,"pricing":{"prompt_usd_per_m":0.3,"completion_usd_per_m":2.5,"blended_usd_per_m":0.85},"scores":{"aime":{"raw":73.33,"norm":66.66,"trust":2,"source_url":"https://artificialanalysis.ai/models/gemini-2-5-flash-reasoning","config":"aa field aime25, aime-2025, artificial analysis intelligence index v4.1.1 suite, effort=none, reasoning=true, run: reasoning, source value 0.733333333333333 is a 0-1 fraction, x100 at harvest","measured_date":null},"arc_agi_2":{"raw":1.69,"norm":0,"trust":3,"source_url":"https://arcprize.org/leaderboard","config":"cost_per_task_usd=0.057, eval=arc-agi-2 semi-private (v2_semi_private), org=google, run: preview, system_type=cot","measured_date":"2026-08-21"},"arena_elo":{"raw":1409.4,"norm":57.84,"trust":3,"source_url":"https://lmarena.ai/leaderboard","config":"text","measured_date":"2026-09-27"},"gpqa_diamond":{"raw":78.99,"norm":76.04,"trust":2,"source_url":"https://artificialanalysis.ai/models/gemini-2-5-flash-reasoning","config":"aa field gpqa, artificial analysis intelligence index v4.1.1 suite, effort=none, gpqa diamond, reasoning=true, run: reasoning, source value 0.78989898989899 is a 0-1 fraction, x100 at harvest","measured_date":null},"hle":{"raw":12.14,"norm":14.91,"trust":2,"source_url":"https://artificialanalysis.ai/models/gemini-2-5-flash-reasoning","config":"aa field hle, artificial analysis intelligence index v4.1.1 suite, effort=none, humanity's last exam, reasoning=true, run: reasoning, source value 0.121408711770158 is a 0-1 fraction, x100 at harvest","measured_date":null},"tau_bench":{"raw":31.58,"norm":15.44,"trust":2,"source_url":"https://artificialanalysis.ai/models/gemini-2-5-flash-reasoning","config":"aa field tau2, aa field tau2 (not mapped to tau_bench), artificial analysis intelligence index v4.1.1 suite, effort=none, reasoning=true, run: reasoning, source value 0.315789473684211 is a 0-1 fraction, x100 at harvest","measured_date":null},"terminal_bench":{"raw":13.64,"norm":10.16,"trust":2,"source_url":"https://artificialanalysis.ai/models/gemini-2-5-flash-reasoning","config":"aa field terminalbenchhard, artificial analysis intelligence index v4.1.1 suite, effort=none, reasoning=true, run: reasoning, source value 0.136363636363636 is a 0-1 fraction, terminal-bench hard, x100 at harvest","measured_date":null}}},{"id":"granite-4.2-8b","display_name":"Granite 4.2 8B","family_id":"granite","vendor":"IBM","status":"current","kind":"model","superseded_by":null,"release_date":"2026-08-31","intelligence_index":41.07,"coverage":0.7539,"index_subset_bias":{"offset":1.13,"peers":10,"method":"subset-knn-v1"},"params_total_b":8.79,"params_active_b":8.79,"vram_est":{"bf16_gb":17.6,"int8_gb":9.3,"int4_gb":5.3,"method":"linear-rom-v1","approximate":true,"basis":"params_total_b"},"vram_frontier":{"efficiency":3.23,"expected_int8_gb":30.1,"method":"frontier-residual-v1","approximate":true},"fits_on":{"intel_b70":"fp8","nvidia_h100_sxm_80g":"fp8","nvidia_dgx_spark":"fp8"},"is_moe":false,"is_open_weights":true,"context_window_tok":131072,"pricing":{"prompt_usd_per_m":0.06,"completion_usd_per_m":0.25,"blended_usd_per_m":0.1075},"scores":{"aime":{"raw":86.67,"norm":83.34,"trust":1,"source_url":"https://huggingface.co/ibm-granite/granite-4.2-8b","config":"25, 8b dense column of ibm's 3b/8b/30b granite-4.2 eval table. math-reasoning benchmark, card-wide settings: temperature=1.0, default full thinking/cot mode (aime-style tasks are the canonical thinking-mode showcase for this release). harness: nemo evaluator sdk-based framework. no shot-count stated. value already 0-100 scale as published., top_p=0.95","measured_date":"2026-08-25"},"arena_elo":{"raw":1288.1,"norm":3.78,"trust":3,"source_url":"https://lmarena.ai/leaderboard","config":"text","measured_date":"2026-10-03"},"gpqa_diamond":{"raw":63.1,"norm":53.66,"trust":2,"source_url":"https://openrouter.ai/ibm-granite/granite-4.2-8b","config":"different harness/grader. no explicit eval-run date given., distinct from ibm's card's plain 'gpqa' figure of 64.14 — do not merge, sourced from artificial analysis per page footer ('metrics sourced from artificial analysis'). value already 0-100 scale as published (63.1%). this is aa's own gpqa diamond run","measured_date":null},"hle":{"raw":9.7,"norm":11.32,"trust":2,"source_url":"https://openrouter.ai/ibm-granite/granite-4.2-8b","config":"full name: humanity's last exam. sourced from artificial analysis per page footer. value already 0-100 scale as published. no explicit eval-run date given.","measured_date":null},"mmlu_pro":{"raw":74.04,"norm":56.73,"trust":1,"source_url":"https://huggingface.co/ibm-granite/granite-4.2-8b","config":"8b dense column of ibm's 3b/8b/30b granite-4.2 eval table. harness: nemo evaluator sdk-based framework. no shot-count stated, card-wide settings: temperature=1.0, default full thinking/cot mode. value already 0-100 scale as published., top_p=0.95","measured_date":"2026-08-25"},"swe_bench_verified":{"raw":47.67,"norm":41.86,"trust":1,"source_url":"https://huggingface.co/ibm-granite/granite-4.2-8b","config":"8b dense column of ibm's 3b/8b/30b granite-4.2 eval table. harness: nemo evaluator sdk-based framework. no per-benchmark shot-count/cot stated, card-wide inference settings: temperature=1.0, default full thinking/cot mode. value already 0-100 scale as published., top_p=0.95","measured_date":"2026-08-25"},"terminal_bench":{"raw":20.56,"norm":18.31,"trust":1,"source_url":"https://huggingface.co/ibm-granite/granite-4.2-8b","config":"8b dense column of ibm's 3b/8b/30b granite-4.2 eval table. named edition: terminal-bench 2.1. harness: nemo evaluator sdk-based framework. no per-benchmark shot-count/cot stated, card-wide settings: temperature=1.0, default full thinking/cot mode. value already 0-100 scale as published., top_p=0.95","measured_date":"2026-08-25"}}},{"id":"gpt-o3-mini","display_name":"OpenAI o3 Mini","family_id":"gpt","vendor":"OpenAI","status":"superseded","kind":"model","superseded_by":"gpt-o4-mini","release_date":"2025-01-31","intelligence_index":40.98,"coverage":0.7222,"index_subset_bias":{"offset":-1.5,"peers":10,"method":"subset-knn-v1"},"params_total_b":null,"params_active_b":null,"vram_est":null,"vram_frontier":null,"fits_on":null,"is_moe":false,"is_open_weights":false,"context_window_tok":200000,"pricing":{"prompt_usd_per_m":1.1,"completion_usd_per_m":4.4,"blended_usd_per_m":1.9250000000000003},"scores":{"aime":{"raw":86.46,"norm":83.07,"trust":3,"source_url":"https://www.vals.ai/benchmarks/aime","config":"archived=true, edition=aime v1, reasoning_effort=high, runner=platform, stderr=1.054, task=overall, updated=2026-04-16","measured_date":"2026-08-19"},"arc_agi_2":{"raw":2.99,"norm":0,"trust":3,"source_url":"https://arcprize.org/leaderboard","config":"cost_per_task_usd=0.5472, eval=arc-agi-2 semi-private (v2_semi_private), model_group=o3-mini, org=openai, run: high, system_type=cot","measured_date":"2026-08-21"},"arena_elo":{"raw":1348.1,"norm":30.52,"trust":3,"source_url":"https://lmarena.ai/leaderboard","config":"text","measured_date":"2026-09-27"},"gpqa_diamond":{"raw":75.5,"norm":71.13,"trust":3,"source_url":"https://www.vals.ai/benchmarks/gpqa","config":"edition=gpqa diamond v1, reasoning_effort=high, runner=platform, stderr=2.176, task=overall, updated=2026-08-19","measured_date":"2026-08-19"},"hle":{"raw":7.91,"norm":8.69,"trust":2,"source_url":"https://artificialanalysis.ai/models/o3-mini","config":"aa field hle, artificial analysis intelligence index v4.1.1 suite, effort=none, humanity's last exam, reasoning=true, source value 0.0791 is a 0-1 fraction, x100 at harvest","measured_date":null},"mmlu_pro":{"raw":78.69,"norm":64.48,"trust":3,"source_url":"https://www.vals.ai/benchmarks/mmlu_pro","config":"edition=mmlu pro v1, reasoning_effort=high, runner=platform, stderr=0.394, task=overall, updated=2026-08-19","measured_date":"2026-08-19"},"tau_bench":{"raw":28.65,"norm":11.53,"trust":2,"source_url":"https://artificialanalysis.ai/models/o3-mini","config":"aa field tau2, aa field tau2 (not mapped to tau_bench), artificial analysis intelligence index v4.1.1 suite, effort=none, reasoning=true, source value 0.286549707602339 is a 0-1 fraction, x100 at harvest","measured_date":null},"terminal_bench":{"raw":6.82,"norm":2.14,"trust":2,"source_url":"https://artificialanalysis.ai/models/o3-mini","config":"aa field terminalbenchhard, artificial analysis intelligence index v4.1.1 suite, effort=none, reasoning=true, source value 0.0681818181818182 is a 0-1 fraction, terminal-bench hard, x100 at harvest","measured_date":null}}},{"id":"devstral-1-2512","display_name":"Devstral 2 2512","family_id":"devstral","vendor":"Mistral AI","status":"current","kind":"model","superseded_by":null,"release_date":"2025-12-09","intelligence_index":40.81,"coverage":0.7223,"index_subset_bias":{"offset":1.04,"peers":10,"method":"subset-knn-v1"},"params_total_b":125.03,"params_active_b":125.03,"vram_est":{"bf16_gb":250,"int8_gb":133,"int4_gb":75,"method":"linear-rom-v1","approximate":true,"basis":"params_total_b"},"vram_frontier":{"efficiency":0.23,"expected_int8_gb":29.9,"method":"frontier-residual-v1","approximate":true},"fits_on":{"nvidia_dgx_spark":"int4"},"is_moe":false,"is_open_weights":true,"context_window_tok":262144,"pricing":{"prompt_usd_per_m":0.4,"completion_usd_per_m":2,"blended_usd_per_m":0.8},"scores":{"aime":{"raw":36.67,"norm":20.84,"trust":2,"source_url":"https://artificialanalysis.ai/models/devstral-2","config":"2025, artificial analysis independent evaluation","measured_date":null},"gpqa_diamond":{"raw":59.39,"norm":48.44,"trust":2,"source_url":"https://artificialanalysis.ai/models/devstral-2","config":"artificial analysis independent evaluation","measured_date":null},"hle":{"raw":3.57,"norm":2.31,"trust":2,"source_url":"https://artificialanalysis.ai/models/devstral-2","config":"artificial analysis independent evaluation","measured_date":null},"mmlu_pro":{"raw":76.16,"norm":60.27,"trust":2,"source_url":"https://artificialanalysis.ai/models/devstral-2","config":"artificial analysis independent evaluation","measured_date":null},"swe_bench_verified":{"raw":72.2,"norm":69.11,"trust":1,"source_url":"https://huggingface.co/mistralai/Devstral-2-123B-Instruct-2512","config":null,"measured_date":null},"tau_bench":{"raw":24.85,"norm":6.47,"trust":2,"source_url":"https://artificialanalysis.ai/models/devstral-2","config":"artificial analysis independent evaluation, tau2/telecom","measured_date":null},"terminal_bench":{"raw":30.34,"norm":29.81,"trust":2,"source_url":"https://artificialanalysis.ai/models/devstral-2","config":"2.1, artificial analysis independent evaluation","measured_date":null}}},{"id":"deepseek-3-0324-instruct","display_name":"DeepSeek V3 0324","family_id":"deepseek","vendor":"DeepSeek","status":"superseded","kind":"model","superseded_by":"deepseek-3.1-instruct","release_date":"2025-03-24","intelligence_index":40.53,"coverage":0.6428,"index_subset_bias":{"offset":1.96,"peers":10,"method":"subset-knn-v1"},"params_total_b":684.53,"params_active_b":37,"vram_est":{"bf16_gb":1369,"int8_gb":726,"int4_gb":411,"method":"linear-rom-v1","approximate":true,"basis":"params_total_b"},"vram_frontier":null,"fits_on":{},"is_moe":true,"is_open_weights":true,"context_window_tok":163840,"pricing":{"prompt_usd_per_m":0.29,"completion_usd_per_m":1.14,"blended_usd_per_m":0.5025},"scores":{"aime":{"raw":52.2,"norm":40.25,"trust":3,"source_url":"https://www.vals.ai/benchmarks/aime","config":"archived=true, edition=aime v1, runner=platform, stderr=1.712, task=overall, updated=2026-04-16","measured_date":"2026-08-19"},"arena_elo":{"raw":1395.6,"norm":51.69,"trust":3,"source_url":"https://lmarena.ai/leaderboard","config":"text","measured_date":"2026-10-01"},"gpqa_diamond":{"raw":61.62,"norm":51.58,"trust":3,"source_url":"https://www.vals.ai/benchmarks/gpqa","config":"edition=gpqa diamond v1, runner=platform, stderr=2.447, task=overall, updated=2026-08-19","measured_date":"2026-08-19"},"hle":{"raw":4.74,"norm":4.03,"trust":2,"source_url":"https://artificialanalysis.ai/models/deepseek-v3-0324","config":"aa field hle, artificial analysis intelligence index v4.1.1 suite, effort=none, humanity's last exam, reasoning=false, source value 0.0474 is a 0-1 fraction, x100 at harvest","measured_date":null},"mmlu_pro":{"raw":79.47,"norm":65.78,"trust":3,"source_url":"https://www.vals.ai/benchmarks/mmlu_pro","config":"edition=mmlu pro v1, runner=platform, stderr=0.396, task=overall, updated=2026-08-19","measured_date":"2026-08-19"},"tau_bench":{"raw":47.08,"norm":36.11,"trust":2,"source_url":"https://artificialanalysis.ai/models/deepseek-v3-0324","config":"aa field tau2, aa field tau2 (not mapped to tau_bench), artificial analysis intelligence index v4.1.1 suite, effort=none, reasoning=false, source value 0.470760233918129 is a 0-1 fraction, x100 at harvest","measured_date":null},"terminal_bench":{"raw":15.15,"norm":11.94,"trust":2,"source_url":"https://artificialanalysis.ai/models/deepseek-v3-0324","config":"aa field terminalbenchhard, artificial analysis intelligence index v4.1.1 suite, effort=none, reasoning=false, source value 0.151515151515152 is a 0-1 fraction, terminal-bench hard, x100 at harvest","measured_date":null}}},{"id":"qwen-3-480b-a35b-07-25-code","display_name":"Qwen3 Coder 480B A35B","family_id":"qwen","vendor":"Alibaba","status":"current","kind":"model","superseded_by":null,"release_date":"2025-07-22","intelligence_index":39.54,"coverage":0.6826,"index_subset_bias":{"offset":-1.67,"peers":10,"method":"subset-knn-v1"},"params_total_b":480.15,"params_active_b":35,"vram_est":{"bf16_gb":960,"int8_gb":509,"int4_gb":288,"method":"linear-rom-v1","approximate":true,"basis":"params_total_b"},"vram_frontier":{"efficiency":0.25,"expected_int8_gb":127,"method":"frontier-residual-v1","approximate":true},"fits_on":{},"is_moe":true,"is_open_weights":true,"context_window_tok":262144,"pricing":{"prompt_usd_per_m":0.3,"completion_usd_per_m":1,"blended_usd_per_m":0.475},"scores":{"aime":{"raw":39.33,"norm":24.16,"trust":2,"source_url":"https://artificialanalysis.ai/models/qwen3-coder-480b-a35b-instruct","config":"aa field aime25, aime-2025, artificial analysis intelligence index v4.1.1 suite, effort=none, reasoning=false, source value 0.393333333333333 is a 0-1 fraction, x100 at harvest","measured_date":null},"arena_elo":{"raw":1387.3,"norm":47.99,"trust":3,"source_url":"https://lmarena.ai/leaderboard","config":"text","measured_date":"2026-10-03"},"gpqa_diamond":{"raw":61.82,"norm":51.86,"trust":2,"source_url":"https://artificialanalysis.ai/models/qwen3-coder-480b-a35b-instruct","config":"aa field gpqa, artificial analysis intelligence index v4.1.1 suite, effort=none, gpqa diamond, reasoning=false, source value 0.618181818181818 is a 0-1 fraction, x100 at harvest","measured_date":null},"hle":{"raw":4.54,"norm":3.74,"trust":2,"source_url":"https://artificialanalysis.ai/models/qwen3-coder-480b-a35b-instruct","config":"aa field hle, artificial analysis intelligence index v4.1.1 suite, effort=none, humanity's last exam, reasoning=false, source value 0.0454124189063948 is a 0-1 fraction, x100 at harvest","measured_date":null},"swe_bench_verified":{"raw":67,"norm":63.33,"trust":2,"source_url":"https://arxiv.org/html/2603.16790v1","config":"incoder-32b technical report table 3 (agentic coding + general tool use comparison table) [raw: swe-bench verified], third-party eval","measured_date":null},"tau_bench":{"raw":43.57,"norm":31.43,"trust":2,"source_url":"https://artificialanalysis.ai/models/qwen3-coder-480b-a35b-instruct","config":"aa field tau2, aa field tau2 (not mapped to tau_bench), artificial analysis intelligence index v4.1.1 suite, effort=none, reasoning=false, source value 0.435672514619883 is a 0-1 fraction, x100 at harvest","measured_date":null},"terminal_bench":{"raw":23.9,"norm":22.24,"trust":3,"source_url":"https://www.tbench.ai/leaderboard/terminal-bench/2.0","config":"23.9% +/- 2.8 [raw: terminal-bench 2.0], terminal-bench 2.0, terminus 2 reference agent (official harness)","measured_date":null}}},{"id":"sonar-1-pro","display_name":"Sonar Pro","family_id":"sonar","vendor":"perplexity","status":"current","kind":"model","superseded_by":null,"release_date":"2025-03-07","intelligence_index":38.88,"coverage":0.3889,"index_subset_bias":{"offset":3.96,"peers":10,"method":"subset-knn-v1"},"params_total_b":null,"params_active_b":null,"vram_est":null,"vram_frontier":null,"fits_on":null,"is_moe":false,"is_open_weights":false,"context_window_tok":200000,"pricing":{"prompt_usd_per_m":3,"completion_usd_per_m":15,"blended_usd_per_m":6},"scores":{"gpqa_diamond":{"raw":57.78,"norm":46.17,"trust":2,"source_url":"https://artificialanalysis.ai/models/sonar-pro","config":"artificial analysis independent evaluation","measured_date":null},"hle":{"raw":6.55,"norm":6.69,"trust":2,"source_url":"https://artificialanalysis.ai/models/sonar-pro","config":"artificial analysis independent evaluation","measured_date":null},"mmlu_pro":{"raw":75.52,"norm":59.2,"trust":2,"source_url":"https://artificialanalysis.ai/models/sonar-pro","config":"artificial analysis independent evaluation","measured_date":null}}},{"id":"mistral-3.1-medium","display_name":"Mistral Medium 3.1","family_id":"mistral","vendor":"Mistral AI","status":"current","kind":"model","superseded_by":null,"release_date":"2025-08-13","intelligence_index":38.26,"coverage":0.3094,"index_subset_bias":{"offset":-7.08,"peers":10,"method":"subset-knn-v1"},"params_total_b":null,"params_active_b":null,"vram_est":null,"vram_frontier":null,"fits_on":null,"is_moe":false,"is_open_weights":false,"context_window_tok":131072,"pricing":{"prompt_usd_per_m":0.4,"completion_usd_per_m":2,"blended_usd_per_m":0.8},"scores":{"arena_elo":{"raw":1409,"norm":57.66,"trust":3,"source_url":"https://arena.ai/leaderboard/text","config":"92749 votes, arena entry mistral-medium-2508, no style control, rank 137, text/overall","measured_date":"2026-09-02"},"hle":{"raw":4.7,"norm":3.97,"trust":2,"source_url":"https://artificialanalysis.ai/evaluations/humanitys-last-exam","config":"artificial analysis independent eval","measured_date":null},"mmlu_pro":{"raw":74.4,"norm":57.33,"trust":1,"source_url":"https://www.noota.io/en/mistral-review-guide","config":"mistral-reported figure as quoted by the review","measured_date":null}}},{"id":"mistral-3-large-vision","display_name":"Mistral Large 3","family_id":"mistral","vendor":"Mistral AI","status":"current","kind":"model","superseded_by":null,"release_date":"2025-12","intelligence_index":38.2,"coverage":0.8016,"index_subset_bias":null,"params_total_b":675,"params_active_b":41,"vram_est":{"bf16_gb":1350,"int8_gb":716,"int4_gb":405,"method":"linear-rom-v1","approximate":true,"basis":"params_total_b"},"vram_frontier":{"efficiency":0.04,"expected_int8_gb":27.6,"method":"frontier-residual-v1","approximate":true},"fits_on":{},"is_moe":false,"is_open_weights":true,"context_window_tok":262000,"pricing":{"prompt_usd_per_m":null,"completion_usd_per_m":null,"blended_usd_per_m":null},"scores":{"aime":{"raw":38,"norm":22.5,"trust":2,"source_url":"https://artificialanalysis.ai/models/mistral-large-3","config":"aime 2025, artificial analysis independent run, no tools, non-reasoning. raw field aime25=0.38. [raw: aime 2025]","measured_date":null},"arena_elo":{"raw":1413.9,"norm":59.85,"trust":3,"source_url":"https://lmarena.ai/leaderboard","config":"text","measured_date":"2026-10-03"},"gpqa_diamond":{"raw":67.98,"norm":60.54,"trust":2,"source_url":"https://artificialanalysis.ai/models/mistral-large-3","config":"artificial analysis independent run (intelligence index v4.1.1 component), no tools, non-reasoning model (0 reasoning tokens). raw value 0.67979797979798. [raw: gpqa diamond]","measured_date":null},"hle":{"raw":4.17,"norm":3.19,"trust":2,"source_url":"https://artificialanalysis.ai/models/mistral-large-3","config":"artificial analysis independent run, text-only / no tools (intelligence index v4.1.1 component). raw value 0.0417052826691381. [raw: humanity's last exam]","measured_date":null},"mmlu_pro":{"raw":79.823,"norm":66.37,"trust":2,"source_url":"https://www.vals.ai/benchmarks/mmlu_pro","config":"not a per-subject sub-score. [raw: mmlu pro], overall leaderboard accuracy (rank 89), vals.ai independent run","measured_date":null},"swe_bench_verified":{"raw":41.4,"norm":34.89,"trust":2,"source_url":"https://www.vals.ai/benchmarks/swebench","config":"bash-only harness, single attempt (resolved rate). [raw: swe-bench verified], single tool, vals.ai independent run on the full 500-instance swe-bench verified split","measured_date":null},"tau_bench":{"raw":24.56,"norm":6.08,"trust":2,"source_url":"https://artificialanalysis.ai/models/mistral-large-3","config":"artificial analysis independent run, single aggregate number (raw field tau2=0.245614035087719). aa's separate τ3-banking domain score is 5.77. [raw: tau-2-bench], τ2-bench","measured_date":null},"terminal_bench":{"raw":11.99,"norm":8.22,"trust":2,"source_url":"https://artificialanalysis.ai/models/mistral-large-3","config":"artificial analysis independent run (intelligence index v4.1.1 component). raw value 0.119850187265918. aa's terminal-bench hard variant for the same model is 15.91. [raw: terminal-bench v2.1], terminal-bench v2.1","measured_date":null}}},{"id":"ling-2.6-flash","display_name":"ling-2.6-flash","family_id":"ling","vendor":"inclusionAI","status":"superseded","kind":"model","superseded_by":"ling-3.0-flash","release_date":"2026-04-21","intelligence_index":37.36,"coverage":0.3651,"index_subset_bias":{"offset":-7.33,"peers":10,"method":"subset-knn-v1"},"params_total_b":null,"params_active_b":null,"vram_est":null,"vram_frontier":null,"fits_on":null,"is_moe":false,"is_open_weights":false,"context_window_tok":262144,"pricing":{"prompt_usd_per_m":null,"completion_usd_per_m":null,"blended_usd_per_m":null},"scores":{"gpqa_diamond":{"raw":59.29,"norm":48.3,"trust":2,"source_url":"https://artificialanalysis.ai/models/ling-2-6-flash","config":"aa field gpqa, artificial analysis intelligence index v4.1.1 suite, effort=none, gpqa diamond, reasoning=false, source value 0.592929292929293 is a 0-1 fraction, x100 at harvest","measured_date":null},"hle":{"raw":6.26,"norm":6.26,"trust":2,"source_url":"https://artificialanalysis.ai/models/ling-2-6-flash","config":"aa field hle, artificial analysis intelligence index v4.1.1 suite, effort=none, humanity's last exam, reasoning=false, source value 0.0625579240037071 is a 0-1 fraction, x100 at harvest","measured_date":null},"tau_bench":{"raw":85.96,"norm":87.95,"trust":2,"source_url":"https://artificialanalysis.ai/models/ling-2-6-flash","config":"aa field tau2, aa field tau2 (not mapped to tau_bench), artificial analysis intelligence index v4.1.1 suite, effort=none, reasoning=false, source value 0.859649122807018 is a 0-1 fraction, x100 at harvest","measured_date":null},"terminal_bench":{"raw":24.34,"norm":22.75,"trust":2,"source_url":"https://artificialanalysis.ai/models/ling-2-6-flash","config":"aa field terminalbenchv21, artificial analysis intelligence index v4.1.1 suite, effort=none, reasoning=false, source value 0.243445692883895 is a 0-1 fraction, terminal-bench 2.1, x100 at harvest","measured_date":null}}},{"id":"gpt-5-nano","display_name":"GPT-5 Nano","family_id":"gpt","vendor":"OpenAI","status":"superseded","kind":"model","superseded_by":"gpt-5.4-nano","release_date":"2025-08-07","intelligence_index":37.15,"coverage":0.7222,"index_subset_bias":{"offset":-1.5,"peers":10,"method":"subset-knn-v1"},"params_total_b":null,"params_active_b":null,"vram_est":null,"vram_frontier":null,"fits_on":null,"is_moe":false,"is_open_weights":false,"context_window_tok":400000,"pricing":{"prompt_usd_per_m":0.05,"completion_usd_per_m":0.4,"blended_usd_per_m":0.1375},"scores":{"aime":{"raw":81.18,"norm":76.48,"trust":3,"source_url":"https://www.vals.ai/benchmarks/aime","config":"archived=true, edition=aime v1, reasoning_effort=high, runner=platform, stderr=1.29, task=overall, updated=2026-04-16","measured_date":"2026-08-19"},"arc_agi_2":{"raw":2.61,"norm":0,"trust":3,"source_url":"https://arcprize.org/leaderboard","config":"cost_per_task_usd=0.0295, eval=arc-agi-2 semi-private (v2_semi_private), model_group=gpt-5-nano-reasoning, org=openai, run: high, system_type=cot","measured_date":"2026-08-21"},"arena_elo":{"raw":1337.5,"norm":25.79,"trust":3,"source_url":"https://lmarena.ai/leaderboard","config":"text","measured_date":"2026-10-01"},"gpqa_diamond":{"raw":63.38,"norm":54.06,"trust":3,"source_url":"https://www.vals.ai/benchmarks/gpqa","config":"edition=gpqa diamond v1, reasoning_effort=high, runner=platform, stderr=2.455, task=overall, updated=2026-08-19, verbosity=medium","measured_date":"2026-08-19"},"hle":{"raw":9.5,"norm":11.03,"trust":2,"source_url":"https://artificialanalysis.ai/models/gpt-5-nano","config":"aa field hle, artificial analysis intelligence index v4.1.1 suite, effort=high, humanity's last exam, reasoning=true, run: high, source value 0.0949953660797034 is a 0-1 fraction, x100 at harvest","measured_date":null},"mmlu_pro":{"raw":76.07,"norm":60.12,"trust":3,"source_url":"https://www.vals.ai/benchmarks/mmlu_pro","config":"edition=mmlu pro v1, reasoning_effort=high, runner=platform, stderr=0.412, task=overall, updated=2026-08-19, verbosity=medium","measured_date":"2026-08-19"},"tau_bench":{"raw":36.55,"norm":22.07,"trust":2,"source_url":"https://artificialanalysis.ai/models/gpt-5-nano","config":"aa field tau2, aa field tau2 (not mapped to tau_bench), artificial analysis intelligence index v4.1.1 suite, effort=high, reasoning=true, run: high, source value 0.365497076023392 is a 0-1 fraction, x100 at harvest","measured_date":null},"terminal_bench":{"raw":17.42,"norm":14.61,"trust":2,"source_url":"https://artificialanalysis.ai/models/gpt-5-nano-medium","config":"aa field terminalbenchhard, artificial analysis intelligence index v4.1.1 suite, effort=medium, reasoning=true, run: medium, source value 0.174242424242424 is a 0-1 fraction, terminal-bench hard, x100 at harvest","measured_date":null}}},{"id":"mistral-3.2-small-24b-2506-instruct","display_name":"Mistral Small 3.2 24B","family_id":"mistral","vendor":"Mistral AI","status":"current","kind":"model","superseded_by":null,"release_date":"2025-06-20","intelligence_index":37.03,"coverage":0.3572,"index_subset_bias":{"offset":13.06,"peers":10,"method":"subset-knn-v1"},"params_total_b":24.01,"params_active_b":24.01,"vram_est":{"bf16_gb":48,"int8_gb":25.5,"int4_gb":14.4,"method":"linear-rom-v1","approximate":true,"basis":"params_total_b"},"vram_frontier":{"efficiency":1.04,"expected_int8_gb":26.6,"method":"frontier-residual-v1","approximate":true},"fits_on":{"intel_b70":"fp8","nvidia_h100_sxm_80g":"fp8","nvidia_dgx_spark":"fp8"},"is_moe":false,"is_open_weights":true,"context_window_tok":256000,"pricing":{"prompt_usd_per_m":0.09375,"completion_usd_per_m":0.25,"blended_usd_per_m":0.1328125},"scores":{"arena_elo":{"raw":1357,"norm":34.48,"trust":3,"source_url":"https://arena.ai/leaderboard/text","config":"17399 votes, arena entry mistral-small-2506, no style control, rank 194, text/overall","measured_date":"2026-09-02"},"gpqa_diamond":{"raw":46.13,"norm":29.76,"trust":1,"source_url":"https://huggingface.co/mistralai/Mistral-Small-3.2-24B-Instruct-2506","config":"5-shot cot","measured_date":null},"mmlu_pro":{"raw":69.06,"norm":48.43,"trust":1,"source_url":"https://huggingface.co/mistralai/Mistral-Small-3.2-24B-Instruct-2506","config":"5-shot cot","measured_date":null}}},{"id":"deepseek-r1-distill-qwen-32b-reasoning","display_name":"DeepSeek-R1-Distill-Qwen-32B","family_id":"deepseek","vendor":"DeepSeek","status":"current","kind":"model","superseded_by":null,"release_date":"2025-01-20","intelligence_index":36.81,"coverage":0.3492,"index_subset_bias":{"offset":-1.62,"peers":10,"method":"subset-knn-v1"},"params_total_b":32.76,"params_active_b":32.76,"vram_est":{"bf16_gb":65.5,"int8_gb":34.7,"int4_gb":19.7,"method":"linear-rom-v1","approximate":true,"basis":"params_total_b"},"vram_frontier":{"efficiency":0.76,"expected_int8_gb":26.4,"method":"frontier-residual-v1","approximate":true},"fits_on":{"intel_b70":"int4","nvidia_h100_sxm_80g":"fp8","nvidia_dgx_spark":"fp8"},"is_moe":false,"is_open_weights":true,"context_window_tok":null,"pricing":{"prompt_usd_per_m":null,"completion_usd_per_m":null,"blended_usd_per_m":null},"scores":{"aime":{"raw":63,"norm":53.75,"trust":2,"source_url":"https://artificialanalysis.ai/models/deepseek-r1-distill-qwen-32b","config":"aa field aime25, aime-2025, artificial analysis intelligence index v4.1.1 suite, effort=none, reasoning=true, source value 0.63 is a 0-1 fraction, x100 at harvest","measured_date":null},"gpqa_diamond":{"raw":61.52,"norm":51.44,"trust":2,"source_url":"https://artificialanalysis.ai/models/deepseek-r1-distill-qwen-32b","config":"aa field gpqa, artificial analysis intelligence index v4.1.1 suite, effort=none, gpqa diamond, reasoning=true, source value 0.615151515151515 is a 0-1 fraction, x100 at harvest","measured_date":null},"hle":{"raw":4.58,"norm":3.79,"trust":2,"source_url":"https://artificialanalysis.ai/models/deepseek-r1-distill-qwen-32b","config":"aa field hle, artificial analysis intelligence index v4.1.1 suite, effort=none, humanity's last exam, reasoning=true, source value 0.0458 is a 0-1 fraction, x100 at harvest","measured_date":null}}},{"id":"gpt-4.1-mini","display_name":"GPT-4.1 Mini","family_id":"gpt","vendor":"OpenAI","status":"superseded","kind":"model","superseded_by":"gpt-5.4-mini","release_date":"2025-04-14","intelligence_index":36.58,"coverage":0.7222,"index_subset_bias":{"offset":-1.5,"peers":10,"method":"subset-knn-v1"},"params_total_b":null,"params_active_b":null,"vram_est":null,"vram_frontier":null,"fits_on":null,"is_moe":false,"is_open_weights":false,"context_window_tok":1047576,"pricing":{"prompt_usd_per_m":0.4,"completion_usd_per_m":1.6,"blended_usd_per_m":0.7000000000000001},"scores":{"aime":{"raw":49.38,"norm":36.73,"trust":3,"source_url":"https://www.vals.ai/benchmarks/aime","config":"archived=true, edition=aime v1, reasoning_effort=high, runner=platform, stderr=1.122, task=overall, updated=2026-04-16","measured_date":"2026-08-19"},"arc_agi_2":{"raw":0,"norm":0,"trust":3,"source_url":"https://arcprize.org/leaderboard","config":"cost_per_task_usd=0.0139, eval=arc-agi-2 semi-private (v2_semi_private), model_group=gpt-4.1, org=openai, system_type=base llm","measured_date":"2026-08-21"},"arena_elo":{"raw":1382.7,"norm":45.94,"trust":3,"source_url":"https://lmarena.ai/leaderboard","config":"text","measured_date":"2026-10-01"},"gpqa_diamond":{"raw":67.93,"norm":60.46,"trust":3,"source_url":"https://www.vals.ai/benchmarks/gpqa","config":"edition=gpqa diamond v1, reasoning_effort=high, runner=platform, stderr=2.351, task=overall, updated=2026-08-19","measured_date":"2026-08-19"},"hle":{"raw":5.02,"norm":4.44,"trust":2,"source_url":"https://artificialanalysis.ai/models/gpt-4-1-mini","config":"aa field hle, artificial analysis intelligence index v4.1.1 suite, effort=none, humanity's last exam, reasoning=false, source value 0.0502 is a 0-1 fraction, x100 at harvest","measured_date":null},"mmlu_pro":{"raw":77.22,"norm":62.03,"trust":3,"source_url":"https://www.vals.ai/benchmarks/mmlu_pro","config":"edition=mmlu pro v1, reasoning_effort=high, runner=platform, stderr=0.405, task=overall, updated=2026-08-19","measured_date":"2026-08-19"},"tau_bench":{"raw":52.92,"norm":43.89,"trust":2,"source_url":"https://artificialanalysis.ai/models/gpt-4-1-mini","config":"aa field tau2, aa field tau2 (not mapped to tau_bench), artificial analysis intelligence index v4.1.1 suite, effort=none, reasoning=false, source value 0.529239766081871 is a 0-1 fraction, x100 at harvest","measured_date":null},"terminal_bench":{"raw":10.11,"norm":6.01,"trust":2,"source_url":"https://artificialanalysis.ai/models/gpt-4-1-mini","config":"aa field terminalbenchv21, artificial analysis intelligence index v4.1.1 suite, effort=none, reasoning=false, source value 0.101123595505618 is a 0-1 fraction, terminal-bench 2.1, x100 at harvest","measured_date":null}}},{"id":"gpt-4.1","display_name":"GPT-4.1","family_id":"gpt","vendor":"OpenAI","status":"superseded","kind":"model","superseded_by":"gpt-5.5","release_date":"2025-04-14","intelligence_index":36.49,"coverage":0.7222,"index_subset_bias":{"offset":-1.5,"peers":10,"method":"subset-knn-v1"},"params_total_b":null,"params_active_b":null,"vram_est":null,"vram_frontier":null,"fits_on":null,"is_moe":false,"is_open_weights":false,"context_window_tok":1047576,"pricing":{"prompt_usd_per_m":2,"completion_usd_per_m":8,"blended_usd_per_m":3.5},"scores":{"aime":{"raw":39.58,"norm":24.48,"trust":3,"source_url":"https://www.vals.ai/benchmarks/aime","config":"archived=true, edition=aime v1, reasoning_effort=high, runner=platform, stderr=1.386, task=overall, updated=2026-04-16","measured_date":"2026-08-19"},"arc_agi_2":{"raw":0.42,"norm":0,"trust":3,"source_url":"https://arcprize.org/leaderboard","config":"cost_per_task_usd=0.0691, eval=arc-agi-2 semi-private (v2_semi_private), model_group=gpt-4.1, org=openai, system_type=base llm","measured_date":"2026-08-21"},"arena_elo":{"raw":1414.8,"norm":60.25,"trust":3,"source_url":"https://lmarena.ai/leaderboard","config":"text","measured_date":"2026-10-01"},"gpqa_diamond":{"raw":65.4,"norm":56.9,"trust":3,"source_url":"https://www.vals.ai/benchmarks/gpqa","config":"edition=gpqa diamond v1, reasoning_effort=high, runner=platform, stderr=2.402, task=overall, updated=2026-08-19","measured_date":"2026-08-19"},"hle":{"raw":4.18,"norm":3.21,"trust":2,"source_url":"https://artificialanalysis.ai/models/gpt-4-1","config":"aa field hle, artificial analysis intelligence index v4.1.1 suite, effort=none, humanity's last exam, reasoning=false, source value 0.0418 is a 0-1 fraction, x100 at harvest","measured_date":null},"mmlu_pro":{"raw":80.5,"norm":67.5,"trust":3,"source_url":"https://www.vals.ai/benchmarks/mmlu_pro","config":"edition=mmlu pro v1, reasoning_effort=high, runner=platform, stderr=0.385, task=overall, updated=2026-08-19","measured_date":"2026-08-19"},"tau_bench":{"raw":47.08,"norm":36.11,"trust":2,"source_url":"https://artificialanalysis.ai/models/gpt-4-1","config":"aa field tau2, aa field tau2 (not mapped to tau_bench), artificial analysis intelligence index v4.1.1 suite, effort=none, reasoning=false, source value 0.470760233918129 is a 0-1 fraction, x100 at harvest","measured_date":null},"terminal_bench":{"raw":13.64,"norm":10.16,"trust":2,"source_url":"https://artificialanalysis.ai/models/gpt-4-1","config":"aa field terminalbenchhard, artificial analysis intelligence index v4.1.1 suite, effort=none, reasoning=false, source value 0.136363636363636 is a 0-1 fraction, terminal-bench hard, x100 at harvest","measured_date":null}}},{"id":"qwen-3-30b-a3b-instruct-vision","display_name":"Qwen3 VL 30B A3B Instruct","family_id":"qwen","vendor":"Alibaba","status":"current","kind":"model","superseded_by":null,"release_date":"2025-10-06","intelligence_index":35.77,"coverage":0.4445,"index_subset_bias":{"offset":-4.09,"peers":10,"method":"subset-knn-v1"},"params_total_b":31.07,"params_active_b":3,"vram_est":{"bf16_gb":62.1,"int8_gb":32.9,"int4_gb":18.6,"method":"linear-rom-v1","approximate":true,"basis":"params_total_b"},"vram_frontier":{"efficiency":3.44,"expected_int8_gb":113,"method":"frontier-residual-v1","approximate":true},"fits_on":{"intel_b70":"int4","nvidia_h100_sxm_80g":"fp8","nvidia_dgx_spark":"fp8"},"is_moe":true,"is_open_weights":true,"context_window_tok":262144,"pricing":{"prompt_usd_per_m":0.15,"completion_usd_per_m":0.6,"blended_usd_per_m":0.26249999999999996},"scores":{"aime":{"raw":72.33,"norm":65.41,"trust":2,"source_url":"https://artificialanalysis.ai/models/qwen3-vl-30b-a3b-instruct","config":"aa field aime25, aime-2025, artificial analysis intelligence index v4.1.1 suite, effort=none, reasoning=false, source value 0.723333333333333 is a 0-1 fraction, x100 at harvest","measured_date":null},"gpqa_diamond":{"raw":69.49,"norm":62.66,"trust":2,"source_url":"https://artificialanalysis.ai/models/qwen3-vl-30b-a3b-instruct","config":"aa field gpqa, artificial analysis intelligence index v4.1.1 suite, effort=none, gpqa diamond, reasoning=false, source value 0.694949494949495 is a 0-1 fraction, x100 at harvest","measured_date":null},"hle":{"raw":6.3,"norm":6.32,"trust":2,"source_url":"https://artificialanalysis.ai/models/qwen3-vl-30b-a3b-instruct","config":"aa field hle, artificial analysis intelligence index v4.1.1 suite, effort=none, humanity's last exam, reasoning=false, source value 0.0630213160333642 is a 0-1 fraction, x100 at harvest","measured_date":null},"tau_bench":{"raw":19.01,"norm":0,"trust":2,"source_url":"https://artificialanalysis.ai/models/qwen3-vl-30b-a3b-instruct","config":"aa field tau2, aa field tau2 (not mapped to tau_bench), artificial analysis intelligence index v4.1.1 suite, effort=none, reasoning=false, source value 0.190058479532164 is a 0-1 fraction, x100 at harvest","measured_date":null},"terminal_bench":{"raw":6.06,"norm":1.25,"trust":2,"source_url":"https://artificialanalysis.ai/models/qwen3-vl-30b-a3b-instruct","config":"aa field terminalbenchhard, artificial analysis intelligence index v4.1.1 suite, effort=none, reasoning=false, source value 0.0606060606060606 is a 0-1 fraction, terminal-bench hard, x100 at harvest","measured_date":null}}},{"id":"mistral-3-large-675b-2512-instruct","display_name":"Mistral-Large-3-675B-Instruct-2512","family_id":"mistral","vendor":"Mistral AI","status":"current","kind":"model","superseded_by":null,"release_date":"2025-12-02","intelligence_index":35.56,"coverage":0.6349,"index_subset_bias":{"offset":-2.49,"peers":10,"method":"subset-knn-v1"},"params_total_b":675,"params_active_b":41,"vram_est":{"bf16_gb":1350,"int8_gb":716,"int4_gb":405,"method":"linear-rom-v1","approximate":true,"basis":"params_total_b"},"vram_frontier":{"efficiency":0.16,"expected_int8_gb":112,"method":"frontier-residual-v1","approximate":true},"fits_on":{},"is_moe":true,"is_open_weights":true,"context_window_tok":256000,"pricing":{"prompt_usd_per_m":null,"completion_usd_per_m":null,"blended_usd_per_m":null},"scores":{"aime":{"raw":42.92,"norm":28.65,"trust":3,"source_url":"https://www.vals.ai/benchmarks/aime","config":"mistralai/mistral-large-2512, overall accuracy (95% ci 31.3-54.6), vals ai aime leaderboard","measured_date":null},"arena_elo":{"raw":1415,"norm":60.34,"trust":3,"source_url":"https://arena.ai/leaderboard/text","config":"arena (lmarena) text leaderboard, default view, ±3","measured_date":"2026-08-17"},"gpqa_diamond":{"raw":67.17,"norm":59.39,"trust":1,"source_url":"https://huggingface.co/mistralai/Mistral-Large-3-675B-Instruct-2512","config":"official model card evaluation results (asterisked)","measured_date":"2025-12-02"},"hle":{"raw":4,"norm":2.94,"trust":2,"source_url":"https://artificialanalysis.ai/models/comparisons/mistral-large-3-vs-llama-4-maverick","config":"artificial analysis independent eval, no tools, site displays rounded whole percent (4%)","measured_date":null},"swe_bench_verified":{"raw":41.4,"norm":34.89,"trust":3,"source_url":"https://www.vals.ai/benchmarks/swebench","config":"overall resolved rate (207/500), vals ai swe-bench verified leaderboard","measured_date":null},"terminal_bench":{"raw":8.99,"norm":4.69,"trust":3,"source_url":"https://www.vals.ai/benchmarks/terminal-bench-2","config":"overall accuracy (8/89 tasks), terminus 2 harness, vals ai terminal-bench 2.0","measured_date":null}}},{"id":"qwen-3-32b-instruct-vision","display_name":"Qwen3 VL 32B Instruct","family_id":"qwen","vendor":"Alibaba","status":"current","kind":"model","superseded_by":null,"release_date":"2025-10-23","intelligence_index":35.46,"coverage":0.4445,"index_subset_bias":{"offset":-4.09,"peers":10,"method":"subset-knn-v1"},"params_total_b":33.36,"params_active_b":33.36,"vram_est":{"bf16_gb":66.7,"int8_gb":35.4,"int4_gb":20,"method":"linear-rom-v1","approximate":true,"basis":"params_total_b"},"vram_frontier":{"efficiency":0.71,"expected_int8_gb":25.3,"method":"frontier-residual-v1","approximate":true},"fits_on":{"intel_b70":"int4","nvidia_h100_sxm_80g":"fp8","nvidia_dgx_spark":"fp8"},"is_moe":false,"is_open_weights":true,"context_window_tok":131072,"pricing":{"prompt_usd_per_m":0.104,"completion_usd_per_m":0.416,"blended_usd_per_m":0.182},"scores":{"aime":{"raw":68.33,"norm":60.41,"trust":2,"source_url":"https://artificialanalysis.ai/models/qwen3-vl-32b-instruct","config":"aa field aime25, aime-2025, artificial analysis intelligence index v4.1.1 suite, effort=none, reasoning=false, source value 0.683333333333333 is a 0-1 fraction, x100 at harvest","measured_date":null},"gpqa_diamond":{"raw":67.07,"norm":59.25,"trust":2,"source_url":"https://artificialanalysis.ai/models/qwen3-vl-32b-instruct","config":"aa field gpqa, artificial analysis intelligence index v4.1.1 suite, effort=none, gpqa diamond, reasoning=false, source value 0.670707070707071 is a 0-1 fraction, x100 at harvest","measured_date":null},"hle":{"raw":6.81,"norm":7.07,"trust":2,"source_url":"https://artificialanalysis.ai/models/qwen3-vl-32b-instruct","config":"aa field hle, artificial analysis intelligence index v4.1.1 suite, effort=none, humanity's last exam, reasoning=false, source value 0.0681186283595922 is a 0-1 fraction, x100 at harvest","measured_date":null},"tau_bench":{"raw":29.24,"norm":12.32,"trust":2,"source_url":"https://artificialanalysis.ai/models/qwen3-vl-32b-instruct","config":"aa field tau2, aa field tau2 (not mapped to tau_bench), artificial analysis intelligence index v4.1.1 suite, effort=none, reasoning=false, source value 0.292397660818713 is a 0-1 fraction, x100 at harvest","measured_date":null},"terminal_bench":{"raw":8.33,"norm":3.92,"trust":2,"source_url":"https://artificialanalysis.ai/models/qwen3-vl-32b-instruct","config":"aa field terminalbenchhard, artificial analysis intelligence index v4.1.1 suite, effort=none, reasoning=false, source value 0.0833333333333333 is a 0-1 fraction, terminal-bench hard, x100 at harvest","measured_date":null}}},{"id":"glm-4.5-v","display_name":"GLM 4.5V","family_id":"glm","vendor":"Zhipu AI (Z.ai)","status":"current","kind":"model","superseded_by":null,"release_date":"2025-08-11","intelligence_index":35.31,"coverage":0.5238,"index_subset_bias":{"offset":-2.92,"peers":10,"method":"subset-knn-v1"},"params_total_b":107.71,"params_active_b":null,"vram_est":{"bf16_gb":215,"int8_gb":114,"int4_gb":64.6,"method":"linear-rom-v1","approximate":true,"basis":"params_total_b"},"vram_frontier":{"efficiency":0.98,"expected_int8_gb":111,"method":"frontier-residual-v1","approximate":true},"fits_on":{"nvidia_h100_sxm_80g":"int4","nvidia_dgx_spark":"fp8"},"is_moe":true,"is_open_weights":true,"context_window_tok":65536,"pricing":{"prompt_usd_per_m":0.6,"completion_usd_per_m":1.8,"blended_usd_per_m":0.8999999999999999},"scores":{"aime":{"raw":73,"norm":66.25,"trust":2,"source_url":"https://artificialanalysis.ai/models/glm-4-5v-reasoning","config":"aa field aime25, aime-2025, artificial analysis intelligence index v4.1.1 suite, effort=none, reasoning=true, run: reasoning, source value 0.73 is a 0-1 fraction, x100 at harvest","measured_date":null},"arena_elo":{"raw":1352.4,"norm":32.43,"trust":3,"source_url":"https://lmarena.ai/leaderboard","config":"text","measured_date":"2026-10-03"},"gpqa_diamond":{"raw":68.38,"norm":61.1,"trust":2,"source_url":"https://artificialanalysis.ai/models/glm-4-5v-reasoning","config":"aa field gpqa, artificial analysis intelligence index v4.1.1 suite, effort=none, gpqa diamond, reasoning=true, run: reasoning, source value 0.683838383838384 is a 0-1 fraction, x100 at harvest","measured_date":null},"hle":{"raw":6.3,"norm":6.32,"trust":2,"source_url":"https://artificialanalysis.ai/models/glm-4-5v-reasoning","config":"aa field hle, artificial analysis intelligence index v4.1.1 suite, effort=none, humanity's last exam, reasoning=true, run: reasoning, source value 0.0630213160333642 is a 0-1 fraction, x100 at harvest","measured_date":null},"tau_bench":{"raw":22.51,"norm":3.35,"trust":2,"source_url":"https://artificialanalysis.ai/models/glm-4-5v-reasoning","config":"aa field tau2, aa field tau2 (not mapped to tau_bench), artificial analysis intelligence index v4.1.1 suite, effort=none, reasoning=true, run: reasoning, source value 0.225146198830409 is a 0-1 fraction, x100 at harvest","measured_date":null},"terminal_bench":{"raw":6.82,"norm":2.14,"trust":2,"source_url":"https://artificialanalysis.ai/models/glm-4-5v","config":"aa field terminalbenchhard, artificial analysis intelligence index v4.1.1 suite, effort=none, reasoning=false, run: non-reasoning, source value 0.0681818181818182 is a 0-1 fraction, terminal-bench hard, x100 at harvest","measured_date":null}}},{"id":"qwen-3-32b-instruct","display_name":"Qwen3-32B","family_id":"qwen","vendor":"Alibaba","status":"current","kind":"model","superseded_by":null,"release_date":"2025-04-29","intelligence_index":35.31,"coverage":0.5238,"index_subset_bias":{"offset":-2.92,"peers":10,"method":"subset-knn-v1"},"params_total_b":32.76,"params_active_b":32.76,"vram_est":{"bf16_gb":65.5,"int8_gb":34.7,"int4_gb":19.7,"method":"linear-rom-v1","approximate":true,"basis":"params_total_b"},"vram_frontier":{"efficiency":0.72,"expected_int8_gb":25.1,"method":"frontier-residual-v1","approximate":true},"fits_on":{"intel_b70":"int4","nvidia_h100_sxm_80g":"fp8","nvidia_dgx_spark":"fp8"},"is_moe":false,"is_open_weights":true,"context_window_tok":131072,"pricing":{"prompt_usd_per_m":0.08,"completion_usd_per_m":0.28,"blended_usd_per_m":0.13},"scores":{"aime":{"raw":73,"norm":66.25,"trust":2,"source_url":"https://artificialanalysis.ai/models/qwen3-32b-instruct-reasoning","config":"aa field aime25, aime-2025, artificial analysis intelligence index v4.1.1 suite, effort=none, reasoning=true, run: reasoning, source value 0.73 is a 0-1 fraction, x100 at harvest","measured_date":null},"arena_elo":{"raw":1346.9,"norm":29.98,"trust":3,"source_url":"https://lmarena.ai/leaderboard","config":"text","measured_date":"2026-10-01"},"gpqa_diamond":{"raw":66.77,"norm":58.83,"trust":2,"source_url":"https://artificialanalysis.ai/models/qwen3-32b-instruct-reasoning","config":"aa field gpqa, artificial analysis intelligence index v4.1.1 suite, effort=none, gpqa diamond, reasoning=true, run: reasoning, source value 0.667676767676768 is a 0-1 fraction, x100 at harvest","measured_date":null},"hle":{"raw":7.41,"norm":7.96,"trust":2,"source_url":"https://artificialanalysis.ai/models/qwen3-32b-instruct-reasoning","config":"aa field hle, artificial analysis intelligence index v4.1.1 suite, effort=none, humanity's last exam, reasoning=true, run: reasoning, source value 0.0741 is a 0-1 fraction, x100 at harvest","measured_date":null},"tau_bench":{"raw":29.82,"norm":13.09,"trust":2,"source_url":"https://artificialanalysis.ai/models/qwen3-32b-instruct-reasoning","config":"aa field tau2, aa field tau2 (not mapped to tau_bench), artificial analysis intelligence index v4.1.1 suite, effort=none, reasoning=true, run: reasoning, source value 0.298245614035088 is a 0-1 fraction, x100 at harvest","measured_date":null},"terminal_bench":{"raw":5.24,"norm":0.28,"trust":2,"source_url":"https://artificialanalysis.ai/models/qwen3-32b-instruct-reasoning","config":"aa field terminalbenchv21, artificial analysis intelligence index v4.1.1 suite, effort=none, reasoning=true, run: reasoning, source value 0.052434456928839 is a 0-1 fraction, terminal-bench 2.1, x100 at harvest","measured_date":null}}},{"id":"qwen-2.5-72b-instruct","display_name":"Qwen2.5 72B Instruct","family_id":"qwen","vendor":"Alibaba","status":"current","kind":"model","superseded_by":null,"release_date":"2024-09-19","intelligence_index":32.78,"coverage":0.4762,"index_subset_bias":null,"params_total_b":72.71,"params_active_b":72.71,"vram_est":{"bf16_gb":145,"int8_gb":77.1,"int4_gb":43.6,"method":"linear-rom-v1","approximate":true,"basis":"params_total_b"},"vram_frontier":{"efficiency":0.3,"expected_int8_gb":23.1,"method":"frontier-residual-v1","approximate":true},"fits_on":{"nvidia_h100_sxm_80g":"int4","nvidia_dgx_spark":"fp8"},"is_moe":false,"is_open_weights":true,"context_window_tok":32768,"pricing":{"prompt_usd_per_m":0.36,"completion_usd_per_m":0.4,"blended_usd_per_m":0.37},"scores":{"arena_elo":{"raw":1302.8,"norm":10.33,"trust":3,"source_url":"https://lmarena.ai/leaderboard","config":"text","measured_date":"2026-10-03"},"gpqa_diamond":{"raw":49,"norm":33.8,"trust":2,"source_url":"https://arxiv.org/html/2412.15115v2","config":"5-shot","measured_date":null},"livebench":{"raw":52.3,"norm":27.33,"trust":2,"source_url":"https://arxiv.org/html/2412.15115v2","config":"0831 edition","measured_date":null},"mmlu_pro":{"raw":71.1,"norm":51.83,"trust":2,"source_url":"https://arxiv.org/html/2412.15115v2","config":"5-shot","measured_date":null}}},{"id":"qwen-3-30b-a3b-instruct","display_name":"Qwen3-30B-A3B","family_id":"qwen","vendor":"Alibaba","status":"superseded","kind":"model","superseded_by":"qwen-3-30b-a3b-2507-instruct","release_date":"2025-04-29","intelligence_index":30.93,"coverage":0.5238,"index_subset_bias":{"offset":-3.01,"peers":10,"method":"subset-knn-v1"},"params_total_b":30.53,"params_active_b":3,"vram_est":{"bf16_gb":61.1,"int8_gb":32.4,"int4_gb":18.3,"method":"linear-rom-v1","approximate":true,"basis":"params_total_b"},"vram_frontier":null,"fits_on":{"intel_b70":"int4","nvidia_h100_sxm_80g":"fp8","nvidia_dgx_spark":"fp8"},"is_moe":true,"is_open_weights":true,"context_window_tok":131072,"pricing":{"prompt_usd_per_m":0.12,"completion_usd_per_m":0.5,"blended_usd_per_m":0.215},"scores":{"aime":{"raw":72.33,"norm":65.41,"trust":2,"source_url":"https://artificialanalysis.ai/models/qwen3-30b-a3b-instruct-reasoning","config":"aa field aime25, aime-2025, artificial analysis intelligence index v4.1.1 suite, effort=none, reasoning=true, run: reasoning, source value 0.723333333333333 is a 0-1 fraction, x100 at harvest","measured_date":null},"arena_elo":{"raw":1326.5,"norm":20.89,"trust":3,"source_url":"https://lmarena.ai/leaderboard","config":"text","measured_date":"2026-10-03"},"gpqa_diamond":{"raw":61.62,"norm":51.58,"trust":2,"source_url":"https://artificialanalysis.ai/models/qwen3-30b-a3b-instruct-reasoning","config":"aa field gpqa, artificial analysis intelligence index v4.1.1 suite, effort=none, gpqa diamond, reasoning=true, run: reasoning, source value 0.616161616161616 is a 0-1 fraction, x100 at harvest","measured_date":null},"hle":{"raw":6.16,"norm":6.12,"trust":2,"source_url":"https://artificialanalysis.ai/models/qwen3-30b-a3b-instruct-reasoning","config":"aa field hle, artificial analysis intelligence index v4.1.1 suite, effort=none, humanity's last exam, reasoning=true, run: reasoning, source value 0.0616 is a 0-1 fraction, x100 at harvest","measured_date":null},"tau_bench":{"raw":26.02,"norm":8.03,"trust":2,"source_url":"https://artificialanalysis.ai/models/qwen3-30b-a3b-instruct-reasoning","config":"aa field tau2, aa field tau2 (not mapped to tau_bench), artificial analysis intelligence index v4.1.1 suite, effort=none, reasoning=true, run: reasoning, source value 0.260233918128655 is a 0-1 fraction, x100 at harvest","measured_date":null},"terminal_bench":{"raw":6.82,"norm":2.14,"trust":2,"source_url":"https://artificialanalysis.ai/models/qwen3-30b-a3b-instruct","config":"aa field terminalbenchhard, artificial analysis intelligence index v4.1.1 suite, effort=none, reasoning=false, run: non-reasoning, source value 0.0681818181818182 is a 0-1 fraction, terminal-bench hard, x100 at harvest","measured_date":null}}},{"id":"nova-1-premier","display_name":"Nova Premier 1.0","family_id":"nova","vendor":"Amazon","status":"current","kind":"model","superseded_by":null,"release_date":"2025-10-31","intelligence_index":29.59,"coverage":0.7223,"index_subset_bias":{"offset":0.71,"peers":10,"method":"subset-knn-v1"},"params_total_b":null,"params_active_b":null,"vram_est":null,"vram_frontier":null,"fits_on":null,"is_moe":false,"is_open_weights":false,"context_window_tok":1000000,"pricing":{"prompt_usd_per_m":2.5,"completion_usd_per_m":12.5,"blended_usd_per_m":5},"scores":{"aime":{"raw":17.3,"norm":0,"trust":1,"source_url":"https://cdn.amazon.science/c5/3d/84514a224666b5be6de4b43ef4aa/nova-2-0-technical-report2.pdf","config":"'nova 1 premier' row, aime 2025, aime 2025 (acc) column [raw: aime 2025], amazon nova 2 technical report, no tools, table 1","measured_date":null},"gpqa_diamond":{"raw":57.1,"norm":45.21,"trust":1,"source_url":"https://cdn.amazon.science/e5/e6/ccc5378c42dca467d1abe1628ec9/amazon-nova-premier-technical-report-and-model-card.pdf","config":"'nova premier' column (first data column), 0-shot cot, amazon nova premier technical report & model card, exact-match accuracy, no tools, reported as 57.1 +/- 6.9 [raw: gpqa diamond], table 1","measured_date":null},"hle":{"raw":4.17,"norm":3.19,"trust":2,"source_url":"https://artificialanalysis.ai/models/nova-premier","config":"artificial analysis intelligence index v4.1.1 hle eval, i.e. 4.17% [raw: humanity's last exam (hle)], no tools, page data payload for slug 'nova-premier' carries hle=0.0417052826691381 (fraction)","measured_date":null},"mmlu_pro":{"raw":73.3,"norm":55.5,"trust":1,"source_url":"https://cdn.amazon.science/c5/3d/84514a224666b5be6de4b43ef4aa/nova-2-0-technical-report2.pdf","config":"'nova 1 premier' row, amazon nova 2 technical report, mmlu-pro (acc) column [raw: mmlu-pro], table 1","measured_date":null},"swe_bench_verified":{"raw":42.4,"norm":36,"trust":1,"source_url":"https://aws.amazon.com/about-aws/whats-new/2025/04/amazon-nova-premier-complex-tasks-model-distillation","config":"internal agentic scaffold, resolved rate","measured_date":"2025-04-30"},"tau_bench":{"raw":38.3,"norm":24.4,"trust":1,"source_url":"https://cdn.amazon.science/c5/3d/84514a224666b5be6de4b43ef4aa/nova-2-0-technical-report2.pdf","config":"'nova 1 premier' row. footnote a: [raw: tau2-bench (telecom)], retail-verified and airline-verified are '-' (not evaluated) for nova 1 premier. amazon nova 2 technical report, table 2, telecom domain only - no average available","measured_date":null},"terminal_bench":{"raw":11.3,"norm":7.41,"trust":1,"source_url":"https://cdn.amazon.science/c5/3d/84514a224666b5be6de4b43ef4aa/nova-2-0-technical-report2.pdf","config":"'nova 1 premier' row [raw: terminal-bench 1.0], accuracy, amazon nova 2 technical report, table 4 (software engineering), terminal-bench 1.0","measured_date":null}}},{"id":"qwen-3-14b-instruct","display_name":"Qwen3-14B","family_id":"qwen","vendor":"Alibaba","status":"current","kind":"model","superseded_by":null,"release_date":"2025-04-29","intelligence_index":29.33,"coverage":0.4445,"index_subset_bias":{"offset":-4.18,"peers":10,"method":"subset-knn-v1"},"params_total_b":14.77,"params_active_b":14.77,"vram_est":{"bf16_gb":29.5,"int8_gb":15.7,"int4_gb":8.9,"method":"linear-rom-v1","approximate":true,"basis":"params_total_b"},"vram_frontier":{"efficiency":1.31,"expected_int8_gb":20.6,"method":"frontier-residual-v1","approximate":true},"fits_on":{"intel_b70":"fp8","nvidia_h100_sxm_80g":"fp8","nvidia_dgx_spark":"fp8"},"is_moe":false,"is_open_weights":true,"context_window_tok":131072,"pricing":{"prompt_usd_per_m":0.12,"completion_usd_per_m":0.24,"blended_usd_per_m":0.15},"scores":{"aime":{"raw":58,"norm":47.5,"trust":2,"source_url":"https://artificialanalysis.ai/models/qwen3-14b-instruct","config":"aa field aime25, aime-2025, artificial analysis intelligence index v4.1.1 suite, effort=none, reasoning=false, run: non-reasoning, source value 0.58 is a 0-1 fraction, x100 at harvest","measured_date":null},"gpqa_diamond":{"raw":60.4,"norm":49.86,"trust":2,"source_url":"https://artificialanalysis.ai/models/qwen3-14b-instruct-reasoning","config":"aa field gpqa, artificial analysis intelligence index v4.1.1 suite, effort=none, gpqa diamond, reasoning=true, run: reasoning, source value 0.604040404040404 is a 0-1 fraction, x100 at harvest","measured_date":null},"hle":{"raw":4.53,"norm":3.72,"trust":2,"source_url":"https://artificialanalysis.ai/models/qwen3-14b-instruct-reasoning","config":"aa field hle, artificial analysis intelligence index v4.1.1 suite, effort=none, humanity's last exam, reasoning=true, run: reasoning, source value 0.0453 is a 0-1 fraction, x100 at harvest","measured_date":null},"tau_bench":{"raw":34.5,"norm":19.33,"trust":2,"source_url":"https://artificialanalysis.ai/models/qwen3-14b-instruct-reasoning","config":"aa field tau2, aa field tau2 (not mapped to tau_bench), artificial analysis intelligence index v4.1.1 suite, effort=none, reasoning=true, run: reasoning, source value 0.345029239766082 is a 0-1 fraction, x100 at harvest","measured_date":null},"terminal_bench":{"raw":5.3,"norm":0.35,"trust":2,"source_url":"https://artificialanalysis.ai/models/qwen3-14b-instruct","config":"aa field terminalbenchhard, artificial analysis intelligence index v4.1.1 suite, effort=none, reasoning=false, run: non-reasoning, source value 0.053030303030303 is a 0-1 fraction, terminal-bench hard, x100 at harvest","measured_date":null}}},{"id":"olmo-3-32b-reasoning","display_name":"olmo-3-32b-think","family_id":"olmo","vendor":"Allen Institute","status":"current","kind":"model","superseded_by":null,"release_date":"2025-11-21","intelligence_index":28.73,"coverage":0.5238,"index_subset_bias":{"offset":-3.01,"peers":10,"method":"subset-knn-v1"},"params_total_b":32.23,"params_active_b":32.23,"vram_est":{"bf16_gb":64.5,"int8_gb":34.2,"int4_gb":19.3,"method":"linear-rom-v1","approximate":true,"basis":"params_total_b"},"vram_frontier":{"efficiency":0.59,"expected_int8_gb":20.1,"method":"frontier-residual-v1","approximate":true},"fits_on":{"intel_b70":"int4","nvidia_h100_sxm_80g":"fp8","nvidia_dgx_spark":"fp8"},"is_moe":false,"is_open_weights":true,"context_window_tok":65536,"pricing":{"prompt_usd_per_m":null,"completion_usd_per_m":null,"blended_usd_per_m":null},"scores":{"aime":{"raw":73.67,"norm":67.09,"trust":2,"source_url":"https://artificialanalysis.ai/models/olmo-3-32b-think","config":"aa field aime25, aime-2025, artificial analysis intelligence index v4.1.1 suite, effort=none, reasoning=true, source value 0.736666666666667 is a 0-1 fraction, x100 at harvest","measured_date":null},"arena_elo":{"raw":1306.4,"norm":11.93,"trust":3,"source_url":"https://lmarena.ai/leaderboard","config":"text","measured_date":"2026-10-03"},"gpqa_diamond":{"raw":61.01,"norm":50.72,"trust":2,"source_url":"https://artificialanalysis.ai/models/olmo-3-32b-think","config":"aa field gpqa, artificial analysis intelligence index v4.1.1 suite, effort=none, gpqa diamond, reasoning=true, source value 0.61010101010101 is a 0-1 fraction, x100 at harvest","measured_date":null},"hle":{"raw":6.44,"norm":6.53,"trust":2,"source_url":"https://artificialanalysis.ai/models/olmo-3-32b-think","config":"aa field hle, artificial analysis intelligence index v4.1.1 suite, effort=none, humanity's last exam, reasoning=true, source value 0.0644114921223355 is a 0-1 fraction, x100 at harvest","measured_date":null},"tau_bench":{"raw":0,"norm":0,"trust":2,"source_url":"https://artificialanalysis.ai/models/olmo-3-32b-think","config":"aa field tau2, aa field tau2 (not mapped to tau_bench), artificial analysis intelligence index v4.1.1 suite, effort=none, reasoning=true, source value 0 is a 0-1 fraction, x100 at harvest","measured_date":null},"terminal_bench":{"raw":1.52,"norm":0,"trust":2,"source_url":"https://artificialanalysis.ai/models/olmo-3-32b-think","config":"aa field terminalbenchhard, artificial analysis intelligence index v4.1.1 suite, effort=none, reasoning=true, source value 0.0151515151515152 is a 0-1 fraction, terminal-bench hard, x100 at harvest","measured_date":null}}},{"id":"nemotron-2-nano-9b","display_name":"nemotron-nano-9b-v2","family_id":"nemotron","vendor":"NVIDIA","status":"current","kind":"model","superseded_by":null,"release_date":"2025-09-05","intelligence_index":28.71,"coverage":0.4445,"index_subset_bias":{"offset":-4.18,"peers":10,"method":"subset-knn-v1"},"params_total_b":8.89,"params_active_b":8.89,"vram_est":{"bf16_gb":17.8,"int8_gb":9.4,"int4_gb":5.3,"method":"linear-rom-v1","approximate":true,"basis":"params_total_b"},"vram_frontier":{"efficiency":2.13,"expected_int8_gb":20.1,"method":"frontier-residual-v1","approximate":true},"fits_on":{"intel_b70":"fp8","nvidia_h100_sxm_80g":"fp8","nvidia_dgx_spark":"fp8"},"is_moe":false,"is_open_weights":true,"context_window_tok":128000,"pricing":{"prompt_usd_per_m":null,"completion_usd_per_m":null,"blended_usd_per_m":null},"scores":{"aime":{"raw":69.67,"norm":62.09,"trust":2,"source_url":"https://artificialanalysis.ai/models/nvidia-nemotron-nano-9b-v2-reasoning","config":"aa field aime25, aime-2025, artificial analysis intelligence index v4.1.1 suite, effort=none, reasoning=true, run: reasoning, source value 0.696666666666667 is a 0-1 fraction, x100 at harvest","measured_date":null},"gpqa_diamond":{"raw":56.97,"norm":45.03,"trust":2,"source_url":"https://artificialanalysis.ai/models/nvidia-nemotron-nano-9b-v2-reasoning","config":"aa field gpqa, artificial analysis intelligence index v4.1.1 suite, effort=none, gpqa diamond, reasoning=true, run: reasoning, source value 0.56969696969697 is a 0-1 fraction, x100 at harvest","measured_date":null},"hle":{"raw":4.87,"norm":4.22,"trust":2,"source_url":"https://artificialanalysis.ai/models/nvidia-nemotron-nano-9b-v2-reasoning","config":"aa field hle, artificial analysis intelligence index v4.1.1 suite, effort=none, humanity's last exam, reasoning=true, run: reasoning, source value 0.0486561631139944 is a 0-1 fraction, x100 at harvest","measured_date":null},"tau_bench":{"raw":23.39,"norm":4.52,"trust":2,"source_url":"https://artificialanalysis.ai/models/nvidia-nemotron-nano-9b-v2","config":"aa field tau2, aa field tau2 (not mapped to tau_bench), artificial analysis intelligence index v4.1.1 suite, effort=none, reasoning=false, run: non-reasoning, source value 0.233918128654971 is a 0-1 fraction, x100 at harvest","measured_date":null},"terminal_bench":{"raw":1.52,"norm":0,"trust":2,"source_url":"https://artificialanalysis.ai/models/nvidia-nemotron-nano-9b-v2-reasoning","config":"aa field terminalbenchhard, artificial analysis intelligence index v4.1.1 suite, effort=none, reasoning=true, run: reasoning, source value 0.0151515151515152 is a 0-1 fraction, terminal-bench hard, x100 at harvest","measured_date":null}}},{"id":"sonar-1","display_name":"Sonar","family_id":"sonar","vendor":"perplexity","status":"current","kind":"model","superseded_by":null,"release_date":"2025-01-27","intelligence_index":28.67,"coverage":0.3889,"index_subset_bias":null,"params_total_b":null,"params_active_b":null,"vram_est":null,"vram_frontier":null,"fits_on":null,"is_moe":false,"is_open_weights":false,"context_window_tok":127072,"pricing":{"prompt_usd_per_m":1,"completion_usd_per_m":1,"blended_usd_per_m":1},"scores":{"gpqa_diamond":{"raw":47.1,"norm":31.13,"trust":2,"source_url":"https://artificialanalysis.ai/evaluations/gpqa-diamond?models=sonar","config":"artificial analysis harness, gpqa diamond","measured_date":null},"hle":{"raw":4.9,"norm":4.26,"trust":2,"source_url":"https://artificialanalysis.ai/evaluations/humanitys-last-exam?models=sonar","config":"artificial analysis harness, humanity's last exam","measured_date":null},"mmlu_pro":{"raw":68.9,"norm":48.17,"trust":2,"source_url":"https://artificialanalysis.ai/evaluations/mmlu-pro?models=sonar","config":"artificial analysis harness, mmlu-pro","measured_date":null}}},{"id":"llama-4-maverick-17b-128e-instruct","display_name":"Llama-4-Maverick-17B-128E-Instruct","family_id":"llama","vendor":"Meta","status":"current","kind":"model","superseded_by":null,"release_date":"2025-04-05","intelligence_index":28.58,"coverage":0.8412,"index_subset_bias":null,"params_total_b":401.58,"params_active_b":17,"vram_est":{"bf16_gb":803,"int8_gb":426,"int4_gb":241,"method":"linear-rom-v1","approximate":true,"basis":"params_total_b"},"vram_frontier":{"efficiency":0.21,"expected_int8_gb":88.7,"method":"frontier-residual-v1","approximate":true},"fits_on":{},"is_moe":true,"is_open_weights":true,"context_window_tok":1048576,"pricing":{"prompt_usd_per_m":0.1875,"completion_usd_per_m":0.6525,"blended_usd_per_m":0.30374999999999996},"scores":{"aime":{"raw":25.21,"norm":6.51,"trust":3,"source_url":"https://www.vals.ai/benchmarks/aime","config":"overall accuracy (95% ci 17.5-32.9), served via fireworks as llama4-maverick-instruct-basic, vals ai aime leaderboard","measured_date":null},"arc_agi_2":{"raw":0,"norm":0,"trust":3,"source_url":"https://arcprize.org/leaderboard","config":"cost_per_task_usd=0.0121, eval=arc-agi-2 semi-private (v2_semi_private), model_group=llama 4, org=meta, system_type=base llm","measured_date":"2026-08-21"},"arena_elo":{"raw":1327,"norm":21.11,"trust":3,"source_url":"https://lmarena.ai/leaderboard","config":"text","measured_date":"2026-09-27"},"gpqa_diamond":{"raw":67.07,"norm":59.25,"trust":2,"source_url":"https://artificialanalysis.ai/models/llama-4-maverick","config":"aa field gpqa, artificial analysis intelligence index v4.1.1 suite, effort=none, gpqa diamond, reasoning=false, source value 0.670707070707071 is a 0-1 fraction, x100 at harvest","measured_date":null},"hle":{"raw":5.7,"norm":5.44,"trust":2,"source_url":"https://epoch.ai/models/llama-4-maverick","config":"best score across settings, epoch ai independent eval, no tools","measured_date":null},"livebench":{"raw":54.38,"norm":31.96,"trust":3,"source_url":"https://livebench.ai/table_2025_04_02.csv","config":"global average = mean of 6 category averages computed from official table_2025_04_02.csv, livebench 2025-04-02 release","measured_date":"2025-04-02"},"mmlu_pro":{"raw":80.5,"norm":67.5,"trust":1,"source_url":"https://huggingface.co/meta-llama/Llama-4-Maverick-17B-128E-Instruct","config":"macro_avg/acc; 0-shot, temperature=0, no majority voting","measured_date":"2025-04-05"},"tau_bench":{"raw":17.84,"norm":0,"trust":2,"source_url":"https://artificialanalysis.ai/models/llama-4-maverick","config":"aa field tau2, aa field tau2 (not mapped to tau_bench), artificial analysis intelligence index v4.1.1 suite, effort=none, reasoning=false, source value 0.178362573099415 is a 0-1 fraction, x100 at harvest","measured_date":null},"terminal_bench":{"raw":2.25,"norm":0,"trust":3,"source_url":"https://www.vals.ai/benchmarks/terminal-bench-2","config":"overall accuracy (2/89 tasks), terminus 2 harness, vals ai terminal-bench 2.0","measured_date":null}}},{"id":"qwen-2.5-32b-instruct","display_name":"Qwen2.5-32B-Instruct","family_id":"qwen","vendor":"Alibaba","status":"superseded","kind":"model","superseded_by":"qwen-3-32b-instruct","release_date":"2024-09","intelligence_index":28.37,"coverage":0.3889,"index_subset_bias":null,"params_total_b":32.76,"params_active_b":32.76,"vram_est":{"bf16_gb":65.5,"int8_gb":34.7,"int4_gb":19.7,"method":"linear-rom-v1","approximate":true,"basis":"params_total_b"},"vram_frontier":null,"fits_on":{"intel_b70":"int4","nvidia_h100_sxm_80g":"fp8","nvidia_dgx_spark":"fp8"},"is_moe":false,"is_open_weights":true,"context_window_tok":null,"pricing":{"prompt_usd_per_m":null,"completion_usd_per_m":null,"blended_usd_per_m":null},"scores":{"gpqa_diamond":{"raw":46.57,"norm":30.38,"trust":2,"source_url":"https://artificialanalysis.ai/models/qwen2.5-32b-instruct","config":"artificial analysis independent evaluation","measured_date":null},"hle":{"raw":3.99,"norm":2.93,"trust":2,"source_url":"https://artificialanalysis.ai/models/qwen2.5-32b-instruct","config":"aa field hle, artificial analysis intelligence index v4.1.1 suite, effort=none, humanity's last exam, reasoning=false, source value 0.0399 is a 0-1 fraction, x100 at harvest","measured_date":null},"mmlu_pro":{"raw":69.66,"norm":49.43,"trust":2,"source_url":"https://artificialanalysis.ai/models/qwen2.5-32b-instruct","config":"artificial analysis independent evaluation","measured_date":null}}},{"id":"gemini-2.5-flash-lite","display_name":"Gemini 2.5 Flash Lite","family_id":"gemini","vendor":"Google","status":"superseded","kind":"model","superseded_by":"gemini-3.5-flash-lite","release_date":"2025-07-22","intelligence_index":28.08,"coverage":0.4445,"index_subset_bias":{"offset":-4.18,"peers":10,"method":"subset-knn-v1"},"params_total_b":null,"params_active_b":null,"vram_est":null,"vram_frontier":null,"fits_on":null,"is_moe":false,"is_open_weights":false,"context_window_tok":1048576,"pricing":{"prompt_usd_per_m":0.1,"completion_usd_per_m":0.4,"blended_usd_per_m":0.17500000000000002},"scores":{"aime":{"raw":53.33,"norm":41.66,"trust":2,"source_url":"https://artificialanalysis.ai/models/gemini-2-5-flash-lite-reasoning","config":"aa field aime25, aime-2025, artificial analysis intelligence index v4.1.1 suite, effort=none, reasoning=true, run: reasoning, source value 0.533333333333333 is a 0-1 fraction, x100 at harvest","measured_date":null},"gpqa_diamond":{"raw":62.53,"norm":52.86,"trust":2,"source_url":"https://artificialanalysis.ai/models/gemini-2-5-flash-lite-reasoning","config":"aa field gpqa, artificial analysis intelligence index v4.1.1 suite, effort=none, gpqa diamond, reasoning=true, run: reasoning, source value 0.625252525252525 is a 0-1 fraction, x100 at harvest","measured_date":null},"hle":{"raw":6.81,"norm":7.07,"trust":2,"source_url":"https://artificialanalysis.ai/models/gemini-2-5-flash-lite-reasoning","config":"aa field hle, artificial analysis intelligence index v4.1.1 suite, effort=none, humanity's last exam, reasoning=true, run: reasoning, source value 0.0681186283595922 is a 0-1 fraction, x100 at harvest","measured_date":null},"tau_bench":{"raw":19.01,"norm":0,"trust":2,"source_url":"https://artificialanalysis.ai/models/gemini-2-5-flash-lite","config":"aa field tau2, aa field tau2 (not mapped to tau_bench), artificial analysis intelligence index v4.1.1 suite, effort=none, reasoning=false, run: non-reasoning, source value 0.190058479532164 is a 0-1 fraction, x100 at harvest","measured_date":null},"terminal_bench":{"raw":4.55,"norm":0,"trust":2,"source_url":"https://artificialanalysis.ai/models/gemini-2-5-flash-lite-reasoning","config":"aa field terminalbenchhard, artificial analysis intelligence index v4.1.1 suite, effort=none, reasoning=true, run: reasoning, source value 0.0454545454545455 is a 0-1 fraction, terminal-bench hard, x100 at harvest","measured_date":null}}},{"id":"deepseek-v3","display_name":"DeepSeek-V3","family_id":"deepseek","vendor":"DeepSeek","status":"superseded","kind":"model","superseded_by":"deepseek-v3.2","release_date":"2024-12","intelligence_index":27.75,"coverage":0.6428,"index_subset_bias":{"offset":1.78,"peers":10,"method":"subset-knn-v1"},"params_total_b":684.53,"params_active_b":37,"vram_est":{"bf16_gb":1369,"int8_gb":726,"int4_gb":411,"method":"linear-rom-v1","approximate":true,"basis":"params_total_b"},"vram_frontier":null,"fits_on":{},"is_moe":true,"is_open_weights":true,"context_window_tok":163840,"pricing":{"prompt_usd_per_m":0.2574,"completion_usd_per_m":1.0287,"blended_usd_per_m":0.450225},"scores":{"aime":{"raw":27.5,"norm":9.38,"trust":3,"source_url":"https://www.vals.ai/benchmarks/aime","config":"archived=true, edition=aime v1, runner=platform, stderr=0.73, task=overall, updated=2026-04-16","measured_date":"2026-08-19"},"arena_elo":{"raw":1358.4,"norm":35.11,"trust":3,"source_url":"https://lmarena.ai/leaderboard","config":"text","measured_date":"2026-10-01"},"gpqa_diamond":{"raw":54.55,"norm":41.62,"trust":3,"source_url":"https://www.vals.ai/benchmarks/gpqa","config":"edition=gpqa diamond v1, runner=platform, stderr=2.504, task=overall, updated=2026-08-19","measured_date":"2026-08-19"},"hle":{"raw":2.9,"norm":1.32,"trust":2,"source_url":"https://artificialanalysis.ai/models/deepseek-v3","config":"aa field hle, artificial analysis intelligence index v4.1.1 suite, effort=none, humanity's last exam, reasoning=false, run: dec '24, source value 0.029 is a 0-1 fraction, x100 at harvest","measured_date":null},"mmlu_pro":{"raw":73.82,"norm":56.37,"trust":3,"source_url":"https://www.vals.ai/benchmarks/mmlu_pro","config":"edition=mmlu pro v1, runner=platform, stderr=0.424, task=overall, updated=2026-08-19","measured_date":"2026-08-19"},"tau_bench":{"raw":22.81,"norm":3.75,"trust":2,"source_url":"https://artificialanalysis.ai/models/deepseek-v3","config":"aa field tau2, aa field tau2 (not mapped to tau_bench), artificial analysis intelligence index v4.1.1 suite, effort=none, reasoning=false, run: dec '24, source value 0.228070175438596 is a 0-1 fraction, x100 at harvest","measured_date":null},"terminal_bench":{"raw":16.85,"norm":13.94,"trust":2,"source_url":"https://artificialanalysis.ai/models/deepseek-v3","config":"aa field terminalbenchv21, artificial analysis intelligence index v4.1.1 suite, effort=none, reasoning=false, run: dec '24, source value 0.168539325842697 is a 0-1 fraction, terminal-bench 2.1, x100 at harvest","measured_date":null}}},{"id":"ministral-3-14b","display_name":"Ministral 3 14B","family_id":"ministral","vendor":"Mistral AI","status":"current","kind":"model","superseded_by":null,"release_date":"2025-12-02","intelligence_index":26.42,"coverage":0.5635,"index_subset_bias":{"offset":1.2,"peers":10,"method":"subset-knn-v1"},"params_total_b":14,"params_active_b":14,"vram_est":{"bf16_gb":28,"int8_gb":14.8,"int4_gb":8.4,"method":"linear-rom-v1","approximate":true,"basis":"params_total_b"},"vram_frontier":{"efficiency":1.24,"expected_int8_gb":18.5,"method":"frontier-residual-v1","approximate":true},"fits_on":{"intel_b70":"fp8","nvidia_h100_sxm_80g":"fp8","nvidia_dgx_spark":"fp8"},"is_moe":false,"is_open_weights":true,"context_window_tok":256000,"pricing":{"prompt_usd_per_m":null,"completion_usd_per_m":null,"blended_usd_per_m":null},"scores":{"aime":{"raw":30,"norm":12.5,"trust":2,"source_url":"https://artificialanalysis.ai/evaluations/aime-2025?models=ministral-3-14b","config":"aime 2025, artificial analysis harness","measured_date":null},"gpqa_diamond":{"raw":57.2,"norm":45.35,"trust":2,"source_url":"https://artificialanalysis.ai/evaluations/gpqa-diamond?models=ministral-3-14b","config":"artificial analysis harness, gpqa diamond","measured_date":null},"hle":{"raw":4.6,"norm":3.82,"trust":2,"source_url":"https://artificialanalysis.ai/evaluations/humanitys-last-exam?models=ministral-3-14b","config":"artificial analysis harness, humanity's last exam","measured_date":null},"mmlu_pro":{"raw":69.3,"norm":48.83,"trust":2,"source_url":"https://artificialanalysis.ai/evaluations/mmlu-pro?models=ministral-3-14b","config":"artificial analysis harness, mmlu-pro","measured_date":null},"tau_bench":{"raw":27.2,"norm":9.6,"trust":2,"source_url":"https://artificialanalysis.ai/evaluations/tau2-bench?models=ministral-3-14b","config":"artificial analysis harness, tau2-bench telecom","measured_date":null},"terminal_bench":{"raw":4.5,"norm":0,"trust":2,"source_url":"https://artificialanalysis.ai/evaluations/terminalbench-hard?models=ministral-3-14b","config":"artificial analysis harness, terminal-bench hard","measured_date":null}}},{"id":"deepseek-r1-distill-qwen-14b-reasoning","display_name":"DeepSeek-R1-Distill-Qwen-14B","family_id":"deepseek","vendor":"DeepSeek","status":"current","kind":"model","superseded_by":null,"release_date":"2025-01-20","intelligence_index":26.1,"coverage":0.3492,"index_subset_bias":{"offset":-1.43,"peers":10,"method":"subset-knn-v1"},"params_total_b":14.77,"params_active_b":14.77,"vram_est":{"bf16_gb":29.5,"int8_gb":15.7,"int4_gb":8.9,"method":"linear-rom-v1","approximate":true,"basis":"params_total_b"},"vram_frontier":{"efficiency":1.17,"expected_int8_gb":18.2,"method":"frontier-residual-v1","approximate":true},"fits_on":{"intel_b70":"fp8","nvidia_h100_sxm_80g":"fp8","nvidia_dgx_spark":"fp8"},"is_moe":false,"is_open_weights":true,"context_window_tok":128000,"pricing":{"prompt_usd_per_m":null,"completion_usd_per_m":null,"blended_usd_per_m":null},"scores":{"aime":{"raw":55.67,"norm":44.59,"trust":2,"source_url":"https://artificialanalysis.ai/models/deepseek-r1-distill-qwen-14b","config":"aa field aime25, aime-2025, artificial analysis intelligence index v4.1.1 suite, effort=none, reasoning=true, source value 0.556666666666667 is a 0-1 fraction, x100 at harvest","measured_date":null},"gpqa_diamond":{"raw":48.38,"norm":32.93,"trust":2,"source_url":"https://artificialanalysis.ai/models/deepseek-r1-distill-qwen-14b","config":"aa field gpqa, artificial analysis intelligence index v4.1.1 suite, effort=none, gpqa diamond, reasoning=true, source value 0.483838383838384 is a 0-1 fraction, x100 at harvest","measured_date":null},"hle":{"raw":4.13,"norm":3.13,"trust":2,"source_url":"https://artificialanalysis.ai/models/deepseek-r1-distill-qwen-14b","config":"aa field hle, artificial analysis intelligence index v4.1.1 suite, effort=none, humanity's last exam, reasoning=true, source value 0.0413 is a 0-1 fraction, x100 at harvest","measured_date":null}}},{"id":"qwen-3-1.7b","display_name":"Qwen3-1.7B","family_id":"qwen","vendor":"Alibaba","status":"current","kind":"model","superseded_by":null,"release_date":"2025-04-28","intelligence_index":25.54,"coverage":0.3572,"index_subset_bias":null,"params_total_b":2.03,"params_active_b":2.03,"vram_est":{"bf16_gb":4.1,"int8_gb":2.2,"int4_gb":1.2,"method":"linear-rom-v1","approximate":true,"basis":"params_total_b"},"vram_frontier":{"efficiency":8.3,"expected_int8_gb":17.9,"method":"frontier-residual-v1","approximate":true},"fits_on":{"intel_b70":"fp8","nvidia_h100_sxm_80g":"fp8","nvidia_dgx_spark":"fp8"},"is_moe":false,"is_open_weights":true,"context_window_tok":32768,"pricing":{"prompt_usd_per_m":null,"completion_usd_per_m":null,"blended_usd_per_m":null},"scores":{"aime":{"raw":48.3,"norm":35.37,"trust":2,"source_url":"https://arxiv.org/html/2505.09388v1","config":"24, thinking mode","measured_date":null},"gpqa_diamond":{"raw":40.1,"norm":21.27,"trust":2,"source_url":"https://arxiv.org/html/2505.09388v1","config":"thinking mode","measured_date":null},"livebench":{"raw":51.1,"norm":24.67,"trust":2,"source_url":"https://arxiv.org/html/2505.09388v1","config":"2024.11.25, thinking mode","measured_date":null}}},{"id":"command-a-03-2025","display_name":"Command A","family_id":"command","vendor":"Cohere","status":"current","kind":"model","superseded_by":null,"release_date":"2025-03","intelligence_index":25.28,"coverage":0.8016,"index_subset_bias":null,"params_total_b":111.06,"params_active_b":111.06,"vram_est":{"bf16_gb":222,"int8_gb":118,"int4_gb":66.6,"method":"linear-rom-v1","approximate":true,"basis":"params_total_b"},"vram_frontier":{"efficiency":0.15,"expected_int8_gb":17.7,"method":"frontier-residual-v1","approximate":true},"fits_on":{"nvidia_h100_sxm_80g":"int4","nvidia_dgx_spark":"fp8"},"is_moe":false,"is_open_weights":true,"context_window_tok":256000,"pricing":{"prompt_usd_per_m":2.5,"completion_usd_per_m":10,"blended_usd_per_m":4.375},"scores":{"aime":{"raw":13.33,"norm":0,"trust":3,"source_url":"https://www.vals.ai/benchmarks/aime","config":"archived=true, edition=aime v1, runner=platform, stderr=0.945, task=overall, updated=2026-04-16","measured_date":"2026-08-19"},"arena_elo":{"raw":1353.7,"norm":33.01,"trust":3,"source_url":"https://lmarena.ai/leaderboard","config":"text","measured_date":"2026-10-01"},"gpqa_diamond":{"raw":48.48,"norm":33.07,"trust":3,"source_url":"https://www.vals.ai/benchmarks/gpqa","config":"edition=gpqa diamond v1, runner=platform, stderr=2.276, task=overall, updated=2026-08-19","measured_date":"2026-08-19"},"hle":{"raw":11.96,"norm":14.65,"trust":2,"source_url":"https://artificialanalysis.ai/models/command-a-plus","config":"aa field hle, artificial analysis intelligence index v4.1.1 suite, effort=none, humanity's last exam, reasoning=true, run: command a+, source value 0.119555143651529 is a 0-1 fraction, x100 at harvest","measured_date":null},"mmlu_pro":{"raw":69.17,"norm":48.62,"trust":3,"source_url":"https://www.vals.ai/benchmarks/mmlu_pro","config":"edition=mmlu pro v1, runner=platform, stderr=0.463, task=overall, updated=2026-08-19","measured_date":"2026-08-19"},"swe_bench_verified":{"raw":7.8,"norm":0,"trust":3,"source_url":"https://www.vals.ai/benchmarks/swebench","config":"edition=swe-bench verified v1, runner=external, stderr=1.201, task=overall, updated=2026-08-19","measured_date":"2026-08-19"},"tau_bench":{"raw":80.7,"norm":80.93,"trust":2,"source_url":"https://artificialanalysis.ai/models/command-a-plus","config":"aa field tau2, aa field tau2 (not mapped to tau_bench), artificial analysis intelligence index v4.1.1 suite, effort=none, reasoning=true, run: command a+, source value 0.807017543859649 is a 0-1 fraction, x100 at harvest","measured_date":null},"terminal_bench":{"raw":25,"norm":23.53,"trust":2,"source_url":"https://artificialanalysis.ai/models/command-a-plus","config":"aa field terminalbenchhard, artificial analysis intelligence index v4.1.1 suite, effort=none, reasoning=true, run: command a+, source value 0.25 is a 0-1 fraction, terminal-bench hard, x100 at harvest","measured_date":null}}},{"id":"gemma-4-e2b","display_name":"Gemma 4 E2B","family_id":"gemma","vendor":"Google DeepMind","status":"current","kind":"model","superseded_by":null,"release_date":"2026-04-02","intelligence_index":24.96,"coverage":0.4049,"index_subset_bias":null,"params_total_b":5.12,"params_active_b":5.12,"vram_est":{"bf16_gb":10.2,"int8_gb":5.4,"int4_gb":3.1,"method":"linear-rom-v1","approximate":true,"basis":"params_total_b"},"vram_frontier":{"efficiency":3.22,"expected_int8_gb":17.5,"method":"frontier-residual-v1","approximate":true},"fits_on":{"intel_b70":"fp8","nvidia_h100_sxm_80g":"fp8","nvidia_dgx_spark":"fp8"},"is_moe":false,"is_open_weights":true,"context_window_tok":128000,"pricing":{"prompt_usd_per_m":null,"completion_usd_per_m":null,"blended_usd_per_m":null},"scores":{"aime":{"raw":37.5,"norm":21.88,"trust":1,"source_url":"https://huggingface.co/google/gemma-4-E2B-it","config":"2026, no tools","measured_date":null},"gpqa_diamond":{"raw":43.4,"norm":25.92,"trust":1,"source_url":"https://huggingface.co/google/gemma-4-E2B-it","config":null,"measured_date":null},"mmlu_pro":{"raw":60,"norm":33.33,"trust":1,"source_url":"https://huggingface.co/google/gemma-4-E2B-it","config":null,"measured_date":null},"tau_bench":{"raw":24.5,"norm":6,"trust":1,"source_url":"https://huggingface.co/google/gemma-4-E2B-it","config":"tau2/average","measured_date":null}}},{"id":"lfm-2.5-2.6b","display_name":"LFM2.5-2.6B","family_id":"lfm","vendor":"liquid","status":"current","kind":"model","superseded_by":null,"release_date":"2026-08-11","intelligence_index":23.83,"coverage":0.3174,"index_subset_bias":{"offset":-6.34,"peers":10,"method":"subset-knn-v1"},"params_total_b":2.7,"params_active_b":2.7,"vram_est":{"bf16_gb":5.4,"int8_gb":2.9,"int4_gb":1.6,"method":"linear-rom-v1","approximate":true,"basis":"params_total_b"},"vram_frontier":{"efficiency":5.83,"expected_int8_gb":16.7,"method":"frontier-residual-v1","approximate":true},"fits_on":{"intel_b70":"fp8","nvidia_h100_sxm_80g":"fp8","nvidia_dgx_spark":"fp8"},"is_moe":false,"is_open_weights":true,"context_window_tok":65536,"pricing":{"prompt_usd_per_m":0,"completion_usd_per_m":0,"blended_usd_per_m":0},"scores":{"gpqa_diamond":{"raw":55.76,"norm":43.32,"trust":2,"source_url":"https://artificialanalysis.ai/models/lfm2-5-2-6b","config":"aa field gpqa, artificial analysis intelligence index v4.1.1 suite, effort=none, gpqa diamond, reasoning=true, source value 0.557575757575758 is a 0-1 fraction, x100 at harvest","measured_date":null},"hle":{"raw":6.21,"norm":6.19,"trust":2,"source_url":"https://artificialanalysis.ai/models/lfm2-5-2-6b","config":"aa field hle, artificial analysis intelligence index v4.1.1 suite, effort=none, humanity's last exam, reasoning=true, source value 0.06209453197405 is a 0-1 fraction, x100 at harvest","measured_date":null},"terminal_bench":{"raw":4.49,"norm":0,"trust":2,"source_url":"https://artificialanalysis.ai/models/lfm2-5-2-6b","config":"aa field terminalbenchv21, artificial analysis intelligence index v4.1.1 suite, effort=none, reasoning=true, source value 0.0449438202247191 is a 0-1 fraction, terminal-bench 2.1, x100 at harvest","measured_date":null}}},{"id":"llama-3.1-405b-instruct","display_name":"Llama-3.1-405B-Instruct","family_id":"llama","vendor":"Meta","status":"current","kind":"model","superseded_by":null,"release_date":"2024-07-23","intelligence_index":23.22,"coverage":0.6428,"index_subset_bias":{"offset":1.78,"peers":10,"method":"subset-knn-v1"},"params_total_b":405.85,"params_active_b":405.85,"vram_est":{"bf16_gb":812,"int8_gb":430,"int4_gb":244,"method":"linear-rom-v1","approximate":true,"basis":"params_total_b"},"vram_frontier":{"efficiency":0.04,"expected_int8_gb":16.3,"method":"frontier-residual-v1","approximate":true},"fits_on":{},"is_moe":false,"is_open_weights":true,"context_window_tok":131072,"pricing":{"prompt_usd_per_m":null,"completion_usd_per_m":null,"blended_usd_per_m":null},"scores":{"aime":{"raw":3,"norm":0,"trust":2,"source_url":"https://artificialanalysis.ai/models/llama-3-1-instruct-405b","config":"2025, artificial analysis independent run, non-reasoning","measured_date":null},"arena_elo":{"raw":1335.2,"norm":24.77,"trust":3,"source_url":"https://arena.ai/leaderboard/text","config":"41375 votes, arena entry llama-3.1-405b-instruct-bf16, leaderboard text-overall-style_control, rank 223, run: llama-3.1-405b-instruct-bf16, style control, text/overall, vote cutoff 2026-08-21","measured_date":"2026-08-21"},"gpqa_diamond":{"raw":51.52,"norm":37.35,"trust":2,"source_url":"https://artificialanalysis.ai/models/llama-3-1-instruct-405b","config":"aa field gpqa, artificial analysis intelligence index v4.1.1 suite, effort=none, gpqa diamond, reasoning=false, source value 0.515151515151515 is a 0-1 fraction, x100 at harvest","measured_date":null},"hle":{"raw":3.98,"norm":2.91,"trust":2,"source_url":"https://artificialanalysis.ai/models/llama-3-1-instruct-405b","config":"artificial analysis independent run, no tools","measured_date":null},"mmlu_pro":{"raw":73.3,"norm":55.5,"trust":1,"source_url":"https://huggingface.co/meta-llama/Llama-3.1-405B-Instruct","config":"cot, 5-shot, micro_avg/acc_char","measured_date":null},"tau_bench":{"raw":19.01,"norm":0,"trust":2,"source_url":"https://artificialanalysis.ai/models/llama-3-1-instruct-405b","config":"aa field tau2, aa field tau2 (not mapped to tau_bench), artificial analysis intelligence index v4.1.1 suite, effort=none, reasoning=false, source value 0.190058479532164 is a 0-1 fraction, x100 at harvest","measured_date":null},"terminal_bench":{"raw":6.82,"norm":2.14,"trust":2,"source_url":"https://artificialanalysis.ai/models/llama-3-1-instruct-405b","config":"aa field terminalbenchhard, artificial analysis intelligence index v4.1.1 suite, effort=none, reasoning=false, source value 0.0681818181818182 is a 0-1 fraction, terminal-bench hard, x100 at harvest","measured_date":null}}},{"id":"mistral-2502-saba","display_name":"Mistral Saba","family_id":"mistral","vendor":"Mistral AI","status":"current","kind":"model","superseded_by":null,"release_date":"2025-02-17","intelligence_index":21.75,"coverage":0.3889,"index_subset_bias":null,"params_total_b":null,"params_active_b":null,"vram_est":null,"vram_frontier":null,"fits_on":null,"is_moe":false,"is_open_weights":false,"context_window_tok":32768,"pricing":{"prompt_usd_per_m":0.2,"completion_usd_per_m":0.6,"blended_usd_per_m":0.30000000000000004},"scores":{"gpqa_diamond":{"raw":42.42,"norm":24.54,"trust":2,"source_url":"https://artificialanalysis.ai/models/mistral-saba","config":"aa field gpqa, artificial analysis intelligence index v4.1.1 suite, effort=none, gpqa diamond, reasoning=false, source value 0.424242424242424 is a 0-1 fraction, x100 at harvest","measured_date":null},"hle":{"raw":4.3,"norm":3.38,"trust":2,"source_url":"https://artificialanalysis.ai/models/mistral-saba","config":"aa field hle, artificial analysis intelligence index v4.1.1 suite, effort=none, humanity's last exam, reasoning=false, source value 0.043 is a 0-1 fraction, x100 at harvest","measured_date":null},"mmlu_pro":{"raw":61.1,"norm":35.17,"trust":2,"source_url":"https://artificialanalysis.ai/evaluations/mmlu-pro","config":"artificial analysis independent eval","measured_date":null}}},{"id":"gpt-4-turbo","display_name":"GPT-4 Turbo","family_id":"gpt","vendor":"OpenAI","status":"current","kind":"model","superseded_by":null,"release_date":"2024-04-09","intelligence_index":21.02,"coverage":0.4285,"index_subset_bias":null,"params_total_b":null,"params_active_b":null,"vram_est":null,"vram_frontier":null,"fits_on":null,"is_moe":false,"is_open_weights":false,"context_window_tok":128000,"pricing":{"prompt_usd_per_m":10,"completion_usd_per_m":30,"blended_usd_per_m":15},"scores":{"arena_elo":{"raw":1324.3,"norm":19.91,"trust":3,"source_url":"https://arena.ai/leaderboard/text","config":"98114 votes, arena entry gpt-4-turbo-2024-04-09, leaderboard text-overall-style_control, rank 233, style control, text/overall, vote cutoff 2026-08-21","measured_date":"2026-08-21"},"hle":{"raw":3.13,"norm":1.66,"trust":2,"source_url":"https://artificialanalysis.ai/models/gpt-4-turbo","config":"aa field hle, artificial analysis intelligence index v4.1.1 suite, effort=none, humanity's last exam, reasoning=false, source value 0.0313 is a 0-1 fraction, x100 at harvest","measured_date":null},"livebench":{"raw":49.6,"norm":21.33,"trust":2,"source_url":"https://arxiv.org/html/2406.19314v2","config":"global average, gpt-4-turbo-2024-04-09, table 2","measured_date":"2025-04-18"},"mmlu_pro":{"raw":63.71,"norm":39.52,"trust":3,"source_url":"https://github.com/TIGER-AI-Lab/MMLU-Pro","config":"official mmlu-pro leaderboard","measured_date":"2024-10-10"}}},{"id":"mistral-3-14b-2512-instruct","display_name":"Ministral-3-14B-Instruct-2512","family_id":"mistral","vendor":"Mistral AI","status":"current","kind":"model","superseded_by":null,"release_date":"2025-12-02","intelligence_index":21.01,"coverage":0.4445,"index_subset_bias":{"offset":-4.18,"peers":10,"method":"subset-knn-v1"},"params_total_b":13.95,"params_active_b":13.95,"vram_est":{"bf16_gb":27.9,"int8_gb":14.8,"int4_gb":8.4,"method":"linear-rom-v1","approximate":true,"basis":"params_total_b"},"vram_frontier":{"efficiency":1,"expected_int8_gb":14.8,"method":"frontier-residual-v1","approximate":true},"fits_on":{"intel_b70":"fp8","nvidia_h100_sxm_80g":"fp8","nvidia_dgx_spark":"fp8"},"is_moe":false,"is_open_weights":true,"context_window_tok":262144,"pricing":{"prompt_usd_per_m":0.2,"completion_usd_per_m":0.2,"blended_usd_per_m":0.2},"scores":{"aime":{"raw":30,"norm":12.5,"trust":2,"source_url":"https://artificialanalysis.ai/models/ministral-3-14b","config":"aime 2025, artificial analysis harness","measured_date":null},"gpqa_diamond":{"raw":57.17,"norm":45.31,"trust":2,"source_url":"https://artificialanalysis.ai/models/ministral-3-14b","config":"artificial analysis harness","measured_date":null},"hle":{"raw":4.63,"norm":3.87,"trust":2,"source_url":"https://artificialanalysis.ai/models/ministral-3-14b","config":"artificial analysis harness, no tools","measured_date":null},"tau_bench":{"raw":27.19,"norm":9.59,"trust":2,"source_url":"https://artificialanalysis.ai/models/ministral-3-14b","config":"artificial analysis harness, tau2","measured_date":null},"terminal_bench":{"raw":9.74,"norm":5.58,"trust":2,"source_url":"https://artificialanalysis.ai/models/ministral-3-14b","config":"artificial analysis harness, v2.1","measured_date":null}}},{"id":"gpt-4-o","display_name":"GPT-4o","family_id":"gpt","vendor":"OpenAI","status":"superseded","kind":"model","superseded_by":"gpt-5.5","release_date":"2024-11-20","intelligence_index":20.99,"coverage":0.6031,"index_subset_bias":{"offset":-5.07,"peers":10,"method":"subset-knn-v1"},"params_total_b":null,"params_active_b":null,"vram_est":null,"vram_frontier":null,"fits_on":null,"is_moe":false,"is_open_weights":false,"context_window_tok":128000,"pricing":{"prompt_usd_per_m":2.5,"completion_usd_per_m":10,"blended_usd_per_m":4.375},"scores":{"aime":{"raw":25.67,"norm":7.09,"trust":2,"source_url":"https://artificialanalysis.ai/models/gpt-4o-chatgpt-03-25","config":"aa field aime25, aime-2025, artificial analysis intelligence index v4.1.1 suite, chatgpt-4o-latest, effort=none, reasoning=false, run: march 2025, source value 0.256666666666667 is a 0-1 fraction, x100 at harvest","measured_date":null},"arc_agi_2":{"raw":0,"norm":0,"trust":3,"source_url":"https://arcprize.org/leaderboard","config":"cost_per_task_usd=0.08, eval=arc-agi-2 semi-private (v2_semi_private), org=openai, system_type=base llm","measured_date":"2026-08-21"},"arena_elo":{"raw":1335.5,"norm":24.9,"trust":3,"source_url":"https://lmarena.ai/leaderboard","config":"text","measured_date":"2026-10-06"},"gpqa_diamond":{"raw":65.45,"norm":56.97,"trust":2,"source_url":"https://artificialanalysis.ai/models/gpt-4o-chatgpt-03-25","config":"aa field gpqa, artificial analysis intelligence index v4.1.1 suite, chatgpt-4o-latest, effort=none, gpqa diamond, reasoning=false, run: march 2025, source value 0.654545454545455 is a 0-1 fraction, x100 at harvest","measured_date":null},"hle":{"raw":3.97,"norm":2.9,"trust":2,"source_url":"https://artificialanalysis.ai/models/gpt-4o-chatgpt-03-25","config":"aa field hle, artificial analysis intelligence index v4.1.1 suite, chatgpt-4o-latest, effort=none, humanity's last exam, reasoning=false, run: march 2025, source value 0.0397 is a 0-1 fraction, x100 at harvest","measured_date":null},"tau_bench":{"raw":28.95,"norm":11.93,"trust":2,"source_url":"https://artificialanalysis.ai/models/gpt-4o-2024-08-06","config":"aa field tau2, aa field tau2 (not mapped to tau_bench), artificial analysis intelligence index v4.1.1 suite, effort=none, reasoning=false, run: aug '24, source value 0.289473684210526 is a 0-1 fraction, x100 at harvest","measured_date":null},"terminal_bench":{"raw":8.33,"norm":3.92,"trust":2,"source_url":"https://artificialanalysis.ai/models/gpt-4o","config":"aa field terminalbenchhard, artificial analysis intelligence index v4.1.1 suite, effort=none, reasoning=false, run: nov '24, source value 0.0833333333333333 is a 0-1 fraction, terminal-bench hard, x100 at harvest","measured_date":null}}},{"id":"mistral-3-8b-2512-instruct","display_name":"Ministral-3-8B-Instruct-2512","family_id":"mistral","vendor":"Mistral AI","status":"current","kind":"model","superseded_by":null,"release_date":"2025-12-02","intelligence_index":20.76,"coverage":0.5635,"index_subset_bias":null,"params_total_b":8.92,"params_active_b":8.92,"vram_est":{"bf16_gb":17.8,"int8_gb":9.5,"int4_gb":5.4,"method":"linear-rom-v1","approximate":true,"basis":"params_total_b"},"vram_frontier":{"efficiency":1.55,"expected_int8_gb":14.6,"method":"frontier-residual-v1","approximate":true},"fits_on":{"intel_b70":"fp8","nvidia_h100_sxm_80g":"fp8","nvidia_dgx_spark":"fp8"},"is_moe":false,"is_open_weights":true,"context_window_tok":262144,"pricing":{"prompt_usd_per_m":0.15,"completion_usd_per_m":0.15,"blended_usd_per_m":0.15},"scores":{"aime":{"raw":31.7,"norm":14.63,"trust":2,"source_url":"https://artificialanalysis.ai/evaluations/aime-2025?models=ministral-3-8b","config":"aime 2025, artificial analysis harness","measured_date":null},"gpqa_diamond":{"raw":47.1,"norm":31.13,"trust":2,"source_url":"https://artificialanalysis.ai/evaluations/gpqa-diamond?models=ministral-3-8b","config":"artificial analysis harness, gpqa diamond","measured_date":null},"hle":{"raw":4.3,"norm":3.38,"trust":2,"source_url":"https://artificialanalysis.ai/evaluations/humanitys-last-exam?models=ministral-3-8b","config":"artificial analysis harness, humanity's last exam","measured_date":null},"mmlu_pro":{"raw":64.2,"norm":40.33,"trust":2,"source_url":"https://artificialanalysis.ai/evaluations/mmlu-pro?models=ministral-3-8b","config":"artificial analysis harness, mmlu-pro","measured_date":null},"tau_bench":{"raw":26.6,"norm":8.8,"trust":2,"source_url":"https://artificialanalysis.ai/evaluations/tau2-bench?models=ministral-3-8b","config":"artificial analysis harness, tau2-bench telecom","measured_date":null},"terminal_bench":{"raw":4.5,"norm":0,"trust":2,"source_url":"https://artificialanalysis.ai/evaluations/terminalbench-hard?models=ministral-3-8b","config":"artificial analysis harness, terminal-bench hard","measured_date":null}}},{"id":"ministral-3-8b","display_name":"Ministral 3 8B","family_id":"ministral","vendor":"Mistral AI","status":"current","kind":"model","superseded_by":null,"release_date":"2025-12-02","intelligence_index":20.71,"coverage":0.5635,"index_subset_bias":null,"params_total_b":8,"params_active_b":8,"vram_est":{"bf16_gb":16,"int8_gb":8.5,"int4_gb":4.8,"method":"linear-rom-v1","approximate":true,"basis":"params_total_b"},"vram_frontier":{"efficiency":1.72,"expected_int8_gb":14.6,"method":"frontier-residual-v1","approximate":true},"fits_on":{"intel_b70":"fp8","nvidia_h100_sxm_80g":"fp8","nvidia_dgx_spark":"fp8"},"is_moe":false,"is_open_weights":true,"context_window_tok":256000,"pricing":{"prompt_usd_per_m":null,"completion_usd_per_m":null,"blended_usd_per_m":null},"scores":{"aime":{"raw":31.67,"norm":14.59,"trust":2,"source_url":"https://artificialanalysis.ai/models/ministral-3-8b","config":"2025, artificial analysis independent evaluation","measured_date":null},"gpqa_diamond":{"raw":47.07,"norm":31.08,"trust":2,"source_url":"https://artificialanalysis.ai/models/ministral-3-8b","config":"artificial analysis independent evaluation","measured_date":null},"hle":{"raw":4.26,"norm":3.32,"trust":2,"source_url":"https://artificialanalysis.ai/models/ministral-3-8b","config":"artificial analysis independent evaluation","measured_date":null},"mmlu_pro":{"raw":64.15,"norm":40.25,"trust":2,"source_url":"https://artificialanalysis.ai/models/ministral-3-8b","config":"artificial analysis independent evaluation","measured_date":null},"tau_bench":{"raw":26.61,"norm":8.81,"trust":2,"source_url":"https://artificialanalysis.ai/models/ministral-3-8b","config":"artificial analysis independent evaluation, tau2/telecom","measured_date":null},"terminal_bench":{"raw":4.12,"norm":0,"trust":2,"source_url":"https://artificialanalysis.ai/models/ministral-3-8b","config":"2.1, artificial analysis independent evaluation","measured_date":null}}},{"id":"mistral-3-medium","display_name":"Mistral Medium 3","family_id":"mistral","vendor":"Mistral AI","status":"superseded","kind":"model","superseded_by":"mistral-3.1-medium","release_date":"2025-05-07","intelligence_index":20.16,"coverage":0.4445,"index_subset_bias":{"offset":-4.18,"peers":10,"method":"subset-knn-v1"},"params_total_b":null,"params_active_b":null,"vram_est":null,"vram_frontier":null,"fits_on":null,"is_moe":false,"is_open_weights":false,"context_window_tok":131072,"pricing":{"prompt_usd_per_m":0.4,"completion_usd_per_m":2,"blended_usd_per_m":0.8},"scores":{"aime":{"raw":30.33,"norm":12.91,"trust":2,"source_url":"https://artificialanalysis.ai/models/mistral-medium-3","config":"2025, artificial analysis independent run","measured_date":null},"gpqa_diamond":{"raw":57.78,"norm":46.17,"trust":2,"source_url":"https://artificialanalysis.ai/models/mistral-medium-3","config":"artificial analysis independent run","measured_date":null},"hle":{"raw":4.05,"norm":3.01,"trust":2,"source_url":"https://artificialanalysis.ai/models/mistral-medium-3","config":"artificial analysis independent run, no tools","measured_date":null},"tau_bench":{"raw":24.27,"norm":5.69,"trust":2,"source_url":"https://artificialanalysis.ai/models/mistral-medium-3","config":"artificial analysis independent run, tau2, with tools","measured_date":null},"terminal_bench":{"raw":3.79,"norm":0,"trust":2,"source_url":"https://artificialanalysis.ai/models/mistral-medium-3","config":"artificial analysis independent run","measured_date":null}}},{"id":"gemma-3-27b-instruct","display_name":"Gemma 3 27B","family_id":"gemma","vendor":"Google DeepMind","status":"current","kind":"model","superseded_by":null,"release_date":"2025-03-12","intelligence_index":20.12,"coverage":0.6428,"index_subset_bias":null,"params_total_b":27.43,"params_active_b":27.43,"vram_est":{"bf16_gb":54.9,"int8_gb":29.1,"int4_gb":16.5,"method":"linear-rom-v1","approximate":true,"basis":"params_total_b"},"vram_frontier":{"efficiency":0.49,"expected_int8_gb":14.2,"method":"frontier-residual-v1","approximate":true},"fits_on":{"intel_b70":"fp8","nvidia_h100_sxm_80g":"fp8","nvidia_dgx_spark":"fp8"},"is_moe":false,"is_open_weights":true,"context_window_tok":131072,"pricing":{"prompt_usd_per_m":0.08,"completion_usd_per_m":0.45,"blended_usd_per_m":0.1725},"scores":{"aime":{"raw":20.67,"norm":0.84,"trust":2,"source_url":"https://artificialanalysis.ai/models/gemma-3-27b","config":"aa field aime25, aime-2025, artificial analysis intelligence index v4.1.1 suite, effort=none, reasoning=false, source value 0.206666666666667 is a 0-1 fraction, x100 at harvest","measured_date":null},"arena_elo":{"raw":1365.4,"norm":38.23,"trust":3,"source_url":"https://lmarena.ai/leaderboard","config":"text","measured_date":"2026-09-27"},"gpqa_diamond":{"raw":42.83,"norm":25.11,"trust":2,"source_url":"https://artificialanalysis.ai/models/gemma-3-27b","config":"aa field gpqa, artificial analysis intelligence index v4.1.1 suite, effort=none, gpqa diamond, reasoning=false, source value 0.428282828282828 is a 0-1 fraction, x100 at harvest","measured_date":null},"hle":{"raw":4.4,"norm":3.53,"trust":2,"source_url":"https://artificialanalysis.ai/models/gemma-3-27b","config":"aa field hle, artificial analysis intelligence index v4.1.1 suite, effort=none, humanity's last exam, reasoning=false, source value 0.044 is a 0-1 fraction, x100 at harvest","measured_date":null},"mmlu_pro":{"raw":67.5,"norm":45.83,"trust":2,"source_url":"https://arxiv.org/html/2503.19786v1","config":"gemma 3 technical report table 6 [raw: mmlu-pro], instruction-tuned (it)","measured_date":null},"tau_bench":{"raw":10.53,"norm":0,"trust":2,"source_url":"https://artificialanalysis.ai/models/gemma-3-27b","config":"aa field tau2, aa field tau2 (not mapped to tau_bench), artificial analysis intelligence index v4.1.1 suite, effort=none, reasoning=false, source value 0.105263157894737 is a 0-1 fraction, x100 at harvest","measured_date":null},"terminal_bench":{"raw":3.79,"norm":0,"trust":2,"source_url":"https://artificialanalysis.ai/models/gemma-3-27b","config":"aa field terminalbenchhard, artificial analysis intelligence index v4.1.1 suite, effort=none, reasoning=false, source value 0.0378787878787879 is a 0-1 fraction, terminal-bench hard, x100 at harvest","measured_date":null}}},{"id":"qwen-3-4b","display_name":"Qwen3-4B","family_id":"qwen","vendor":"Alibaba","status":"current","kind":"model","superseded_by":null,"release_date":"2025-04-28","intelligence_index":20.01,"coverage":0.4762,"index_subset_bias":null,"params_total_b":4.02,"params_active_b":4.02,"vram_est":{"bf16_gb":8,"int8_gb":4.3,"int4_gb":2.4,"method":"linear-rom-v1","approximate":true,"basis":"params_total_b"},"vram_frontier":{"efficiency":3.32,"expected_int8_gb":14.2,"method":"frontier-residual-v1","approximate":true},"fits_on":{"intel_b70":"fp8","nvidia_h100_sxm_80g":"fp8","nvidia_dgx_spark":"fp8"},"is_moe":false,"is_open_weights":true,"context_window_tok":128000,"pricing":{"prompt_usd_per_m":null,"completion_usd_per_m":null,"blended_usd_per_m":null},"scores":{"aime":{"raw":19.1,"norm":0,"trust":1,"source_url":"https://huggingface.co/Qwen/Qwen3-4B-Instruct-2507","config":"aime25, non-thinking mode","measured_date":null},"gpqa_diamond":{"raw":41.7,"norm":23.52,"trust":1,"source_url":"https://huggingface.co/Qwen/Qwen3-4B-Instruct-2507","config":"non-thinking mode","measured_date":null},"livebench":{"raw":48.4,"norm":18.67,"trust":1,"source_url":"https://huggingface.co/Qwen/Qwen3-4B-Instruct-2507","config":"20241125 release, non-thinking mode","measured_date":null},"mmlu_pro":{"raw":58,"norm":30,"trust":1,"source_url":"https://huggingface.co/Qwen/Qwen3-4B-Instruct-2507","config":"non-thinking mode","measured_date":null}}},{"id":"qwen-3-8b-instruct","display_name":"Qwen3-8B","family_id":"qwen","vendor":"Alibaba","status":"current","kind":"model","superseded_by":null,"release_date":"2025-04-29","intelligence_index":19.82,"coverage":0.4445,"index_subset_bias":{"offset":-4.18,"peers":10,"method":"subset-knn-v1"},"params_total_b":8.19,"params_active_b":8.19,"vram_est":{"bf16_gb":16.4,"int8_gb":8.7,"int4_gb":4.9,"method":"linear-rom-v1","approximate":true,"basis":"params_total_b"},"vram_frontier":{"efficiency":1.62,"expected_int8_gb":14,"method":"frontier-residual-v1","approximate":true},"fits_on":{"intel_b70":"fp8","nvidia_h100_sxm_80g":"fp8","nvidia_dgx_spark":"fp8"},"is_moe":false,"is_open_weights":true,"context_window_tok":131072,"pricing":{"prompt_usd_per_m":0.117,"completion_usd_per_m":0.455,"blended_usd_per_m":0.2015},"scores":{"aime":{"raw":24.33,"norm":5.41,"trust":2,"source_url":"https://artificialanalysis.ai/models/qwen3-8b-instruct","config":"aa field aime25, aime-2025, artificial analysis intelligence index v4.1.1 suite, effort=none, reasoning=false, run: non-reasoning, source value 0.243333333333333 is a 0-1 fraction, x100 at harvest","measured_date":null},"gpqa_diamond":{"raw":58.89,"norm":47.73,"trust":2,"source_url":"https://artificialanalysis.ai/models/qwen3-8b-instruct-reasoning","config":"aa field gpqa, artificial analysis intelligence index v4.1.1 suite, effort=none, gpqa diamond, reasoning=true, run: reasoning, source value 0.588888888888889 is a 0-1 fraction, x100 at harvest","measured_date":null},"hle":{"raw":3.89,"norm":2.78,"trust":2,"source_url":"https://artificialanalysis.ai/models/qwen3-8b-instruct-reasoning","config":"aa field hle, artificial analysis intelligence index v4.1.1 suite, effort=none, humanity's last exam, reasoning=true, run: reasoning, source value 0.0389 is a 0-1 fraction, x100 at harvest","measured_date":null},"tau_bench":{"raw":27.78,"norm":10.37,"trust":2,"source_url":"https://artificialanalysis.ai/models/qwen3-8b-instruct-reasoning","config":"aa field tau2, aa field tau2 (not mapped to tau_bench), artificial analysis intelligence index v4.1.1 suite, effort=none, reasoning=true, run: reasoning, source value 0.277777777777778 is a 0-1 fraction, x100 at harvest","measured_date":null},"terminal_bench":{"raw":2.27,"norm":0,"trust":2,"source_url":"https://artificialanalysis.ai/models/qwen3-8b-instruct","config":"aa field terminalbenchhard, artificial analysis intelligence index v4.1.1 suite, effort=none, reasoning=false, run: non-reasoning, source value 0.0227272727272727 is a 0-1 fraction, terminal-bench hard, x100 at harvest","measured_date":null}}},{"id":"nemotron-3-nano-omni-30b-a3b-reasoning","display_name":"Nemotron 3 Nano Omni","family_id":"nemotron","vendor":"NVIDIA","status":"current","kind":"model","superseded_by":null,"release_date":"2026-04-28","intelligence_index":19.58,"coverage":0.3651,"index_subset_bias":{"offset":-6.36,"peers":10,"method":"subset-knn-v1"},"params_total_b":33.02,"params_active_b":3,"vram_est":{"bf16_gb":66,"int8_gb":35,"int4_gb":19.8,"method":"linear-rom-v1","approximate":true,"basis":"params_total_b"},"vram_frontier":{"efficiency":1.76,"expected_int8_gb":61.5,"method":"frontier-residual-v1","approximate":true},"fits_on":{"intel_b70":"int4","nvidia_h100_sxm_80g":"fp8","nvidia_dgx_spark":"fp8"},"is_moe":true,"is_open_weights":true,"context_window_tok":256000,"pricing":{"prompt_usd_per_m":0,"completion_usd_per_m":0,"blended_usd_per_m":0},"scores":{"gpqa_diamond":{"raw":46.87,"norm":30.8,"trust":2,"source_url":"https://artificialanalysis.ai/models/nemotron-3-nano-omni-30b-a3b","config":"aa field gpqa, artificial analysis intelligence index v4.1.1 suite, effort=none, gpqa diamond, reasoning=true, source value 0.468686868686869 is a 0-1 fraction, x100 at harvest","measured_date":null},"hle":{"raw":4.82,"norm":4.15,"trust":2,"source_url":"https://artificialanalysis.ai/models/nemotron-3-nano-omni-30b-a3b","config":"aa field hle, artificial analysis intelligence index v4.1.1 suite, effort=none, humanity's last exam, reasoning=true, source value 0.0481927710843374 is a 0-1 fraction, x100 at harvest","measured_date":null},"tau_bench":{"raw":45.32,"norm":33.76,"trust":2,"source_url":"https://artificialanalysis.ai/models/nemotron-3-nano-omni-30b-a3b","config":"aa field tau2, aa field tau2 (not mapped to tau_bench), artificial analysis intelligence index v4.1.1 suite, effort=none, reasoning=true, source value 0.453216374269006 is a 0-1 fraction, x100 at harvest","measured_date":null},"terminal_bench":{"raw":8.33,"norm":3.92,"trust":2,"source_url":"https://artificialanalysis.ai/models/nemotron-3-nano-omni-30b-a3b","config":"aa field terminalbenchhard, artificial analysis intelligence index v4.1.1 suite, effort=none, reasoning=true, source value 0.0833333333333333 is a 0-1 fraction, terminal-bench hard, x100 at harvest","measured_date":null}}},{"id":"qwen-3-30b-a3b-instruct-code","display_name":"Qwen3-Coder-30B-A3B-Instruct","family_id":"qwen","vendor":"Alibaba","status":"current","kind":"model","superseded_by":null,"release_date":"2025-04-29","intelligence_index":19.43,"coverage":0.4445,"index_subset_bias":{"offset":-4.18,"peers":10,"method":"subset-knn-v1"},"params_total_b":30.53,"params_active_b":3,"vram_est":{"bf16_gb":61.1,"int8_gb":32.4,"int4_gb":18.3,"method":"linear-rom-v1","approximate":true,"basis":"params_total_b"},"vram_frontier":{"efficiency":1.89,"expected_int8_gb":61.1,"method":"frontier-residual-v1","approximate":true},"fits_on":{"intel_b70":"int4","nvidia_h100_sxm_80g":"fp8","nvidia_dgx_spark":"fp8"},"is_moe":true,"is_open_weights":true,"context_window_tok":262144,"pricing":{"prompt_usd_per_m":0.07,"completion_usd_per_m":0.28,"blended_usd_per_m":0.12250000000000001},"scores":{"aime":{"raw":29,"norm":11.25,"trust":2,"source_url":"https://artificialanalysis.ai/models/qwen3-coder-30b-a3b-instruct","config":"aa field aime25, aime-2025, artificial analysis intelligence index v4.1.1 suite, effort=none, reasoning=false, source value 0.29 is a 0-1 fraction, x100 at harvest","measured_date":null},"gpqa_diamond":{"raw":51.62,"norm":37.49,"trust":2,"source_url":"https://artificialanalysis.ai/models/qwen3-coder-30b-a3b-instruct","config":"aa field gpqa, artificial analysis intelligence index v4.1.1 suite, effort=none, gpqa diamond, reasoning=false, source value 0.516161616161616 is a 0-1 fraction, x100 at harvest","measured_date":null},"hle":{"raw":3.85,"norm":2.72,"trust":2,"source_url":"https://artificialanalysis.ai/models/qwen3-coder-30b-a3b-instruct","config":"aa field hle, artificial analysis intelligence index v4.1.1 suite, effort=none, humanity's last exam, reasoning=false, source value 0.0384615384615385 is a 0-1 fraction, x100 at harvest","measured_date":null},"tau_bench":{"raw":34.5,"norm":19.33,"trust":2,"source_url":"https://artificialanalysis.ai/models/qwen3-coder-30b-a3b-instruct","config":"aa field tau2, aa field tau2 (not mapped to tau_bench), artificial analysis intelligence index v4.1.1 suite, effort=none, reasoning=false, source value 0.345029239766082 is a 0-1 fraction, x100 at harvest","measured_date":null},"terminal_bench":{"raw":15.15,"norm":11.94,"trust":2,"source_url":"https://artificialanalysis.ai/models/qwen3-coder-30b-a3b-instruct","config":"aa field terminalbenchhard, artificial analysis intelligence index v4.1.1 suite, effort=none, reasoning=false, source value 0.151515151515152 is a 0-1 fraction, terminal-bench hard, x100 at harvest","measured_date":null}}},{"id":"mistral-3.1-small-24b-2503-instruct","display_name":"Mistral-Small-3.1-24B-Instruct-2503","family_id":"mistral","vendor":"Mistral AI","status":"superseded","kind":"model","superseded_by":"mistral-3.2-small-24b-2506-instruct","release_date":"2025-03-17","intelligence_index":19.32,"coverage":0.6428,"index_subset_bias":null,"params_total_b":24.01,"params_active_b":24.01,"vram_est":{"bf16_gb":48,"int8_gb":25.5,"int4_gb":14.4,"method":"linear-rom-v1","approximate":true,"basis":"params_total_b"},"vram_frontier":null,"fits_on":{"intel_b70":"fp8","nvidia_h100_sxm_80g":"fp8","nvidia_dgx_spark":"fp8"},"is_moe":false,"is_open_weights":true,"context_window_tok":128000,"pricing":{"prompt_usd_per_m":0.351,"completion_usd_per_m":0.555,"blended_usd_per_m":0.402},"scores":{"aime":{"raw":3.67,"norm":0,"trust":2,"source_url":"https://artificialanalysis.ai/models/mistral-small-3-1","config":"2025, artificial analysis independent evaluation","measured_date":null},"arena_elo":{"raw":1303.1,"norm":10.46,"trust":3,"source_url":"https://lmarena.ai/leaderboard","config":"text","measured_date":"2026-09-27"},"gpqa_diamond":{"raw":45.35,"norm":28.66,"trust":2,"source_url":"https://artificialanalysis.ai/models/mistral-small-3-1","config":"artificial analysis independent evaluation","measured_date":null},"hle":{"raw":4.31,"norm":3.4,"trust":2,"source_url":"https://artificialanalysis.ai/models/mistral-small-3-1","config":"artificial analysis independent evaluation","measured_date":null},"mmlu_pro":{"raw":65.93,"norm":43.22,"trust":2,"source_url":"https://artificialanalysis.ai/models/mistral-small-3-1","config":"artificial analysis independent evaluation","measured_date":null},"tau_bench":{"raw":25.15,"norm":6.87,"trust":2,"source_url":"https://artificialanalysis.ai/models/mistral-small-3-1","config":"artificial analysis independent evaluation, tau2/telecom","measured_date":null},"terminal_bench":{"raw":26.22,"norm":24.96,"trust":2,"source_url":"https://artificialanalysis.ai/models/mistral-small-3-1","config":"2.1, artificial analysis independent evaluation","measured_date":null}}},{"id":"qwen-2.5-14b-instruct","display_name":"Qwen2.5-14B-Instruct","family_id":"qwen","vendor":"Alibaba","status":"superseded","kind":"model","superseded_by":"qwen-3-14b-instruct","release_date":"2024-09","intelligence_index":19,"coverage":0.3969,"index_subset_bias":null,"params_total_b":14.77,"params_active_b":14.77,"vram_est":{"bf16_gb":29.5,"int8_gb":15.7,"int4_gb":8.9,"method":"linear-rom-v1","approximate":true,"basis":"params_total_b"},"vram_frontier":null,"fits_on":{"intel_b70":"fp8","nvidia_h100_sxm_80g":"fp8","nvidia_dgx_spark":"fp8"},"is_moe":false,"is_open_weights":true,"context_window_tok":null,"pricing":{"prompt_usd_per_m":null,"completion_usd_per_m":null,"blended_usd_per_m":null},"scores":{"gpqa_diamond":{"raw":45.5,"norm":28.87,"trust":2,"source_url":"https://arxiv.org/html/2412.15115v2","config":"5-shot, qwen2.5 technical report table 7, subset not specified by the source (not stated as diamond)","measured_date":null},"livebench":{"raw":44.4,"norm":9.78,"trust":2,"source_url":"https://arxiv.org/html/2412.15115v2","config":"livebench 0831, qwen2.5 technical report table 7, qwen2.5-14b column","measured_date":null},"mmlu_pro":{"raw":49.04,"norm":15.07,"trust":3,"source_url":"https://huggingface.co/spaces/open-llm-leaderboard/open_llm_leaderboard","config":"5-shot raw accuracy (leaderboard-normalised value 43.38), bfloat16, huggingface open llm leaderboard v2","measured_date":null}}},{"id":"nova-1-pro","display_name":"Nova Pro 1.0","family_id":"nova","vendor":"Amazon","status":"current","kind":"model","superseded_by":null,"release_date":"2024-12-05","intelligence_index":18.61,"coverage":0.6428,"index_subset_bias":null,"params_total_b":null,"params_active_b":null,"vram_est":null,"vram_frontier":null,"fits_on":null,"is_moe":false,"is_open_weights":false,"context_window_tok":300000,"pricing":{"prompt_usd_per_m":0.8,"completion_usd_per_m":3.2,"blended_usd_per_m":1.4000000000000001},"scores":{"aime":{"raw":7,"norm":0,"trust":2,"source_url":"https://artificialanalysis.ai/evaluations/aime-2025?models=nova-pro","config":"aime 2025, artificial analysis harness","measured_date":null},"arena_elo":{"raw":1290,"norm":4.62,"trust":3,"source_url":"https://arena.ai/leaderboard/text","config":"24, 745 votes, arena entry amazon-nova-pro-v1.0, rank 275, text overall","measured_date":null},"gpqa_diamond":{"raw":49.9,"norm":35.07,"trust":2,"source_url":"https://artificialanalysis.ai/evaluations/gpqa-diamond?models=nova-pro","config":"artificial analysis harness, gpqa diamond","measured_date":null},"hle":{"raw":3.2,"norm":1.76,"trust":2,"source_url":"https://artificialanalysis.ai/evaluations/humanitys-last-exam?models=nova-pro","config":"artificial analysis harness, humanity's last exam","measured_date":null},"mmlu_pro":{"raw":69.1,"norm":48.5,"trust":2,"source_url":"https://artificialanalysis.ai/evaluations/mmlu-pro?models=nova-pro","config":"artificial analysis harness, mmlu-pro","measured_date":null},"tau_bench":{"raw":14,"norm":0,"trust":2,"source_url":"https://artificialanalysis.ai/evaluations/tau2-bench?models=nova-pro","config":"artificial analysis harness, tau2-bench telecom","measured_date":null},"terminal_bench":{"raw":6.1,"norm":1.29,"trust":2,"source_url":"https://artificialanalysis.ai/evaluations/terminalbench-hard?models=nova-pro","config":"artificial analysis harness, terminal-bench hard","measured_date":null}}},{"id":"gpt-4.1-nano","display_name":"GPT-4.1 Nano","family_id":"gpt","vendor":"OpenAI","status":"superseded","kind":"model","superseded_by":"gpt-5.4-nano","release_date":"2025-04-14","intelligence_index":17.8,"coverage":0.7222,"index_subset_bias":null,"params_total_b":null,"params_active_b":null,"vram_est":null,"vram_frontier":null,"fits_on":null,"is_moe":false,"is_open_weights":false,"context_window_tok":1047576,"pricing":{"prompt_usd_per_m":0.1,"completion_usd_per_m":0.4,"blended_usd_per_m":0.17500000000000002},"scores":{"aime":{"raw":26.46,"norm":8.08,"trust":3,"source_url":"https://www.vals.ai/benchmarks/aime","config":"archived=true, edition=aime v1, reasoning_effort=high, runner=platform, stderr=0.814, task=overall, updated=2026-04-16","measured_date":"2026-08-19"},"arc_agi_2":{"raw":0,"norm":0,"trust":3,"source_url":"https://arcprize.org/leaderboard","config":"cost_per_task_usd=0.0036, eval=arc-agi-2 semi-private (v2_semi_private), model_group=gpt-4.1, org=openai, system_type=base llm","measured_date":"2026-08-21"},"arena_elo":{"raw":1322.3,"norm":19.02,"trust":3,"source_url":"https://lmarena.ai/leaderboard","config":"text","measured_date":"2026-10-01"},"gpqa_diamond":{"raw":50.76,"norm":36.28,"trust":3,"source_url":"https://www.vals.ai/benchmarks/gpqa","config":"edition=gpqa diamond v1, reasoning_effort=high, runner=platform, stderr=2.457, task=overall, updated=2026-08-19","measured_date":"2026-08-19"},"hle":{"raw":3.75,"norm":2.57,"trust":2,"source_url":"https://artificialanalysis.ai/models/gpt-4-1-nano","config":"aa field hle, artificial analysis intelligence index v4.1.1 suite, effort=none, humanity's last exam, reasoning=false, source value 0.0375347544022243 is a 0-1 fraction, x100 at harvest","measured_date":null},"mmlu_pro":{"raw":63.48,"norm":39.13,"trust":3,"source_url":"https://www.vals.ai/benchmarks/mmlu_pro","config":"edition=mmlu pro v1, reasoning_effort=high, runner=platform, stderr=0.462, task=overall, updated=2026-08-19","measured_date":"2026-08-19"},"tau_bench":{"raw":17.25,"norm":0,"trust":2,"source_url":"https://artificialanalysis.ai/models/gpt-4-1-nano","config":"aa field tau2, aa field tau2 (not mapped to tau_bench), artificial analysis intelligence index v4.1.1 suite, effort=none, reasoning=false, source value 0.172514619883041 is a 0-1 fraction, x100 at harvest","measured_date":null},"terminal_bench":{"raw":3.75,"norm":0,"trust":2,"source_url":"https://artificialanalysis.ai/models/gpt-4-1-nano","config":"aa field terminalbenchv21, artificial analysis intelligence index v4.1.1 suite, effort=none, reasoning=false, source value 0.0374531835205993 is a 0-1 fraction, terminal-bench 2.1, x100 at harvest","measured_date":null}}},{"id":"llama-4-scout-17b-16e-instruct","display_name":"Llama-4-Scout-17B-16E-Instruct","family_id":"llama","vendor":"Meta","status":"current","kind":"model","superseded_by":null,"release_date":"2025-04-05","intelligence_index":17.4,"coverage":0.7222,"index_subset_bias":null,"params_total_b":108.64,"params_active_b":17,"vram_est":{"bf16_gb":217,"int8_gb":115,"int4_gb":65.2,"method":"linear-rom-v1","approximate":true,"basis":"params_total_b"},"vram_frontier":{"efficiency":0.48,"expected_int8_gb":55.3,"method":"frontier-residual-v1","approximate":true},"fits_on":{"nvidia_h100_sxm_80g":"int4","nvidia_dgx_spark":"fp8"},"is_moe":true,"is_open_weights":true,"context_window_tok":1310720,"pricing":{"prompt_usd_per_m":0.1,"completion_usd_per_m":0.3,"blended_usd_per_m":0.15000000000000002},"scores":{"aime":{"raw":18.96,"norm":0,"trust":3,"source_url":"https://www.vals.ai/benchmarks/aime","config":"archived=true, edition=aime v1, runner=platform, stderr=0.7, task=overall, updated=2026-04-16","measured_date":"2026-08-19"},"arc_agi_2":{"raw":0,"norm":0,"trust":3,"source_url":"https://arcprize.org/leaderboard","config":"cost_per_task_usd=0.0062, eval=arc-agi-2 semi-private (v2_semi_private), model_group=llama 4, org=meta, system_type=base llm","measured_date":"2026-08-21"},"arena_elo":{"raw":1321.6,"norm":18.71,"trust":3,"source_url":"https://lmarena.ai/leaderboard","config":"text","measured_date":"2026-09-27"},"gpqa_diamond":{"raw":46.97,"norm":30.94,"trust":3,"source_url":"https://www.vals.ai/benchmarks/gpqa","config":"edition=gpqa diamond v1, runner=platform, stderr=2.491, task=overall, updated=2026-08-19","measured_date":"2026-08-19"},"hle":{"raw":3.78,"norm":2.62,"trust":2,"source_url":"https://artificialanalysis.ai/models/llama-4-scout","config":"aa field hle, artificial analysis intelligence index v4.1.1 suite, effort=none, humanity's last exam, reasoning=false, source value 0.0378 is a 0-1 fraction, x100 at harvest","measured_date":null},"mmlu_pro":{"raw":69.63,"norm":49.38,"trust":3,"source_url":"https://www.vals.ai/benchmarks/mmlu_pro","config":"edition=mmlu pro v1, runner=platform, stderr=0.445, task=overall, updated=2026-08-19","measured_date":"2026-08-19"},"tau_bench":{"raw":15.5,"norm":0,"trust":2,"source_url":"https://artificialanalysis.ai/models/llama-4-scout","config":"aa field tau2, aa field tau2 (not mapped to tau_bench), artificial analysis intelligence index v4.1.1 suite, effort=none, reasoning=false, source value 0.154970760233918 is a 0-1 fraction, x100 at harvest","measured_date":null},"terminal_bench":{"raw":3.75,"norm":0,"trust":2,"source_url":"https://artificialanalysis.ai/models/llama-4-scout","config":"artificial analysis harness, intelligence index v4.1.1 component, page value terminalbenchv21=0.0374531835205993 [raw: terminal-bench v2.1], terminal-bench v2.1 (89-task dataset)","measured_date":null}}},{"id":"llama-3.3-70b-instruct","display_name":"Llama-3.3-70B-Instruct","family_id":"llama","vendor":"Meta","status":"current","kind":"model","superseded_by":null,"release_date":"2024-12-06","intelligence_index":16.6,"coverage":0.8016,"index_subset_bias":null,"params_total_b":70.55,"params_active_b":70.55,"vram_est":{"bf16_gb":141,"int8_gb":74.8,"int4_gb":42.3,"method":"linear-rom-v1","approximate":true,"basis":"params_total_b"},"vram_frontier":{"efficiency":0.16,"expected_int8_gb":12,"method":"frontier-residual-v1","approximate":true},"fits_on":{"nvidia_h100_sxm_80g":"int4","nvidia_dgx_spark":"fp8"},"is_moe":false,"is_open_weights":true,"context_window_tok":131072,"pricing":{"prompt_usd_per_m":0.22,"completion_usd_per_m":0.5,"blended_usd_per_m":0.29000000000000004},"scores":{"aime":{"raw":7.67,"norm":0,"trust":2,"source_url":"https://artificialanalysis.ai/models/llama-3-3-instruct-70b","config":"aa field aime25, aime-2025, artificial analysis intelligence index v4.1.1 suite, effort=none, reasoning=false, source value 0.0766666666666667 is a 0-1 fraction, x100 at harvest","measured_date":null},"arena_elo":{"raw":1317.8,"norm":17.01,"trust":3,"source_url":"https://lmarena.ai/leaderboard","config":"text","measured_date":"2026-09-27"},"gpqa_diamond":{"raw":49.8,"norm":34.93,"trust":2,"source_url":"https://artificialanalysis.ai/models/llama-3-3-instruct-70b","config":"aa field gpqa, artificial analysis intelligence index v4.1.1 suite, effort=none, gpqa diamond, reasoning=false, run: llama 3.3 instruct 70b, source value 0.497979797979798 is a 0-1 fraction, x100 at harvest","measured_date":null},"hle":{"raw":3.56,"norm":2.29,"trust":2,"source_url":"https://artificialanalysis.ai/models/llama-3-3-instruct-70b","config":"aa field hle, artificial analysis intelligence index v4.1.1 suite, effort=none, humanity's last exam, reasoning=false, source value 0.0356 is a 0-1 fraction, x100 at harvest","measured_date":null},"mmlu_pro":{"raw":68.9,"norm":48.17,"trust":1,"source_url":"https://huggingface.co/meta-llama/Llama-3.3-70B-Instruct","config":"cot, 5-shot, macro_avg/acc","measured_date":"2024-12-06"},"swe_bench_verified":{"raw":5.4,"norm":0,"trust":2,"source_url":"https://arxiv.org/pdf/2502.18449","config":"'baseline comparison on swe-bench verified'. row: llama-3.3-70b-instruct, 'repair performance (oracle)' = 5.4 (correct-format rate 12.2% [raw: swe-bench verified], arxiv:2502.18449) table 2, greedy decoding, swe-rl paper (meta","measured_date":null},"tau_bench":{"raw":26.61,"norm":8.81,"trust":2,"source_url":"https://artificialanalysis.ai/models/llama-3-3-instruct-70b","config":"aa field tau2, aa field tau2 (not mapped to tau_bench), artificial analysis intelligence index v4.1.1 suite, effort=none, reasoning=false, source value 0.266081871345029 is a 0-1 fraction, x100 at harvest","measured_date":null},"terminal_bench":{"raw":3.03,"norm":0,"trust":2,"source_url":"https://artificialanalysis.ai/models/llama-3-3-instruct-70b","config":"aa field terminalbenchhard, artificial analysis intelligence index v4.1.1 suite, effort=none, reasoning=false, source value 0.0303030303030303 is a 0-1 fraction, terminal-bench hard, x100 at harvest","measured_date":null}}},{"id":"deepseek-r1-distill-llama-70b-reasoning","display_name":"DeepSeek-R1-Distill-Llama-70B","family_id":"deepseek","vendor":"DeepSeek","status":"current","kind":"model","superseded_by":null,"release_date":"2025-01-20","intelligence_index":16.59,"coverage":0.4445,"index_subset_bias":{"offset":-4.18,"peers":10,"method":"subset-knn-v1"},"params_total_b":70.55,"params_active_b":70.55,"vram_est":{"bf16_gb":141,"int8_gb":74.8,"int4_gb":42.3,"method":"linear-rom-v1","approximate":true,"basis":"params_total_b"},"vram_frontier":{"efficiency":0.16,"expected_int8_gb":12,"method":"frontier-residual-v1","approximate":true},"fits_on":{"nvidia_h100_sxm_80g":"int4","nvidia_dgx_spark":"fp8"},"is_moe":false,"is_open_weights":true,"context_window_tok":8192,"pricing":{"prompt_usd_per_m":null,"completion_usd_per_m":null,"blended_usd_per_m":null},"scores":{"aime":{"raw":53.67,"norm":42.09,"trust":2,"source_url":"https://artificialanalysis.ai/models/deepseek-r1-distill-llama-70b","config":"aa field aime25, aime-2025, artificial analysis intelligence index v4.1.1 suite, effort=none, reasoning=true, source value 0.536666666666667 is a 0-1 fraction, x100 at harvest","measured_date":null},"gpqa_diamond":{"raw":40.2,"norm":21.41,"trust":2,"source_url":"https://artificialanalysis.ai/models/deepseek-r1-distill-llama-70b","config":"aa field gpqa, artificial analysis intelligence index v4.1.1 suite, effort=none, gpqa diamond, reasoning=true, source value 0.402020202020202 is a 0-1 fraction, x100 at harvest","measured_date":null},"hle":{"raw":5.13,"norm":4.6,"trust":2,"source_url":"https://artificialanalysis.ai/models/deepseek-r1-distill-llama-70b","config":"aa field hle, artificial analysis intelligence index v4.1.1 suite, effort=none, humanity's last exam, reasoning=true, source value 0.0513 is a 0-1 fraction, x100 at harvest","measured_date":null},"tau_bench":{"raw":21.93,"norm":2.57,"trust":2,"source_url":"https://artificialanalysis.ai/models/deepseek-r1-distill-llama-70b","config":"aa field tau2, aa field tau2 (not mapped to tau_bench), artificial analysis intelligence index v4.1.1 suite, effort=none, reasoning=true, source value 0.219298245614035 is a 0-1 fraction, x100 at harvest","measured_date":null},"terminal_bench":{"raw":1.52,"norm":0,"trust":2,"source_url":"https://artificialanalysis.ai/models/deepseek-r1-distill-llama-70b","config":"aa field terminalbenchhard, artificial analysis intelligence index v4.1.1 suite, effort=none, reasoning=true, source value 0.0151515151515152 is a 0-1 fraction, terminal-bench hard, x100 at harvest","measured_date":null}}},{"id":"granite-4.1-8b","display_name":"granite-4.1-8b","family_id":"granite","vendor":"IBM","status":"superseded","kind":"model","superseded_by":"granite-4.2-8b","release_date":"2026-04-30","intelligence_index":15.84,"coverage":0.5635,"index_subset_bias":null,"params_total_b":8.79,"params_active_b":8.79,"vram_est":{"bf16_gb":17.6,"int8_gb":9.3,"int4_gb":5.3,"method":"linear-rom-v1","approximate":true,"basis":"params_total_b"},"vram_frontier":null,"fits_on":{"intel_b70":"fp8","nvidia_h100_sxm_80g":"fp8","nvidia_dgx_spark":"fp8"},"is_moe":false,"is_open_weights":true,"context_window_tok":131072,"pricing":{"prompt_usd_per_m":null,"completion_usd_per_m":null,"blended_usd_per_m":null},"scores":{"arena_elo":{"raw":1304.1,"norm":10.91,"trust":3,"source_url":"https://lmarena.ai/leaderboard","config":"text","measured_date":"2026-10-03"},"gpqa_diamond":{"raw":43.33,"norm":25.82,"trust":2,"source_url":"https://artificialanalysis.ai/models/granite-4-1-8b","config":"aa field gpqa, artificial analysis intelligence index v4.1.1 suite, effort=none, gpqa diamond, reasoning=false, source value 0.433333333333333 is a 0-1 fraction, x100 at harvest","measured_date":null},"hle":{"raw":3.8,"norm":2.65,"trust":2,"source_url":"https://artificialanalysis.ai/models/granite-4-1-8b","config":"aa field hle, artificial analysis intelligence index v4.1.1 suite, effort=none, humanity's last exam, reasoning=false, source value 0.0379981464318814 is a 0-1 fraction, x100 at harvest","measured_date":null},"mmlu_pro":{"raw":55.99,"norm":26.65,"trust":1,"source_url":"https://huggingface.co/ibm-granite/granite-4.1-8b","config":"'8b dense' column, 5-shot, cot, instruct","measured_date":"2026-04-29"},"tau_bench":{"raw":27.78,"norm":10.37,"trust":2,"source_url":"https://artificialanalysis.ai/models/granite-4-1-8b","config":"aa field tau2, aa field tau2 (not mapped to tau_bench), artificial analysis intelligence index v4.1.1 suite, effort=none, reasoning=false, source value 0.277777777777778 is a 0-1 fraction, x100 at harvest","measured_date":null},"terminal_bench":{"raw":0,"norm":0,"trust":2,"source_url":"https://artificialanalysis.ai/models/granite-4-1-8b","config":"aa field terminalbenchhard, artificial analysis intelligence index v4.1.1 suite, effort=none, reasoning=false, source value 0 is a 0-1 fraction, terminal-bench hard, x100 at harvest","measured_date":null}}},{"id":"mistral-2501-small-24b-instruct","display_name":"Mistral Small 3","family_id":"mistral","vendor":"Mistral AI","status":"current","kind":"model","superseded_by":null,"release_date":"2025-01-30","intelligence_index":15.26,"coverage":0.7143,"index_subset_bias":null,"params_total_b":23.57,"params_active_b":23.57,"vram_est":{"bf16_gb":47.1,"int8_gb":25,"int4_gb":14.1,"method":"linear-rom-v1","approximate":true,"basis":"params_total_b"},"vram_frontier":{"efficiency":0.44,"expected_int8_gb":11.1,"method":"frontier-residual-v1","approximate":true},"fits_on":{"intel_b70":"fp8","nvidia_h100_sxm_80g":"fp8","nvidia_dgx_spark":"fp8"},"is_moe":false,"is_open_weights":true,"context_window_tok":32768,"pricing":{"prompt_usd_per_m":0.05,"completion_usd_per_m":0.08,"blended_usd_per_m":0.05750000000000001},"scores":{"aime":{"raw":4.33,"norm":0,"trust":2,"source_url":"https://artificialanalysis.ai/models/mistral-small-3","config":"2025, artificial analysis independent run","measured_date":null},"arena_elo":{"raw":1274.4,"norm":0,"trust":3,"source_url":"https://lmarena.ai/leaderboard","config":"text","measured_date":"2026-09-27"},"gpqa_diamond":{"raw":46.16,"norm":29.8,"trust":2,"source_url":"https://artificialanalysis.ai/models/mistral-small-3","config":"artificial analysis independent run","measured_date":null},"hle":{"raw":3.76,"norm":2.59,"trust":2,"source_url":"https://artificialanalysis.ai/models/mistral-small-3","config":"artificial analysis independent run, no tools","measured_date":null},"livebench":{"raw":42.5,"norm":5.56,"trust":3,"source_url":"https://livebench.ai/table_2024_11_25.csv","config":"global average of the 6 category averages, leaderboard row mistral-small-2501, livebench 2024-11-25 release","measured_date":"2024-11-25"},"mmlu_pro":{"raw":66.3,"norm":43.83,"trust":1,"source_url":"https://huggingface.co/mistralai/Mistral-Small-24B-Instruct-2501","config":"5-shot cot, instruct","measured_date":null},"tau_bench":{"raw":19.59,"norm":0,"trust":2,"source_url":"https://artificialanalysis.ai/models/mistral-small-3","config":"artificial analysis independent run, tau2, with tools","measured_date":null}}},{"id":"smollm-3-3b","display_name":"SmolLM3-3B","family_id":"smollm","vendor":"Hugging Face","status":"current","kind":"model","superseded_by":null,"release_date":"2025-07-08","intelligence_index":15.09,"coverage":0.3572,"index_subset_bias":null,"params_total_b":3.08,"params_active_b":3.08,"vram_est":{"bf16_gb":6.2,"int8_gb":3.3,"int4_gb":1.8,"method":"linear-rom-v1","approximate":true,"basis":"params_total_b"},"vram_frontier":{"efficiency":3.37,"expected_int8_gb":11,"method":"frontier-residual-v1","approximate":true},"fits_on":{"intel_b70":"fp8","nvidia_h100_sxm_80g":"fp8","nvidia_dgx_spark":"fp8"},"is_moe":false,"is_open_weights":true,"context_window_tok":128000,"pricing":{"prompt_usd_per_m":null,"completion_usd_per_m":null,"blended_usd_per_m":null},"scores":{"aime":{"raw":36.7,"norm":20.88,"trust":1,"source_url":"https://huggingface.co/HuggingFaceTB/SmolLM3-3B","config":"aime 2025, extended thinking","measured_date":null},"gpqa_diamond":{"raw":41.7,"norm":23.52,"trust":1,"source_url":"https://huggingface.co/HuggingFaceTB/SmolLM3-3B","config":"extended thinking","measured_date":null},"mmlu_pro":{"raw":32.7,"norm":0,"trust":1,"source_url":"https://huggingface.co/HuggingFaceTB/SmolLM3-3B","config":"0-shot, base model, lighteval, mmlu pro mcf","measured_date":null}}},{"id":"mistral-2407-large","display_name":"Mistral Large 2407","family_id":"mistral","vendor":"Mistral AI","status":"superseded","kind":"model","superseded_by":"mistral-2512-large","release_date":"2024-11-19","intelligence_index":15.06,"coverage":0.4762,"index_subset_bias":null,"params_total_b":null,"params_active_b":null,"vram_est":null,"vram_frontier":null,"fits_on":null,"is_moe":false,"is_open_weights":false,"context_window_tok":131072,"pricing":{"prompt_usd_per_m":2,"completion_usd_per_m":6,"blended_usd_per_m":3},"scores":{"aime":{"raw":0,"norm":0,"trust":2,"source_url":"https://artificialanalysis.ai/models/mistral-large-2407","config":"aa field aime25, aime-2025, artificial analysis intelligence index v4.1.1 suite, effort=none, reasoning=false, run: jul '24, source value 0 is a 0-1 fraction, x100 at harvest","measured_date":null},"arena_elo":{"raw":1314.4,"norm":15.5,"trust":3,"source_url":"https://lmarena.ai/leaderboard","config":"text","measured_date":"2026-09-27"},"gpqa_diamond":{"raw":47.17,"norm":31.23,"trust":2,"source_url":"https://artificialanalysis.ai/models/mistral-large-2407","config":"aa field gpqa, artificial analysis intelligence index v4.1.1 suite, effort=none, gpqa diamond, reasoning=false, run: jul '24, source value 0.471717171717172 is a 0-1 fraction, x100 at harvest","measured_date":null},"hle":{"raw":2.95,"norm":1.4,"trust":2,"source_url":"https://artificialanalysis.ai/models/mistral-large-2407","config":"aa field hle, artificial analysis intelligence index v4.1.1 suite, effort=none, humanity's last exam, reasoning=false, run: jul '24, source value 0.0295 is a 0-1 fraction, x100 at harvest","measured_date":null},"tau_bench":{"raw":33.04,"norm":17.39,"trust":2,"source_url":"https://artificialanalysis.ai/models/mistral-large-2407","config":"aa field tau2, aa field tau2 (not mapped to tau_bench), artificial analysis intelligence index v4.1.1 suite, effort=none, reasoning=false, run: jul '24, source value 0.330409356725146 is a 0-1 fraction, x100 at harvest","measured_date":null}}},{"id":"qwen-2.5-32b-instruct-code","display_name":"Qwen2.5 Coder 32B Instruct","family_id":"qwen","vendor":"Alibaba","status":"current","kind":"model","superseded_by":null,"release_date":"2024-11-11","intelligence_index":14.95,"coverage":0.6666,"index_subset_bias":null,"params_total_b":32.76,"params_active_b":32.76,"vram_est":{"bf16_gb":65.5,"int8_gb":34.7,"int4_gb":19.7,"method":"linear-rom-v1","approximate":true,"basis":"params_total_b"},"vram_frontier":{"efficiency":0.31,"expected_int8_gb":10.9,"method":"frontier-residual-v1","approximate":true},"fits_on":{"intel_b70":"int4","nvidia_h100_sxm_80g":"fp8","nvidia_dgx_spark":"fp8"},"is_moe":false,"is_open_weights":true,"context_window_tok":32768,"pricing":{"prompt_usd_per_m":0.66,"completion_usd_per_m":1,"blended_usd_per_m":0.745},"scores":{"aime":{"raw":20,"norm":0,"trust":2,"source_url":"https://arxiv.org/html/2409.12186v3","config":"aime24, qwen2.5-coder technical report table 20","measured_date":"2024-11-12"},"arena_elo":{"raw":1270.6,"norm":0,"trust":3,"source_url":"https://lmarena.ai/leaderboard","config":"text","measured_date":"2026-09-27"},"gpqa_diamond":{"raw":41.7,"norm":23.52,"trust":2,"source_url":"https://artificialanalysis.ai/evaluations/gpqa-diamond?models=qwen2-5-coder-32b-instruct","config":"artificial analysis harness, gpqa diamond","measured_date":null},"hle":{"raw":3.5,"norm":2.21,"trust":2,"source_url":"https://artificialanalysis.ai/evaluations/humanitys-last-exam?models=qwen2-5-coder-32b-instruct","config":"artificial analysis harness, humanity's last exam","measured_date":null},"livebench":{"raw":45,"norm":11.11,"trust":2,"source_url":"https://arxiv.org/html/2406.19314v2","config":"global average, qwen2.5-coder-32b-instruct, table 2","measured_date":"2025-04-18"},"mmlu_pro":{"raw":63.5,"norm":39.17,"trust":2,"source_url":"https://artificialanalysis.ai/evaluations/mmlu-pro?models=qwen2-5-coder-32b-instruct","config":"artificial analysis harness, mmlu-pro","measured_date":null}}},{"id":"qwen-2.5-7b-instruct","display_name":"Qwen2.5 7B Instruct","family_id":"qwen","vendor":"Alibaba","status":"current","kind":"model","superseded_by":null,"release_date":"2024-09-18","intelligence_index":14.58,"coverage":0.3969,"index_subset_bias":null,"params_total_b":7.62,"params_active_b":7.62,"vram_est":{"bf16_gb":15.2,"int8_gb":8.1,"int4_gb":4.6,"method":"linear-rom-v1","approximate":true,"basis":"params_total_b"},"vram_frontier":{"efficiency":1.32,"expected_int8_gb":10.7,"method":"frontier-residual-v1","approximate":true},"fits_on":{"intel_b70":"fp8","nvidia_h100_sxm_80g":"fp8","nvidia_dgx_spark":"fp8"},"is_moe":false,"is_open_weights":true,"context_window_tok":32768,"pricing":{"prompt_usd_per_m":0.1,"completion_usd_per_m":0.2,"blended_usd_per_m":0.125},"scores":{"gpqa_diamond":{"raw":36.4,"norm":16.06,"trust":1,"source_url":"https://qwenlm.github.io/blog/qwen2.5-llm/","config":null,"measured_date":"2024-09-19"},"livebench":{"raw":35.9,"norm":0,"trust":1,"source_url":"https://qwenlm.github.io/blog/qwen2.5-llm/","config":"livebench 0831 release","measured_date":"2024-09-19"},"mmlu_pro":{"raw":56.3,"norm":27.17,"trust":1,"source_url":"https://qwenlm.github.io/blog/qwen2.5-llm/","config":null,"measured_date":"2024-09-19"}}},{"id":"hermes-3-llama-3.1-70b","display_name":"Hermes 3 70B Instruct","family_id":"hermes","vendor":"nousresearch","status":"superseded","kind":"model","superseded_by":"hermes-4-70b","release_date":"2024-08-18","intelligence_index":13.22,"coverage":0.3889,"index_subset_bias":null,"params_total_b":70.55,"params_active_b":70.55,"vram_est":{"bf16_gb":141,"int8_gb":74.8,"int4_gb":42.3,"method":"linear-rom-v1","approximate":true,"basis":"params_total_b"},"vram_frontier":null,"fits_on":{"nvidia_h100_sxm_80g":"int4","nvidia_dgx_spark":"fp8"},"is_moe":false,"is_open_weights":true,"context_window_tok":131072,"pricing":{"prompt_usd_per_m":0.7,"completion_usd_per_m":0.7,"blended_usd_per_m":0.7},"scores":{"gpqa_diamond":{"raw":40.1,"norm":21.27,"trust":2,"source_url":"https://artificialanalysis.ai/models/hermes-3-llama-3-1-70b","config":"aa field gpqa, artificial analysis intelligence index v4.1.1 suite, effort=none, gpqa diamond, reasoning=false, source value 0.401010101010101 is a 0-1 fraction, x100 at harvest","measured_date":null},"hle":{"raw":3.99,"norm":2.93,"trust":2,"source_url":"https://artificialanalysis.ai/models/hermes-3-llama-3-1-70b","config":"aa field hle, artificial analysis intelligence index v4.1.1 suite, effort=none, humanity's last exam, reasoning=false, source value 0.0399 is a 0-1 fraction, x100 at harvest","measured_date":null},"mmlu_pro":{"raw":47.24,"norm":12.07,"trust":2,"source_url":"https://arxiv.org/pdf/2408.11857","config":"5-shot","measured_date":"2024-08-15"}}},{"id":"deepseek-r1-distill-llama-8b-reasoning","display_name":"DeepSeek-R1-Distill-Llama-8B","family_id":"deepseek","vendor":"DeepSeek","status":"current","kind":"model","superseded_by":null,"release_date":"2025-01-20","intelligence_index":13.17,"coverage":0.4762,"index_subset_bias":null,"params_total_b":8.03,"params_active_b":8.03,"vram_est":{"bf16_gb":16.1,"int8_gb":8.5,"int4_gb":4.8,"method":"linear-rom-v1","approximate":true,"basis":"params_total_b"},"vram_frontier":{"efficiency":1.15,"expected_int8_gb":9.8,"method":"frontier-residual-v1","approximate":true},"fits_on":{"intel_b70":"fp8","nvidia_h100_sxm_80g":"fp8","nvidia_dgx_spark":"fp8"},"is_moe":false,"is_open_weights":true,"context_window_tok":null,"pricing":{"prompt_usd_per_m":null,"completion_usd_per_m":null,"blended_usd_per_m":null},"scores":{"aime":{"raw":41.33,"norm":26.66,"trust":2,"source_url":"https://artificialanalysis.ai/models/deepseek-r1-distill-llama-8b","config":"aime 2025, artificial analysis harness","measured_date":null},"gpqa_diamond":{"raw":30.2,"norm":7.32,"trust":2,"source_url":"https://artificialanalysis.ai/models/deepseek-r1-distill-llama-8b","config":"artificial analysis harness","measured_date":null},"livebench":{"raw":40.6,"norm":1.33,"trust":2,"source_url":"https://arxiv.org/html/2505.09388v1","config":"livebench 2024-11-25, qwen3 technical report table 19, thinking mode","measured_date":"2025-05-14"},"mmlu_pro":{"raw":54.3,"norm":23.83,"trust":2,"source_url":"https://artificialanalysis.ai/evaluations/mmlu-pro?models=deepseek-r1-distill-llama-8b","config":"artificial analysis harness, mmlu-pro","measured_date":null}}},{"id":"qwen-3-8b-instruct-vision","display_name":"Qwen3 VL 8B Instruct","family_id":"qwen","vendor":"Alibaba","status":"current","kind":"model","superseded_by":null,"release_date":"2025-10-14","intelligence_index":12.13,"coverage":0.4445,"index_subset_bias":null,"params_total_b":8.77,"params_active_b":8.77,"vram_est":{"bf16_gb":17.5,"int8_gb":9.3,"int4_gb":5.3,"method":"linear-rom-v1","approximate":true,"basis":"params_total_b"},"vram_frontier":{"efficiency":0.98,"expected_int8_gb":9.1,"method":"frontier-residual-v1","approximate":true},"fits_on":{"intel_b70":"fp8","nvidia_h100_sxm_80g":"fp8","nvidia_dgx_spark":"fp8"},"is_moe":false,"is_open_weights":true,"context_window_tok":262144,"pricing":{"prompt_usd_per_m":0.117,"completion_usd_per_m":0.455,"blended_usd_per_m":0.2015},"scores":{"aime":{"raw":27.33,"norm":9.16,"trust":2,"source_url":"https://artificialanalysis.ai/models/qwen3-vl-8b-instruct","config":"aa field aime25, aime-2025, artificial analysis intelligence index v4.1.1 suite, effort=none, reasoning=false, source value 0.273333333333333 is a 0-1 fraction, x100 at harvest","measured_date":null},"gpqa_diamond":{"raw":42.73,"norm":24.97,"trust":2,"source_url":"https://artificialanalysis.ai/models/qwen3-vl-8b-instruct","config":"aa field gpqa, artificial analysis intelligence index v4.1.1 suite, effort=none, gpqa diamond, reasoning=false, source value 0.427272727272727 is a 0-1 fraction, x100 at harvest","measured_date":null},"hle":{"raw":2.69,"norm":1.01,"trust":2,"source_url":"https://artificialanalysis.ai/models/qwen3-vl-8b-instruct","config":"aa field hle, artificial analysis intelligence index v4.1.1 suite, effort=none, humanity's last exam, reasoning=false, source value 0.0268767377201112 is a 0-1 fraction, x100 at harvest","measured_date":null},"tau_bench":{"raw":29.24,"norm":12.32,"trust":2,"source_url":"https://artificialanalysis.ai/models/qwen3-vl-8b-instruct","config":"aa field tau2, aa field tau2 (not mapped to tau_bench), artificial analysis intelligence index v4.1.1 suite, effort=none, reasoning=false, source value 0.292397660818713 is a 0-1 fraction, x100 at harvest","measured_date":null},"terminal_bench":{"raw":2.27,"norm":0,"trust":2,"source_url":"https://artificialanalysis.ai/models/qwen3-vl-8b-instruct","config":"aa field terminalbenchhard, artificial analysis intelligence index v4.1.1 suite, effort=none, reasoning=false, source value 0.0227272727272727 is a 0-1 fraction, terminal-bench hard, x100 at harvest","measured_date":null}}},{"id":"gpt-4","display_name":"GPT-4","family_id":"gpt","vendor":"OpenAI","status":"current","kind":"model","superseded_by":null,"release_date":"2023-05-28","intelligence_index":10.77,"coverage":0.3572,"index_subset_bias":null,"params_total_b":null,"params_active_b":null,"vram_est":null,"vram_frontier":null,"fits_on":null,"is_moe":false,"is_open_weights":false,"context_window_tok":8191,"pricing":{"prompt_usd_per_m":30,"completion_usd_per_m":60,"blended_usd_per_m":37.5},"scores":{"arena_elo":{"raw":1287.4,"norm":3.46,"trust":3,"source_url":"https://arena.ai/leaderboard/text","config":"54173 votes, arena entry gpt-4-0314, leaderboard text-overall-style_control, rank 274, run: gpt-4-0314, style control, text/overall, vote cutoff 2026-08-21","measured_date":"2026-08-21"},"gpqa_diamond":{"raw":34.95,"norm":14.01,"trust":2,"source_url":"https://artificialanalysis.ai/models/gpt-4","config":"aa field gpqa, artificial analysis intelligence index v4.1.1 suite, effort=none, gpqa diamond, reasoning=false, source value 0.349494949494949 is a 0-1 fraction, x100 at harvest","measured_date":null},"livebench":{"raw":45.1,"norm":11.33,"trust":3,"source_url":"https://livebench.ai/table_2024_08_31.csv","config":"global average of the 6 category averages, leaderboard row gpt-4-0613, livebench 2024-08-31 release","measured_date":"2024-08-31"}}},{"id":"phi-4-mini-3.8b-instruct","display_name":"Phi-4-mini-instruct","family_id":"phi","vendor":"Microsoft","status":"current","kind":"model","superseded_by":null,"release_date":"2025-02-27","intelligence_index":10.67,"coverage":0.4365,"index_subset_bias":null,"params_total_b":3.84,"params_active_b":3.84,"vram_est":{"bf16_gb":7.7,"int8_gb":4.1,"int4_gb":2.3,"method":"linear-rom-v1","approximate":true,"basis":"params_total_b"},"vram_frontier":{"efficiency":2.02,"expected_int8_gb":8.2,"method":"frontier-residual-v1","approximate":true},"fits_on":{"intel_b70":"fp8","nvidia_h100_sxm_80g":"fp8","nvidia_dgx_spark":"fp8"},"is_moe":false,"is_open_weights":true,"context_window_tok":128000,"pricing":{"prompt_usd_per_m":null,"completion_usd_per_m":null,"blended_usd_per_m":null},"scores":{"gpqa_diamond":{"raw":33,"norm":11.27,"trust":2,"source_url":"https://artificialanalysis.ai/leaderboards/models","config":"artificial analysis independent eval, leaderboard cell displayed rounded to whole percent","measured_date":null},"hle":{"raw":4,"norm":2.94,"trust":2,"source_url":"https://artificialanalysis.ai/leaderboards/models","config":"artificial analysis independent eval, leaderboard cell displayed rounded to whole percent, no tools","measured_date":null},"mmlu_pro":{"raw":52.8,"norm":21.33,"trust":1,"source_url":"https://huggingface.co/microsoft/Phi-4-mini-instruct","config":"0-shot cot","measured_date":null},"terminal_bench":{"raw":0,"norm":0,"trust":2,"source_url":"https://artificialanalysis.ai/leaderboards/models","config":"artificial analysis independent eval, leaderboard cell displayed rounded to whole percent, terminal-bench v2.1","measured_date":null}}},{"id":"gpt-4-o-mini","display_name":"GPT-4o-mini","family_id":"gpt","vendor":"OpenAI","status":"superseded","kind":"model","superseded_by":"gpt-5.4-mini","release_date":"2024-07-18","intelligence_index":10.22,"coverage":0.5554,"index_subset_bias":null,"params_total_b":null,"params_active_b":null,"vram_est":null,"vram_frontier":null,"fits_on":null,"is_moe":false,"is_open_weights":false,"context_window_tok":128000,"pricing":{"prompt_usd_per_m":0.15,"completion_usd_per_m":0.6,"blended_usd_per_m":0.26249999999999996},"scores":{"aime":{"raw":14.67,"norm":0,"trust":2,"source_url":"https://artificialanalysis.ai/models/gpt-4o-mini","config":"aa field aime25, aime-2025, artificial analysis intelligence index v4.1.1 suite, effort=none, reasoning=false, source value 0.146666666666667 is a 0-1 fraction, x100 at harvest","measured_date":null},"arc_agi_2":{"raw":0,"norm":0,"trust":3,"source_url":"https://arcprize.org/leaderboard","config":"cost_per_task_usd=0.01, eval=arc-agi-2 semi-private (v2_semi_private), org=openai, system_type=base llm","measured_date":"2026-08-21"},"arena_elo":{"raw":1317.6,"norm":16.92,"trust":3,"source_url":"https://lmarena.ai/leaderboard","config":"text","measured_date":"2026-10-03"},"gpqa_diamond":{"raw":42.63,"norm":24.83,"trust":2,"source_url":"https://artificialanalysis.ai/models/gpt-4o-mini","config":"aa field gpqa, artificial analysis intelligence index v4.1.1 suite, effort=none, gpqa diamond, reasoning=false, source value 0.426262626262626 is a 0-1 fraction, x100 at harvest","measured_date":null},"hle":{"raw":4.2,"norm":3.24,"trust":2,"source_url":"https://artificialanalysis.ai/models/gpt-4o-mini","config":"aa field hle, artificial analysis intelligence index v4.1.1 suite, effort=none, humanity's last exam, reasoning=false, source value 0.042 is a 0-1 fraction, x100 at harvest","measured_date":null},"terminal_bench":{"raw":5.62,"norm":0.73,"trust":2,"source_url":"https://artificialanalysis.ai/models/gpt-4o-mini","config":"aa field terminalbenchv21, artificial analysis intelligence index v4.1.1 suite, effort=none, reasoning=false, source value 0.0561797752808989 is a 0-1 fraction, terminal-bench 2.1, x100 at harvest","measured_date":null}}},{"id":"mistral-1-large","display_name":"Mistral Large","family_id":"mistral","vendor":"Mistral AI","status":"superseded","kind":"model","superseded_by":"mistral-2512-large","release_date":"2024-02-26","intelligence_index":10.2,"coverage":0.4682,"index_subset_bias":null,"params_total_b":null,"params_active_b":null,"vram_est":null,"vram_frontier":null,"fits_on":null,"is_moe":false,"is_open_weights":false,"context_window_tok":128000,"pricing":{"prompt_usd_per_m":2,"completion_usd_per_m":6,"blended_usd_per_m":3},"scores":{"arena_elo":{"raw":1242,"norm":0,"trust":3,"source_url":"https://arena.ai/leaderboard/text","config":"no style control, overall (text)","measured_date":null},"gpqa_diamond":{"raw":35.05,"norm":14.15,"trust":2,"source_url":"https://artificialanalysis.ai/models/mistral-large","config":"aa field gpqa, artificial analysis intelligence index v4.1.1 suite, effort=none, gpqa diamond, reasoning=false, run: feb '24, source value 0.350505050505051 is a 0-1 fraction, x100 at harvest","measured_date":null},"hle":{"raw":3.5,"norm":2.21,"trust":2,"source_url":"https://artificialanalysis.ai/models/mistral-large","config":"aa field hle, artificial analysis intelligence index v4.1.1 suite, effort=none, humanity's last exam, reasoning=false, run: feb '24, source value 0.035 is a 0-1 fraction, x100 at harvest","measured_date":null},"mmlu_pro":{"raw":51.5,"norm":19.17,"trust":2,"source_url":"http://web.archive.org/web/20250618051413/https://artificialanalysis.ai/models/mistral-large","config":"artificial analysis independent run, read from the 2025-06-18 wayback capture of aa's now-deprecated mistral large (feb '24) page","measured_date":null}}},{"id":"gemma-2-27b-instruct","display_name":"Gemma 2 27B","family_id":"gemma","vendor":"Google DeepMind","status":"current","kind":"model","superseded_by":null,"release_date":"2024-07-13","intelligence_index":10.08,"coverage":0.4762,"index_subset_bias":null,"params_total_b":27.23,"params_active_b":27.23,"vram_est":{"bf16_gb":54.5,"int8_gb":28.9,"int4_gb":16.3,"method":"linear-rom-v1","approximate":true,"basis":"params_total_b"},"vram_frontier":{"efficiency":0.27,"expected_int8_gb":7.8,"method":"frontier-residual-v1","approximate":true},"fits_on":{"intel_b70":"fp8","nvidia_h100_sxm_80g":"fp8","nvidia_dgx_spark":"fp8"},"is_moe":false,"is_open_weights":true,"context_window_tok":8192,"pricing":{"prompt_usd_per_m":0.65,"completion_usd_per_m":0.65,"blended_usd_per_m":0.65},"scores":{"arena_elo":{"raw":1289.4,"norm":4.35,"trust":3,"source_url":"https://lmarena.ai/leaderboard","config":"text","measured_date":"2026-10-01"},"gpqa_diamond":{"raw":40.91,"norm":22.41,"trust":2,"source_url":"https://huggingface.co/google/gemma-2-27b-it","config":"accuracy, inc. third-party run), sglang, wasp 0.3.0 harness (writer","measured_date":"2026-04-16"},"livebench":{"raw":38.2,"norm":0,"trust":3,"source_url":"https://livebench.ai/","config":"global average (overall), livebench-2024-11-25 release","measured_date":"2024-11-25"},"mmlu_pro":{"raw":44.51,"norm":7.52,"trust":3,"source_url":"https://huggingface.co/spaces/open-llm-leaderboard/open_llm_leaderboard","config":"5-shot, bfloat16, huggingface open llm leaderboard v2, raw accuracy (leaderboard-normalised value 38.35)","measured_date":null}}},{"id":"gemma-3-12b-instruct","display_name":"Gemma 3 12B","family_id":"gemma","vendor":"Google DeepMind","status":"superseded","kind":"model","superseded_by":"gemma-4-12b-unified-instruct","release_date":"2025-03-12","intelligence_index":9.13,"coverage":0.5238,"index_subset_bias":null,"params_total_b":12.19,"params_active_b":12.19,"vram_est":{"bf16_gb":24.4,"int8_gb":12.9,"int4_gb":7.3,"method":"linear-rom-v1","approximate":true,"basis":"params_total_b"},"vram_frontier":null,"fits_on":{"intel_b70":"fp8","nvidia_h100_sxm_80g":"fp8","nvidia_dgx_spark":"fp8"},"is_moe":false,"is_open_weights":true,"context_window_tok":131072,"pricing":{"prompt_usd_per_m":0.05,"completion_usd_per_m":0.15,"blended_usd_per_m":0.07500000000000001},"scores":{"aime":{"raw":18.33,"norm":0,"trust":2,"source_url":"https://artificialanalysis.ai/models/gemma-3-12b","config":"aa field aime25, aime-2025, artificial analysis intelligence index v4.1.1 suite, effort=none, reasoning=false, source value 0.183333333333333 is a 0-1 fraction, x100 at harvest","measured_date":null},"arena_elo":{"raw":1341.8,"norm":27.71,"trust":3,"source_url":"https://lmarena.ai/leaderboard","config":"text","measured_date":"2026-09-27"},"gpqa_diamond":{"raw":34.95,"norm":14.01,"trust":2,"source_url":"https://artificialanalysis.ai/models/gemma-3-12b","config":"aa field gpqa, artificial analysis intelligence index v4.1.1 suite, effort=none, gpqa diamond, reasoning=false, source value 0.349494949494949 is a 0-1 fraction, x100 at harvest","measured_date":null},"hle":{"raw":4.21,"norm":3.25,"trust":2,"source_url":"https://artificialanalysis.ai/models/gemma-3-12b","config":"aa field hle, artificial analysis intelligence index v4.1.1 suite, effort=none, humanity's last exam, reasoning=false, source value 0.0421 is a 0-1 fraction, x100 at harvest","measured_date":null},"tau_bench":{"raw":10.82,"norm":0,"trust":2,"source_url":"https://artificialanalysis.ai/models/gemma-3-12b","config":"aa field tau2, aa field tau2 (not mapped to tau_bench), artificial analysis intelligence index v4.1.1 suite, effort=none, reasoning=false, source value 0.108187134502924 is a 0-1 fraction, x100 at harvest","measured_date":null},"terminal_bench":{"raw":0.76,"norm":0,"trust":2,"source_url":"https://artificialanalysis.ai/models/gemma-3-12b","config":"aa field terminalbenchhard, artificial analysis intelligence index v4.1.1 suite, effort=none, reasoning=false, source value 0.00757575757575758 is a 0-1 fraction, terminal-bench hard, x100 at harvest","measured_date":null}}},{"id":"granite-4.0-h-small-32b-instruct","display_name":"Granite-4.0-H-Small","family_id":"granite","vendor":"IBM","status":"current","kind":"model","superseded_by":null,"release_date":"2025-10-02","intelligence_index":9.02,"coverage":0.4445,"index_subset_bias":null,"params_total_b":32.21,"params_active_b":9,"vram_est":{"bf16_gb":64.4,"int8_gb":34.1,"int4_gb":19.3,"method":"linear-rom-v1","approximate":true,"basis":"params_total_b"},"vram_frontier":{"efficiency":0.93,"expected_int8_gb":31.7,"method":"frontier-residual-v1","approximate":true},"fits_on":{"intel_b70":"int4","nvidia_h100_sxm_80g":"fp8","nvidia_dgx_spark":"fp8"},"is_moe":true,"is_open_weights":true,"context_window_tok":null,"pricing":{"prompt_usd_per_m":null,"completion_usd_per_m":null,"blended_usd_per_m":null},"scores":{"aime":{"raw":13.67,"norm":0,"trust":2,"source_url":"https://artificialanalysis.ai/models/granite-4-0-h-small","config":"aa field aime25, aime-2025, artificial analysis intelligence index v4.1.1 suite, effort=none, reasoning=false, source value 0.136666666666667 is a 0-1 fraction, x100 at harvest","measured_date":null},"gpqa_diamond":{"raw":41.62,"norm":23.41,"trust":2,"source_url":"https://artificialanalysis.ai/models/granite-4-0-h-small","config":"aa field gpqa, artificial analysis intelligence index v4.1.1 suite, effort=none, gpqa diamond, reasoning=false, source value 0.416161616161616 is a 0-1 fraction, x100 at harvest","measured_date":null},"hle":{"raw":3.8,"norm":2.65,"trust":2,"source_url":"https://artificialanalysis.ai/models/granite-4-0-h-small","config":"aa field hle, artificial analysis intelligence index v4.1.1 suite, effort=none, humanity's last exam, reasoning=false, source value 0.0379981464318814 is a 0-1 fraction, x100 at harvest","measured_date":null},"tau_bench":{"raw":17.25,"norm":0,"trust":2,"source_url":"https://artificialanalysis.ai/models/granite-4-0-h-small","config":"aa field tau2, aa field tau2 (not mapped to tau_bench), artificial analysis intelligence index v4.1.1 suite, effort=none, reasoning=false, source value 0.172514619883041 is a 0-1 fraction, x100 at harvest","measured_date":null},"terminal_bench":{"raw":2.27,"norm":0,"trust":2,"source_url":"https://artificialanalysis.ai/models/granite-4-0-h-small","config":"aa field terminalbenchhard, artificial analysis intelligence index v4.1.1 suite, effort=none, reasoning=false, source value 0.0227272727272727 is a 0-1 fraction, terminal-bench hard, x100 at harvest","measured_date":null}}},{"id":"qwen-2.5-1.5b","display_name":"Qwen2.5-1.5B","family_id":"qwen","vendor":"Alibaba","status":"current","kind":"model","superseded_by":null,"release_date":"2024-09-18","intelligence_index":8.56,"coverage":0.3572,"index_subset_bias":null,"params_total_b":1.54,"params_active_b":1.54,"vram_est":{"bf16_gb":3.1,"int8_gb":1.6,"int4_gb":0.9,"method":"linear-rom-v1","approximate":true,"basis":"params_total_b"},"vram_frontier":{"efficiency":4.2,"expected_int8_gb":6.9,"method":"frontier-residual-v1","approximate":true},"fits_on":{"intel_b70":"fp8","nvidia_h100_sxm_80g":"fp8","nvidia_dgx_spark":"fp8"},"is_moe":false,"is_open_weights":true,"context_window_tok":32768,"pricing":{"prompt_usd_per_m":null,"completion_usd_per_m":null,"blended_usd_per_m":null},"scores":{"aime":{"raw":0.4,"norm":25,"trust":1,"source_url":"https://arxiv.org/abs/2505.09388","config":"aime'25, measured by the qwen3 team","measured_date":"2025-05-14"},"gpqa_diamond":{"raw":29.8,"norm":6.76,"trust":1,"source_url":"https://arxiv.org/abs/2505.09388","config":"measured by the qwen3 team, non-thinking, qwen2.5-1.5b-instruct","measured_date":"2025-05-14"},"livebench":{"raw":18,"norm":0,"trust":1,"source_url":"https://arxiv.org/abs/2505.09388","config":"livebench 2024-11-25, measured by the qwen3 team","measured_date":"2025-05-14"}}},{"id":"llama-3.1-70b-instruct","display_name":"Llama 3.1 70B Instruct","family_id":"llama","vendor":"Meta","status":"superseded","kind":"model","superseded_by":"llama-3.3-70b-instruct","release_date":"2024-07-23","intelligence_index":8.48,"coverage":0.5238,"index_subset_bias":null,"params_total_b":70.55,"params_active_b":70.55,"vram_est":{"bf16_gb":141,"int8_gb":74.8,"int4_gb":42.3,"method":"linear-rom-v1","approximate":true,"basis":"params_total_b"},"vram_frontier":null,"fits_on":{"nvidia_h100_sxm_80g":"int4","nvidia_dgx_spark":"fp8"},"is_moe":false,"is_open_weights":true,"context_window_tok":131072,"pricing":{"prompt_usd_per_m":0.4,"completion_usd_per_m":0.4,"blended_usd_per_m":0.4},"scores":{"aime":{"raw":4,"norm":0,"trust":2,"source_url":"https://artificialanalysis.ai/models/llama-3-1-instruct-70b","config":"aa field aime25, aime-2025, artificial analysis intelligence index v4.1.1 suite, effort=none, reasoning=false, source value 0.04 is a 0-1 fraction, x100 at harvest","measured_date":null},"arena_elo":{"raw":1293.3,"norm":6.09,"trust":3,"source_url":"https://lmarena.ai/leaderboard","config":"text","measured_date":"2026-09-27"},"gpqa_diamond":{"raw":40.91,"norm":22.41,"trust":2,"source_url":"https://artificialanalysis.ai/models/llama-3-1-instruct-70b","config":"aa field gpqa, artificial analysis intelligence index v4.1.1 suite, effort=none, gpqa diamond, reasoning=false, source value 0.409090909090909 is a 0-1 fraction, x100 at harvest","measured_date":null},"hle":{"raw":4.47,"norm":3.63,"trust":2,"source_url":"https://artificialanalysis.ai/models/llama-3-1-instruct-70b","config":"aa field hle, artificial analysis intelligence index v4.1.1 suite, effort=none, humanity's last exam, reasoning=false, source value 0.0447 is a 0-1 fraction, x100 at harvest","measured_date":null},"tau_bench":{"raw":15.2,"norm":0,"trust":2,"source_url":"https://artificialanalysis.ai/models/llama-3-1-instruct-70b","config":"aa field tau2, aa field tau2 (not mapped to tau_bench), artificial analysis intelligence index v4.1.1 suite, effort=none, reasoning=false, source value 0.152046783625731 is a 0-1 fraction, x100 at harvest","measured_date":null},"terminal_bench":{"raw":3.03,"norm":0,"trust":2,"source_url":"https://artificialanalysis.ai/models/llama-3-1-instruct-70b","config":"aa field terminalbenchhard, artificial analysis intelligence index v4.1.1 suite, effort=none, reasoning=false, source value 0.0303030303030303 is a 0-1 fraction, terminal-bench hard, x100 at harvest","measured_date":null}}},{"id":"gemma-3-n-e4b-instruct","display_name":"gemma-3n-e4b-it","family_id":"gemma","vendor":"Google DeepMind","status":"current","kind":"model","superseded_by":null,"release_date":"2025-05-20","intelligence_index":7.58,"coverage":0.6428,"index_subset_bias":null,"params_total_b":7.85,"params_active_b":7.85,"vram_est":{"bf16_gb":15.7,"int8_gb":8.3,"int4_gb":4.7,"method":"linear-rom-v1","approximate":true,"basis":"params_total_b"},"vram_frontier":{"efficiency":0.75,"expected_int8_gb":6.2,"method":"frontier-residual-v1","approximate":true},"fits_on":{"intel_b70":"fp8","nvidia_h100_sxm_80g":"fp8","nvidia_dgx_spark":"fp8"},"is_moe":false,"is_open_weights":true,"context_window_tok":32768,"pricing":{"prompt_usd_per_m":null,"completion_usd_per_m":null,"blended_usd_per_m":null},"scores":{"aime":{"raw":14.33,"norm":0,"trust":2,"source_url":"https://artificialanalysis.ai/models/gemma-3n-e4b","config":"aime 2025, artificial analysis harness","measured_date":null},"arena_elo":{"raw":1317.4,"norm":16.83,"trust":3,"source_url":"https://lmarena.ai/leaderboard","config":"text","measured_date":"2026-10-03"},"gpqa_diamond":{"raw":29.6,"norm":6.48,"trust":2,"source_url":"https://artificialanalysis.ai/models/gemma-3n-e4b","config":"artificial analysis harness","measured_date":null},"hle":{"raw":4.49,"norm":3.66,"trust":2,"source_url":"https://artificialanalysis.ai/models/gemma-3n-e4b","config":"artificial analysis harness, no tools","measured_date":null},"mmlu_pro":{"raw":50.6,"norm":17.67,"trust":1,"source_url":"https://huggingface.co/google/gemma-3n-E4B-it","config":"0-shot accuracy, card row 'mmlu (pro)', e4b it","measured_date":null},"tau_bench":{"raw":4.97,"norm":0,"trust":2,"source_url":"https://artificialanalysis.ai/models/gemma-3n-e4b","config":"artificial analysis harness, tau2","measured_date":null},"terminal_bench":{"raw":0.75,"norm":0,"trust":2,"source_url":"https://artificialanalysis.ai/models/gemma-3n-e4b","config":"artificial analysis harness, v2.1","measured_date":null}}},{"id":"claude-haiku-3","display_name":"claude-3-haiku","family_id":"claude","vendor":"Anthropic","status":"superseded","kind":"model","superseded_by":"claude-haiku-4.5","release_date":"2024-03-13","intelligence_index":7.14,"coverage":0.4445,"index_subset_bias":null,"params_total_b":null,"params_active_b":null,"vram_est":null,"vram_frontier":null,"fits_on":null,"is_moe":false,"is_open_weights":false,"context_window_tok":200000,"pricing":{"prompt_usd_per_m":null,"completion_usd_per_m":null,"blended_usd_per_m":null},"scores":{"arena_elo":{"raw":1261.4,"norm":0,"trust":3,"source_url":"https://arena.ai/leaderboard/text","config":"117701 votes, arena entry claude-3-haiku-20240307, leaderboard text-overall-style_control, rank 295, style control, text/overall, vote cutoff 2026-08-21","measured_date":"2026-08-21"},"gpqa_diamond":{"raw":37.37,"norm":17.42,"trust":2,"source_url":"https://artificialanalysis.ai/models/claude-3-haiku","config":"aa field gpqa, artificial analysis intelligence index v4.1.1 suite, effort=none, gpqa diamond, reasoning=false, source value 0.373737373737374 is a 0-1 fraction, x100 at harvest","measured_date":null},"hle":{"raw":4.08,"norm":3.06,"trust":2,"source_url":"https://artificialanalysis.ai/models/claude-3-haiku","config":"aa field hle, artificial analysis intelligence index v4.1.1 suite, effort=none, humanity's last exam, reasoning=false, source value 0.0407784986098239 is a 0-1 fraction, x100 at harvest","measured_date":null},"tau_bench":{"raw":21.05,"norm":1.4,"trust":2,"source_url":"https://artificialanalysis.ai/models/claude-3-haiku","config":"aa field tau2, aa field tau2 (not mapped to tau_bench), artificial analysis intelligence index v4.1.1 suite, effort=none, reasoning=false, source value 0.210526315789474 is a 0-1 fraction, x100 at harvest","measured_date":null},"terminal_bench":{"raw":0.76,"norm":0,"trust":2,"source_url":"https://artificialanalysis.ai/models/claude-3-haiku","config":"aa field terminalbenchhard, artificial analysis intelligence index v4.1.1 suite, effort=none, reasoning=false, source value 0.00757575757575758 is a 0-1 fraction, terminal-bench hard, x100 at harvest","measured_date":null}}},{"id":"gpt-3.5-turbo","display_name":"GPT-3.5 Turbo","family_id":"gpt","vendor":"OpenAI","status":"current","kind":"model","superseded_by":null,"release_date":"2023-05-28","intelligence_index":6.92,"coverage":0.3572,"index_subset_bias":null,"params_total_b":null,"params_active_b":null,"vram_est":null,"vram_frontier":null,"fits_on":null,"is_moe":false,"is_open_weights":false,"context_window_tok":16385,"pricing":{"prompt_usd_per_m":0.5,"completion_usd_per_m":1.5,"blended_usd_per_m":0.75},"scores":{"arena_elo":{"raw":1225,"norm":0,"trust":3,"source_url":"https://arena.ai/leaderboard/text","config":"66207 votes, arena entry gpt-3.5-turbo-0125, leaderboard text-overall-style_control, rank 313, run: gpt-3.5-turbo-0125, style control, text/overall, vote cutoff 2026-08-21","measured_date":"2026-08-21"},"gpqa_diamond":{"raw":30.56,"norm":7.83,"trust":3,"source_url":"https://www.vals.ai/benchmarks/gpqa","config":"edition=gpqa diamond v1, reasoning_effort=high, runner=platform, stderr=2.287, task=overall, updated=2026-08-19","measured_date":"2026-08-19"},"mmlu_pro":{"raw":46.19,"norm":10.32,"trust":2,"source_url":"https://artificialanalysis.ai/models/gpt-35-turbo","config":"artificial analysis independent evaluation","measured_date":null}}},{"id":"nova-1-micro","display_name":"Nova Micro 1.0","family_id":"nova","vendor":"Amazon","status":"current","kind":"model","superseded_by":null,"release_date":"2024-12-05","intelligence_index":6.38,"coverage":0.4445,"index_subset_bias":null,"params_total_b":null,"params_active_b":null,"vram_est":null,"vram_frontier":null,"fits_on":null,"is_moe":false,"is_open_weights":false,"context_window_tok":128000,"pricing":{"prompt_usd_per_m":0.035,"completion_usd_per_m":0.14,"blended_usd_per_m":0.061250000000000006},"scores":{"aime":{"raw":6,"norm":0,"trust":2,"source_url":"https://artificialanalysis.ai/models/nova-micro","config":"aa eval, aime 2025","measured_date":null},"gpqa_diamond":{"raw":35.76,"norm":15.15,"trust":2,"source_url":"https://artificialanalysis.ai/models/nova-micro","config":"aa intelligence index eval","measured_date":null},"hle":{"raw":4.63,"norm":3.87,"trust":2,"source_url":"https://artificialanalysis.ai/models/nova-micro","config":"aa eval, no tools","measured_date":null},"tau_bench":{"raw":14.04,"norm":0,"trust":2,"source_url":"https://artificialanalysis.ai/models/nova-micro","config":"aa eval, tau2-bench telecom","measured_date":null},"terminal_bench":{"raw":1.52,"norm":0,"trust":2,"source_url":"https://artificialanalysis.ai/models/nova-micro","config":"aa eval, terminal-bench hard","measured_date":null}}},{"id":"mixtral-8-x22b-instruct","display_name":"Mixtral 8x22B Instruct","family_id":"mixtral","vendor":"Mistral AI","status":"current","kind":"model","superseded_by":null,"release_date":"2024-04","intelligence_index":6.21,"coverage":0.3492,"index_subset_bias":null,"params_total_b":140.63,"params_active_b":39,"vram_est":{"bf16_gb":281,"int8_gb":149,"int4_gb":84.4,"method":"linear-rom-v1","approximate":true,"basis":"params_total_b"},"vram_frontier":{"efficiency":0.16,"expected_int8_gb":23.5,"method":"frontier-residual-v1","approximate":true},"fits_on":{"nvidia_dgx_spark":"int4"},"is_moe":true,"is_open_weights":true,"context_window_tok":65536,"pricing":{"prompt_usd_per_m":2,"completion_usd_per_m":6,"blended_usd_per_m":3},"scores":{"arena_elo":{"raw":1229.5,"norm":0,"trust":3,"source_url":"https://lmarena.ai/leaderboard","config":"text","measured_date":"2026-10-01"},"gpqa_diamond":{"raw":33.23,"norm":11.59,"trust":2,"source_url":"https://artificialanalysis.ai/models/mistral-8x22b-instruct","config":"aa field gpqa, artificial analysis intelligence index v4.1.1 suite, effort=none, gpqa diamond, reasoning=false, source value 0.332323232323232 is a 0-1 fraction, x100 at harvest","measured_date":null},"hle":{"raw":4.01,"norm":2.96,"trust":2,"source_url":"https://artificialanalysis.ai/models/mistral-8x22b-instruct","config":"aa field hle, artificial analysis intelligence index v4.1.1 suite, effort=none, humanity's last exam, reasoning=false, source value 0.0401 is a 0-1 fraction, x100 at harvest","measured_date":null}}},{"id":"command-r-08-plus-2024","display_name":"Command R+ (08-2024)","family_id":"command","vendor":"Cohere","status":"current","kind":"model","superseded_by":null,"release_date":"2024-08-30","intelligence_index":5.85,"coverage":0.3572,"index_subset_bias":null,"params_total_b":null,"params_active_b":null,"vram_est":null,"vram_frontier":null,"fits_on":null,"is_moe":false,"is_open_weights":false,"context_window_tok":128000,"pricing":{"prompt_usd_per_m":2.5,"completion_usd_per_m":10,"blended_usd_per_m":4.375},"scores":{"arena_elo":{"raw":1276.3,"norm":0,"trust":3,"source_url":"https://lmarena.ai/leaderboard","config":"text","measured_date":"2026-10-03"},"gpqa_diamond":{"raw":34.34,"norm":13.15,"trust":1,"source_url":"https://huggingface.co/CohereLabs/c4ai-command-r-plus-08-2024","config":"as listed in the model card's evaluation entry","measured_date":null},"livebench":{"raw":34.9,"norm":0,"trust":3,"source_url":"https://livebench.ai/#/","config":"livebench-2025-04-25 release","measured_date":"2025-04-25"}}},{"id":"granite-4.0-h-micro","display_name":"Granite 4.0 Micro","family_id":"granite","vendor":"IBM","status":"current","kind":"model","superseded_by":null,"release_date":"2025-10-20","intelligence_index":5.45,"coverage":0.4445,"index_subset_bias":null,"params_total_b":3.19,"params_active_b":3.19,"vram_est":{"bf16_gb":6.4,"int8_gb":3.4,"int4_gb":1.9,"method":"linear-rom-v1","approximate":true,"basis":"params_total_b"},"vram_frontier":{"efficiency":1.42,"expected_int8_gb":4.8,"method":"frontier-residual-v1","approximate":true},"fits_on":{"intel_b70":"fp8","nvidia_h100_sxm_80g":"fp8","nvidia_dgx_spark":"fp8"},"is_moe":false,"is_open_weights":true,"context_window_tok":131000,"pricing":{"prompt_usd_per_m":0.017,"completion_usd_per_m":0.112,"blended_usd_per_m":0.04075},"scores":{"aime":{"raw":6,"norm":0,"trust":2,"source_url":"https://artificialanalysis.ai/models/granite-4-0-micro","config":"aa field aime25, aime-2025, artificial analysis intelligence index v4.1.1 suite, effort=none, reasoning=false, source value 0.06 is a 0-1 fraction, x100 at harvest","measured_date":null},"gpqa_diamond":{"raw":33.64,"norm":12.17,"trust":2,"source_url":"https://artificialanalysis.ai/models/granite-4-0-micro","config":"aa field gpqa, artificial analysis intelligence index v4.1.1 suite, effort=none, gpqa diamond, reasoning=false, source value 0.336363636363636 is a 0-1 fraction, x100 at harvest","measured_date":null},"hle":{"raw":5,"norm":4.41,"trust":2,"source_url":"https://artificialanalysis.ai/models/granite-4-0-micro","config":"aa field hle, artificial analysis intelligence index v4.1.1 suite, effort=none, humanity's last exam, reasoning=false, source value 0.0500463392029657 is a 0-1 fraction, x100 at harvest","measured_date":null},"tau_bench":{"raw":12.57,"norm":0,"trust":2,"source_url":"https://artificialanalysis.ai/models/granite-4-0-micro","config":"aa field tau2, aa field tau2 (not mapped to tau_bench), artificial analysis intelligence index v4.1.1 suite, effort=none, reasoning=false, source value 0.125730994152047 is a 0-1 fraction, x100 at harvest","measured_date":null},"terminal_bench":{"raw":1.52,"norm":0,"trust":2,"source_url":"https://artificialanalysis.ai/models/granite-4-0-micro","config":"aa field terminalbenchhard, artificial analysis intelligence index v4.1.1 suite, effort=none, reasoning=false, source value 0.0151515151515152 is a 0-1 fraction, terminal-bench hard, x100 at harvest","measured_date":null}}},{"id":"granite-3.3-8b-instruct","display_name":"Granite-3.3-8B-Instruct","family_id":"granite","vendor":"IBM","status":"current","kind":"model","superseded_by":null,"release_date":"2025-04-16","intelligence_index":5.24,"coverage":0.4445,"index_subset_bias":null,"params_total_b":8.17,"params_active_b":8.17,"vram_est":{"bf16_gb":16.3,"int8_gb":8.7,"int4_gb":4.9,"method":"linear-rom-v1","approximate":true,"basis":"params_total_b"},"vram_frontier":{"efficiency":0.54,"expected_int8_gb":4.7,"method":"frontier-residual-v1","approximate":true},"fits_on":{"intel_b70":"fp8","nvidia_h100_sxm_80g":"fp8","nvidia_dgx_spark":"fp8"},"is_moe":false,"is_open_weights":true,"context_window_tok":128000,"pricing":{"prompt_usd_per_m":null,"completion_usd_per_m":null,"blended_usd_per_m":null},"scores":{"aime":{"raw":6.67,"norm":0,"trust":2,"source_url":"https://artificialanalysis.ai/models/granite-3-3-8b-instruct","config":"aa field aime25, aime-2025, artificial analysis intelligence index v4.1.1 suite, effort=none, reasoning=false, run: non-reasoning, source value 0.0666666666666667 is a 0-1 fraction, x100 at harvest","measured_date":null},"gpqa_diamond":{"raw":33.84,"norm":12.45,"trust":2,"source_url":"https://artificialanalysis.ai/models/granite-3-3-8b-instruct","config":"aa field gpqa, artificial analysis intelligence index v4.1.1 suite, effort=none, gpqa diamond, reasoning=false, run: non-reasoning, source value 0.338383838383838 is a 0-1 fraction, x100 at harvest","measured_date":null},"hle":{"raw":4.17,"norm":3.19,"trust":2,"source_url":"https://artificialanalysis.ai/models/granite-3-3-8b-instruct","config":"aa field hle, artificial analysis intelligence index v4.1.1 suite, effort=none, humanity's last exam, reasoning=false, run: non-reasoning, source value 0.0417052826691381 is a 0-1 fraction, x100 at harvest","measured_date":null},"tau_bench":{"raw":10.53,"norm":0,"trust":2,"source_url":"https://artificialanalysis.ai/models/granite-3-3-8b-instruct","config":"aa field tau2, aa field tau2 (not mapped to tau_bench), artificial analysis intelligence index v4.1.1 suite, effort=none, reasoning=false, run: non-reasoning, source value 0.105263157894737 is a 0-1 fraction, x100 at harvest","measured_date":null},"terminal_bench":{"raw":0,"norm":0,"trust":2,"source_url":"https://artificialanalysis.ai/models/granite-3-3-8b-instruct","config":"aa field terminalbenchhard, artificial analysis intelligence index v4.1.1 suite, effort=none, reasoning=false, run: non-reasoning, source value 0 is a 0-1 fraction, terminal-bench hard, x100 at harvest","measured_date":null}}},{"id":"qwen-2.5-3b","display_name":"Qwen2.5-3B","family_id":"qwen","vendor":"Alibaba","status":"current","kind":"model","superseded_by":null,"release_date":"2024-09-18","intelligence_index":4.84,"coverage":0.3969,"index_subset_bias":null,"params_total_b":3.09,"params_active_b":3.09,"vram_est":{"bf16_gb":6.2,"int8_gb":3.3,"int4_gb":1.9,"method":"linear-rom-v1","approximate":true,"basis":"params_total_b"},"vram_frontier":{"efficiency":1.34,"expected_int8_gb":4.4,"method":"frontier-residual-v1","approximate":true},"fits_on":{"intel_b70":"fp8","nvidia_h100_sxm_80g":"fp8","nvidia_dgx_spark":"fp8"},"is_moe":false,"is_open_weights":true,"context_window_tok":32768,"pricing":{"prompt_usd_per_m":null,"completion_usd_per_m":null,"blended_usd_per_m":null},"scores":{"gpqa_diamond":{"raw":30.3,"norm":7.46,"trust":2,"source_url":"https://arxiv.org/html/2412.15115v2","config":"5-shot","measured_date":null},"livebench":{"raw":26.8,"norm":0,"trust":2,"source_url":"https://arxiv.org/html/2412.15115v2","config":"0831 edition","measured_date":null},"mmlu_pro":{"raw":43.7,"norm":6.17,"trust":2,"source_url":"https://arxiv.org/html/2412.15115v2","config":"5-shot","measured_date":null}}},{"id":"gemma-3-4b-instruct","display_name":"Gemma 3 4B","family_id":"gemma","vendor":"Google DeepMind","status":"current","kind":"model","superseded_by":null,"release_date":"2025-03-12","intelligence_index":4.36,"coverage":0.5238,"index_subset_bias":null,"params_total_b":4.3,"params_active_b":4.3,"vram_est":{"bf16_gb":8.6,"int8_gb":4.6,"int4_gb":2.6,"method":"linear-rom-v1","approximate":true,"basis":"params_total_b"},"vram_frontier":{"efficiency":0.89,"expected_int8_gb":4,"method":"frontier-residual-v1","approximate":true},"fits_on":{"intel_b70":"fp8","nvidia_h100_sxm_80g":"fp8","nvidia_dgx_spark":"fp8"},"is_moe":false,"is_open_weights":true,"context_window_tok":131072,"pricing":{"prompt_usd_per_m":0.05,"completion_usd_per_m":0.1,"blended_usd_per_m":0.0625},"scores":{"aime":{"raw":12.67,"norm":0,"trust":2,"source_url":"https://artificialanalysis.ai/models/gemma-3-4b","config":"aa field aime25, aime-2025, artificial analysis intelligence index v4.1.1 suite, effort=none, reasoning=false, source value 0.126666666666667 is a 0-1 fraction, x100 at harvest","measured_date":null},"arena_elo":{"raw":1303.2,"norm":10.51,"trust":3,"source_url":"https://lmarena.ai/leaderboard","config":"text","measured_date":"2026-10-01"},"gpqa_diamond":{"raw":29.09,"norm":5.76,"trust":2,"source_url":"https://artificialanalysis.ai/models/gemma-3-4b","config":"aa field gpqa, artificial analysis intelligence index v4.1.1 suite, effort=none, gpqa diamond, reasoning=false, source value 0.290909090909091 is a 0-1 fraction, x100 at harvest","measured_date":null},"hle":{"raw":5.29,"norm":4.84,"trust":2,"source_url":"https://artificialanalysis.ai/models/gemma-3-4b","config":"aa field hle, artificial analysis intelligence index v4.1.1 suite, effort=none, humanity's last exam, reasoning=false, source value 0.0529 is a 0-1 fraction, x100 at harvest","measured_date":null},"tau_bench":{"raw":4.97,"norm":0,"trust":2,"source_url":"https://artificialanalysis.ai/models/gemma-3-4b","config":"aa field tau2, aa field tau2 (not mapped to tau_bench), artificial analysis intelligence index v4.1.1 suite, effort=none, reasoning=false, source value 0.0497076023391813 is a 0-1 fraction, x100 at harvest","measured_date":null},"terminal_bench":{"raw":0.37,"norm":0,"trust":2,"source_url":"https://artificialanalysis.ai/models/gemma-3-4b","config":"aa field terminalbenchv21, artificial analysis intelligence index v4.1.1 suite, effort=none, reasoning=false, source value 0.00374531835205993 is a 0-1 fraction, terminal-bench 2.1, x100 at harvest","measured_date":null}}},{"id":"llama-3.1-8b","display_name":"Llama 3.1 8B","family_id":"llama","vendor":"Meta","status":"current","kind":"model","superseded_by":null,"release_date":"2024-07-23","intelligence_index":4.22,"coverage":0.5635,"index_subset_bias":null,"params_total_b":8.03,"params_active_b":8.03,"vram_est":{"bf16_gb":16.1,"int8_gb":8.5,"int4_gb":4.8,"method":"linear-rom-v1","approximate":true,"basis":"params_total_b"},"vram_frontier":{"efficiency":0.46,"expected_int8_gb":3.9,"method":"frontier-residual-v1","approximate":true},"fits_on":{"intel_b70":"fp8","nvidia_h100_sxm_80g":"fp8","nvidia_dgx_spark":"fp8"},"is_moe":false,"is_open_weights":true,"context_window_tok":128000,"pricing":{"prompt_usd_per_m":null,"completion_usd_per_m":null,"blended_usd_per_m":null},"scores":{"aime":{"raw":4.33,"norm":0,"trust":2,"source_url":"https://artificialanalysis.ai/models/llama-3-1-instruct-8b","config":"aime 2025, artificial analysis harness","measured_date":null},"gpqa_diamond":{"raw":25.86,"norm":1.21,"trust":2,"source_url":"https://artificialanalysis.ai/models/llama-3-1-instruct-8b","config":"artificial analysis harness","measured_date":null},"hle":{"raw":5.29,"norm":4.84,"trust":2,"source_url":"https://artificialanalysis.ai/models/llama-3-1-instruct-8b","config":"artificial analysis harness, no tools","measured_date":null},"mmlu_pro":{"raw":48.3,"norm":13.83,"trust":1,"source_url":"https://github.com/meta-llama/llama-models/blob/main/models/llama3_1/MODEL_CARD.md","config":"5-shot cot macro_avg/acc, llama 3.1 8b instruct column","measured_date":null},"tau_bench":{"raw":16.37,"norm":0,"trust":2,"source_url":"https://artificialanalysis.ai/models/llama-3-1-instruct-8b","config":"artificial analysis harness, tau2","measured_date":null},"terminal_bench":{"raw":1.5,"norm":0,"trust":2,"source_url":"https://artificialanalysis.ai/models/llama-3-1-instruct-8b","config":"artificial analysis harness, v2.1","measured_date":null}}},{"id":"command-r-08-2024","display_name":"Command R (08-2024)","family_id":"command","vendor":"Cohere","status":"current","kind":"model","superseded_by":null,"release_date":"2024-08-30","intelligence_index":3.55,"coverage":0.6666,"index_subset_bias":null,"params_total_b":null,"params_active_b":null,"vram_est":null,"vram_frontier":null,"fits_on":null,"is_moe":false,"is_open_weights":false,"context_window_tok":128000,"pricing":{"prompt_usd_per_m":0.15,"completion_usd_per_m":0.6,"blended_usd_per_m":0.26249999999999996},"scores":{"aime":{"raw":0.3,"norm":12.5,"trust":2,"source_url":"http://web.archive.org/web/20251113030850/https://artificialanalysis.ai/models/command-r","config":"2025-11-13 wayback capture of aa's deprecated command-r (aug '24) page, artificial analysis independent run","measured_date":null},"arena_elo":{"raw":1250.4,"norm":0,"trust":3,"source_url":"https://lmarena.ai/leaderboard","config":"text","measured_date":"2026-09-27"},"gpqa_diamond":{"raw":28.9,"norm":5.49,"trust":2,"source_url":"http://web.archive.org/web/20251113030850/https://artificialanalysis.ai/models/command-r","config":"2025-11-13 wayback capture of aa's deprecated command-r (aug '24) page, artificial analysis independent run","measured_date":null},"hle":{"raw":5.1,"norm":4.56,"trust":2,"source_url":"http://web.archive.org/web/20251113030850/https://artificialanalysis.ai/models/command-r","config":"2025-11-13 wayback capture of aa's deprecated command-r (aug '24) page, artificial analysis independent run, no tools","measured_date":null},"livebench":{"raw":31.4,"norm":0,"trust":3,"source_url":"https://livebench.ai/table_2025_04_25.csv","config":"global average of the 6 category averages, leaderboard row command-r-08-2024, livebench 2025-04-25 release","measured_date":"2025-04-25"},"mmlu_pro":{"raw":33.7,"norm":0,"trust":2,"source_url":"http://web.archive.org/web/20251113030850/https://artificialanalysis.ai/models/command-r","config":"artificial analysis independent run, read from the 2025-11-13 wayback capture of aa's now-deprecated command-r (aug '24) page","measured_date":null}}},{"id":"qwen-2.5-0.5b","display_name":"Qwen2.5-0.5B","family_id":"qwen","vendor":"Alibaba","status":"current","kind":"model","superseded_by":null,"release_date":"2024-09-18","intelligence_index":2.7,"coverage":0.3969,"index_subset_bias":null,"params_total_b":0.49,"params_active_b":0.49,"vram_est":{"bf16_gb":1,"int8_gb":0.5,"int4_gb":0.3,"method":"linear-rom-v1","approximate":true,"basis":"params_total_b"},"vram_frontier":{"efficiency":5.39,"expected_int8_gb":2.8,"method":"frontier-residual-v1","approximate":true},"fits_on":{"intel_b70":"fp8","nvidia_h100_sxm_80g":"fp8","nvidia_dgx_spark":"fp8"},"is_moe":false,"is_open_weights":true,"context_window_tok":32768,"pricing":{"prompt_usd_per_m":null,"completion_usd_per_m":null,"blended_usd_per_m":null},"scores":{"gpqa_diamond":{"raw":29.8,"norm":6.76,"trust":2,"source_url":"https://arxiv.org/html/2412.15115v2","config":"qwen2.5-0.5b-instruct, table 10 (instruction-tuned models)","measured_date":null},"livebench":{"raw":12.6,"norm":0,"trust":2,"source_url":"https://arxiv.org/html/2412.15115v2","config":"qwen2.5-0.5b-instruct, table 10 (instruction-tuned models)","measured_date":null},"mmlu_pro":{"raw":15,"norm":0,"trust":2,"source_url":"https://arxiv.org/html/2412.15115v2","config":"qwen2.5-0.5b-instruct, table 10 (instruction-tuned models)","measured_date":null}}},{"id":"qwen-3-0.6b","display_name":"Qwen3-0.6B","family_id":"qwen","vendor":"Alibaba","status":"current","kind":"model","superseded_by":null,"release_date":"2025-04-28","intelligence_index":2.54,"coverage":0.5159,"index_subset_bias":null,"params_total_b":0.75,"params_active_b":0.75,"vram_est":{"bf16_gb":1.5,"int8_gb":0.8,"int4_gb":0.5,"method":"linear-rom-v1","approximate":true,"basis":"params_total_b"},"vram_frontier":{"efficiency":3.36,"expected_int8_gb":2.7,"method":"frontier-residual-v1","approximate":true},"fits_on":{"intel_b70":"fp8","nvidia_h100_sxm_80g":"fp8","nvidia_dgx_spark":"fp8"},"is_moe":false,"is_open_weights":true,"context_window_tok":32768,"pricing":{"prompt_usd_per_m":null,"completion_usd_per_m":null,"blended_usd_per_m":null},"scores":{"aime":{"raw":15.1,"norm":0,"trust":1,"source_url":"https://arxiv.org/abs/2505.09388","config":"aime'25, thinking mode","measured_date":"2025-05-14"},"gpqa_diamond":{"raw":27.9,"norm":4.08,"trust":1,"source_url":"https://arxiv.org/abs/2505.09388","config":"avg of 10 samples, thinking mode","measured_date":"2025-05-14"},"hle":{"raw":5.64,"norm":5.35,"trust":2,"source_url":"https://artificialanalysis.ai/models/qwen3-0.6b-instruct-reasoning","config":"aa eval, no tools, qwen3 0.6b (reasoning)","measured_date":null},"livebench":{"raw":30.3,"norm":0,"trust":1,"source_url":"https://arxiv.org/abs/2505.09388","config":"livebench 2024-11-25, thinking mode","measured_date":"2025-05-14"},"tau_bench":{"raw":21.05,"norm":1.4,"trust":2,"source_url":"https://artificialanalysis.ai/models/qwen3-0.6b-instruct-reasoning","config":"aa eval, qwen3 0.6b (reasoning), tau2-bench telecom","measured_date":null}}},{"id":"granite-4.0-1b","display_name":"Granite-4.0-1B","family_id":"granite","vendor":"IBM","status":"current","kind":"model","superseded_by":null,"release_date":"2025-10-28","intelligence_index":2.36,"coverage":0.5635,"index_subset_bias":null,"params_total_b":1.63,"params_active_b":1.63,"vram_est":{"bf16_gb":3.3,"int8_gb":1.7,"int4_gb":1,"method":"linear-rom-v1","approximate":true,"basis":"params_total_b"},"vram_frontier":{"efficiency":1.46,"expected_int8_gb":2.5,"method":"frontier-residual-v1","approximate":true},"fits_on":{"intel_b70":"fp8","nvidia_h100_sxm_80g":"fp8","nvidia_dgx_spark":"fp8"},"is_moe":false,"is_open_weights":true,"context_window_tok":128000,"pricing":{"prompt_usd_per_m":null,"completion_usd_per_m":null,"blended_usd_per_m":null},"scores":{"aime":{"raw":6.33,"norm":0,"trust":2,"source_url":"https://artificialanalysis.ai/models/granite-4-0-nano-1b","config":"aime 2025, artificial analysis harness","measured_date":null},"gpqa_diamond":{"raw":28.08,"norm":4.34,"trust":2,"source_url":"https://artificialanalysis.ai/models/granite-4-0-nano-1b","config":"artificial analysis harness","measured_date":null},"hle":{"raw":4.82,"norm":4.15,"trust":2,"source_url":"https://artificialanalysis.ai/models/granite-4-0-nano-1b","config":"artificial analysis harness, no tools","measured_date":null},"mmlu_pro":{"raw":34.02,"norm":0,"trust":1,"source_url":"https://huggingface.co/ibm-granite/granite-4.0-1b","config":"1b dense column, 5-shot cot, olmes","measured_date":null},"tau_bench":{"raw":22.81,"norm":3.75,"trust":2,"source_url":"https://artificialanalysis.ai/models/granite-4-0-nano-1b","config":"artificial analysis harness, tau2","measured_date":null},"terminal_bench":{"raw":0,"norm":0,"trust":2,"source_url":"https://artificialanalysis.ai/models/granite-4-0-nano-1b","config":"artificial analysis harness","measured_date":null}}},{"id":"llama-3.2-3b-instruct","display_name":"Llama 3.2 3B Instruct","family_id":"llama","vendor":"Meta","status":"current","kind":"model","superseded_by":null,"release_date":"2024-09-25","intelligence_index":1.5,"coverage":0.4762,"index_subset_bias":null,"params_total_b":3.21,"params_active_b":3.21,"vram_est":{"bf16_gb":6.4,"int8_gb":3.4,"int4_gb":1.9,"method":"linear-rom-v1","approximate":true,"basis":"params_total_b"},"vram_frontier":{"efficiency":0.66,"expected_int8_gb":2.2,"method":"frontier-residual-v1","approximate":true},"fits_on":{"intel_b70":"fp8","nvidia_h100_sxm_80g":"fp8","nvidia_dgx_spark":"fp8"},"is_moe":false,"is_open_weights":true,"context_window_tok":131072,"pricing":{"prompt_usd_per_m":0.05,"completion_usd_per_m":0.33,"blended_usd_per_m":0.12000000000000001},"scores":{"aime":{"raw":3.33,"norm":0,"trust":2,"source_url":"https://artificialanalysis.ai/models/llama-3-2-instruct-3b","config":"aa field aime25, aime-2025, artificial analysis intelligence index v4.1.1 suite, effort=none, reasoning=false, source value 0.0333333333333333 is a 0-1 fraction, x100 at harvest","measured_date":null},"arena_elo":{"raw":1166.7,"norm":0,"trust":3,"source_url":"https://lmarena.ai/leaderboard","config":"text","measured_date":"2026-10-01"},"gpqa_diamond":{"raw":25.45,"norm":0.63,"trust":2,"source_url":"https://artificialanalysis.ai/models/llama-3-2-instruct-3b","config":"aa field gpqa, artificial analysis intelligence index v4.1.1 suite, effort=none, gpqa diamond, reasoning=false, source value 0.254545454545455 is a 0-1 fraction, x100 at harvest","measured_date":null},"hle":{"raw":5.35,"norm":4.93,"trust":2,"source_url":"https://artificialanalysis.ai/models/llama-3-2-instruct-3b","config":"aa field hle, artificial analysis intelligence index v4.1.1 suite, effort=none, humanity's last exam, reasoning=false, source value 0.0535 is a 0-1 fraction, x100 at harvest","measured_date":null},"tau_bench":{"raw":21.05,"norm":1.4,"trust":2,"source_url":"https://artificialanalysis.ai/models/llama-3-2-instruct-3b","config":"aa field tau2, aa field tau2 (not mapped to tau_bench), artificial analysis intelligence index v4.1.1 suite, effort=none, reasoning=false, source value 0.210526315789474 is a 0-1 fraction, x100 at harvest","measured_date":null}}},{"id":"granite-4.0-350m","display_name":"Granite-4.0-350M","family_id":"granite","vendor":"IBM","status":"current","kind":"model","superseded_by":null,"release_date":"2025-10-28","intelligence_index":1.45,"coverage":0.5635,"index_subset_bias":null,"params_total_b":0.35,"params_active_b":0.35,"vram_est":{"bf16_gb":0.7,"int8_gb":0.4,"int4_gb":0.2,"method":"linear-rom-v1","approximate":true,"basis":"params_total_b"},"vram_frontier":{"efficiency":6.02,"expected_int8_gb":2.2,"method":"frontier-residual-v1","approximate":true},"fits_on":{"intel_b70":"fp8","nvidia_h100_sxm_80g":"fp8","nvidia_dgx_spark":"fp8"},"is_moe":false,"is_open_weights":true,"context_window_tok":32000,"pricing":{"prompt_usd_per_m":null,"completion_usd_per_m":null,"blended_usd_per_m":null},"scores":{"aime":{"raw":0,"norm":0,"trust":2,"source_url":"https://artificialanalysis.ai/evaluations/aime-2025?models=granite-4-0-350m","config":"aime 2025, artificial analysis harness","measured_date":null},"gpqa_diamond":{"raw":26.1,"norm":1.55,"trust":2,"source_url":"https://artificialanalysis.ai/evaluations/gpqa-diamond?models=granite-4-0-350m","config":"artificial analysis harness, gpqa diamond","measured_date":null},"hle":{"raw":5.5,"norm":5.15,"trust":2,"source_url":"https://artificialanalysis.ai/evaluations/humanitys-last-exam?models=granite-4-0-350m","config":"artificial analysis harness, humanity's last exam","measured_date":null},"mmlu_pro":{"raw":12.4,"norm":0,"trust":2,"source_url":"https://artificialanalysis.ai/evaluations/mmlu-pro?models=granite-4-0-350m","config":"artificial analysis harness, mmlu-pro","measured_date":null},"tau_bench":{"raw":13.2,"norm":0,"trust":2,"source_url":"https://artificialanalysis.ai/evaluations/tau2-bench?models=granite-4-0-350m","config":"artificial analysis harness, tau2-bench telecom","measured_date":null},"terminal_bench":{"raw":0,"norm":0,"trust":2,"source_url":"https://artificialanalysis.ai/evaluations/terminalbench-hard?models=granite-4-0-350m","config":"artificial analysis harness, terminal-bench hard","measured_date":null}}},{"id":"llama-3.1-8b-instruct","display_name":"Llama 3.1 8B Instruct","family_id":"llama","vendor":"Meta","status":"current","kind":"model","superseded_by":null,"release_date":"2024-07-23","intelligence_index":1.39,"coverage":0.5238,"index_subset_bias":null,"params_total_b":8.03,"params_active_b":8.03,"vram_est":{"bf16_gb":16.1,"int8_gb":8.5,"int4_gb":4.8,"method":"linear-rom-v1","approximate":true,"basis":"params_total_b"},"vram_frontier":{"efficiency":0.26,"expected_int8_gb":2.2,"method":"frontier-residual-v1","approximate":true},"fits_on":{"intel_b70":"fp8","nvidia_h100_sxm_80g":"fp8","nvidia_dgx_spark":"fp8"},"is_moe":false,"is_open_weights":true,"context_window_tok":131072,"pricing":{"prompt_usd_per_m":0.05,"completion_usd_per_m":0.08,"blended_usd_per_m":0.05750000000000001},"scores":{"aime":{"raw":4.33,"norm":0,"trust":2,"source_url":"https://artificialanalysis.ai/models/llama-3-1-instruct-8b","config":"aa field aime25, aime-2025, artificial analysis intelligence index v4.1.1 suite, effort=none, reasoning=false, source value 0.0433333333333333 is a 0-1 fraction, x100 at harvest","measured_date":null},"arena_elo":{"raw":1211.2,"norm":0,"trust":3,"source_url":"https://lmarena.ai/leaderboard","config":"text","measured_date":"2026-09-27"},"gpqa_diamond":{"raw":25.86,"norm":1.21,"trust":2,"source_url":"https://artificialanalysis.ai/models/llama-3-1-instruct-8b","config":"aa field gpqa, artificial analysis intelligence index v4.1.1 suite, effort=none, gpqa diamond, reasoning=false, source value 0.258585858585859 is a 0-1 fraction, x100 at harvest","measured_date":null},"hle":{"raw":5.29,"norm":4.84,"trust":2,"source_url":"https://artificialanalysis.ai/models/llama-3-1-instruct-8b","config":"aa field hle, artificial analysis intelligence index v4.1.1 suite, effort=none, humanity's last exam, reasoning=false, source value 0.0529 is a 0-1 fraction, x100 at harvest","measured_date":null},"tau_bench":{"raw":16.37,"norm":0,"trust":2,"source_url":"https://artificialanalysis.ai/models/llama-3-1-instruct-8b","config":"aa field tau2, aa field tau2 (not mapped to tau_bench), artificial analysis intelligence index v4.1.1 suite, effort=none, reasoning=false, source value 0.16374269005848 is a 0-1 fraction, x100 at harvest","measured_date":null},"terminal_bench":{"raw":1.5,"norm":0,"trust":2,"source_url":"https://artificialanalysis.ai/models/llama-3-1-instruct-8b","config":"aa field terminalbenchv21, artificial analysis intelligence index v4.1.1 suite, effort=none, reasoning=false, source value 0.0149812734082397 is a 0-1 fraction, terminal-bench 2.1, x100 at harvest","measured_date":null}}},{"id":"nova-1-lite","display_name":"Nova Lite 1.0","family_id":"nova","vendor":"Amazon","status":"superseded","kind":"model","superseded_by":"nova-2-lite-v1","release_date":"2024-12-05","intelligence_index":1.21,"coverage":0.3094,"index_subset_bias":null,"params_total_b":null,"params_active_b":null,"vram_est":null,"vram_frontier":null,"fits_on":null,"is_moe":false,"is_open_weights":false,"context_window_tok":300000,"pricing":{"prompt_usd_per_m":0.06,"completion_usd_per_m":0.24,"blended_usd_per_m":0.105},"scores":{"arena_elo":{"raw":1260,"norm":0,"trust":3,"source_url":"https://arena.ai/leaderboard/text","config":"19372 votes, arena entry amazon-nova-lite-v1.0, no style control, rank 302, text/overall","measured_date":"2026-09-02"},"hle":{"raw":4.3,"norm":3.38,"trust":2,"source_url":"https://artificialanalysis.ai/evaluations/humanitys-last-exam","config":"artificial analysis independent eval","measured_date":null},"livebench":{"raw":39.1,"norm":0,"trust":3,"source_url":"https://livebench.ai/#/","config":"livebench-2025-04-25 release","measured_date":"2025-04-25"}}},{"id":"llama-3.2-1b-instruct","display_name":"Llama 3.2 1B Instruct","family_id":"llama","vendor":"Meta","status":"current","kind":"model","superseded_by":null,"release_date":"2024-09-25","intelligence_index":1.08,"coverage":0.5238,"index_subset_bias":null,"params_total_b":1.24,"params_active_b":1.24,"vram_est":{"bf16_gb":2.5,"int8_gb":1.3,"int4_gb":0.7,"method":"linear-rom-v1","approximate":true,"basis":"params_total_b"},"vram_frontier":{"efficiency":1.7,"expected_int8_gb":2.2,"method":"frontier-residual-v1","approximate":true},"fits_on":{"intel_b70":"fp8","nvidia_h100_sxm_80g":"fp8","nvidia_dgx_spark":"fp8"},"is_moe":false,"is_open_weights":true,"context_window_tok":60000,"pricing":{"prompt_usd_per_m":0.027,"completion_usd_per_m":0.201,"blended_usd_per_m":0.07050000000000001},"scores":{"aime":{"raw":0,"norm":0,"trust":2,"source_url":"https://artificialanalysis.ai/models/llama-3-2-instruct-1b","config":"aa field aime25, aime-2025, artificial analysis intelligence index v4.1.1 suite, effort=none, reasoning=false, source value 0 is a 0-1 fraction, x100 at harvest","measured_date":null},"arena_elo":{"raw":1111.1,"norm":0,"trust":3,"source_url":"https://lmarena.ai/leaderboard","config":"text","measured_date":"2026-09-27"},"gpqa_diamond":{"raw":19.6,"norm":0,"trust":2,"source_url":"https://artificialanalysis.ai/models/llama-3-2-instruct-1b","config":"aa field gpqa, artificial analysis intelligence index v4.1.1 suite, effort=none, gpqa diamond, reasoning=false, source value 0.195959595959596 is a 0-1 fraction, x100 at harvest","measured_date":null},"hle":{"raw":5.46,"norm":5.09,"trust":2,"source_url":"https://artificialanalysis.ai/models/llama-3-2-instruct-1b","config":"aa field hle, artificial analysis intelligence index v4.1.1 suite, effort=none, humanity's last exam, reasoning=false, source value 0.0546 is a 0-1 fraction, x100 at harvest","measured_date":null},"tau_bench":{"raw":0,"norm":0,"trust":2,"source_url":"https://artificialanalysis.ai/models/llama-3-2-instruct-1b","config":"aa field tau2, aa field tau2 (not mapped to tau_bench), artificial analysis intelligence index v4.1.1 suite, effort=none, reasoning=false, source value 0 is a 0-1 fraction, x100 at harvest","measured_date":null},"terminal_bench":{"raw":0,"norm":0,"trust":2,"source_url":"https://artificialanalysis.ai/models/llama-3-2-instruct-1b","config":"aa field terminalbenchhard, artificial analysis intelligence index v4.1.1 suite, effort=none, reasoning=false, source value 0 is a 0-1 fraction, terminal-bench hard, x100 at harvest","measured_date":null}}},{"id":"gemma-3-1b","display_name":"Gemma 3 1B","family_id":"gemma","vendor":"Google DeepMind","status":"current","kind":"model","superseded_by":null,"release_date":"2025-03-12","intelligence_index":0.86,"coverage":0.635,"index_subset_bias":null,"params_total_b":1,"params_active_b":1,"vram_est":{"bf16_gb":2,"int8_gb":1.1,"int4_gb":0.6,"method":"linear-rom-v1","approximate":true,"basis":"params_total_b"},"vram_frontier":{"efficiency":2.11,"expected_int8_gb":2.2,"method":"frontier-residual-v1","approximate":true},"fits_on":{"intel_b70":"fp8","nvidia_h100_sxm_80g":"fp8","nvidia_dgx_spark":"fp8"},"is_moe":false,"is_open_weights":true,"context_window_tok":32000,"pricing":{"prompt_usd_per_m":null,"completion_usd_per_m":null,"blended_usd_per_m":null},"scores":{"aime":{"raw":3.33,"norm":0,"trust":2,"source_url":"https://artificialanalysis.ai/models/gemma-3-1b","config":"aa eval, aime 2025","measured_date":null},"gpqa_diamond":{"raw":19.2,"norm":0,"trust":1,"source_url":"https://arxiv.org/abs/2503.19786","config":"gemma 3 1b it","measured_date":"2025-03-12"},"hle":{"raw":5.33,"norm":4.9,"trust":2,"source_url":"https://artificialanalysis.ai/models/gemma-3-1b","config":"aa eval, no tools","measured_date":null},"livebench":{"raw":14.4,"norm":0,"trust":2,"source_url":"https://arxiv.org/abs/2505.09388","config":"gemma-3-1b-it, livebench 2024-11-25, measured by the qwen3 team, non-thinking","measured_date":"2025-05-14"},"mmlu_pro":{"raw":14.7,"norm":0,"trust":1,"source_url":"https://arxiv.org/abs/2503.19786","config":"gemma 3 1b it","measured_date":"2025-03-12"},"tau_bench":{"raw":10.53,"norm":0,"trust":2,"source_url":"https://artificialanalysis.ai/models/gemma-3-1b","config":"aa eval, tau2-bench telecom","measured_date":null}}},{"id":"apodex-1.1","display_name":"Apodex 1.1","family_id":"apodex","vendor":"Apodex","status":"current","kind":"model","superseded_by":null,"release_date":"2026-08-24","intelligence_index":null,"coverage":null,"index_subset_bias":null,"params_total_b":null,"params_active_b":null,"vram_est":null,"vram_frontier":null,"fits_on":null,"is_moe":false,"is_open_weights":false,"context_window_tok":null,"pricing":{"prompt_usd_per_m":null,"completion_usd_per_m":null,"blended_usd_per_m":null},"scores":{"hle":{"raw":53.2,"norm":75.29,"trust":1,"source_url":"https://www.apodex.com/pdf/20260824","config":"react, with tools","measured_date":"2026-08-24"},"swe_bench_verified":{"raw":77.7,"norm":75.22,"trust":1,"source_url":"https://www.apodex.com/pdf/20260824","config":"coding-agent, highest reported setting, one result per model","measured_date":"2026-08-24"},"terminal_bench":{"raw":70.8,"norm":77.41,"trust":1,"source_url":"https://www.apodex.com/pdf/20260824","config":"2.1, coding-agent, highest reported setting, one result per model","measured_date":"2026-08-24"}}},{"id":"claude-5.1-mythos","display_name":"Claude Mythos 5.1","family_id":"claude","vendor":"Anthropic","status":"current","kind":"model","superseded_by":null,"release_date":"2026-09-01","intelligence_index":null,"coverage":null,"index_subset_bias":null,"params_total_b":null,"params_active_b":null,"vram_est":null,"vram_frontier":null,"fits_on":null,"is_moe":false,"is_open_weights":false,"context_window_tok":1000000,"pricing":{"prompt_usd_per_m":null,"completion_usd_per_m":null,"blended_usd_per_m":null},"scores":{"terminal_bench":{"raw":60.9,"norm":65.76,"trust":1,"source_url":"https://www.anthropic.com/claude-fable-and-mythos-5-1","config":"10 trials per task (660 trials), 4.0, claude code --bare mode, maximum thinking effort, standard error ±1.6–2 points","measured_date":"2026-09-01"}}},{"id":"claude-sonnet-5.5","display_name":"Claude Sonnet 5.5","family_id":"claude","vendor":"Anthropic","status":"current","kind":"model","superseded_by":null,"release_date":"2026-09-28","intelligence_index":null,"coverage":null,"index_subset_bias":null,"params_total_b":null,"params_active_b":null,"vram_est":null,"vram_frontier":null,"fits_on":null,"is_moe":false,"is_open_weights":false,"context_window_tok":1000000,"pricing":{"prompt_usd_per_m":2,"completion_usd_per_m":10,"blended_usd_per_m":4},"scores":{"arena_elo":{"raw":1471,"norm":85.3,"trust":3,"source_url":"https://lmarena.ai/leaderboard","config":"text","measured_date":"2026-10-03"}}},{"id":"command-r-7-b-12-2024-7b","display_name":"Command R7B (12-2024)","family_id":"command","vendor":"Cohere","status":"current","kind":"model","superseded_by":null,"release_date":"2024-12","intelligence_index":null,"coverage":null,"index_subset_bias":null,"params_total_b":7,"params_active_b":7,"vram_est":{"bf16_gb":14,"int8_gb":7.4,"int4_gb":4.2,"method":"linear-rom-v1","approximate":true,"basis":"params_total_b"},"vram_frontier":null,"fits_on":null,"is_moe":false,"is_open_weights":false,"context_window_tok":128000,"pricing":{"prompt_usd_per_m":0.0375,"completion_usd_per_m":0.15,"blended_usd_per_m":0.06562499999999999},"scores":{"mmlu_pro":{"raw":35.72,"norm":0,"trust":3,"source_url":"https://huggingface.co/spaces/open-llm-leaderboard/open_llm_leaderboard","config":"5-shot raw accuracy (the leaderboard-normalised value for the same run is 28.58), huggingface open llm leaderboard v2","measured_date":null}}},{"id":"deepseek-v4-flash-0731","display_name":"DeepSeek V4 Flash 0731","family_id":"deepseek","vendor":"DeepSeek","status":"current","kind":"model","superseded_by":null,"release_date":"2026-07-31","intelligence_index":null,"coverage":null,"index_subset_bias":null,"params_total_b":304.18,"params_active_b":null,"vram_est":{"bf16_gb":608,"int8_gb":322,"int4_gb":183,"method":"linear-rom-v1","approximate":true,"basis":"params_total_b"},"vram_frontier":null,"fits_on":{},"is_moe":true,"is_open_weights":true,"context_window_tok":1048576,"pricing":{"prompt_usd_per_m":0.0118,"completion_usd_per_m":1.28,"blended_usd_per_m":0.32885000000000003},"scores":{"terminal_bench":{"raw":82.7,"norm":91.41,"trust":1,"source_url":"https://huggingface.co/deepseek-ai/DeepSeek-V4-Flash-0731","config":"2.1, deepseek harness (minimal mode), max reasoning effort, temperature=1.0, top_p=0.95.","measured_date":null}}},{"id":"deepseek-v4-pro-0813","display_name":"DeepSeek V4 Pro 0813","family_id":"deepseek","vendor":"DeepSeek","status":"superseded","kind":"model","superseded_by":"deepseek-v4-pro","release_date":"2026-08-12","intelligence_index":null,"coverage":null,"index_subset_bias":null,"params_total_b":1650.5,"params_active_b":null,"vram_est":{"bf16_gb":3301,"int8_gb":1750,"int4_gb":990,"method":"linear-rom-v1","approximate":true,"basis":"params_total_b"},"vram_frontier":null,"fits_on":{},"is_moe":true,"is_open_weights":true,"context_window_tok":1048576,"pricing":{"prompt_usd_per_m":0.66,"completion_usd_per_m":1.98,"blended_usd_per_m":0.99},"scores":{"terminal_bench":{"raw":87.9,"norm":97.53,"trust":1,"source_url":"https://huggingface.co/deepseek-ai/DeepSeek-V4-Pro-0813","config":"2.1, deepseek harness (minimal mode), max reasoning effort, temperature=1.0, top_p=0.95.","measured_date":null}}},{"id":"fugu-2-ultra","display_name":"Fugu Ultra v2","family_id":"fugu","vendor":"sakana","status":"current","kind":"model","superseded_by":null,"release_date":"2026-09-11","intelligence_index":null,"coverage":null,"index_subset_bias":null,"params_total_b":null,"params_active_b":null,"vram_est":null,"vram_frontier":null,"fits_on":null,"is_moe":false,"is_open_weights":false,"context_window_tok":1000000,"pricing":{"prompt_usd_per_m":5,"completion_usd_per_m":30,"blended_usd_per_m":11.25},"scores":{"gpqa_diamond":{"raw":93.3,"norm":96.2,"trust":2,"source_url":"https://openrouter.ai/benchmarks/gpqa-diamond","config":"default routing, fixed gpqa diamond question set, last benchmark run 2026-09-30, openrouter independent run, representative-run accuracy","measured_date":"2026-09-30"}}},{"id":"gemini-4-argon","display_name":"Gemini 4 Argon","family_id":"gemini","vendor":"Google","status":"current","kind":"model","superseded_by":null,"release_date":"2026-09-30","intelligence_index":null,"coverage":null,"index_subset_bias":null,"params_total_b":null,"params_active_b":null,"vram_est":null,"vram_frontier":null,"fits_on":null,"is_moe":false,"is_open_weights":false,"context_window_tok":null,"pricing":{"prompt_usd_per_m":null,"completion_usd_per_m":null,"blended_usd_per_m":null},"scores":{"arena_elo":{"raw":1525.2,"norm":100,"trust":3,"source_url":"https://lmarena.ai/leaderboard","config":"text","measured_date":"2026-10-03"},"terminal_bench":{"raw":57.58,"norm":61.86,"trust":2,"source_url":"https://www.vals.ai/models/google_gemini-4-argon","config":"4.0, reasoning effort high, temperature 1.0","measured_date":"2026-09-30"}}},{"id":"glm-0414-z1-32b-reasoning","display_name":"GLM-Z1-32B-0414","family_id":"glm","vendor":"Zhipu AI (Z.ai)","status":"current","kind":"model","superseded_by":null,"release_date":"2025-04","intelligence_index":null,"coverage":null,"index_subset_bias":null,"params_total_b":32.57,"params_active_b":32.57,"vram_est":{"bf16_gb":65.1,"int8_gb":34.5,"int4_gb":19.5,"method":"linear-rom-v1","approximate":true,"basis":"params_total_b"},"vram_frontier":null,"fits_on":{"intel_b70":"int4","nvidia_h100_sxm_80g":"fp8","nvidia_dgx_spark":"fp8"},"is_moe":false,"is_open_weights":true,"context_window_tok":null,"pricing":{"prompt_usd_per_m":null,"completion_usd_per_m":null,"blended_usd_per_m":null},"scores":{"aime":{"raw":63.6,"norm":54.5,"trust":1,"source_url":"https://raw.githubusercontent.com/zai-org/GLM-4/main/resources/Bench-Z1-32B.png","config":"aime25, thinking mode","measured_date":null},"gpqa_diamond":{"raw":66.1,"norm":57.89,"trust":1,"source_url":"https://raw.githubusercontent.com/zai-org/GLM-4/main/resources/Bench-Z1-32B.png","config":"thinking mode","measured_date":null}}},{"id":"glm-4-32b-0414-instruct","display_name":"GLM-4-32B-0414","family_id":"glm","vendor":"Zhipu AI (Z.ai)","status":"current","kind":"model","superseded_by":null,"release_date":"2025-04","intelligence_index":null,"coverage":null,"index_subset_bias":null,"params_total_b":32,"params_active_b":32,"vram_est":{"bf16_gb":64,"int8_gb":33.9,"int4_gb":19.2,"method":"linear-rom-v1","approximate":true,"basis":"params_total_b"},"vram_frontier":null,"fits_on":{"intel_b70":"int4","nvidia_h100_sxm_80g":"fp8","nvidia_dgx_spark":"fp8"},"is_moe":false,"is_open_weights":true,"context_window_tok":32768,"pricing":{"prompt_usd_per_m":null,"completion_usd_per_m":null,"blended_usd_per_m":null},"scores":{"swe_bench_verified":{"raw":27.2,"norm":19.11,"trust":1,"source_url":"https://huggingface.co/zai-org/GLM-4-32B-0414","config":"60 iterations, no yarn, openhands v0.29.1 framework","measured_date":null},"tau_bench":{"raw":51.2,"norm":41.6,"trust":1,"source_url":"https://huggingface.co/zai-org/GLM-4-32B-0414","config":"airline","measured_date":null}}},{"id":"glm-4.6-v-106b","display_name":"GLM-4.6V","family_id":"glm","vendor":"Zhipu AI (Z.ai)","status":"current","kind":"model","superseded_by":null,"release_date":"2025-12-08","intelligence_index":null,"coverage":null,"index_subset_bias":null,"params_total_b":107.71,"params_active_b":106,"vram_est":{"bf16_gb":215,"int8_gb":114,"int4_gb":64.6,"method":"linear-rom-v1","approximate":true,"basis":"params_total_b"},"vram_frontier":null,"fits_on":{"nvidia_h100_sxm_80g":"int4","nvidia_dgx_spark":"fp8"},"is_moe":true,"is_open_weights":true,"context_window_tok":131072,"pricing":{"prompt_usd_per_m":0.3,"completion_usd_per_m":0.9,"blended_usd_per_m":0.44999999999999996},"scores":{"arena_elo":{"raw":1378.7,"norm":44.16,"trust":3,"source_url":"https://lmarena.ai/leaderboard","config":"text","measured_date":"2026-10-03"}}},{"id":"gpt-3.5-turbo-0613","display_name":"GPT-3.5 Turbo (older v0613)","family_id":"gpt","vendor":"OpenAI","status":"current","kind":"model","superseded_by":null,"release_date":"2024-01-25","intelligence_index":null,"coverage":null,"index_subset_bias":null,"params_total_b":null,"params_active_b":null,"vram_est":null,"vram_frontier":null,"fits_on":null,"is_moe":false,"is_open_weights":false,"context_window_tok":4095,"pricing":{"prompt_usd_per_m":1,"completion_usd_per_m":2,"blended_usd_per_m":1.25},"scores":{"arena_elo":{"raw":1112,"norm":0,"trust":3,"source_url":"https://www.lmsys.org/blog/2023-12-07-leaderboard/","config":"bradley-terry mle, chatbot arena, dec 2023 leaderboard","measured_date":"2023-12-07"}}},{"id":"gpt-5.6-luna-pro","display_name":"GPT-5.6 Luna Pro","family_id":"gpt","vendor":"OpenAI","status":"current","kind":"model","superseded_by":null,"release_date":"2026-07-09","intelligence_index":null,"coverage":null,"index_subset_bias":null,"params_total_b":null,"params_active_b":null,"vram_est":null,"vram_frontier":null,"fits_on":null,"is_moe":false,"is_open_weights":false,"context_window_tok":1050000,"pricing":{"prompt_usd_per_m":0.2,"completion_usd_per_m":1.2,"blended_usd_per_m":0.45},"scores":{"gpqa_diamond":{"raw":89.9,"norm":91.41,"trust":2,"source_url":"https://openrouter.ai/openai/gpt-5.6-luna-pro","config":"1 run, auto-routing, openrouter provider benchmark","measured_date":null},"tau_bench":{"raw":70,"norm":66.67,"trust":2,"source_url":"https://openrouter.ai/openai/gpt-5.6-luna-pro","config":"1 run, auto-routing, tau_bench_verified_airline","measured_date":null}}},{"id":"gpt-o1-pro","display_name":"OpenAI o1-pro","family_id":"gpt","vendor":"OpenAI","status":"superseded","kind":"model","superseded_by":"gpt-o3-pro","release_date":"2025-03-19","intelligence_index":null,"coverage":null,"index_subset_bias":null,"params_total_b":null,"params_active_b":null,"vram_est":null,"vram_frontier":null,"fits_on":null,"is_moe":false,"is_open_weights":false,"context_window_tok":200000,"pricing":{"prompt_usd_per_m":150,"completion_usd_per_m":600,"blended_usd_per_m":262.5},"scores":{"aime":{"raw":86,"norm":82.5,"trust":1,"source_url":"https://web.archive.org/web/20241206000000/https://openai.com/index/introducing-chatgpt-pro/","config":"aime 2024, o1 pro mode, openai 'introducing chatgpt pro' chart series 'o1 pro mode' (2024-12-05 internet archive snapshot of openai.com/index/introducing-chatgpt-pro/), pass@1 accuracy","measured_date":"2024-12-05"},"gpqa_diamond":{"raw":79,"norm":76.06,"trust":1,"source_url":"https://web.archive.org/web/20241206000000/https://openai.com/index/introducing-chatgpt-pro/","config":"o1 pro mode, openai 'introducing chatgpt pro' chart series 'o1 pro mode' (read from the 2024-12-05 internet archive snapshot of openai.com/index/introducing-chatgpt-pro/ because openai.com blocks automated fetches), pass@1 accuracy","measured_date":"2024-12-05"}}},{"id":"granite-3.3-2b-instruct","display_name":"Granite-3.3-2B-Instruct","family_id":"granite","vendor":"IBM","status":"current","kind":"model","superseded_by":null,"release_date":"2025-04-16","intelligence_index":null,"coverage":null,"index_subset_bias":null,"params_total_b":2.53,"params_active_b":2.53,"vram_est":{"bf16_gb":5.1,"int8_gb":2.7,"int4_gb":1.5,"method":"linear-rom-v1","approximate":true,"basis":"params_total_b"},"vram_frontier":null,"fits_on":{"intel_b70":"fp8","nvidia_h100_sxm_80g":"fp8","nvidia_dgx_spark":"fp8"},"is_moe":false,"is_open_weights":true,"context_window_tok":128000,"pricing":{"prompt_usd_per_m":null,"completion_usd_per_m":null,"blended_usd_per_m":null},"scores":{"aime":{"raw":3.28,"norm":0,"trust":1,"source_url":"https://huggingface.co/ibm-granite/granite-3.3-2b-instruct","config":"aime24, granite-3.3-2b-instruct column, olmes","measured_date":null}}},{"id":"grok-4.20-multi-agent","display_name":"Grok 4.20 Multi-Agent","family_id":"grok","vendor":"xAI","status":"superseded","kind":"model","superseded_by":"grok-4.7","release_date":"2026-03-31","intelligence_index":null,"coverage":null,"index_subset_bias":null,"params_total_b":null,"params_active_b":null,"vram_est":null,"vram_frontier":null,"fits_on":null,"is_moe":false,"is_open_weights":false,"context_window_tok":2000000,"pricing":{"prompt_usd_per_m":1.25,"completion_usd_per_m":2.5,"blended_usd_per_m":1.5625},"scores":{"arena_elo":{"raw":1470.2,"norm":84.94,"trust":3,"source_url":"https://arena.ai/leaderboard/text","config":"60864 votes, arena entry grok-4.20-multi-agent-beta-0309, leaderboard text-overall-style_control, rank 36, style control, text/overall, vote cutoff 2026-08-21","measured_date":"2026-08-21"},"tau_bench":{"raw":96.5,"norm":100,"trust":2,"source_url":"https://designforonline.com/ai-models/xai-grok-4-20-multi-agent-beta/","config":"high/xhigh = 16 agents, low/medium = 4 agents, multi-agent beta, tau2","measured_date":null}}},{"id":"hermes-3-llama-3.1-405b","display_name":"Hermes 3 405B Instruct","family_id":"hermes","vendor":"nousresearch","status":"superseded","kind":"model","superseded_by":"hermes-4-405b","release_date":"2024-08-16","intelligence_index":null,"coverage":null,"index_subset_bias":null,"params_total_b":405.85,"params_active_b":405.85,"vram_est":{"bf16_gb":812,"int8_gb":430,"int4_gb":244,"method":"linear-rom-v1","approximate":true,"basis":"params_total_b"},"vram_frontier":null,"fits_on":{},"is_moe":false,"is_open_weights":true,"context_window_tok":131072,"pricing":{"prompt_usd_per_m":1,"completion_usd_per_m":1,"blended_usd_per_m":1},"scores":{"gpqa_diamond":{"raw":44.84,"norm":27.94,"trust":2,"source_url":"https://arxiv.org/html/2408.11857v1","config":"0-shot — hermes 3 technical report, table 5 (final downstream task evaluations)","measured_date":null},"mmlu_pro":{"raw":54.14,"norm":23.57,"trust":2,"source_url":"https://arxiv.org/html/2408.11857v1","config":"5-shot — hermes 3 technical report, table 5 (final downstream task evaluations)","measured_date":null}}},{"id":"kat-coder-2.5-pro","display_name":"KAT-Coder-Pro V2.5","family_id":"kat-coder","vendor":"kwaipilot","status":"current","kind":"model","superseded_by":null,"release_date":"2026-07-10","intelligence_index":null,"coverage":null,"index_subset_bias":null,"params_total_b":null,"params_active_b":null,"vram_est":null,"vram_frontier":null,"fits_on":null,"is_moe":false,"is_open_weights":false,"context_window_tok":262144,"pricing":{"prompt_usd_per_m":0.74,"completion_usd_per_m":2.96,"blended_usd_per_m":1.295},"scores":{"terminal_bench":{"raw":60.7,"norm":65.53,"trust":2,"source_url":"https://arxiv.org/pdf/2607.05471","config":"terminal-bench 2.1","measured_date":"2026-07-06"}}},{"id":"laguna-s-2.1","display_name":"Laguna S 2.1","family_id":"laguna","vendor":"poolside","status":"current","kind":"model","superseded_by":null,"release_date":"2026-07-21","intelligence_index":null,"coverage":null,"index_subset_bias":null,"params_total_b":117.56,"params_active_b":null,"vram_est":{"bf16_gb":235,"int8_gb":125,"int4_gb":70.5,"method":"linear-rom-v1","approximate":true,"basis":"params_total_b"},"vram_frontier":null,"fits_on":{"nvidia_h100_sxm_80g":"int4","nvidia_dgx_spark":"int4"},"is_moe":true,"is_open_weights":true,"context_window_tok":1048576,"pricing":{"prompt_usd_per_m":0.09,"completion_usd_per_m":0.18,"blended_usd_per_m":0.1125},"scores":{"terminal_bench":{"raw":70.2,"norm":76.71,"trust":1,"source_url":"https://poolside.ai/blog/introducing-laguna-s-2-1","config":"2.1, max thinking, pass@1 avg of 4","measured_date":"2026-07-21"}}},{"id":"laguna-xs-2.1","display_name":"Laguna XS 2.1","family_id":"laguna","vendor":"poolside","status":"current","kind":"model","superseded_by":null,"release_date":"2026-07-02","intelligence_index":null,"coverage":null,"index_subset_bias":null,"params_total_b":33.44,"params_active_b":null,"vram_est":{"bf16_gb":66.9,"int8_gb":35.4,"int4_gb":20.1,"method":"linear-rom-v1","approximate":true,"basis":"params_total_b"},"vram_frontier":null,"fits_on":{"intel_b70":"int4","nvidia_h100_sxm_80g":"fp8","nvidia_dgx_spark":"fp8"},"is_moe":true,"is_open_weights":true,"context_window_tok":262144,"pricing":{"prompt_usd_per_m":0.06,"completion_usd_per_m":0.12,"blended_usd_per_m":0.075},"scores":{"swe_bench_verified":{"raw":70.9,"norm":67.67,"trust":1,"source_url":"https://huggingface.co/poolside/Laguna-XS-2.1","config":"harbor framework + pool agent harness, mean pass@1 over 4 attempts, thinking mode","measured_date":null},"terminal_bench":{"raw":37.5,"norm":38.24,"trust":1,"source_url":"https://huggingface.co/poolside/Laguna-XS-2.1","config":"2.0","measured_date":null}}},{"id":"ling-3.0-flash-fin","display_name":"Ling 3.0 Flash Fin","family_id":"ling","vendor":"inclusionAI","status":"current","kind":"model","superseded_by":null,"release_date":"2026-08-27","intelligence_index":null,"coverage":null,"index_subset_bias":null,"params_total_b":null,"params_active_b":null,"vram_est":null,"vram_frontier":null,"fits_on":null,"is_moe":false,"is_open_weights":false,"context_window_tok":262144,"pricing":{"prompt_usd_per_m":0.042,"completion_usd_per_m":0.1232,"blended_usd_per_m":0.0623},"scores":{"hle":{"raw":23,"norm":30.88,"trust":1,"source_url":"https://opper.ai/inclusionai/ling-3-0-flash-fin","config":"artificial analysis, reasoning model","measured_date":"2026-09-11"},"terminal_bench":{"raw":50.19,"norm":53.16,"trust":2,"source_url":"https://www.vals.ai/models/ant_ling-3.0-flash-fin","config":"2.1, default provider ant group, max output tokens 131072, temperature 1, top_k 20, top_p 0.95","measured_date":"2026-10-02"}}},{"id":"ling-3.0-flash-sante","display_name":"Ling 3.0 Flash Sante","family_id":"ling","vendor":"inclusionAI","status":"current","kind":"model","superseded_by":null,"release_date":"2026-09-04","intelligence_index":null,"coverage":null,"index_subset_bias":null,"params_total_b":null,"params_active_b":null,"vram_est":null,"vram_frontier":null,"fits_on":null,"is_moe":false,"is_open_weights":false,"context_window_tok":262144,"pricing":{"prompt_usd_per_m":0,"completion_usd_per_m":0,"blended_usd_per_m":0},"scores":{"hle":{"raw":53.24,"norm":75.35,"trust":1,"source_url":"https://x.com/AntLingAGI?lang=en","config":"tools on, vendor-reported, with tools","measured_date":"2026-09-04"}}},{"id":"ling-3.0-flash-vision","display_name":"Ling 3.0 Flash VL","family_id":"ling","vendor":"inclusionAI","status":"current","kind":"model","superseded_by":null,"release_date":"2026-09-10","intelligence_index":null,"coverage":null,"index_subset_bias":null,"params_total_b":124.85,"params_active_b":null,"vram_est":{"bf16_gb":250,"int8_gb":132,"int4_gb":74.9,"method":"linear-rom-v1","approximate":true,"basis":"params_total_b"},"vram_frontier":null,"fits_on":{"nvidia_h100_sxm_80g":"int4","nvidia_dgx_spark":"int4"},"is_moe":true,"is_open_weights":true,"context_window_tok":262144,"pricing":{"prompt_usd_per_m":0.021,"completion_usd_per_m":0.0616,"blended_usd_per_m":0.03115},"scores":{"gpqa_diamond":{"raw":86.2,"norm":86.2,"trust":2,"source_url":"https://openrouter.ai/inclusionai/ling-3.0-flash-vl:free","config":"artificial analysis, thinking/reasoning","measured_date":"2026-09-10"},"hle":{"raw":22,"norm":29.41,"trust":2,"source_url":"https://openrouter.ai/inclusionai/ling-3.0-flash-vl:free","config":"artificial analysis, humanity's last exam","measured_date":"2026-09-10"}}},{"id":"mercury-2.5","display_name":"Mercury 2.5","family_id":"mercury","vendor":"inception","status":"current","kind":"model","superseded_by":null,"release_date":"2026-08-31","intelligence_index":null,"coverage":null,"index_subset_bias":null,"params_total_b":null,"params_active_b":null,"vram_est":null,"vram_frontier":null,"fits_on":null,"is_moe":false,"is_open_weights":false,"context_window_tok":260000,"pricing":{"prompt_usd_per_m":0.04,"completion_usd_per_m":0.15,"blended_usd_per_m":0.0675},"scores":{"hle":{"raw":11.8,"norm":14.41,"trust":2,"source_url":"https://openrouter.ai/inception/mercury-2.5","config":"artificial analysis, humanity's last exam","measured_date":"2026-09-08"},"terminal_bench":{"raw":0,"norm":0,"trust":2,"source_url":"https://www.vals.ai/models/inception_mercury-2.5","config":"4.0, vals ai independent eval","measured_date":"2026-10-03"}}},{"id":"mimo-2.6-flash","display_name":"MiMo-V2.6-Flash","family_id":"mimo","vendor":"xiaomi","status":"current","kind":"model","superseded_by":null,"release_date":"2026-09-21","intelligence_index":null,"coverage":null,"index_subset_bias":null,"params_total_b":310.76,"params_active_b":null,"vram_est":{"bf16_gb":622,"int8_gb":329,"int4_gb":186,"method":"linear-rom-v1","approximate":true,"basis":"params_total_b"},"vram_frontier":null,"fits_on":{},"is_moe":true,"is_open_weights":true,"context_window_tok":1050000,"pricing":{"prompt_usd_per_m":0.14,"completion_usd_per_m":0.28,"blended_usd_per_m":0.17500000000000002},"scores":{"arena_elo":{"raw":1451.8,"norm":76.74,"trust":3,"source_url":"https://lmarena.ai/leaderboard","config":"text","measured_date":"2026-10-03"},"terminal_bench":{"raw":87.6,"norm":97.18,"trust":1,"source_url":"https://huggingface.co/XiaomiMiMo/MiMo-V2.6-Flash-RL","config":"2.1, thinking, tools","measured_date":"2026-09-21"}}},{"id":"mimo-2.6-pro","display_name":"MiMo-V2.6-Pro","family_id":"mimo","vendor":"xiaomi","status":"current","kind":"model","superseded_by":null,"release_date":"2026-09-21","intelligence_index":null,"coverage":null,"index_subset_bias":null,"params_total_b":1024.22,"params_active_b":null,"vram_est":{"bf16_gb":2048,"int8_gb":1086,"int4_gb":615,"method":"linear-rom-v1","approximate":true,"basis":"params_total_b"},"vram_frontier":null,"fits_on":{},"is_moe":true,"is_open_weights":true,"context_window_tok":1050000,"pricing":{"prompt_usd_per_m":0.435,"completion_usd_per_m":0.87,"blended_usd_per_m":0.54375},"scores":{"arena_elo":{"raw":1480.1,"norm":89.35,"trust":3,"source_url":"https://lmarena.ai/leaderboard","config":"text","measured_date":"2026-10-03"},"terminal_bench":{"raw":67.79,"norm":73.87,"trust":2,"source_url":"https://www.vals.ai/models/xiaomi_mimo-v2.6-pro","config":"2.1, reasoning on, temperature 1.0, vals independent, xiaomi api","measured_date":"2026-09-22"}}},{"id":"minimax-01","display_name":"MiniMax-01","family_id":"minimax","vendor":"MiniMax","status":"current","kind":"model","superseded_by":null,"release_date":"2025-01-15","intelligence_index":null,"coverage":null,"index_subset_bias":null,"params_total_b":456.09,"params_active_b":null,"vram_est":{"bf16_gb":912,"int8_gb":483,"int4_gb":274,"method":"linear-rom-v1","approximate":true,"basis":"params_total_b"},"vram_frontier":null,"fits_on":{},"is_moe":true,"is_open_weights":true,"context_window_tok":1000192,"pricing":{"prompt_usd_per_m":0.2,"completion_usd_per_m":1.1,"blended_usd_per_m":0.42500000000000004},"scores":{"gpqa_diamond":{"raw":54.4,"norm":41.41,"trust":1,"source_url":"https://huggingface.co/MiniMaxAI/MiniMax-Text-01","config":"0-shot cot","measured_date":null},"mmlu_pro":{"raw":75.7,"norm":59.5,"trust":1,"source_url":"https://huggingface.co/MiniMaxAI/MiniMax-Text-01","config":"0-shot cot","measured_date":null}}},{"id":"ministral-3-3b-2512-reasoning","display_name":"Ministral-3-3B-Reasoning-2512","family_id":"ministral","vendor":"Mistral AI","status":"current","kind":"model","superseded_by":null,"release_date":"2025-12-02","intelligence_index":null,"coverage":null,"index_subset_bias":null,"params_total_b":4.25,"params_active_b":4.25,"vram_est":{"bf16_gb":8.5,"int8_gb":4.5,"int4_gb":2.6,"method":"linear-rom-v1","approximate":true,"basis":"params_total_b"},"vram_frontier":null,"fits_on":{"intel_b70":"fp8","nvidia_h100_sxm_80g":"fp8","nvidia_dgx_spark":"fp8"},"is_moe":false,"is_open_weights":true,"context_window_tok":128000,"pricing":{"prompt_usd_per_m":null,"completion_usd_per_m":null,"blended_usd_per_m":null},"scores":{"aime":{"raw":77.5,"norm":71.88,"trust":2,"source_url":"https://arxiv.org/html/2601.08584v1","config":"2024, ministral 3 3b column, ministral 3 technical report table 5 (reasoning models)","measured_date":null},"gpqa_diamond":{"raw":53.4,"norm":40,"trust":2,"source_url":"https://arxiv.org/html/2601.08584v1","config":"ministral 3 3b column, ministral 3 technical report table 5 (reasoning models)","measured_date":null}}},{"id":"ministral-3-8b-2512-reasoning","display_name":"Ministral-3-8B-Reasoning-2512","family_id":"ministral","vendor":"Mistral AI","status":"current","kind":"model","superseded_by":null,"release_date":"2025-12-02","intelligence_index":null,"coverage":null,"index_subset_bias":null,"params_total_b":8.92,"params_active_b":8.92,"vram_est":{"bf16_gb":17.8,"int8_gb":9.5,"int4_gb":5.4,"method":"linear-rom-v1","approximate":true,"basis":"params_total_b"},"vram_frontier":null,"fits_on":{"intel_b70":"fp8","nvidia_h100_sxm_80g":"fp8","nvidia_dgx_spark":"fp8"},"is_moe":false,"is_open_weights":true,"context_window_tok":128000,"pricing":{"prompt_usd_per_m":null,"completion_usd_per_m":null,"blended_usd_per_m":null},"scores":{"aime":{"raw":86,"norm":82.5,"trust":1,"source_url":"https://huggingface.co/mistralai/Ministral-3-8B-Reasoning-2512","config":"2024, reasoning mode","measured_date":null},"gpqa_diamond":{"raw":66.8,"norm":58.87,"trust":1,"source_url":"https://huggingface.co/mistralai/Ministral-3-8B-Reasoning-2512","config":"reasoning mode","measured_date":null}}},{"id":"mistral-3-14b-2512-reasoning","display_name":"Ministral-3-14B-Reasoning-2512","family_id":"mistral","vendor":"Mistral AI","status":"current","kind":"model","superseded_by":null,"release_date":"2025-12-02","intelligence_index":null,"coverage":null,"index_subset_bias":null,"params_total_b":13.95,"params_active_b":13.95,"vram_est":{"bf16_gb":27.9,"int8_gb":14.8,"int4_gb":8.4,"method":"linear-rom-v1","approximate":true,"basis":"params_total_b"},"vram_frontier":null,"fits_on":{"intel_b70":"fp8","nvidia_h100_sxm_80g":"fp8","nvidia_dgx_spark":"fp8"},"is_moe":false,"is_open_weights":true,"context_window_tok":256000,"pricing":{"prompt_usd_per_m":null,"completion_usd_per_m":null,"blended_usd_per_m":null},"scores":{"aime":{"raw":89.8,"norm":87.25,"trust":1,"source_url":"https://huggingface.co/mistralai/Ministral-3-14B-Reasoning-2512","config":"2024, reasoning mode","measured_date":null},"gpqa_diamond":{"raw":71.2,"norm":65.07,"trust":1,"source_url":"https://huggingface.co/mistralai/Ministral-3-14B-Reasoning-2512","config":"reasoning mode","measured_date":null}}},{"id":"muse-spark-1.3-max","display_name":"Muse Spark 1.3 Max","family_id":"muse","vendor":"Meta","status":"current","kind":"model","superseded_by":null,"release_date":"2026-09-05","intelligence_index":null,"coverage":null,"index_subset_bias":null,"params_total_b":null,"params_active_b":null,"vram_est":null,"vram_frontier":null,"fits_on":null,"is_moe":false,"is_open_weights":false,"context_window_tok":1048576,"pricing":{"prompt_usd_per_m":null,"completion_usd_per_m":null,"blended_usd_per_m":null},"scores":{"arena_elo":{"raw":1494.3,"norm":95.68,"trust":3,"source_url":"https://lmarena.ai/leaderboard","config":"text","measured_date":"2026-10-03"}}},{"id":"nemotron-3-super","display_name":"Nemotron 3 Super","family_id":"nemotron","vendor":"NVIDIA","status":"superseded","kind":"model","superseded_by":"nemotron-3.5-lightning","release_date":"2025-12-15","intelligence_index":null,"coverage":null,"index_subset_bias":null,"params_total_b":120,"params_active_b":12,"vram_est":{"bf16_gb":240,"int8_gb":127,"int4_gb":72,"method":"linear-rom-v1","approximate":true,"basis":"params_total_b"},"vram_frontier":null,"fits_on":{"nvidia_h100_sxm_80g":"int4","nvidia_dgx_spark":"int4"},"is_moe":true,"is_open_weights":true,"context_window_tok":262144,"pricing":{"prompt_usd_per_m":null,"completion_usd_per_m":null,"blended_usd_per_m":null},"scores":{"arena_elo":{"raw":1360.5,"norm":36.04,"trust":3,"source_url":"https://lmarena.ai/leaderboard","config":"text","measured_date":"2026-10-01"}}},{"id":"nex-n2.5-mini","display_name":"Nex-N2.5-Mini","family_id":"nex","vendor":"nex-agi","status":"current","kind":"model","superseded_by":null,"release_date":"2026-09-08","intelligence_index":null,"coverage":null,"index_subset_bias":null,"params_total_b":35.11,"params_active_b":null,"vram_est":{"bf16_gb":70.2,"int8_gb":37.2,"int4_gb":21.1,"method":"linear-rom-v1","approximate":true,"basis":"params_total_b"},"vram_frontier":null,"fits_on":{"intel_b70":"int4","nvidia_h100_sxm_80g":"fp8","nvidia_dgx_spark":"fp8"},"is_moe":true,"is_open_weights":true,"context_window_tok":262144,"pricing":{"prompt_usd_per_m":0.025,"completion_usd_per_m":0.1,"blended_usd_per_m":0.043750000000000004},"scores":{"terminal_bench":{"raw":73.4,"norm":80.47,"trust":1,"source_url":"https://huggingface.co/nex-agi/Nex-N2.5-mini","config":"2.1, coding tasks, nexau harness, temperature=0.7, top_k=40, top_p=0.95","measured_date":"2026-09-08"}}},{"id":"nex-n2.5-pro","display_name":"Nex-N2.5-Pro","family_id":"nex","vendor":"nex-agi","status":"current","kind":"model","superseded_by":null,"release_date":"2026-09-08","intelligence_index":null,"coverage":null,"index_subset_bias":null,"params_total_b":396.8,"params_active_b":null,"vram_est":{"bf16_gb":794,"int8_gb":421,"int4_gb":238,"method":"linear-rom-v1","approximate":true,"basis":"params_total_b"},"vram_frontier":null,"fits_on":{},"is_moe":true,"is_open_weights":true,"context_window_tok":262144,"pricing":{"prompt_usd_per_m":0.075,"completion_usd_per_m":0.25,"blended_usd_per_m":0.11875},"scores":{"terminal_bench":{"raw":82.7,"norm":91.41,"trust":1,"source_url":"https://github.com/nex-agi/Nex-N2.5","config":"2.1, nexau harness, reasoning_effort default medium (adaptive thinking), temperature=0.7, top_k=40, top_p=0.95","measured_date":"2026-09-10"}}},{"id":"olmo-2-0325-32b-instruct","display_name":"OLMo-2-0325-32B-Instruct","family_id":"olmo","vendor":"Allen Institute","status":"current","kind":"model","superseded_by":null,"release_date":"2025-03","intelligence_index":null,"coverage":null,"index_subset_bias":null,"params_total_b":32.23,"params_active_b":32,"vram_est":{"bf16_gb":64.5,"int8_gb":34.2,"int4_gb":19.3,"method":"linear-rom-v1","approximate":true,"basis":"params_total_b"},"vram_frontier":null,"fits_on":{"intel_b70":"int4","nvidia_h100_sxm_80g":"fp8","nvidia_dgx_spark":"fp8"},"is_moe":false,"is_open_weights":true,"context_window_tok":4096,"pricing":{"prompt_usd_per_m":null,"completion_usd_per_m":null,"blended_usd_per_m":null},"scores":{"arena_elo":{"raw":1251.6,"norm":0,"trust":3,"source_url":"https://lmarena.ai/leaderboard","config":"text","measured_date":"2026-10-01"}}},{"id":"palmyra-x5","display_name":"Palmyra X5","family_id":"palmyra","vendor":"writer","status":"current","kind":"model","superseded_by":null,"release_date":"2026-01-21","intelligence_index":null,"coverage":null,"index_subset_bias":null,"params_total_b":null,"params_active_b":null,"vram_est":null,"vram_frontier":null,"fits_on":null,"is_moe":false,"is_open_weights":false,"context_window_tok":1040000,"pricing":{"prompt_usd_per_m":0.6,"completion_usd_per_m":6,"blended_usd_per_m":1.95},"scores":{"gpqa_diamond":{"raw":47.2,"norm":31.27,"trust":1,"source_url":"https://dev.writer.com/home/models","config":"labelled 'gpqa (graduate-level google-proof q&a)', subset not stated (not identified as diamond)","measured_date":null},"mmlu_pro":{"raw":65.02,"norm":41.7,"trust":1,"source_url":"https://dev.writer.com/home/models","config":"labelled mmlu_pro on writer's model docs page","measured_date":null}}},{"id":"phi-4-mini-3.8b-reasoning","display_name":"Phi-4-mini-reasoning","family_id":"phi","vendor":"Microsoft","status":"current","kind":"model","superseded_by":null,"release_date":"2025-04-01","intelligence_index":null,"coverage":null,"index_subset_bias":null,"params_total_b":3.84,"params_active_b":3.84,"vram_est":{"bf16_gb":7.7,"int8_gb":4.1,"int4_gb":2.3,"method":"linear-rom-v1","approximate":true,"basis":"params_total_b"},"vram_frontier":null,"fits_on":{"intel_b70":"fp8","nvidia_h100_sxm_80g":"fp8","nvidia_dgx_spark":"fp8"},"is_moe":false,"is_open_weights":true,"context_window_tok":128000,"pricing":{"prompt_usd_per_m":null,"completion_usd_per_m":null,"blended_usd_per_m":null},"scores":{"aime":{"raw":57.5,"norm":46.88,"trust":2,"source_url":"https://arxiv.org/html/2504.21233v1","config":"2024, pass@1, phi-4-mini-reasoning paper, table 3 (+rl final)","measured_date":null},"gpqa_diamond":{"raw":52,"norm":38.03,"trust":2,"source_url":"https://arxiv.org/html/2504.21233v1","config":"pass@1, phi-4-mini-reasoning paper, table 3 (+rl final)","measured_date":null}}},{"id":"qwen-2.5-72b","display_name":"Qwen2.5-72B","family_id":"qwen","vendor":"Alibaba","status":"current","kind":"model","superseded_by":null,"release_date":"2024-09-18","intelligence_index":null,"coverage":null,"index_subset_bias":null,"params_total_b":72.71,"params_active_b":72.71,"vram_est":{"bf16_gb":145,"int8_gb":77.1,"int4_gb":43.6,"method":"linear-rom-v1","approximate":true,"basis":"params_total_b"},"vram_frontier":null,"fits_on":{"nvidia_h100_sxm_80g":"int4","nvidia_dgx_spark":"fp8"},"is_moe":false,"is_open_weights":true,"context_window_tok":131072,"pricing":{"prompt_usd_per_m":null,"completion_usd_per_m":null,"blended_usd_per_m":null},"scores":{"gpqa_diamond":{"raw":45.9,"norm":29.44,"trust":2,"source_url":"https://arxiv.org/pdf/2412.15115","config":"5-shot, base model","measured_date":"2024-12-19"},"mmlu_pro":{"raw":58.1,"norm":30.17,"trust":2,"source_url":"https://arxiv.org/pdf/2412.15115","config":"5-shot, base model","measured_date":"2024-12-19"}}},{"id":"seed-2-1-turbo","display_name":"Seed 2.1 Turbo","family_id":"seed","vendor":"bytedance-seed","status":"current","kind":"model","superseded_by":null,"release_date":"2026-08-12","intelligence_index":null,"coverage":null,"index_subset_bias":null,"params_total_b":null,"params_active_b":null,"vram_est":null,"vram_frontier":null,"fits_on":null,"is_moe":false,"is_open_weights":false,"context_window_tok":262144,"pricing":{"prompt_usd_per_m":0.5,"completion_usd_per_m":2.5,"blended_usd_per_m":1},"scores":{"arc_agi_2":{"raw":61.3,"norm":62.56,"trust":1,"source_url":"https://anotherwrapper.com/tools/llm-pricing/glm-5.2/seed-2.1-turbo","config":null,"measured_date":"2026-09-18"},"hle":{"raw":54.6,"norm":77.35,"trust":1,"source_url":"https://anotherwrapper.com/tools/llm-pricing/seed-2.1-turbo","config":null,"measured_date":"2026-09-27"},"terminal_bench":{"raw":67.6,"norm":73.65,"trust":1,"source_url":"https://anotherwrapper.com/tools/llm-pricing/qwen3.7-max/seed-2.1-turbo","config":"2.1","measured_date":"2026-09-28"}}},{"id":"seed-2.0-code","display_name":"Seed-2.0-Code","family_id":"seed","vendor":"bytedance-seed","status":"current","kind":"model","superseded_by":null,"release_date":"2026-08-12","intelligence_index":null,"coverage":null,"index_subset_bias":null,"params_total_b":null,"params_active_b":null,"vram_est":null,"vram_frontier":null,"fits_on":null,"is_moe":false,"is_open_weights":false,"context_window_tok":262144,"pricing":{"prompt_usd_per_m":0.5,"completion_usd_per_m":3,"blended_usd_per_m":1.125},"scores":{"swe_bench_verified":{"raw":76.5,"norm":73.89,"trust":1,"source_url":"https://www.llmreference.com/model/bytedance-doubao-seed-2-0-code","config":"shares pro swe-bench score per launch materials (resolved)","measured_date":"2026-06-07"}}},{"id":"smollm-2-1.7b","display_name":"SmolLM2-1.7B","family_id":"smollm","vendor":"Hugging Face","status":"current","kind":"model","superseded_by":null,"release_date":"2024-11-02","intelligence_index":null,"coverage":null,"index_subset_bias":null,"params_total_b":1.71,"params_active_b":1.71,"vram_est":{"bf16_gb":3.4,"int8_gb":1.8,"int4_gb":1,"method":"linear-rom-v1","approximate":true,"basis":"params_total_b"},"vram_frontier":null,"fits_on":{"intel_b70":"fp8","nvidia_h100_sxm_80g":"fp8","nvidia_dgx_spark":"fp8"},"is_moe":false,"is_open_weights":true,"context_window_tok":8192,"pricing":{"prompt_usd_per_m":null,"completion_usd_per_m":null,"blended_usd_per_m":null},"scores":{"mmlu_pro":{"raw":19.4,"norm":0,"trust":1,"source_url":"https://huggingface.co/HuggingFaceTB/SmolLM2-1.7B","config":"base model, mcf","measured_date":null}}},{"id":"smollm-2-135m","display_name":"SmolLM2-135M","family_id":"smollm","vendor":"Hugging Face","status":"current","kind":"model","superseded_by":null,"release_date":"2024-11-02","intelligence_index":null,"coverage":null,"index_subset_bias":null,"params_total_b":0.13,"params_active_b":0.13,"vram_est":{"bf16_gb":0.3,"int8_gb":0.1,"int4_gb":0.1,"method":"linear-rom-v1","approximate":true,"basis":"params_total_b"},"vram_frontier":null,"fits_on":{"intel_b70":"fp8","nvidia_h100_sxm_80g":"fp8","nvidia_dgx_spark":"fp8"},"is_moe":false,"is_open_weights":true,"context_window_tok":8192,"pricing":{"prompt_usd_per_m":null,"completion_usd_per_m":null,"blended_usd_per_m":null},"scores":{"mmlu_pro":{"raw":10.85,"norm":0,"trust":3,"source_url":"https://huggingface.co/HuggingFaceTB/SmolLM2-135M","config":"tiger-lab mmlu-pro leaderboard entry","measured_date":null}}},{"id":"sonar-1-pro-reasoning","display_name":"Sonar Reasoning Pro","family_id":"sonar","vendor":"perplexity","status":"current","kind":"model","superseded_by":null,"release_date":"2025-03-07","intelligence_index":null,"coverage":null,"index_subset_bias":null,"params_total_b":null,"params_active_b":null,"vram_est":null,"vram_frontier":null,"fits_on":null,"is_moe":false,"is_open_weights":false,"context_window_tok":128000,"pricing":{"prompt_usd_per_m":2,"completion_usd_per_m":8,"blended_usd_per_m":3.5},"scores":{"aime":{"raw":79,"norm":73.75,"trust":2,"source_url":"http://web.archive.org/web/20250707232933/https://artificialanalysis.ai/models/sonar-reasoning-pro","config":"aime 2024), artificial analysis independent run (legacy aa 'aime' field, read from the 2025-07-07 wayback capture of aa's now-deprecated model page","measured_date":null}}},{"id":"sonar-deep-research-1","display_name":"Sonar Deep Research","family_id":"sonar","vendor":"perplexity","status":"current","kind":"model","superseded_by":null,"release_date":"2025-03-07","intelligence_index":null,"coverage":null,"index_subset_bias":null,"params_total_b":null,"params_active_b":null,"vram_est":null,"vram_frontier":null,"fits_on":null,"is_moe":false,"is_open_weights":false,"context_window_tok":128000,"pricing":{"prompt_usd_per_m":2,"completion_usd_per_m":8,"blended_usd_per_m":3.5},"scores":{"hle":{"raw":21.1,"norm":28.09,"trust":1,"source_url":"https://www.perplexity.ai/hub/blog/introducing-perplexity-deep-research","config":"accuracy, figure published for perplexity deep research mode on the 2025-02-14 product launch page — perplexity does not restate it for the sonar-deep-research api model","measured_date":"2025-02-14"}}},{"id":"wizardlm-2-8x22b","display_name":"WizardLM-2 8x22B","family_id":"wizardlm","vendor":"microsoft","status":"current","kind":"model","superseded_by":null,"release_date":"2024-04-16","intelligence_index":null,"coverage":null,"index_subset_bias":null,"params_total_b":null,"params_active_b":null,"vram_est":null,"vram_frontier":null,"fits_on":null,"is_moe":true,"is_open_weights":true,"context_window_tok":65535,"pricing":{"prompt_usd_per_m":0.62,"completion_usd_per_m":0.62,"blended_usd_per_m":0.62},"scores":{"gpqa_diamond":{"raw":17.56,"norm":0,"trust":3,"source_url":"https://huggingface.co/alpindale/WizardLM-2-8x22B","config":"0-shot, open llm leaderboard v2 normalized accuracy","measured_date":null},"mmlu_pro":{"raw":39.96,"norm":0,"trust":3,"source_url":"https://huggingface.co/alpindale/WizardLM-2-8x22B","config":"5-shot, open llm leaderboard v2","measured_date":null}}}]}}