{"data":[{"id":"aa_agentic_index","display_name":"Artificial Analysis Agentic Index","category":"composite","unit":"index","scale_min":0,"scale_max":100,"higher_better":true,"weight_in_composite":0,"status":"core","origin":"seed","first_seen_run_id":null,"active":true,"notes":"AA sub-index (Agents). Weight 0 by design (brief) — same rationale as aa_coding_index.","models_covered":93},{"id":"aa_briefcase","display_name":"AA-Briefcase","category":"other","unit":"elo","scale_min":null,"scale_max":null,"higher_better":true,"weight_in_composite":0,"status":"provisional","origin":"auto","first_seen_run_id":"run_553b3da274594398a3713bcb7b3afa2d","active":true,"notes":null,"models_covered":2},{"id":"aa_coding_agent_index","display_name":"AA Coding Agent Index","category":"other","unit":"index","scale_min":null,"scale_max":null,"higher_better":true,"weight_in_composite":0,"status":"provisional","origin":"auto","first_seen_run_id":"run_5a7b2bf97fed4a3cb01efdb8d503d9b4","active":true,"notes":null,"models_covered":1},{"id":"aa_coding_index","display_name":"Artificial Analysis Coding Index","category":"composite","unit":"index","scale_min":0,"scale_max":100,"higher_better":true,"weight_in_composite":0,"status":"core","origin":"seed","first_seen_run_id":null,"active":true,"notes":"AA sub-index (Coding). Weight 0 by design (brief) — aa_intelligence_index alone represents the AA family in the composite; this row exists so the OpenRouter lane has a target to ingest into from day one without dropping the value.","models_covered":110},{"id":"aa_intelligence_index","display_name":"Artificial Analysis Intelligence Index","category":"composite","unit":"index","scale_min":0,"scale_max":100,"higher_better":true,"weight_in_composite":0,"status":"core","origin":"seed","first_seen_run_id":null,"active":true,"notes":"AA's flagship composite (v4.1.1, 9 evals/4 categories), arrives via OpenRouter's embedded benchmarks.artificial_analysis field (source_type=aggregator, trust 2) per 09-A1 — do not build a direct AA API connector this phase (redistribution licensing gate, R8a §1). 4 of the 9 sub-evals (GDPval-AA, CritPt, SciCode, AA-LCR) are AA-proprietary/closed-methodology (R8a §1.17) — lower independent-reproducibility, still trust 2 as an aggregate.","models_covered":97},{"id":"aa_lcr","display_name":"AA-LCR","category":"other","unit":"percent","scale_min":null,"scale_max":null,"higher_better":true,"weight_in_composite":0,"status":"provisional","origin":"auto","first_seen_run_id":"run_f7be5cdfc6ed41c99f63660105f869ce","active":true,"notes":null,"models_covered":3},{"id":"aa_omniscience","display_name":"AA-Omniscience","category":"other","unit":"percent","scale_min":null,"scale_max":null,"higher_better":true,"weight_in_composite":0,"status":"provisional","origin":"auto","first_seen_run_id":"run_a60ebb3a51fe482db14bf1479d4f70ec","active":true,"notes":null,"models_covered":2},{"id":"aa_omniscience_accuracy","display_name":"AA-Omniscience Accuracy","category":"other","unit":"percent","scale_min":null,"scale_max":null,"higher_better":true,"weight_in_composite":0,"status":"provisional","origin":"auto","first_seen_run_id":"run_2e5a562a40d64392a3a803438b1da5c3","active":true,"notes":null,"models_covered":1},{"id":"aa_omniscience_hallucination_rate","display_name":"AA-Omniscience Hallucination Rate","category":"other","unit":"percent","scale_min":null,"scale_max":null,"higher_better":true,"weight_in_composite":0,"status":"provisional","origin":"auto","first_seen_run_id":"run_553b3da274594398a3713bcb7b3afa2d","active":true,"notes":null,"models_covered":1},{"id":"aa_omniscience_non_hallucination","display_name":"AA-Omniscience Non-Hallucination","category":"other","unit":"percent","scale_min":null,"scale_max":null,"higher_better":true,"weight_in_composite":0,"status":"provisional","origin":"auto","first_seen_run_id":"run_2e5a562a40d64392a3a803438b1da5c3","active":true,"notes":null,"models_covered":1},{"id":"agents_last_exam","display_name":"Agents' Last Exam","category":"other","unit":"percent","scale_min":null,"scale_max":null,"higher_better":true,"weight_in_composite":0,"status":"provisional","origin":"auto","first_seen_run_id":"run_acf3136ad9694471b137d965b747a7f6","active":true,"notes":null,"models_covered":3},{"id":"aider_polyglot","display_name":"Aider-Polyglot","category":"other","unit":"percent","scale_min":null,"scale_max":null,"higher_better":true,"weight_in_composite":0,"status":"provisional","origin":"auto","first_seen_run_id":"run_97c943d2c5ee4107a9a57d2adea4a5ad","active":true,"notes":null,"models_covered":2},{"id":"aime","display_name":"AIME (annual)","category":"math","unit":"percent","scale_min":20,"scale_max":100,"higher_better":true,"weight_in_composite":0.0735,"status":"core","origin":"seed","first_seen_run_id":null,"active":true,"notes":"Year-parameterized family (aime-2025, aime-2026, ...) — capture edition/year in score_config, not a new benchmark id, per R8a §5b. Small-N (30 problems/year) -> wide CI, single-problem swing ~3.3pts. Near-saturating within ~1yr of each new edition.","models_covered":22},{"id":"alpacaeval_2_0","display_name":"AlpacaEval 2.0","category":"other","unit":"percent","scale_min":null,"scale_max":null,"higher_better":true,"weight_in_composite":0,"status":"provisional","origin":"auto","first_seen_run_id":"run_97c943d2c5ee4107a9a57d2adea4a5ad","active":true,"notes":null,"models_covered":1},{"id":"androidbench","display_name":"AndroidBench","category":"other","unit":"percent","scale_min":null,"scale_max":null,"higher_better":true,"weight_in_composite":0,"status":"provisional","origin":"auto","first_seen_run_id":"run_6028ac39c0fb4d9a90025f0eba1e265f","active":true,"notes":null,"models_covered":1},{"id":"apex_agents","display_name":"APEX-Agents","category":"other","unit":"percent","scale_min":null,"scale_max":null,"higher_better":true,"weight_in_composite":0,"status":"provisional","origin":"auto","first_seen_run_id":"run_25639cafaa534a87b7332e203f141975","active":true,"notes":null,"models_covered":3},{"id":"apex_swe","display_name":"APEX-SWE","category":"other","unit":"percent","scale_min":null,"scale_max":null,"higher_better":true,"weight_in_composite":0,"status":"provisional","origin":"auto","first_seen_run_id":"run_c666bf86747f4194a293ae4cb54a1df1","active":true,"notes":null,"models_covered":1},{"id":"arc_agi_1","display_name":"ARC-AGI-1","category":"other","unit":"percent","scale_min":null,"scale_max":null,"higher_better":true,"weight_in_composite":0,"status":"provisional","origin":"auto","first_seen_run_id":"run_d5e2006f4e3e4803b6aa364787492ff0","active":true,"notes":null,"models_covered":3},{"id":"arc_agi_2","display_name":"ARC-AGI-2","category":"reasoning","unit":"percent","scale_min":5,"scale_max":95,"higher_better":true,"weight_in_composite":0.0735,"status":"core","origin":"seed","first_seen_run_id":null,"active":true,"notes":"Held-out visual/abstract-reasoning grid puzzles. Cost/compute-budget is a load-bearing paired axis (R8a §1.9) — same model can swing 31%/$0.81 to 54%/$31 by inference-time spend; score without cost context is misleading.","models_covered":26},{"id":"arc_agi_3","display_name":"ARC-AGI-3","category":"other","unit":"percent","scale_min":null,"scale_max":null,"higher_better":true,"weight_in_composite":0,"status":"provisional","origin":"auto","first_seen_run_id":"run_553b3da274594398a3713bcb7b3afa2d","active":true,"notes":null,"models_covered":3},{"id":"arc_challenge","display_name":"ARC-Challenge","category":"other","unit":"percent","scale_min":null,"scale_max":null,"higher_better":true,"weight_in_composite":0,"status":"provisional","origin":"auto","first_seen_run_id":"run_9c1fc86de31b467badcaeb6b68cb1153","active":true,"notes":null,"models_covered":1},{"id":"arena_elo","display_name":"LMArena / Arena Elo","category":"composite","unit":"elo","scale_min":1366.95,"scale_max":1501.77,"higher_better":true,"weight_in_composite":0.0735,"status":"core","origin":"seed","first_seen_run_id":null,"active":true,"notes":"Human pairwise-preference Elo, live/continuously updated (lmarena.ai rebranded arena.ai Jan 2026). R8a flags this as a preference signal, not a capability signal — top-of-board differences are frequently statistical noise (overlapping CIs); weight kept per spec 07's locked composite table, retained here rather than overridden, but treat rank deltas <~30 Elo as noise.","models_covered":95},{"id":"arena_elo_document","display_name":"Arena Elo document","category":"other","unit":"elo","scale_min":null,"scale_max":null,"higher_better":true,"weight_in_composite":0,"status":"provisional","origin":"auto","first_seen_run_id":"run_68998df3bf3f44729cc6558681a176bf","active":true,"notes":null,"models_covered":24},{"id":"arena_elo_image_to_webdev","display_name":"Arena Elo image_to_webdev","category":"other","unit":"elo","scale_min":null,"scale_max":null,"higher_better":true,"weight_in_composite":0,"status":"provisional","origin":"auto","first_seen_run_id":"run_68998df3bf3f44729cc6558681a176bf","active":true,"notes":null,"models_covered":23},{"id":"arena_elo_search","display_name":"Arena Elo search","category":"other","unit":"elo","scale_min":null,"scale_max":null,"higher_better":true,"weight_in_composite":0,"status":"provisional","origin":"auto","first_seen_run_id":"run_68998df3bf3f44729cc6558681a176bf","active":true,"notes":null,"models_covered":4},{"id":"arena_elo_vision","display_name":"Arena Elo vision","category":"other","unit":"elo","scale_min":null,"scale_max":null,"higher_better":true,"weight_in_composite":0,"status":"provisional","origin":"auto","first_seen_run_id":"run_68998df3bf3f44729cc6558681a176bf","active":true,"notes":null,"models_covered":58},{"id":"arena_elo_webdev","display_name":"Arena Elo webdev","category":"other","unit":"elo","scale_min":null,"scale_max":null,"higher_better":true,"weight_in_composite":0,"status":"provisional","origin":"auto","first_seen_run_id":"run_68998df3bf3f44729cc6558681a176bf","active":true,"notes":null,"models_covered":57},{"id":"arena_hard_v2","display_name":"Arena-Hard v2","category":"other","unit":"percent","scale_min":null,"scale_max":null,"higher_better":true,"weight_in_composite":0,"status":"provisional","origin":"auto","first_seen_run_id":"run_c157934da2b1494e95383b8c151c338e","active":true,"notes":null,"models_covered":1},{"id":"arenahard","display_name":"ArenaHard","category":"other","unit":"elo","scale_min":null,"scale_max":null,"higher_better":true,"weight_in_composite":0,"status":"provisional","origin":"auto","first_seen_run_id":"run_97c943d2c5ee4107a9a57d2adea4a5ad","active":true,"notes":null,"models_covered":0},{"id":"artificial_analysis_coding_agent_index","display_name":"Artificial Analysis Coding Agent Index","category":"other","unit":"index","scale_min":null,"scale_max":null,"higher_better":true,"weight_in_composite":0,"status":"provisional","origin":"auto","first_seen_run_id":"run_acf3136ad9694471b137d965b747a7f6","active":true,"notes":null,"models_covered":2},{"id":"autobench","display_name":"AutoBench","category":"other","unit":"percent","scale_min":null,"scale_max":null,"higher_better":true,"weight_in_composite":0,"status":"provisional","origin":"auto","first_seen_run_id":"run_a79d8f61dd56498990b7266ec18cfb4b","active":true,"notes":null,"models_covered":1},{"id":"automation_bench","display_name":"Automation-Bench","category":"other","unit":"percent","scale_min":null,"scale_max":null,"higher_better":true,"weight_in_composite":0,"status":"provisional","origin":"auto","first_seen_run_id":"run_6028ac39c0fb4d9a90025f0eba1e265f","active":true,"notes":null,"models_covered":1},{"id":"bfcl","display_name":"BFCL","category":"other","unit":"percent","scale_min":null,"scale_max":null,"higher_better":true,"weight_in_composite":0,"status":"provisional","origin":"auto","first_seen_run_id":"run_9c1fc86de31b467badcaeb6b68cb1153","active":true,"notes":null,"models_covered":2},{"id":"bfcl_v2","display_name":"BFCL v2","category":"other","unit":"percent","scale_min":null,"scale_max":null,"higher_better":true,"weight_in_composite":0,"status":"provisional","origin":"auto","first_seen_run_id":"run_282bf64514de478b9fde1d211282288c","active":true,"notes":null,"models_covered":1},{"id":"bixbench","display_name":"BixBench","category":"other","unit":"percent","scale_min":null,"scale_max":null,"higher_better":true,"weight_in_composite":0,"status":"provisional","origin":"auto","first_seen_run_id":"run_131a8a1728b44785bf474e46e254b8be","active":true,"notes":null,"models_covered":1},{"id":"blueprint_bench_2","display_name":"Blueprint-Bench 2","category":"other","unit":"percent","scale_min":null,"scale_max":null,"higher_better":true,"weight_in_composite":0,"status":"provisional","origin":"auto","first_seen_run_id":"run_a60ebb3a51fe482db14bf1479d4f70ec","active":true,"notes":null,"models_covered":1},{"id":"browsecomp","display_name":"BrowseComp","category":"other","unit":"percent","scale_min":null,"scale_max":null,"higher_better":true,"weight_in_composite":0,"status":"provisional","origin":"auto","first_seen_run_id":"run_25639cafaa534a87b7332e203f141975","active":true,"notes":null,"models_covered":16},{"id":"browsecomp_zh","display_name":"BrowseComp-ZH","category":"other","unit":"percent","scale_min":null,"scale_max":null,"higher_better":true,"weight_in_composite":0,"status":"provisional","origin":"auto","first_seen_run_id":"run_bf713be07f1c4f6781df4a9b64ce09c5","active":true,"notes":null,"models_covered":1},{"id":"chartqa","display_name":"ChartQA","category":"other","unit":"percent","scale_min":null,"scale_max":null,"higher_better":true,"weight_in_composite":0,"status":"provisional","origin":"auto","first_seen_run_id":"run_4eaa68da41964b1f84786f0dd048a38a","active":true,"notes":null,"models_covered":2},{"id":"charxiv","display_name":"CharXiv","category":"other","unit":"percent","scale_min":null,"scale_max":null,"higher_better":true,"weight_in_composite":0,"status":"provisional","origin":"auto","first_seen_run_id":"run_d96417a9afb74afd8322737c2b9940c9","active":true,"notes":null,"models_covered":1},{"id":"charxiv_reasoning","display_name":"CharXiv Reasoning","category":"other","unit":"percent","scale_min":null,"scale_max":null,"higher_better":true,"weight_in_composite":0,"status":"provisional","origin":"auto","first_seen_run_id":"run_5f55387d72cd481ebb4a7dc5d6f940e5","active":true,"notes":null,"models_covered":3},{"id":"code_arena","display_name":"Code Arena","category":"other","unit":"elo","scale_min":null,"scale_max":null,"higher_better":true,"weight_in_composite":0,"status":"provisional","origin":"auto","first_seen_run_id":"run_5f55387d72cd481ebb4a7dc5d6f940e5","active":true,"notes":null,"models_covered":1},{"id":"codeforces_elo","display_name":"Codeforces Elo (LLM, human scale)","category":"code","unit":"elo","scale_min":800,"scale_max":2500,"higher_better":true,"weight_in_composite":0,"status":"core","origin":"seed","first_seen_run_id":null,"active":true,"notes":"Keep strictly on the human Codeforces Elo scale (800-3800 human range). Do NOT merge with 0-1-normalized \"Codeforces\" variants seen on some trackers (R8a §1.15) — incompatible units despite the shared name.","models_covered":2},{"id":"coworkbench","display_name":"CoWorkBench","category":"other","unit":"percent","scale_min":null,"scale_max":null,"higher_better":true,"weight_in_composite":0,"status":"provisional","origin":"auto","first_seen_run_id":"run_6028ac39c0fb4d9a90025f0eba1e265f","active":true,"notes":null,"models_covered":1},{"id":"critpt","display_name":"CritPt","category":"other","unit":"percent","scale_min":null,"scale_max":null,"higher_better":true,"weight_in_composite":0,"status":"provisional","origin":"auto","first_seen_run_id":"run_aff8de7dba644d48940dfb9eb3d32d96","active":true,"notes":null,"models_covered":1},{"id":"cursorbench","display_name":"CursorBench","category":"other","unit":"percent","scale_min":null,"scale_max":null,"higher_better":true,"weight_in_composite":0,"status":"provisional","origin":"auto","first_seen_run_id":"run_a927f856add64bd994092110b766a8f2","active":true,"notes":null,"models_covered":1},{"id":"cursorbench_v3_2","display_name":"CursorBench v3.2","category":"other","unit":"percent","scale_min":null,"scale_max":null,"higher_better":true,"weight_in_composite":0,"status":"provisional","origin":"auto","first_seen_run_id":"run_c666bf86747f4194a293ae4cb54a1df1","active":true,"notes":null,"models_covered":1},{"id":"cybergym","display_name":"CyberGym","category":"other","unit":"percent","scale_min":null,"scale_max":null,"higher_better":true,"weight_in_composite":0,"status":"provisional","origin":"auto","first_seen_run_id":"run_bf713be07f1c4f6781df4a9b64ce09c5","active":true,"notes":null,"models_covered":2},{"id":"deepswe","display_name":"DeepSWE","category":"other","unit":"percent","scale_min":null,"scale_max":null,"higher_better":true,"weight_in_composite":0,"status":"provisional","origin":"auto","first_seen_run_id":"run_aff8de7dba644d48940dfb9eb3d32d96","active":true,"notes":null,"models_covered":5},{"id":"deepswe_1_0","display_name":"DeepSWE 1.0","category":"other","unit":"percent","scale_min":null,"scale_max":null,"higher_better":true,"weight_in_composite":0,"status":"provisional","origin":"auto","first_seen_run_id":"run_474270a493514b6589ef766381031e54","active":true,"notes":null,"models_covered":1},{"id":"deepswe_1_1","display_name":"DeepSWE 1.1","category":"other","unit":"percent","scale_min":null,"scale_max":null,"higher_better":true,"weight_in_composite":0,"status":"provisional","origin":"auto","first_seen_run_id":"run_6028ac39c0fb4d9a90025f0eba1e265f","active":true,"notes":null,"models_covered":2},{"id":"deepswe_v1_1","display_name":"DeepSWE v1.1","category":"other","unit":"percent","scale_min":null,"scale_max":null,"higher_better":true,"weight_in_composite":0,"status":"provisional","origin":"auto","first_seen_run_id":"run_5f55387d72cd481ebb4a7dc5d6f940e5","active":true,"notes":null,"models_covered":4},{"id":"design_arena_3d","display_name":"design_arena_3d","category":"other","unit":"elo","scale_min":null,"scale_max":null,"higher_better":true,"weight_in_composite":0,"status":"provisional","origin":"auto","first_seen_run_id":"run_68998df3bf3f44729cc6558681a176bf","active":true,"notes":null,"models_covered":90},{"id":"design_arena_agenticgamedev","display_name":"design_arena_agenticgamedev","category":"other","unit":"elo","scale_min":null,"scale_max":null,"higher_better":true,"weight_in_composite":0,"status":"provisional","origin":"auto","first_seen_run_id":"run_68998df3bf3f44729cc6558681a176bf","active":true,"notes":null,"models_covered":19},{"id":"design_arena_agentichtmlslides","display_name":"design_arena_agentichtmlslides","category":"other","unit":"elo","scale_min":null,"scale_max":null,"higher_better":true,"weight_in_composite":0,"status":"provisional","origin":"auto","first_seen_run_id":"run_68998df3bf3f44729cc6558681a176bf","active":true,"notes":null,"models_covered":10},{"id":"design_arena_agenticslides","display_name":"design_arena_agenticslides","category":"other","unit":"elo","scale_min":null,"scale_max":null,"higher_better":true,"weight_in_composite":0,"status":"provisional","origin":"auto","first_seen_run_id":"run_68998df3bf3f44729cc6558681a176bf","active":true,"notes":null,"models_covered":10},{"id":"design_arena_androidnative","display_name":"design_arena_androidnative","category":"other","unit":"elo","scale_min":null,"scale_max":null,"higher_better":true,"weight_in_composite":0,"status":"provisional","origin":"auto","first_seen_run_id":"run_68998df3bf3f44729cc6558681a176bf","active":true,"notes":null,"models_covered":35},{"id":"design_arena_asciiart","display_name":"design_arena_asciiart","category":"other","unit":"elo","scale_min":null,"scale_max":null,"higher_better":true,"weight_in_composite":0,"status":"provisional","origin":"auto","first_seen_run_id":"run_68998df3bf3f44729cc6558681a176bf","active":true,"notes":null,"models_covered":50},{"id":"design_arena_codecategories","display_name":"design_arena_codecategories","category":"other","unit":"elo","scale_min":null,"scale_max":null,"higher_better":true,"weight_in_composite":0,"status":"provisional","origin":"auto","first_seen_run_id":"run_68998df3bf3f44729cc6558681a176bf","active":true,"notes":null,"models_covered":98},{"id":"design_arena_dataviz","display_name":"design_arena_dataviz","category":"other","unit":"elo","scale_min":null,"scale_max":null,"higher_better":true,"weight_in_composite":0,"status":"provisional","origin":"auto","first_seen_run_id":"run_68998df3bf3f44729cc6558681a176bf","active":true,"notes":null,"models_covered":96},{"id":"design_arena_fullstack","display_name":"design_arena_fullstack","category":"other","unit":"elo","scale_min":null,"scale_max":null,"higher_better":true,"weight_in_composite":0,"status":"provisional","origin":"auto","first_seen_run_id":"run_68998df3bf3f44729cc6558681a176bf","active":true,"notes":null,"models_covered":38},{"id":"design_arena_gamedev","display_name":"design_arena_gamedev","category":"other","unit":"elo","scale_min":null,"scale_max":null,"higher_better":true,"weight_in_composite":0,"status":"provisional","origin":"auto","first_seen_run_id":"run_68998df3bf3f44729cc6558681a176bf","active":true,"notes":null,"models_covered":97},{"id":"design_arena_godotgamedev","display_name":"design_arena_godotgamedev","category":"other","unit":"elo","scale_min":null,"scale_max":null,"higher_better":true,"weight_in_composite":0,"status":"provisional","origin":"auto","first_seen_run_id":"run_68998df3bf3f44729cc6558681a176bf","active":true,"notes":null,"models_covered":29},{"id":"design_arena_graphicdesign","display_name":"design_arena_graphicdesign","category":"other","unit":"elo","scale_min":null,"scale_max":null,"higher_better":true,"weight_in_composite":0,"status":"provisional","origin":"auto","first_seen_run_id":"run_68998df3bf3f44729cc6558681a176bf","active":true,"notes":null,"models_covered":5},{"id":"design_arena_htmlslides","display_name":"design_arena_htmlslides","category":"other","unit":"elo","scale_min":null,"scale_max":null,"higher_better":true,"weight_in_composite":0,"status":"provisional","origin":"auto","first_seen_run_id":"run_68998df3bf3f44729cc6558681a176bf","active":true,"notes":null,"models_covered":21},{"id":"design_arena_image","display_name":"design_arena_image","category":"other","unit":"elo","scale_min":null,"scale_max":null,"higher_better":true,"weight_in_composite":0,"status":"provisional","origin":"auto","first_seen_run_id":"run_68998df3bf3f44729cc6558681a176bf","active":true,"notes":null,"models_covered":5},{"id":"design_arena_imageediting","display_name":"design_arena_imageediting","category":"other","unit":"elo","scale_min":null,"scale_max":null,"higher_better":true,"weight_in_composite":0,"status":"provisional","origin":"auto","first_seen_run_id":"run_68998df3bf3f44729cc6558681a176bf","active":true,"notes":null,"models_covered":1},{"id":"design_arena_logo","display_name":"design_arena_logo","category":"other","unit":"elo","scale_min":null,"scale_max":null,"higher_better":true,"weight_in_composite":0,"status":"provisional","origin":"auto","first_seen_run_id":"run_68998df3bf3f44729cc6558681a176bf","active":true,"notes":null,"models_covered":5},{"id":"design_arena_mobileapps","display_name":"design_arena_mobileapps","category":"other","unit":"elo","scale_min":null,"scale_max":null,"higher_better":true,"weight_in_composite":0,"status":"provisional","origin":"auto","first_seen_run_id":"run_68998df3bf3f44729cc6558681a176bf","active":true,"notes":null,"models_covered":35},{"id":"design_arena_pptxslides","display_name":"design_arena_pptxslides","category":"other","unit":"elo","scale_min":null,"scale_max":null,"higher_better":true,"weight_in_composite":0,"status":"provisional","origin":"auto","first_seen_run_id":"run_68998df3bf3f44729cc6558681a176bf","active":true,"notes":null,"models_covered":9},{"id":"design_arena_python_pptxslides","display_name":"design_arena_python-pptxslides","category":"other","unit":"elo","scale_min":null,"scale_max":null,"higher_better":true,"weight_in_composite":0,"status":"provisional","origin":"auto","first_seen_run_id":"run_68998df3bf3f44729cc6558681a176bf","active":true,"notes":null,"models_covered":22},{"id":"design_arena_svg","display_name":"design_arena_svg","category":"other","unit":"elo","scale_min":null,"scale_max":null,"higher_better":true,"weight_in_composite":0,"status":"provisional","origin":"auto","first_seen_run_id":"run_68998df3bf3f44729cc6558681a176bf","active":true,"notes":null,"models_covered":66},{"id":"design_arena_uicomponent","display_name":"design_arena_uicomponent","category":"other","unit":"elo","scale_min":null,"scale_max":null,"higher_better":true,"weight_in_composite":0,"status":"provisional","origin":"auto","first_seen_run_id":"run_68998df3bf3f44729cc6558681a176bf","active":true,"notes":null,"models_covered":94},{"id":"design_arena_webapps","display_name":"design_arena_webapps","category":"other","unit":"elo","scale_min":null,"scale_max":null,"higher_better":true,"weight_in_composite":0,"status":"provisional","origin":"auto","first_seen_run_id":"run_68998df3bf3f44729cc6558681a176bf","active":true,"notes":null,"models_covered":37},{"id":"design_arena_website","display_name":"design_arena_website","category":"other","unit":"elo","scale_min":null,"scale_max":null,"higher_better":true,"weight_in_composite":0,"status":"provisional","origin":"auto","first_seen_run_id":"run_68998df3bf3f44729cc6558681a176bf","active":true,"notes":null,"models_covered":104},{"id":"docvqa","display_name":"DocVQA","category":"other","unit":"percent","scale_min":null,"scale_max":null,"higher_better":true,"weight_in_composite":0,"status":"provisional","origin":"auto","first_seen_run_id":"run_4eaa68da41964b1f84786f0dd048a38a","active":true,"notes":null,"models_covered":2},{"id":"drop","display_name":"DROP","category":"other","unit":"percent","scale_min":null,"scale_max":null,"higher_better":true,"weight_in_composite":0,"status":"provisional","origin":"auto","first_seen_run_id":"run_b117e42664ba451c8a56cc67a74071b4","active":true,"notes":null,"models_covered":1},{"id":"expert_swe","display_name":"Expert-SWE","category":"other","unit":"percent","scale_min":null,"scale_max":null,"higher_better":true,"weight_in_composite":0,"status":"provisional","origin":"auto","first_seen_run_id":"run_131a8a1728b44785bf474e46e254b8be","active":true,"notes":null,"models_covered":1},{"id":"finance_agent","display_name":"Finance Agent","category":"other","unit":"percent","scale_min":null,"scale_max":null,"higher_better":true,"weight_in_composite":0,"status":"provisional","origin":"auto","first_seen_run_id":"run_4c932a77cb624e88b1eb83c143534b88","active":true,"notes":null,"models_covered":1},{"id":"finance_agent_v2","display_name":"Finance Agent v2","category":"other","unit":"percent","scale_min":null,"scale_max":null,"higher_better":true,"weight_in_composite":0,"status":"provisional","origin":"auto","first_seen_run_id":"run_6d1eabd36ecb488885533ee2704804da","active":true,"notes":null,"models_covered":1},{"id":"frontier_bench_v0_1","display_name":"Frontier-Bench v0.1","category":"other","unit":"percent","scale_min":null,"scale_max":null,"higher_better":true,"weight_in_composite":0,"status":"provisional","origin":"auto","first_seen_run_id":"run_553b3da274594398a3713bcb7b3afa2d","active":true,"notes":null,"models_covered":1},{"id":"frontiercode_1_1_main","display_name":"FrontierCode 1.1 Main","category":"other","unit":"percent","scale_min":null,"scale_max":null,"higher_better":true,"weight_in_composite":0,"status":"provisional","origin":"auto","first_seen_run_id":"run_5f55387d72cd481ebb4a7dc5d6f940e5","active":true,"notes":null,"models_covered":1},{"id":"frontiercode_v1_1_extended","display_name":"FrontierCode v1.1 (Extended)","category":"other","unit":"percent","scale_min":null,"scale_max":null,"higher_better":true,"weight_in_composite":0,"status":"provisional","origin":"auto","first_seen_run_id":"run_c666bf86747f4194a293ae4cb54a1df1","active":true,"notes":null,"models_covered":1},{"id":"frontiermath","display_name":"FrontierMath","category":"math","unit":"percent","scale_min":0,"scale_max":55,"higher_better":true,"weight_in_composite":0,"status":"core","origin":"seed","first_seen_run_id":null,"active":true,"notes":"Epoch AI, 4 tiers (Tier 4 = research-level). v2 (Jun 12 2026) corrected 42% of v1 problems — pre-v2 scores are on a different, partly-erroneous problem set, not directly comparable to post-v2. Also note disclosed Epoch/OpenAI funding relationship as a provenance caveat (R8a §1.14, §2.5).","models_covered":1},{"id":"frontiermath_tiers_1_3","display_name":"FrontierMath Tiers 1-3","category":"other","unit":"percent","scale_min":null,"scale_max":null,"higher_better":true,"weight_in_composite":0,"status":"provisional","origin":"auto","first_seen_run_id":"run_131a8a1728b44785bf474e46e254b8be","active":true,"notes":null,"models_covered":1},{"id":"frontierswe","display_name":"FrontierSWE","category":"other","unit":"percent","scale_min":null,"scale_max":null,"higher_better":true,"weight_in_composite":0,"status":"provisional","origin":"auto","first_seen_run_id":"run_6028ac39c0fb4d9a90025f0eba1e265f","active":true,"notes":null,"models_covered":3},{"id":"gdm_mrcr_v2","display_name":"GDM-MRCR v2","category":"other","unit":"percent","scale_min":null,"scale_max":null,"higher_better":true,"weight_in_composite":0,"status":"provisional","origin":"auto","first_seen_run_id":"run_6c3d8d40b1334e50b419a6d5f5788334","active":true,"notes":null,"models_covered":1},{"id":"gdm_mrcr_v2_8_needle","display_name":"GDM-MRCR v2 (8-needle)","category":"other","unit":"percent","scale_min":null,"scale_max":null,"higher_better":true,"weight_in_composite":0,"status":"provisional","origin":"auto","first_seen_run_id":"run_5f55387d72cd481ebb4a7dc5d6f940e5","active":true,"notes":null,"models_covered":1},{"id":"gdpval","display_name":"GDPval","category":"other","unit":"percent","scale_min":null,"scale_max":null,"higher_better":true,"weight_in_composite":0,"status":"provisional","origin":"auto","first_seen_run_id":"run_f7be5cdfc6ed41c99f63660105f869ce","active":true,"notes":null,"models_covered":2},{"id":"gdpval_aa","display_name":"GDPval-AA","category":"other","unit":"elo","scale_min":null,"scale_max":null,"higher_better":true,"weight_in_composite":0,"status":"provisional","origin":"auto","first_seen_run_id":"run_25639cafaa534a87b7332e203f141975","active":true,"notes":null,"models_covered":5},{"id":"gdpval_aa_v2","display_name":"GDPval-AA v2","category":"other","unit":"elo","scale_min":null,"scale_max":null,"higher_better":true,"weight_in_composite":0,"status":"provisional","origin":"auto","first_seen_run_id":"run_553b3da274594398a3713bcb7b3afa2d","active":true,"notes":null,"models_covered":7},{"id":"genebench_pro","display_name":"GeneBench Pro","category":"other","unit":"percent","scale_min":null,"scale_max":null,"higher_better":true,"weight_in_composite":0,"status":"provisional","origin":"auto","first_seen_run_id":"run_acf3136ad9694471b137d965b747a7f6","active":true,"notes":null,"models_covered":1},{"id":"global_mmlu_lite","display_name":"Global MMLU-Lite","category":"other","unit":"percent","scale_min":null,"scale_max":null,"higher_better":true,"weight_in_composite":0,"status":"provisional","origin":"auto","first_seen_run_id":"run_33d010562a42487e9578cf616dfeec53","active":true,"notes":null,"models_covered":1},{"id":"gpqa_diamond","display_name":"GPQA Diamond","category":"reasoning","unit":"percent","scale_min":25,"scale_max":96,"higher_better":true,"weight_in_composite":0.1471,"status":"core","origin":"seed","first_seen_run_id":null,"active":true,"notes":"PhD-level science MC, hardest curated subset. Near-saturated at frontier (Aug 2026 ~90-95%). Highest cross-source agreement of any benchmark in R8a.","models_covered":61},{"id":"gsm8k","display_name":"GSM8K","category":"other","unit":"percent","scale_min":null,"scale_max":null,"higher_better":true,"weight_in_composite":0,"status":"provisional","origin":"auto","first_seen_run_id":"run_9c1fc86de31b467badcaeb6b68cb1153","active":true,"notes":null,"models_covered":1},{"id":"harvey_lab_vals","display_name":"Harvey LAB (Vals)","category":"other","unit":"percent","scale_min":null,"scale_max":null,"higher_better":true,"weight_in_composite":0,"status":"provisional","origin":"auto","first_seen_run_id":"run_c666bf86747f4194a293ae4cb54a1df1","active":true,"notes":null,"models_covered":1},{"id":"healthbench","display_name":"HealthBench","category":"other","unit":"percent","scale_min":null,"scale_max":null,"higher_better":true,"weight_in_composite":0,"status":"provisional","origin":"auto","first_seen_run_id":"run_6028ac39c0fb4d9a90025f0eba1e265f","active":true,"notes":null,"models_covered":3},{"id":"healthbench_consensus","display_name":"HealthBench Consensus","category":"other","unit":"percent","scale_min":null,"scale_max":null,"higher_better":true,"weight_in_composite":0,"status":"provisional","origin":"auto","first_seen_run_id":"run_a8319c22a50e4818a64634d19511f43d","active":true,"notes":null,"models_covered":1},{"id":"healthbench_hard","display_name":"HealthBench Hard","category":"other","unit":"percent","scale_min":null,"scale_max":null,"higher_better":true,"weight_in_composite":0,"status":"provisional","origin":"auto","first_seen_run_id":"run_a8319c22a50e4818a64634d19511f43d","active":true,"notes":null,"models_covered":2},{"id":"healthbench_professional","display_name":"HealthBench Professional","category":"other","unit":"percent","scale_min":null,"scale_max":null,"higher_better":true,"weight_in_composite":0,"status":"provisional","origin":"auto","first_seen_run_id":"run_a8319c22a50e4818a64634d19511f43d","active":true,"notes":null,"models_covered":2},{"id":"hle","display_name":"Humanity's Last Exam","category":"reasoning","unit":"percent","scale_min":2,"scale_max":60,"higher_better":true,"weight_in_composite":0.1029,"status":"core","origin":"seed","first_seen_run_id":null,"active":true,"notes":"Confirm tools-on/off + text-only/multimodal variant before comparing scores (R8a §1.8) — AA/PricePerToken (~55%) vs Scale AI official (~35%) diverge sharply, likely different methodology variants, not the same measurement.","models_covered":52},{"id":"hle_verified","display_name":"HLE-Verified","category":"other","unit":"percent","scale_min":null,"scale_max":null,"higher_better":true,"weight_in_composite":0,"status":"provisional","origin":"auto","first_seen_run_id":"run_5f55387d72cd481ebb4a7dc5d6f940e5","active":true,"notes":null,"models_covered":1},{"id":"hle_with_tools","display_name":"HLE with tools","category":"other","unit":"percent","scale_min":null,"scale_max":null,"higher_better":true,"weight_in_composite":0,"status":"provisional","origin":"auto","first_seen_run_id":"run_b81290bb2ab64e88bf29b71d8ba48b7b","active":true,"notes":null,"models_covered":1},{"id":"hmmt","display_name":"HMMT","category":"other","unit":"percent","scale_min":null,"scale_max":null,"higher_better":true,"weight_in_composite":0,"status":"provisional","origin":"auto","first_seen_run_id":"run_bf713be07f1c4f6781df4a9b64ce09c5","active":true,"notes":null,"models_covered":1},{"id":"hmmt_2026_feb","display_name":"HMMT 2026 Feb","category":"other","unit":"percent","scale_min":null,"scale_max":null,"higher_better":true,"weight_in_composite":0,"status":"provisional","origin":"auto","first_seen_run_id":"run_652c7c2de97b4b489991fb719fa85b4a","active":true,"notes":null,"models_covered":3},{"id":"hmmt_feb_2025","display_name":"HMMT Feb 2025","category":"other","unit":"percent","scale_min":null,"scale_max":null,"higher_better":true,"weight_in_composite":0,"status":"provisional","origin":"auto","first_seen_run_id":"run_195871e76b544cee9e330f942e1e8051","active":true,"notes":null,"models_covered":1},{"id":"hmmt_feb_2026","display_name":"HMMT Feb 2026","category":"other","unit":"percent","scale_min":null,"scale_max":null,"higher_better":true,"weight_in_composite":0,"status":"provisional","origin":"auto","first_seen_run_id":"run_aff8de7dba644d48940dfb9eb3d32d96","active":true,"notes":null,"models_covered":1},{"id":"hmmt_nov_2025","display_name":"HMMT Nov 2025","category":"other","unit":"percent","scale_min":null,"scale_max":null,"higher_better":true,"weight_in_composite":0,"status":"provisional","origin":"auto","first_seen_run_id":"run_aff8de7dba644d48940dfb9eb3d32d96","active":true,"notes":null,"models_covered":1},{"id":"humaneval","display_name":"HumanEval","category":"other","unit":"percent","scale_min":null,"scale_max":null,"higher_better":true,"weight_in_composite":0,"status":"provisional","origin":"auto","first_seen_run_id":"run_9c1fc86de31b467badcaeb6b68cb1153","active":true,"notes":null,"models_covered":3},{"id":"humanitys_last_exam_with_tools","display_name":"Humanity's Last Exam (with tools)","category":"other","unit":"percent","scale_min":null,"scale_max":null,"higher_better":true,"weight_in_composite":0,"status":"provisional","origin":"auto","first_seen_run_id":"run_652c7c2de97b4b489991fb719fa85b4a","active":true,"notes":null,"models_covered":1},{"id":"ifbench","display_name":"IFBench","category":"other","unit":"percent","scale_min":null,"scale_max":null,"higher_better":true,"weight_in_composite":0,"status":"provisional","origin":"auto","first_seen_run_id":"run_6028ac39c0fb4d9a90025f0eba1e265f","active":true,"notes":null,"models_covered":4},{"id":"ifeval","display_name":"IFEval","category":"other","unit":"percent","scale_min":null,"scale_max":null,"higher_better":true,"weight_in_composite":0,"status":"provisional","origin":"auto","first_seen_run_id":"run_9c1fc86de31b467badcaeb6b68cb1153","active":true,"notes":null,"models_covered":4},{"id":"imo_answerbench","display_name":"IMO-AnswerBench","category":"other","unit":"percent","scale_min":null,"scale_max":null,"higher_better":true,"weight_in_composite":0,"status":"provisional","origin":"auto","first_seen_run_id":"run_652c7c2de97b4b489991fb719fa85b4a","active":true,"notes":null,"models_covered":1},{"id":"imoanswerbench","display_name":"IMOAnswerBench","category":"other","unit":"percent","scale_min":null,"scale_max":null,"higher_better":true,"weight_in_composite":0,"status":"provisional","origin":"auto","first_seen_run_id":"run_bf713be07f1c4f6781df4a9b64ce09c5","active":true,"notes":null,"models_covered":2},{"id":"jobbench","display_name":"JobBench","category":"other","unit":"percent","scale_min":null,"scale_max":null,"higher_better":true,"weight_in_composite":0,"status":"provisional","origin":"auto","first_seen_run_id":"run_6028ac39c0fb4d9a90025f0eba1e265f","active":true,"notes":null,"models_covered":1},{"id":"kernelbench_hard","display_name":"KernelBench Hard","category":"other","unit":"percent","scale_min":null,"scale_max":null,"higher_better":true,"weight_in_composite":0,"status":"provisional","origin":"auto","first_seen_run_id":"run_f8e2332c4c034edba09fea1b7882b8b5","active":true,"notes":null,"models_covered":1},{"id":"livebench","display_name":"LiveBench","category":"composite","unit":"index","scale_min":40,"scale_max":85,"higher_better":true,"weight_in_composite":0.1103,"status":"core","origin":"seed","first_seen_run_id":null,"active":true,"notes":"Contamination-resistant (fresh Qs, objective auto-scoring, no LLM-judge). Trust canonical livebench.ai only (trust 3) — third-party mirrors (e.g. BenchLM.ai) diverge meaningfully (R8a §1.5, §2.2).","models_covered":25},{"id":"livecodebench","display_name":"LiveCodeBench v6","category":"other","unit":"percent","scale_min":null,"scale_max":null,"higher_better":true,"weight_in_composite":0,"status":"provisional","origin":"auto","first_seen_run_id":"run_15dad7768a114aca88498cbfff0fd7a5","active":true,"notes":null,"models_covered":12},{"id":"lmarena_text_arena_elo","display_name":"LMArena Text Arena Elo","category":"other","unit":"elo","scale_min":null,"scale_max":null,"higher_better":true,"weight_in_composite":0,"status":"provisional","origin":"auto","first_seen_run_id":"run_bf713be07f1c4f6781df4a9b64ce09c5","active":true,"notes":null,"models_covered":3},{"id":"logicvista","display_name":"LogicVista","category":"other","unit":"percent","scale_min":null,"scale_max":null,"higher_better":true,"weight_in_composite":0,"status":"provisional","origin":"auto","first_seen_run_id":"run_b9316cd9218541edba4a54b3f349acd3","active":true,"notes":null,"models_covered":1},{"id":"long_horizon_terminal_bench","display_name":"Long-Horizon-Terminal-Bench","category":"other","unit":"percent","scale_min":null,"scale_max":null,"higher_better":true,"weight_in_composite":0,"status":"provisional","origin":"auto","first_seen_run_id":"run_d7b4ee6078684e3a9a7eb5ff12f0c81d","active":true,"notes":null,"models_covered":1},{"id":"longbench_v2","display_name":"LongBench v2","category":"other","unit":"percent","scale_min":null,"scale_max":null,"higher_better":true,"weight_in_composite":0,"status":"provisional","origin":"auto","first_seen_run_id":"run_6028ac39c0fb4d9a90025f0eba1e265f","active":true,"notes":null,"models_covered":1},{"id":"longcodebench_1m","display_name":"LongCodeBench 1M","category":"other","unit":"percent","scale_min":null,"scale_max":null,"higher_better":true,"weight_in_composite":0,"status":"provisional","origin":"auto","first_seen_run_id":"run_d8b288e8a4314a718d62098d4463f8f4","active":true,"notes":null,"models_covered":1},{"id":"lvbench","display_name":"LVBench","category":"other","unit":"percent","scale_min":null,"scale_max":null,"higher_better":true,"weight_in_composite":0,"status":"provisional","origin":"auto","first_seen_run_id":"run_5f55387d72cd481ebb4a7dc5d6f940e5","active":true,"notes":null,"models_covered":1},{"id":"math","display_name":"MATH","category":"other","unit":"percent","scale_min":null,"scale_max":null,"higher_better":true,"weight_in_composite":0,"status":"provisional","origin":"auto","first_seen_run_id":"run_9c1fc86de31b467badcaeb6b68cb1153","active":true,"notes":null,"models_covered":3},{"id":"math_500","display_name":"MATH-500","category":"other","unit":"percent","scale_min":null,"scale_max":null,"higher_better":true,"weight_in_composite":0,"status":"provisional","origin":"auto","first_seen_run_id":"run_15dad7768a114aca88498cbfff0fd7a5","active":true,"notes":null,"models_covered":4},{"id":"mathvision","display_name":"MathVision","category":"other","unit":"percent","scale_min":null,"scale_max":null,"higher_better":true,"weight_in_composite":0,"status":"provisional","origin":"auto","first_seen_run_id":"run_b9316cd9218541edba4a54b3f349acd3","active":true,"notes":null,"models_covered":2},{"id":"mathvista","display_name":"MathVista","category":"other","unit":"percent","scale_min":null,"scale_max":null,"higher_better":true,"weight_in_composite":0,"status":"provisional","origin":"auto","first_seen_run_id":"run_4eaa68da41964b1f84786f0dd048a38a","active":true,"notes":null,"models_covered":3},{"id":"mbpp_evalplus","display_name":"MBPP EvalPlus","category":"other","unit":"percent","scale_min":null,"scale_max":null,"higher_better":true,"weight_in_composite":0,"status":"provisional","origin":"auto","first_seen_run_id":"run_282bf64514de478b9fde1d211282288c","active":true,"notes":null,"models_covered":1},{"id":"mcp_atlas","display_name":"MCP Atlas","category":"other","unit":"percent","scale_min":null,"scale_max":null,"higher_better":true,"weight_in_composite":0,"status":"provisional","origin":"auto","first_seen_run_id":"run_25639cafaa534a87b7332e203f141975","active":true,"notes":null,"models_covered":6},{"id":"mgsm","display_name":"MGSM","category":"other","unit":"percent","scale_min":null,"scale_max":null,"higher_better":true,"weight_in_composite":0,"status":"provisional","origin":"auto","first_seen_run_id":"run_9c1fc86de31b467badcaeb6b68cb1153","active":true,"notes":null,"models_covered":4},{"id":"mle_bench","display_name":"MLE-Bench","category":"other","unit":"percent","scale_min":null,"scale_max":null,"higher_better":true,"weight_in_composite":0,"status":"provisional","origin":"auto","first_seen_run_id":"run_6c3d8d40b1334e50b419a6d5f5788334","active":true,"notes":null,"models_covered":1},{"id":"mle_bench_lite","display_name":"MLE-Bench Lite","category":"other","unit":"percent","scale_min":null,"scale_max":null,"higher_better":true,"weight_in_composite":0,"status":"provisional","origin":"auto","first_seen_run_id":"run_7531f4d597aa43ddb248859c44f27611","active":true,"notes":null,"models_covered":1},{"id":"mls_bench_lite","display_name":"MLS-Bench-Lite","category":"other","unit":"percent","scale_min":null,"scale_max":null,"higher_better":true,"weight_in_composite":0,"status":"provisional","origin":"auto","first_seen_run_id":"run_6028ac39c0fb4d9a90025f0eba1e265f","active":true,"notes":null,"models_covered":1},{"id":"mm_claw","display_name":"MM Claw","category":"other","unit":"percent","scale_min":null,"scale_max":null,"higher_better":true,"weight_in_composite":0,"status":"provisional","origin":"auto","first_seen_run_id":"run_7531f4d597aa43ddb248859c44f27611","active":true,"notes":null,"models_covered":1},{"id":"mmlu","display_name":"MMLU","category":"other","unit":"percent","scale_min":null,"scale_max":null,"higher_better":true,"weight_in_composite":0,"status":"provisional","origin":"auto","first_seen_run_id":"run_9c1fc86de31b467badcaeb6b68cb1153","active":true,"notes":null,"models_covered":6},{"id":"mmlu_pro","display_name":"MMLU-Pro","category":"knowledge","unit":"percent","scale_min":40,"scale_max":92,"higher_better":true,"weight_in_composite":0.1103,"status":"core","origin":"seed","first_seen_run_id":null,"active":true,"notes":"Near-saturated at frontier (~90%+); low differentiation power at the top in 2026 — retained as a floor/sanity-check signal (contamination/regression detector), not a ranking driver.","models_covered":44},{"id":"mmlu_redux","display_name":"MMLU-Redux","category":"other","unit":"percent","scale_min":null,"scale_max":null,"higher_better":true,"weight_in_composite":0,"status":"provisional","origin":"auto","first_seen_run_id":"run_97c943d2c5ee4107a9a57d2adea4a5ad","active":true,"notes":null,"models_covered":1},{"id":"mmmlu","display_name":"MMMLU","category":"other","unit":"percent","scale_min":null,"scale_max":null,"higher_better":true,"weight_in_composite":0,"status":"provisional","origin":"auto","first_seen_run_id":"run_25639cafaa534a87b7332e203f141975","active":true,"notes":null,"models_covered":1},{"id":"mmmu","display_name":"MMMU","category":"other","unit":"percent","scale_min":null,"scale_max":null,"higher_better":true,"weight_in_composite":0,"status":"provisional","origin":"auto","first_seen_run_id":"run_4eaa68da41964b1f84786f0dd048a38a","active":true,"notes":null,"models_covered":4},{"id":"mmmu_pro","display_name":"MMMU-Pro","category":"other","unit":"percent","scale_min":null,"scale_max":null,"higher_better":true,"weight_in_composite":0,"status":"provisional","origin":"auto","first_seen_run_id":"run_25639cafaa534a87b7332e203f141975","active":true,"notes":null,"models_covered":5},{"id":"mrcr","display_name":"MRCR (multi-needle retrieval)","category":"other","unit":"percent","scale_min":20,"scale_max":97,"higher_better":true,"weight_in_composite":0,"status":"core","origin":"seed","first_seen_run_id":null,"active":true,"notes":"MUST capture needle_count (2/4/8) and context_length bucket per score row — the single largest comparability trap found in R8a (§1.13, §4.6): scores vary 30-60+ points by bucket alone. Weight 0 pending that structured capture.","models_covered":3},{"id":"mrcr_1m","display_name":"MRCR 1M","category":"other","unit":"percent","scale_min":null,"scale_max":null,"higher_better":true,"weight_in_composite":0,"status":"provisional","origin":"auto","first_seen_run_id":"run_c59159c0343e49c096da469a4161a2e2","active":true,"notes":null,"models_covered":1},{"id":"mrcr_v2_8_needle","display_name":"MRCR v2 (8-needle)","category":"other","unit":"percent","scale_min":null,"scale_max":null,"higher_better":true,"weight_in_composite":0,"status":"provisional","origin":"auto","first_seen_run_id":"run_25639cafaa534a87b7332e203f141975","active":true,"notes":null,"models_covered":2},{"id":"multi_swe_bench","display_name":"Multi-SWE-bench","category":"other","unit":"percent","scale_min":null,"scale_max":null,"higher_better":true,"weight_in_composite":0,"status":"provisional","origin":"auto","first_seen_run_id":"run_7531f4d597aa43ddb248859c44f27611","active":true,"notes":null,"models_covered":1},{"id":"multichallenge","display_name":"MultiChallenge","category":"other","unit":"percent","scale_min":null,"scale_max":null,"higher_better":true,"weight_in_composite":0,"status":"provisional","origin":"auto","first_seen_run_id":"run_d8b288e8a4314a718d62098d4463f8f4","active":true,"notes":null,"models_covered":1},{"id":"multilingual_mmlu","display_name":"Multilingual MMLU","category":"other","unit":"percent","scale_min":null,"scale_max":null,"higher_better":true,"weight_in_composite":0,"status":"provisional","origin":"auto","first_seen_run_id":"run_4eaa68da41964b1f84786f0dd048a38a","active":true,"notes":null,"models_covered":1},{"id":"multipl_e_humaneval","display_name":"MultiPL-E HumanEval","category":"other","unit":"percent","scale_min":null,"scale_max":null,"higher_better":true,"weight_in_composite":0,"status":"provisional","origin":"auto","first_seen_run_id":"run_9c1fc86de31b467badcaeb6b68cb1153","active":true,"notes":null,"models_covered":1},{"id":"nl2repo","display_name":"NL2Repo","category":"other","unit":"percent","scale_min":null,"scale_max":null,"higher_better":true,"weight_in_composite":0,"status":"provisional","origin":"auto","first_seen_run_id":"run_aff8de7dba644d48940dfb9eb3d32d96","active":true,"notes":null,"models_covered":2},{"id":"nl2repo_bench","display_name":"NL2Repo-Bench","category":"other","unit":"percent","scale_min":null,"scale_max":null,"higher_better":true,"weight_in_composite":0,"status":"provisional","origin":"auto","first_seen_run_id":"run_6028ac39c0fb4d9a90025f0eba1e265f","active":true,"notes":null,"models_covered":1},{"id":"online_mind2web","display_name":"Online-Mind2Web","category":"other","unit":"percent","scale_min":null,"scale_max":null,"higher_better":true,"weight_in_composite":0,"status":"provisional","origin":"auto","first_seen_run_id":"run_6d1eabd36ecb488885533ee2704804da","active":true,"notes":null,"models_covered":1},{"id":"openai_internal_multi_policy_moderation_accuracy","display_name":"OpenAI internal multi-policy moderation accuracy","category":"other","unit":"percent","scale_min":null,"scale_max":null,"higher_better":true,"weight_in_composite":0,"status":"provisional","origin":"auto","first_seen_run_id":"run_fabbc8b6d4b74f5095713f8300d109a8","active":true,"notes":null,"models_covered":1},{"id":"openai_moderation_2022_f1","display_name":"OpenAI Moderation (2022) F1","category":"other","unit":"percent","scale_min":null,"scale_max":null,"higher_better":true,"weight_in_composite":0,"status":"provisional","origin":"auto","first_seen_run_id":"run_fabbc8b6d4b74f5095713f8300d109a8","active":true,"notes":null,"models_covered":1},{"id":"osworld","display_name":"OSWorld","category":"other","unit":"percent","scale_min":null,"scale_max":null,"higher_better":true,"weight_in_composite":0,"status":"provisional","origin":"auto","first_seen_run_id":"run_5a7b2bf97fed4a3cb01efdb8d503d9b4","active":true,"notes":null,"models_covered":1},{"id":"osworld_2_0","display_name":"OSWorld-2.0","category":"other","unit":"percent","scale_min":null,"scale_max":null,"higher_better":true,"weight_in_composite":0,"status":"provisional","origin":"auto","first_seen_run_id":"run_5f55387d72cd481ebb4a7dc5d6f940e5","active":true,"notes":null,"models_covered":3},{"id":"osworld_verified","display_name":"OSWorld-Verified","category":"other","unit":"percent","scale_min":null,"scale_max":null,"higher_better":true,"weight_in_composite":0,"status":"provisional","origin":"auto","first_seen_run_id":"run_f8e2332c4c034edba09fea1b7882b8b5","active":true,"notes":null,"models_covered":9},{"id":"paperbench","display_name":"PaperBench","category":"other","unit":"percent","scale_min":null,"scale_max":null,"higher_better":true,"weight_in_composite":0,"status":"provisional","origin":"auto","first_seen_run_id":"run_6028ac39c0fb4d9a90025f0eba1e265f","active":true,"notes":null,"models_covered":2},{"id":"phibench","display_name":"PhiBench","category":"other","unit":"percent","scale_min":null,"scale_max":null,"higher_better":true,"weight_in_composite":0,"status":"provisional","origin":"auto","first_seen_run_id":"run_b117e42664ba451c8a56cc67a74071b4","active":true,"notes":null,"models_covered":1},{"id":"pinchbench","display_name":"PinchBench","category":"other","unit":"percent","scale_min":null,"scale_max":null,"higher_better":true,"weight_in_composite":0,"status":"provisional","origin":"auto","first_seen_run_id":"run_407580b701a043a38dfb38f539a26607","active":true,"notes":null,"models_covered":1},{"id":"plawbench","display_name":"PLawBench","category":"other","unit":"percent","scale_min":null,"scale_max":null,"higher_better":true,"weight_in_composite":0,"status":"provisional","origin":"auto","first_seen_run_id":"run_6028ac39c0fb4d9a90025f0eba1e265f","active":true,"notes":null,"models_covered":1},{"id":"posttrainbench","display_name":"PostTrainBench","category":"other","unit":"percent","scale_min":null,"scale_max":null,"higher_better":true,"weight_in_composite":0,"status":"provisional","origin":"auto","first_seen_run_id":"run_aff8de7dba644d48940dfb9eb3d32d96","active":true,"notes":null,"models_covered":1},{"id":"prbench_finance","display_name":"PRBench-Finance","category":"other","unit":"percent","scale_min":null,"scale_max":null,"higher_better":true,"weight_in_composite":0,"status":"provisional","origin":"auto","first_seen_run_id":"run_6028ac39c0fb4d9a90025f0eba1e265f","active":true,"notes":null,"models_covered":1},{"id":"prbench_legal","display_name":"PRBench-Legal","category":"other","unit":"percent","scale_min":null,"scale_max":null,"higher_better":true,"weight_in_composite":0,"status":"provisional","origin":"auto","first_seen_run_id":"run_6028ac39c0fb4d9a90025f0eba1e265f","active":true,"notes":null,"models_covered":1},{"id":"programbench","display_name":"ProgramBench","category":"other","unit":"percent","scale_min":null,"scale_max":null,"higher_better":true,"weight_in_composite":0,"status":"provisional","origin":"auto","first_seen_run_id":"run_aff8de7dba644d48940dfb9eb3d32d96","active":true,"notes":null,"models_covered":2},{"id":"qwenqoderbench","display_name":"QwenQoderBench","category":"other","unit":"percent","scale_min":null,"scale_max":null,"higher_better":true,"weight_in_composite":0,"status":"provisional","origin":"auto","first_seen_run_id":"run_6028ac39c0fb4d9a90025f0eba1e265f","active":true,"notes":null,"models_covered":1},{"id":"qwenreactbench","display_name":"QwenReactBench","category":"other","unit":"elo","scale_min":null,"scale_max":null,"higher_better":true,"weight_in_composite":0,"status":"provisional","origin":"auto","first_seen_run_id":"run_6028ac39c0fb4d9a90025f0eba1e265f","active":true,"notes":null,"models_covered":1},{"id":"qwensvgbench","display_name":"QwenSVGBench","category":"other","unit":"elo","scale_min":null,"scale_max":null,"higher_better":true,"weight_in_composite":0,"status":"provisional","origin":"auto","first_seen_run_id":"run_6028ac39c0fb4d9a90025f0eba1e265f","active":true,"notes":null,"models_covered":1},{"id":"qwenswebench","display_name":"QwenSWEBench","category":"other","unit":"percent","scale_min":null,"scale_max":null,"higher_better":true,"weight_in_composite":0,"status":"provisional","origin":"auto","first_seen_run_id":"run_6028ac39c0fb4d9a90025f0eba1e265f","active":true,"notes":null,"models_covered":1},{"id":"ruler","display_name":"RULER","category":"other","unit":"percent","scale_min":null,"scale_max":null,"higher_better":true,"weight_in_composite":0,"status":"provisional","origin":"auto","first_seen_run_id":"run_f7be5cdfc6ed41c99f63660105f869ce","active":true,"notes":null,"models_covered":1},{"id":"sage","display_name":"SAGE","category":"other","unit":"percent","scale_min":null,"scale_max":null,"higher_better":true,"weight_in_composite":0,"status":"provisional","origin":"auto","first_seen_run_id":"run_4c932a77cb624e88b1eb83c143534b88","active":true,"notes":null,"models_covered":1},{"id":"scicode","display_name":"SciCode","category":"other","unit":"percent","scale_min":null,"scale_max":null,"higher_better":true,"weight_in_composite":0,"status":"provisional","origin":"auto","first_seen_run_id":"run_25639cafaa534a87b7332e203f141975","active":true,"notes":null,"models_covered":5},{"id":"simpleqa","display_name":"SimpleQA","category":"other","unit":"percent","scale_min":null,"scale_max":null,"higher_better":true,"weight_in_composite":0,"status":"provisional","origin":"auto","first_seen_run_id":"run_d96417a9afb74afd8322737c2b9940c9","active":true,"notes":null,"models_covered":4},{"id":"skillsbench","display_name":"SkillsBench","category":"other","unit":"percent","scale_min":null,"scale_max":null,"higher_better":true,"weight_in_composite":0,"status":"provisional","origin":"auto","first_seen_run_id":"run_6028ac39c0fb4d9a90025f0eba1e265f","active":true,"notes":null,"models_covered":2},{"id":"supergpqa","display_name":"SuperGPQA","category":"other","unit":"percent","scale_min":null,"scale_max":null,"higher_better":true,"weight_in_composite":0,"status":"provisional","origin":"auto","first_seen_run_id":"run_c157934da2b1494e95383b8c151c338e","active":true,"notes":null,"models_covered":1},{"id":"swe_bench_multilingual","display_name":"SWE-bench Multilingual","category":"other","unit":"percent","scale_min":null,"scale_max":null,"higher_better":true,"weight_in_composite":0,"status":"provisional","origin":"auto","first_seen_run_id":"run_15dad7768a114aca88498cbfff0fd7a5","active":true,"notes":null,"models_covered":9},{"id":"swe_bench_pro","display_name":"SWE-bench Pro","category":"code","unit":"percent","scale_min":5,"scale_max":65,"higher_better":true,"weight_in_composite":0,"status":"core","origin":"seed","first_seen_run_id":null,"active":true,"notes":"Scale AI, 1,865 tasks, contamination-resistant. MUST capture dataset_split (public vs private/held-out) per score — public and private numbers are not comparable (R8a §1.3, §4.7). Weight 0 pending split-aware ingestion; do not blend public/private silently.","models_covered":20},{"id":"swe_bench_verified","display_name":"SWE-bench Verified","category":"code","unit":"percent","scale_min":10,"scale_max":85,"higher_better":true,"weight_in_composite":0.1471,"status":"core","origin":"seed","first_seen_run_id":null,"active":true,"notes":"OpenAI-created, 500 human-filtered instances. Reliability degrading (Feb 2026 OpenAI audit: 59.4% of hardest unsolved instances have flawed tests) — directional, not precise. OpenAI recommends swe_bench_pro over this going forward.","models_covered":47},{"id":"swe_fficiency","display_name":"SWE-fficiency","category":"other","unit":"percent","scale_min":null,"scale_max":null,"higher_better":true,"weight_in_composite":0,"status":"provisional","origin":"auto","first_seen_run_id":"run_f8e2332c4c034edba09fea1b7882b8b5","active":true,"notes":null,"models_covered":1},{"id":"swe_marathon","display_name":"SWE-Marathon","category":"other","unit":"percent","scale_min":null,"scale_max":null,"higher_better":true,"weight_in_composite":0,"status":"provisional","origin":"auto","first_seen_run_id":"run_aff8de7dba644d48940dfb9eb3d32d96","active":true,"notes":null,"models_covered":3},{"id":"tau2_bench_retail","display_name":"tau2-bench (Retail)","category":"other","unit":"percent","scale_min":null,"scale_max":null,"higher_better":true,"weight_in_composite":0,"status":"provisional","origin":"auto","first_seen_run_id":"run_25639cafaa534a87b7332e203f141975","active":true,"notes":null,"models_covered":3},{"id":"tau2_bench_telecom","display_name":"tau2-bench (Telecom)","category":"other","unit":"percent","scale_min":null,"scale_max":null,"higher_better":true,"weight_in_composite":0,"status":"provisional","origin":"auto","first_seen_run_id":"run_25639cafaa534a87b7332e203f141975","active":true,"notes":null,"models_covered":3},{"id":"tau3_bench_banking","display_name":"tau3-bench (Banking)","category":"other","unit":"percent","scale_min":null,"scale_max":null,"higher_better":true,"weight_in_composite":0,"status":"provisional","origin":"auto","first_seen_run_id":"run_407580b701a043a38dfb38f539a26607","active":true,"notes":null,"models_covered":1},{"id":"tau3_telecom","display_name":"tau3-Telecom","category":"other","unit":"percent","scale_min":null,"scale_max":null,"higher_better":true,"weight_in_composite":0,"status":"provisional","origin":"auto","first_seen_run_id":"run_4c932a77cb624e88b1eb83c143534b88","active":true,"notes":null,"models_covered":1},{"id":"tau_bench","display_name":"tau-bench / tau2-bench","category":"agentic","unit":"percent","scale_min":20,"scale_max":95,"higher_better":true,"weight_in_composite":0.0442,"status":"core","origin":"seed","first_seen_run_id":null,"active":true,"notes":"Tool-using conversational agent task success (airline/retail/banking domains). tau-bench and tau2-bench (dynamic-env successor) are DIFFERENT benchmarks despite the name similarity (R8a §3) — do not merge scores across editions; capture edition in score_config.","models_covered":19},{"id":"tau_bench_retail","display_name":"tau-bench Retail","category":"other","unit":"percent","scale_min":null,"scale_max":null,"higher_better":true,"weight_in_composite":0,"status":"provisional","origin":"auto","first_seen_run_id":"run_6c738b9f3a2d4a97b22b79e5db77ddfa","active":true,"notes":null,"models_covered":1},{"id":"tau_bench_v3_average","display_name":"tau-bench V3 Average","category":"other","unit":"percent","scale_min":null,"scale_max":null,"higher_better":true,"weight_in_composite":0,"status":"provisional","origin":"auto","first_seen_run_id":"run_f7be5cdfc6ed41c99f63660105f869ce","active":true,"notes":null,"models_covered":1},{"id":"terminal_bench","display_name":"Terminal-Bench (Hard)","category":"agentic","unit":"percent","scale_min":5,"scale_max":90,"higher_better":true,"weight_in_composite":0.0441,"status":"core","origin":"seed","first_seen_run_id":null,"active":true,"notes":"Fractional pass rate across 89 hand-crafted CLI/terminal tasks, ~5 attempts/task averaged. Scaffold/agent-harness-sensitive (101 agents / 23 scaffolds tracked) — capture scaffold as a field, not just model.","models_covered":47},{"id":"tool_decathlon","display_name":"Tool-Decathlon","category":"other","unit":"percent","scale_min":null,"scale_max":null,"higher_better":true,"weight_in_composite":0,"status":"provisional","origin":"auto","first_seen_run_id":"run_bf713be07f1c4f6781df4a9b64ce09c5","active":true,"notes":null,"models_covered":2},{"id":"toolathlon","display_name":"Toolathlon","category":"other","unit":"percent","scale_min":null,"scale_max":null,"higher_better":true,"weight_in_composite":0,"status":"provisional","origin":"auto","first_seen_run_id":"run_d5e2006f4e3e4803b6aa364787492ff0","active":true,"notes":null,"models_covered":3},{"id":"toolathlon_verified","display_name":"Toolathlon Verified","category":"other","unit":"percent","scale_min":null,"scale_max":null,"higher_better":true,"weight_in_composite":0,"status":"provisional","origin":"auto","first_seen_run_id":"run_6028ac39c0fb4d9a90025f0eba1e265f","active":true,"notes":null,"models_covered":1},{"id":"toxicchat_f1","display_name":"ToxicChat F1","category":"other","unit":"percent","scale_min":null,"scale_max":null,"higher_better":true,"weight_in_composite":0,"status":"provisional","origin":"auto","first_seen_run_id":"run_fabbc8b6d4b74f5095713f8300d109a8","active":true,"notes":null,"models_covered":1},{"id":"vals_index","display_name":"Vals Index","category":"other","unit":"index","scale_min":null,"scale_max":null,"higher_better":true,"weight_in_composite":0,"status":"provisional","origin":"auto","first_seen_run_id":"run_2e5a562a40d64392a3a803438b1da5c3","active":true,"notes":null,"models_covered":2},{"id":"vibe_pro","display_name":"VIBE-Pro","category":"other","unit":"percent","scale_min":null,"scale_max":null,"higher_better":true,"weight_in_composite":0,"status":"provisional","origin":"auto","first_seen_run_id":"run_7531f4d597aa43ddb248859c44f27611","active":true,"notes":null,"models_covered":1},{"id":"video_mme","display_name":"Video-MME","category":"other","unit":"percent","scale_min":null,"scale_max":null,"higher_better":true,"weight_in_composite":0,"status":"provisional","origin":"auto","first_seen_run_id":"run_f8e2332c4c034edba09fea1b7882b8b5","active":true,"notes":null,"models_covered":1},{"id":"widesearch","display_name":"WideSearch","category":"other","unit":"percent","scale_min":null,"scale_max":null,"higher_better":true,"weight_in_composite":0,"status":"provisional","origin":"auto","first_seen_run_id":"run_6028ac39c0fb4d9a90025f0eba1e265f","active":true,"notes":null,"models_covered":1},{"id":"wildclawbench","display_name":"WildClawBench","category":"other","unit":"percent","scale_min":null,"scale_max":null,"higher_better":true,"weight_in_composite":0,"status":"provisional","origin":"auto","first_seen_run_id":"run_aff8de7dba644d48940dfb9eb3d32d96","active":true,"notes":null,"models_covered":3},{"id":"workspacebench","display_name":"WorkSpaceBench","category":"other","unit":"percent","scale_min":null,"scale_max":null,"higher_better":true,"weight_in_composite":0,"status":"provisional","origin":"auto","first_seen_run_id":"run_6028ac39c0fb4d9a90025f0eba1e265f","active":true,"notes":null,"models_covered":1}]}