斯坦福2026 AI指数报告:中美模型性能差距缩窄至2.7%
2026年4月16日,斯坦福大学以人为本人工智能研究所(HAI)发布的《2026 AI指数报告》显示,中美两国在AI模型技术性能上的差距已大幅收窄。基于MMLU、MATH、HumanEval等主要基准的评估,领先的美国模型对中国的性能优势仅为2.7%,而在2023年这一差距尚在17.5至31.6个百分点之间。报告指出,Anthropic的Claude Opus 4.6在斯坦福追踪的基准上,相较字节跳动的最佳模型保持39分的Elo领先优势。与此同时,美国在私人AI投资(2859亿美元 vs. 124亿美元)和年度重要模型产出数量(50 vs. 30)上仍保持领先,而中国则在AI论文发表量、专利产出和工业机器人部署方面领先。该报告通过系统化的基准评测,量化了全球AI竞争格局的演变。
来源:Fortune
链接:https://fortune.com/2026/04/16/stanford-study-how-has-china-gained-on-us-ai-war/
DataLearner AI模型实时排行榜更新至4月17日
2026年4月17日,DataLearner AI更新了其AI模型实时综合排行榜。该榜单聚合了包括ARC-AGI-2、HLE、AIME 2025、SWE-bench Verified在内的多个前沿基准的评测结果,并提供数学、编程、智能体等维度的细分排名。榜单采用两种互补的评估视角:“AA Intelligence Index”基于10项标准化基准(涵盖编程、数学、科学、推理与智能体任务)计算综合能力分数;“LMArena文本生成”则基于匿名的众包A/B投票生成反映真实用户偏好的Elo评分。更新后的榜单显示,在综合能力排名中,Gemini 3.1 Pro Preview、GPT-5.4等模型位居前列;在用户偏好排名中,Claude Opus 4.6等模型表现突出。该工具为模型能力的横向比较与追踪提供了实时、多角度的参考。
来源:DataLearner AI
链接:https://www.datalearner.com/en/leaderboards