CaTS-Bench:时间序列字幕生成新基准,含1746条人工重写标注
2026年4月21日,时间序列字幕生成领域的新基准CaTS-Bench正式发布。该基准的核心是一个包含1746条人工重写标注的金标准评估集,覆盖11个不同领域,旨在衡量模型将复杂数字趋势转化为可理解叙事的能力。除了评估集,CaTS-Bench还发布了一个包含910个多选题的诊断套件,用于测量时间序列特定的推理能力。基准的创建者同时开发了一个可扩展的合成标注生成流水线,以缓解人工标注数据稀缺的问题。该基准为多模态文本生成在数字领域提供了可靠的评估基础。
来源:Machine Brief
链接:https://www.machinebrief.com/news/cats-bench-revolutionizing-time-series-narratives-lvon
QIMMA:首个质量优先的阿拉伯语大模型排行榜,覆盖7大领域
2026年4月21日,由Technology Innovation Institute (TII) 团队发布的QIMMA(قمّة,意为“顶峰”)成为首个以质量验证为核心的阿拉伯语大模型排行榜。该排行榜整合了来自14个源基准的109个子集,包含超过52,000个样本,覆盖文化、STEM、法律、医学、安全、诗歌文学与编码等7个领域。QIMMA在评估前对所有样本应用了严格的多阶段质量验证流水线,发现并剔除了源基准中存在的系统性质量问题(如阿拉伯语MMLU的剔除率为3.1%)。排行榜还首次纳入了阿拉伯语适配的代码生成评估(HumanEval+ 与 MBPP+)。初步结果显示,Qwen3.5-397B-A17B-FP8以68.06的平均分位列第一。
来源:Hugging Face Blog
链接:https://huggingface.co/blog/tiiuae/qimma-arabic-leaderboard
GeoRepEval:评估几何问题中表示鲁棒性的新框架
2026年4月21日,arXiv上发布了GeoRepEval基准,旨在量化大语言模型对几何问题等价表示(欧几里得、坐标、向量形式)的鲁棒性。该框架在问题级别测量正确性、不变性和一致性,并提出了Invariance@3指标,该指标将准确率分解为稳健和脆弱两部分。基准包含158个精选的高中几何问题(共474个实例)。对11款LLM的评估显示,仅表示选择就可导致高达14个百分点的准确率差距,其中向量表示是普遍的失败点(Invariance@3最低为0.044)。结果表明,当前模型依赖表示特定的启发式方法,而非抽象的几何推理。
来源:arXiv
链接:https://arxiv.org/abs/2604.16421
EchoChain:全双工语音交互中状态更新推理的基准
2026年4月21日,EchoChain基准在arXiv上发布,用于评估语音助手在语音输出被中途打断时,进行全双工状态更新推理的能力。该基准通过生成场景驱动的对话,并在助手语音开始的标准化时间点注入打断,以实现可控的跨模型比较。它识别了三种反复出现的故障模式:上下文惯性、打断遗忘和目标偏移。在配对半双工控制实验中,总故障率比被打断的运行降低了40.2%,表明许多错误是由中断下的状态更新推理驱动,而非单纯的任务难度。在所评估的实时语音模型中,没有一个系统的通过率超过50%,显示中间生成状态修订方面存在巨大改进空间。
来源:arXiv
链接:https://arxiv.org/abs/2604.16456
MedPRMBench:首个医学推理过程奖励模型细粒度基准
2026年4月21日,MedPRMBench基准在arXiv上发布,这是首个面向医学领域的过程级奖励模型基准。该基准基于临床推理蓝图构建,从七个医学问答源系统生成高质量评估数据,涵盖三个类别(简洁性、合理性、敏感性)下的14种细粒度错误类型,并首次采用4级严重度分级系统来量化临床影响。基准包含6,500个问题、13,000条推理链和113,910个步骤级标签,另有6,879个问题用于训练。其医学PRM基线取得了87.1%的总体PRMScore,显著超越所有基线,作为即插即用的验证器,可将下游医学QA准确率提升3.2–6.7个百分点。
来源:arXiv
链接:https://arxiv.org/abs/2604.17282
HorizonBench:评估长时域个性化与偏好演化的基准
2026年4月21日,HorizonBench基准在arXiv上发布,用于评估模型在用户偏好随时间演化场景下的长时域个性化能力。该基准通过结构化心智状态图生成对话,为跨越6个月时间线的每个偏好变化提供了可追溯的真实来源。基准包含来自360个模拟用户的4,245个项目,平均拥有约4,300轮对话、约163K token的6个月对话历史。在25款前沿模型的评估中,最佳模型准确率为52.8%,多数模型得分处于或低于20%的随机基线。当模型在已演变的偏好上出错时,超过三分之一的情况是选择了用户最初声明的值,而未追踪更新后的用户状态,这突显了状态跟踪能力是长时域个性化的主要瓶颈。
来源:arXiv
链接:https://arxiv.org/abs/2604.17283
ArgBench:计算论证任务的标准化评估基准
2026年4月21日,ArgBench基准在arXiv上发布,这是首个用于标准化评估基于LLM的计算论证方法的基准。该基准以统一形式整合了先前工作中的33个数据集,涵盖挖掘论点、评估观点、评估论证质量、关于论证的推理和生成论证等46个计算论证任务。利用该基准,研究者评估了五个LLM系列在不同任务上的泛化能力,并对少样本示例、推理步骤、模型规模和训练技能对性能的贡献进行了广泛的系统分析。
来源:arXiv
链接:https://arxiv.org/abs/2604.17366
MineBench:3D Minecraft结构生成能力评测基准
2026年4月21日,Reddit用户分享了在MineBench基准上对比Kimi K2.5与Kimi K2.6模型的结果。MineBench是一个用于测试模型创建3D Minecraft类结构能力的公开基准。模型会获得一个方块(类似乐高积木)调色板和一个构建提示(例如“战斗机”),然后需要通过返回每个方块的坐标(x, y, z)的JSON来构建该结构。基准旨在观察哪些模型能更好地根据提示创建3D表示,更智能的模型倾向于设计更详细、更复杂的构建。基准网站和代码库均已公开。
来源:Reddit
链接:https://www.reddit.com/r/LocalLLaMA/comments/1srs4uj/differences_between_kimi_k25_and_kimi_k26_on/
SeekerGym:评估AI信息检索“大局观”的新基准
2026年4月21日,Machine Brief报道了名为SeekerGym的新基准。该基准旨在评估AI智能体在信息检索中,能否超越零散事实的提取,完成对“大局”的整体把握。报道指出,当前AI智能体擅长检索信息,但常常错失更大的图景,SeekerGym正是为了系统评估AI如何补全信息拼图而设计。
来源:Machine Brief
链接:https://www.machinebrief.com/news/ais-info-retrieval-problem-meet-seekergym-iztr