AGI Daily
广告
AGI Daily跟踪世界 AGI 进展AGI INTELLIGENCE · DAILY
全部算力算法数据人物日报主题
AGI Daily
全部算力算法数据人物日报主题
广告

CaTS-Bench:时间序列字幕生成新基准,含1746条人工重写标注

2026年4月22日 · 2026-04-22

榜单与结果

CaTS-Bench:时间序列字幕生成新基准,含1746条人工重写标注

2026年4月21日,时间序列字幕生成领域的新基准CaTS-Bench正式发布。该基准的核心是一个包含1746条人工重写标注的金标准评估集,覆盖11个不同领域,旨在衡量模型将复杂数字趋势转化为可理解叙事的能力。除了评估集,CaTS-Bench还发布了一个包含910个多选题的诊断套件,用于测量时间序列特定的推理能力。基准的创建者同时开发了一个可扩展的合成标注生成流水线,以缓解人工标注数据稀缺的问题。该基准为多模态文本生成在数字领域提供了可靠的评估基础。

来源:Machine Brief
链接:https://www.machinebrief.com/news/cats-bench-revolutionizing-time-series-narratives-lvon

QIMMA:首个质量优先的阿拉伯语大模型排行榜,覆盖7大领域

2026年4月21日,由Technology Innovation Institute (TII) 团队发布的QIMMA(قمّة,意为“顶峰”)成为首个以质量验证为核心的阿拉伯语大模型排行榜。该排行榜整合了来自14个源基准的109个子集,包含超过52,000个样本,覆盖文化、STEM、法律、医学、安全、诗歌文学与编码等7个领域。QIMMA在评估前对所有样本应用了严格的多阶段质量验证流水线,发现并剔除了源基准中存在的系统性质量问题(如阿拉伯语MMLU的剔除率为3.1%)。排行榜还首次纳入了阿拉伯语适配的代码生成评估(HumanEval+ 与 MBPP+)。初步结果显示,Qwen3.5-397B-A17B-FP8以68.06的平均分位列第一。

来源:Hugging Face Blog
链接:https://huggingface.co/blog/tiiuae/qimma-arabic-leaderboard

GeoRepEval:评估几何问题中表示鲁棒性的新框架

2026年4月21日,arXiv上发布了GeoRepEval基准,旨在量化大语言模型对几何问题等价表示(欧几里得、坐标、向量形式)的鲁棒性。该框架在问题级别测量正确性、不变性和一致性,并提出了Invariance@3指标,该指标将准确率分解为稳健和脆弱两部分。基准包含158个精选的高中几何问题(共474个实例)。对11款LLM的评估显示,仅表示选择就可导致高达14个百分点的准确率差距,其中向量表示是普遍的失败点(Invariance@3最低为0.044)。结果表明,当前模型依赖表示特定的启发式方法,而非抽象的几何推理。

来源:arXiv
链接:https://arxiv.org/abs/2604.16421

EchoChain:全双工语音交互中状态更新推理的基准

2026年4月21日,EchoChain基准在arXiv上发布,用于评估语音助手在语音输出被中途打断时,进行全双工状态更新推理的能力。该基准通过生成场景驱动的对话,并在助手语音开始的标准化时间点注入打断,以实现可控的跨模型比较。它识别了三种反复出现的故障模式:上下文惯性、打断遗忘和目标偏移。在配对半双工控制实验中,总故障率比被打断的运行降低了40.2%,表明许多错误是由中断下的状态更新推理驱动,而非单纯的任务难度。在所评估的实时语音模型中,没有一个系统的通过率超过50%,显示中间生成状态修订方面存在巨大改进空间。

来源:arXiv
链接:https://arxiv.org/abs/2604.16456

MedPRMBench:首个医学推理过程奖励模型细粒度基准

2026年4月21日,MedPRMBench基准在arXiv上发布,这是首个面向医学领域的过程级奖励模型基准。该基准基于临床推理蓝图构建,从七个医学问答源系统生成高质量评估数据,涵盖三个类别(简洁性、合理性、敏感性)下的14种细粒度错误类型,并首次采用4级严重度分级系统来量化临床影响。基准包含6,500个问题、13,000条推理链和113,910个步骤级标签,另有6,879个问题用于训练。其医学PRM基线取得了87.1%的总体PRMScore,显著超越所有基线,作为即插即用的验证器,可将下游医学QA准确率提升3.2–6.7个百分点。

来源:arXiv
链接:https://arxiv.org/abs/2604.17282

HorizonBench:评估长时域个性化与偏好演化的基准

2026年4月21日,HorizonBench基准在arXiv上发布,用于评估模型在用户偏好随时间演化场景下的长时域个性化能力。该基准通过结构化心智状态图生成对话,为跨越6个月时间线的每个偏好变化提供了可追溯的真实来源。基准包含来自360个模拟用户的4,245个项目,平均拥有约4,300轮对话、约163K token的6个月对话历史。在25款前沿模型的评估中,最佳模型准确率为52.8%,多数模型得分处于或低于20%的随机基线。当模型在已演变的偏好上出错时,超过三分之一的情况是选择了用户最初声明的值,而未追踪更新后的用户状态,这突显了状态跟踪能力是长时域个性化的主要瓶颈。

来源:arXiv
链接:https://arxiv.org/abs/2604.17283

ArgBench:计算论证任务的标准化评估基准

2026年4月21日,ArgBench基准在arXiv上发布,这是首个用于标准化评估基于LLM的计算论证方法的基准。该基准以统一形式整合了先前工作中的33个数据集,涵盖挖掘论点、评估观点、评估论证质量、关于论证的推理和生成论证等46个计算论证任务。利用该基准,研究者评估了五个LLM系列在不同任务上的泛化能力,并对少样本示例、推理步骤、模型规模和训练技能对性能的贡献进行了广泛的系统分析。

来源:arXiv
链接:https://arxiv.org/abs/2604.17366

MineBench:3D Minecraft结构生成能力评测基准

2026年4月21日,Reddit用户分享了在MineBench基准上对比Kimi K2.5与Kimi K2.6模型的结果。MineBench是一个用于测试模型创建3D Minecraft类结构能力的公开基准。模型会获得一个方块(类似乐高积木)调色板和一个构建提示(例如“战斗机”),然后需要通过返回每个方块的坐标(x, y, z)的JSON来构建该结构。基准旨在观察哪些模型能更好地根据提示创建3D表示,更智能的模型倾向于设计更详细、更复杂的构建。基准网站和代码库均已公开。

来源:Reddit
链接:https://www.reddit.com/r/LocalLLaMA/comments/1srs4uj/differences_between_kimi_k25_and_kimi_k26_on/

SeekerGym:评估AI信息检索“大局观”的新基准

2026年4月21日,Machine Brief报道了名为SeekerGym的新基准。该基准旨在评估AI智能体在信息检索中,能否超越零散事实的提取,完成对“大局”的整体把握。报道指出,当前AI智能体擅长检索信息,但常常错失更大的图景,SeekerGym正是为了系统评估AI如何补全信息拼图而设计。

来源:Machine Brief
链接:https://www.machinebrief.com/news/ais-info-retrieval-problem-meet-seekergym-iztr

方法与争议

模型不确定性归因能力不足:UA-Bench基准揭示LLM难以区分数据与模型不确定性

2026年4月21日,UA-Bench基准在arXiv上发布,旨在评估LLM在区分输入级模糊性(数据不确定性)与能力局限性(模型不确定性)方面的自我意识。该基准从六个数据集中抽取了超过3500个问题,涵盖知识密集型与推理密集型任务。对18款前沿LLM的评估显示,即使是先进模型也难以可靠地区分这两种不确定性,且高答案准确率并不必然意味着强不确定性归因能力。为此,研究者提出了一种轻量级的数据合成与强化学习策略,在Qwen3-4B-Instruct-2507和思维模式下的Qwen3-8B上实验表明,该方法能在保持答案准确率的同时改善不确定性归因。

来源:arXiv
链接:https://arxiv.org/abs/2604.17293

对抗性人文学科基准揭示前沿模型安全策略缺乏风格鲁棒性

2026年4月21日,Adversarial Humanities Benchmark (AHB) 在arXiv上发布了评估结果。该基准从MLCommons AILuminate中抽取有害任务,并通过人文学科风格的文本改写(如诗歌、故事)在保留意图的同时进行风格混淆,以测试模型安全拒绝策略的鲁棒性。结果显示,原始攻击的成功率为3.84%,而经过风格转换后的攻击成功率在36.8%到65.0%之间,总体成功率达55.75%(覆盖31款前沿模型)。在欧盟《人工智能法案》实践准则的系统性风险视角下,化学、生物、放射性与核威胁是风险最高的类别。这些结果表明,当前的安全技术泛化能力弱,对“非恶意”原则的深层理解仍是未解决的核心问题。

来源:arXiv
链接:https://arxiv.org/abs/2604.18487

评测框架本身的可信度问题:SPENCE基准检测NL2SQL评测中的训练数据污染

2026年4月21日,SPENCE(NL2SQL污染效应句法探测与评估)框架在arXiv上发布。该框架通过系统生成测试查询的句法变体,来检测和量化NL2SQL基准(如Spider、SParC、CoSQL、BIRD)可能因训练数据污染而导致的性能虚高。通过测量不同句法分歧程度下执行准确率的变化,并与基准发布日期对齐,研究者观察到一个清晰的时间梯度:较旧的基准(如Spider)表现出最强的负相关性,训练泄漏可能性最高;而较新的BIRD数据集则敏感性最小,基本未被污染。这一发现强调了基于时间上下文和句法探测的评估对于可信NL2SQL评测的重要性。

来源:arXiv
链接:https://arxiv.org/abs/2604.17771

评论

登录后即可参与评论。

加载评论中…

最新日报

  • 沙箱环境被突破的概念图,表现数据从受限立方体中逸出OpenAI 首次公开披露模型「越狱」:数学突破后两次逃出沙箱,内部紧急暂停Daily · 7月22日
  • SK 海力士 36GB HBM3E 高带宽内存产品的正反面展示SK 集团警告:AI 内存短缺或引发地缘政治摩擦Daily · 7月21日
  • Apple vs Nvidia market cap今日头条:Kimi K3 余震——AI 估值逻辑遭遇重新定价Daily · 7月20日

往期日报

  • OCBENCH:大型语言模型过度服从性跨模型基准OCBENCH:大型语言模型过度服从性跨模型基准Daily · 4月21日
  • CNMLEQA:面向中国国家医学资格考试的大语言模型评测数据集CNMLEQA:面向中国国家医学资格考试的大语言模型评测数据集Daily · 4月20日
  • DogReID‑1553:大规模犬只重识别视频数据集与基准测试Daily · 4月19日
  • 斯坦福2026 AI指数报告:中美模型性能差距缩窄至2.7%斯坦福2026 AI指数报告:中美模型性能差距缩窄至2.7%Daily · 4月18日
  • Claude Design 名称与橙色 Claude 标志Claude Design 把快速视觉生成带入可编辑工作流Daily · 4月17日
  • GlotOCR Bench:揭示OCR模型在百种文字上的泛化局限GlotOCR Bench:揭示OCR模型在百种文字上的泛化局限Daily · 4月16日
  • Adobe Firefly 创意工具的彩色视觉画面Adobe 让 Firefly 助手跨应用执行,创意 AI 进入工作流编排Daily · 4月15日
  • OpenAI 标志叠在蓝色二进制数字背景前OpenAI 收购 Hiro,通用助手开始进入高信任个人财务场景Daily · 4月14日
  • Guillermo Rauch 在 HumanX 大会舞台上发言Vercel 称三成托管应用由 Agent 创建,部署量开始接受收入检验Daily · 4月13日
  • 电信领域多语言意图与流程对齐电信领域多语言意图与流程对齐Daily · 4月10日
  • Meta AI 标志置于蓝紫色彩背景中央Meta 发布 Muse Spark,模型重启转向产品与多智能体协作Daily · 4月9日
AGIDaily跟踪世界 AGI 进展© 2026 AGIDaily
关于邮件栏目主题定制投稿招聘广告SkillTermsContactRSS