DogReID‑1553:大规模犬只重识别视频数据集与基准测试
2026年4月17日,研究团队在哈佛大学Dataverse上发布了DogReID‑1553数据集及配套的评测基准。该数据集包含1,553只不同犬只的7,463段视频(平均每只犬4.8段视频),每段视频的首帧图像均提供了手工标注的边界框,并附有由GPT‑5生成的文本描述。除了数据,团队还建立了在线排行榜,支持研究者提交模型结果进行排名。该基准旨在推动视频级别的犬只重识别(Re‑ID)任务,为细粒度生物识别、动物行为研究等场景提供可复现的评估标准。
来源:Harvard Dataverse
链接:https://doi.org/10.7910/DVN/LVTRLG
AIRA₂:突破AI研究智能体瓶颈的新基准测试
2026年4月16日,Meta AI发布了研究智能体系统AIRA₂,并同步公开了其在MLE‑bench‑30与AIRS‑Bench两个基准上的评测结果。AIRA₂通过异步多GPU工作池、隐藏一致性评估协议以及可动态调整动作的ReAct智能体,解决了现有研究智能体在样本吞吐量、泛化gap和单轮LLM算子能力上限三个结构性瓶颈。在MLE‑bench‑30上,AIRA₂在24小时和72小时的运行后分别取得81.5%和83.1%的平均百分位排名,显著超过最强基线的72.7%。在AIRS‑Bench涵盖的20项多样研究任务中,AIRA₂在6项任务上超越了人类最佳水平。该工作为研究智能体的系统化评估提供了新的基准框架。
来源:Meta AI Research
链接:https://ai.meta.com/research/publications/aira-overcoming-bottlenecks-in-ai-research-agents/