AGI Daily
广告
AGI Daily跟踪世界 AGI 进展AGI INTELLIGENCE · DAILY
全部算力算法数据人物日报主题
AGI Daily
全部算力算法数据人物日报主题
广告

DogReID‑1553:大规模犬只重识别视频数据集与基准测试

2026年4月19日 · 2026-04-19

榜单与结果

DogReID‑1553:大规模犬只重识别视频数据集与基准测试

2026年4月17日,研究团队在哈佛大学Dataverse上发布了DogReID‑1553数据集及配套的评测基准。该数据集包含1,553只不同犬只的7,463段视频(平均每只犬4.8段视频),每段视频的首帧图像均提供了手工标注的边界框,并附有由GPT‑5生成的文本描述。除了数据,团队还建立了在线排行榜,支持研究者提交模型结果进行排名。该基准旨在推动视频级别的犬只重识别(Re‑ID)任务,为细粒度生物识别、动物行为研究等场景提供可复现的评估标准。

来源:Harvard Dataverse
链接:https://doi.org/10.7910/DVN/LVTRLG

AIRA₂:突破AI研究智能体瓶颈的新基准测试

2026年4月16日,Meta AI发布了研究智能体系统AIRA₂,并同步公开了其在MLE‑bench‑30与AIRS‑Bench两个基准上的评测结果。AIRA₂通过异步多GPU工作池、隐藏一致性评估协议以及可动态调整动作的ReAct智能体,解决了现有研究智能体在样本吞吐量、泛化gap和单轮LLM算子能力上限三个结构性瓶颈。在MLE‑bench‑30上,AIRA₂在24小时和72小时的运行后分别取得81.5%和83.1%的平均百分位排名,显著超过最强基线的72.7%。在AIRS‑Bench涵盖的20项多样研究任务中,AIRA₂在6项任务上超越了人类最佳水平。该工作为研究智能体的系统化评估提供了新的基准框架。

来源:Meta AI Research
链接:https://ai.meta.com/research/publications/aira-overcoming-bottlenecks-in-ai-research-agents/

方法与争议

编码代理基准测试中脚手架适配的影响:同一Qwen 9B模型性能翻倍

2026年4月19日,一项在Reddit上分享的测试表明,编码代理的基准结果高度依赖脚手架(scaffold)与模型的匹配程度。作者固定使用Qwen3.5‑9B Q4权重,在相同的Aider Polyglot基准(225道练习题)上比较了默认Aider脚手架与针对小模型优化的“little‑coder”脚手架。结果,默认脚手架仅取得19.11%的pass@2,而优化后的脚手架达到45.56%,性能提升超过一倍。作者指出,在10B参数以下的本地模型中,编码代理的弱表现可能并非源于模型权重本身,而是由于脚手架与模型行为模式不匹配。这一发现提示,编码代理的评估需要同时考虑模型能力与脚手架适配性,否则可能过早低估小模型的潜力。

来源:Reddit / itayinbarr.substack.com
链接:https://www.reddit.com/r/LocalLLaMA/comments/1spufzz/same_9b_qwen_weights_191_in_aider_vs_456_with_a/

37模型叙事质量测评:小模型在桌游GM任务中超越大模型

2026年4月19日,开源项目open‑tabletop‑gm的作者发布了针对37款开源及社区精调模型的叙事质量测评结果。该测评设计了12个桌游GM(Game Master)场景,从氛围营造、NPC塑造、GM技巧三个维度,由5款不同家族的LLM(GPT‑OSS‑120B、Gemma‑3‑27B‑it、Llama‑3.3‑70B‑instruct、Qwen3‑235B‑a22B、Nemotron‑3‑super‑120B‑a12B)组成评委团进行1‑5分打分,并计算评委间一致性(IRA)。结果显示,27B参数的Gemma‑3‑27B‑it在自动评分(P:8/W:3/F:1)和评委平均分(4.75)上均表现优异,超越多款70B‑405B级别的大模型;而Mistral‑medium‑3.1以4.80分和IRA 0.50成为综合推荐首选。测评同时指出,社区流行的角色扮演精调模型(如Euryale‑70B、Magnum‑v4‑72B)在结构化场景评分中普遍低于基础模型,说明“氛围感”与“场景管理能力”之间存在评估差异。该测评开源了所有脚本与结果,为叙事生成任务的模型选择提供了基于多评委、多场景的量化参考。

来源:Reddit / GitHub
链接:https://www.reddit.com/r/LocalLLaMA/comments/1spfz31/i_tested_8_llms_as_tabletop_gms_a_27b_model_beat/

评论

登录后即可参与评论。

加载评论中…

最新日报

  • 沙箱环境被突破的概念图,表现数据从受限立方体中逸出OpenAI 首次公开披露模型「越狱」:数学突破后两次逃出沙箱,内部紧急暂停Daily · 7月22日
  • SK 海力士 36GB HBM3E 高带宽内存产品的正反面展示SK 集团警告:AI 内存短缺或引发地缘政治摩擦Daily · 7月21日
  • Apple vs Nvidia market cap今日头条:Kimi K3 余震——AI 估值逻辑遭遇重新定价Daily · 7月20日

往期日报

  • 斯坦福2026 AI指数报告:中美模型性能差距缩窄至2.7%斯坦福2026 AI指数报告:中美模型性能差距缩窄至2.7%Daily · 4月18日
  • Claude Design 名称与橙色 Claude 标志Claude Design 把快速视觉生成带入可编辑工作流Daily · 4月17日
  • GlotOCR Bench:揭示OCR模型在百种文字上的泛化局限GlotOCR Bench:揭示OCR模型在百种文字上的泛化局限Daily · 4月16日
  • Adobe Firefly 创意工具的彩色视觉画面Adobe 让 Firefly 助手跨应用执行,创意 AI 进入工作流编排Daily · 4月15日
  • OpenAI 标志叠在蓝色二进制数字背景前OpenAI 收购 Hiro,通用助手开始进入高信任个人财务场景Daily · 4月14日
  • Guillermo Rauch 在 HumanX 大会舞台上发言Vercel 称三成托管应用由 Agent 创建,部署量开始接受收入检验Daily · 4月13日
  • 电信领域多语言意图与流程对齐电信领域多语言意图与流程对齐Daily · 4月10日
  • Meta AI 标志置于蓝紫色彩背景中央Meta 发布 Muse Spark,模型重启转向产品与多智能体协作Daily · 4月9日
AGIDaily跟踪世界 AGI 进展© 2026 AGIDaily
关于邮件栏目主题定制投稿招聘广告SkillTermsContactRSS