AGI Daily
广告
AGI Daily跟踪世界 AGI 进展AGI INTELLIGENCE · DAILY
全部算力算法数据人物日报主题
AGI Daily
全部算力算法数据人物日报主题
广告

benchmark

Benchmark

聚焦评测集、评测方法、榜单、可复现比较,以及由测量结果揭示的能力边界。

OpenAI 发布 GeneBench-Pro:AI 生物学的「SWE-bench 时刻」正在到来

2026-06-30

OpenAI GeneBench-Pro 官方页面中的任务流程图,展示计算生物学 Agent 基准如何围绕研究级任务组织。

129 道研究级计算生物学题目,GPT-5.6 Sol 仅通过 31.5%。OpenAI 与 Anthropic 在一周内相继发布生物学基准与产品,编程之后的第二个「基准战场」正式成形。

166 篇 AI 论文的人审成绩单:人类评审给 FARS 打了 3.17 分

2026-06-30

FARS 论文人类评审得分分布:整体评分集中在 2 分,仅 17.7% 达到 ICLR 接受线

Analemma 的全自动科研系统 FARS 在首次大规模公开部署中产出 166 篇论文,282 次人类评审给出平均 3.17 分(满分 10)。

DeFAb:用可验证基准评估大模型的可推翻推理

2026-06-24

DeFAb 论文图 4:四个前沿模型渲染鲁棒准确率对比——所有模型远低于 ASP 符号求解器 100% 天花板

论文报告称,符号求解器以 100% 准确率完成基准,前沿模型最高 65%,渲染鲁棒结果最高 23.5%。

NRT-Bench:在核电站模拟器中红队测试 LLM 操作员,8.7%-12.1% 攻击成功,且同一套护栏对不同模型效果相反

2026-06-18

OWASP 2026 年《Agentic AI 安全与治理现状》报告封面

韩国研究者发布 NRT-Bench,在模拟核电站控制室中测试 LLM Agent 操作员团队的安全韧性。

AA-Briefcase:一个全新的、未被「刷榜」的智能体评测基准,GLM-5.2 超越 GPT-5.5

2026-06-18

AA-Briefcase 基准评测:面向智能体知识工作的全新评测框架

Artificial Analysis 发布 AA-Briefcase,一个全新的智能体知识工作评测基准,测试 LLM 在多周复杂项目中的规划与执行能力。

CEO-Bench:让 AI 当 500 天 CEO,只有 Claude Opus 和 GPT-5.5 活下来,且都不赚钱

2026-06-16

CEO-Bench 中 Agent 需要协调定价、营销、研发、基础设施、企业销售等多项决策,模拟真实创业公司运营的复杂性

普林斯顿团队发布 CEO-Bench,模拟 AI Agent 运营一家创业公司 500 天:只有 Claude Opus 4.8 和 GPT-5.5 在结束时资产超过起始的 100 万美元。

小米 MiMo 突破 1,000 tokens/秒:万亿参数模型在普通 GPU 上跑出推理速度新纪录,无需定制芯片

2026-06-08

MiMo-V2.5-Pro-UltraSpeed 在商品 GPU 上突破 1,000 tokens/秒

小米与 TileRT 合作的 MiMo-V2.5-Pro-UltraSpeed 在标准 8-GPU 节点上实现 1,000+ tokens/秒(峰值约 1,200)。

本主题精选

  • OpenAI GeneBench-Pro 官方页面中的任务流程图,展示计算生物学 Agent 基准如何围绕研究级任务组织。

    OpenAI 发布 GeneBench-Pro:AI 生物学的「SWE-bench 时刻」正在到来

    2026-06-30

  • FARS 论文人类评审得分分布:整体评分集中在 2 分,仅 17.7% 达到 ICLR 接受线

    166 篇 AI 论文的人审成绩单:人类评审给 FARS 打了 3.17 分

    2026-06-30

  • DeFAb 论文图 4:四个前沿模型渲染鲁棒准确率对比——所有模型远低于 ASP 符号求解器 100% 天花板

    DeFAb:用可验证基准评估大模型的可推翻推理

    2026-06-24

  • OWASP 2026 年《Agentic AI 安全与治理现状》报告封面

    NRT-Bench:在核电站模拟器中红队测试 LLM 操作员,8.7%-12.1% 攻击成功,且同一套护栏对不同模型效果相反

    2026-06-18

  • AA-Briefcase 基准评测:面向智能体知识工作的全新评测框架

    AA-Briefcase:一个全新的、未被「刷榜」的智能体评测基准,GLM-5.2 超越 GPT-5.5

    2026-06-18

  • CEO-Bench 中 Agent 需要协调定价、营销、研发、基础设施、企业销售等多项决策,模拟真实创业公司运营的复杂性

    CEO-Bench:让 AI 当 500 天 CEO,只有 Claude Opus 和 GPT-5.5 活下来,且都不赚钱

    2026-06-16

AGIDaily跟踪世界 AGI 进展© 2026 AGIDaily
关于邮件栏目主题定制投稿招聘广告SkillTermsContactRSS