AGI Daily
广告
AGI Daily跟踪世界 AGI 进展AGI INTELLIGENCE · DAILY
全部算力算法数据人物日报主题
AGI Daily
全部算力算法数据人物日报主题
广告

CNMLEQA:面向中国国家医学资格考试的大语言模型评测数据集

2026年4月20日 · 2026-04-20

榜单与结果

CNMLEQA:面向中国国家医学资格考试的大语言模型评测数据集

2026年4月17日,研究团队在《Scientific Data》上发布了CNMLEQA数据集,这是一个专门用于评估大语言模型在中国国家医学资格考试(CNMLE)上表现的多维度基准。该数据集整合了来自PubMed、GitHub和MedExamLLM三个来源的试题-答案对,包含两个子集:CNMLEQA‑10k(9,890道多选题)和CNMLEQA‑3k(2,949道多选题)。每道题均经临床专家标注,覆盖试题类型、考试年份及临床场景(疾病诊断、手术、用药、检验、症状/体征)等多个维度。研究团队使用该数据集评估了包括Gemini、DeepSeek、GPT、Qwen和LLaMA在内的主流模型,并进行了Qwen模型的微调实验。结果显示,Qwen2.5‑32B在CNMLEQA‑10k上取得90.88%的准确率,而DeepSeek‑R1在CNMLEQA‑3k上达到91.59%的准确率。该数据集已在Zenodo开源,并配套发布了评测代码,为中文医学大模型的标准化评估提供了可复现的基准。

来源:Scientific Data
链接:https://doi.org/10.1038/s41597-026-07261-9

DogReID‑1553:大规模犬只重识别视频数据集与基准测试

2026年4月17日,研究团队在哈佛大学Dataverse上发布了DogReID‑1553数据集及配套的评测基准。该数据集包含1,553只不同犬只的7,463段视频(平均每只犬4.8段视频),每段视频的首帧图像均提供了手工标注的边界框,并附有由GPT‑5生成的文本描述。除了数据,团队还建立了在线排行榜,支持研究者提交模型结果进行排名。该基准旨在推动视频级别的犬只重识别(Re‑ID)任务,为细粒度生物识别、动物行为研究等场景提供可复现的评估标准。

来源:Harvard Dataverse
链接:https://doi.org/10.7910/DVN/LVTRLG

方法与争议

编码代理基准测试中脚手架适配的影响:同一Qwen 9B模型性能翻倍

2026年4月19日,一项在Reddit上分享的测试表明,编码代理的基准结果高度依赖脚手架(scaffold)与模型的匹配程度。作者固定使用Qwen3.5‑9B Q4权重,在相同的Aider Polyglot基准(225道练习题)上比较了默认Aider脚手架与针对小模型优化的“little‑coder”脚手架。结果,默认脚手架仅取得19.11%的pass@2,而优化后的脚手架达到45.56%,性能提升超过一倍。作者指出,在10B参数以下的本地模型中,编码代理的弱表现可能并非源于模型权重本身,而是由于脚手架与模型行为模式不匹配。这一发现提示,编码代理的评估需要同时考虑模型能力与脚手架适配性,否则可能过早低估小模型的潜力。

来源:Reddit / itayinbarr.substack.com
链接:https://www.reddit.com/r/LocalLLaMA/comments/1spufzz/same_9b_qwen_weights_191_in_aider_vs_456_with_a/

37模型叙事质量测评:小模型在桌游GM任务中超越大模型

2026年4月19日,开源项目open‑tabletop‑gm的作者发布了针对37款开源及社区精调模型的叙事质量测评结果。该测评设计了12个桌游GM(Game Master)场景,从氛围营造、NPC塑造、GM技巧三个维度,由5款不同家族的LLM(GPT‑OSS‑120B、Gemma‑3‑27B‑it、Llama‑3.3‑70B‑instruct、Qwen3‑235B‑a22B、Nemotron‑3‑super‑120B‑a12B)组成评委团进行1‑5分打分,并计算评委间一致性(IRA)。结果显示,27B参数的Gemma‑3‑27B‑it在自动评分(P:8/W:3/F:1)和评委平均分(4.75)上均表现优异,超越多款70B‑405B级别的大模型;而Mistral‑medium‑3.1以4.80分和IRA 0.50成为综合推荐首选。测评同时指出,社区流行的角色扮演精调模型(如Euryale‑70B、Magnum‑v4‑72B)在结构化场景评分中普遍低于基础模型,说明“氛围感”与“场景管理能力”之间存在评估差异。该测评开源了所有脚本与结果,为叙事生成任务的模型选择提供了基于多评委、多场景的量化参考。

来源:Reddit / GitHub
链接:https://www.reddit.com/r/LocalLLaMA/comments/1spfz31/i_tested_8_llms_as_tabletop_gms_a_27b_model_beat/

评论

登录后即可参与评论。

加载评论中…

最新日报

  • 沙箱环境被突破的概念图,表现数据从受限立方体中逸出OpenAI 首次公开披露模型「越狱」:数学突破后两次逃出沙箱,内部紧急暂停Daily · 7月22日
  • SK 海力士 36GB HBM3E 高带宽内存产品的正反面展示SK 集团警告:AI 内存短缺或引发地缘政治摩擦Daily · 7月21日
  • Apple vs Nvidia market cap今日头条:Kimi K3 余震——AI 估值逻辑遭遇重新定价Daily · 7月20日

往期日报

  • DogReID‑1553:大规模犬只重识别视频数据集与基准测试Daily · 4月19日
  • 斯坦福2026 AI指数报告:中美模型性能差距缩窄至2.7%斯坦福2026 AI指数报告:中美模型性能差距缩窄至2.7%Daily · 4月18日
  • Claude Design 名称与橙色 Claude 标志Claude Design 把快速视觉生成带入可编辑工作流Daily · 4月17日
  • GlotOCR Bench:揭示OCR模型在百种文字上的泛化局限GlotOCR Bench:揭示OCR模型在百种文字上的泛化局限Daily · 4月16日
  • Adobe Firefly 创意工具的彩色视觉画面Adobe 让 Firefly 助手跨应用执行,创意 AI 进入工作流编排Daily · 4月15日
  • OpenAI 标志叠在蓝色二进制数字背景前OpenAI 收购 Hiro,通用助手开始进入高信任个人财务场景Daily · 4月14日
  • Guillermo Rauch 在 HumanX 大会舞台上发言Vercel 称三成托管应用由 Agent 创建,部署量开始接受收入检验Daily · 4月13日
  • 电信领域多语言意图与流程对齐电信领域多语言意图与流程对齐Daily · 4月10日
  • Meta AI 标志置于蓝紫色彩背景中央Meta 发布 Muse Spark,模型重启转向产品与多智能体协作Daily · 4月9日
AGIDaily跟踪世界 AGI 进展© 2026 AGIDaily
关于邮件栏目主题定制投稿招聘广告SkillTermsContactRSS