CNMLEQA:面向中国国家医学资格考试的大语言模型评测数据集
2026年4月17日,研究团队在《Scientific Data》上发布了CNMLEQA数据集,这是一个专门用于评估大语言模型在中国国家医学资格考试(CNMLE)上表现的多维度基准。该数据集整合了来自PubMed、GitHub和MedExamLLM三个来源的试题-答案对,包含两个子集:CNMLEQA‑10k(9,890道多选题)和CNMLEQA‑3k(2,949道多选题)。每道题均经临床专家标注,覆盖试题类型、考试年份及临床场景(疾病诊断、手术、用药、检验、症状/体征)等多个维度。研究团队使用该数据集评估了包括Gemini、DeepSeek、GPT、Qwen和LLaMA在内的主流模型,并进行了Qwen模型的微调实验。结果显示,Qwen2.5‑32B在CNMLEQA‑10k上取得90.88%的准确率,而DeepSeek‑R1在CNMLEQA‑3k上达到91.59%的准确率。该数据集已在Zenodo开源,并配套发布了评测代码,为中文医学大模型的标准化评估提供了可复现的基准。
来源:Scientific Data
链接:https://doi.org/10.1038/s41597-026-07261-9
DogReID‑1553:大规模犬只重识别视频数据集与基准测试
2026年4月17日,研究团队在哈佛大学Dataverse上发布了DogReID‑1553数据集及配套的评测基准。该数据集包含1,553只不同犬只的7,463段视频(平均每只犬4.8段视频),每段视频的首帧图像均提供了手工标注的边界框,并附有由GPT‑5生成的文本描述。除了数据,团队还建立了在线排行榜,支持研究者提交模型结果进行排名。该基准旨在推动视频级别的犬只重识别(Re‑ID)任务,为细粒度生物识别、动物行为研究等场景提供可复现的评估标准。
来源:Harvard Dataverse
链接:https://doi.org/10.7910/DVN/LVTRLG