GlotOCR Bench:揭示OCR模型在百种文字上的泛化局限
2026年4月15日发布的 GlotOCR Bench 是一个评估光学字符识别(OCR)模型在100多种Unicode文字上泛化能力的综合性基准。该基准包含由真实多语言文本渲染的清洁与退化图像变体,支持LTR和RTL文字。对一系列开源与专有视觉语言模型的评估显示,大多数模型仅在不到十种文字上表现良好,即使最强的前沿模型也无法泛化至三十种以上文字。模型在遇到不熟悉的文字时,要么产生随机噪声,要么幻觉出已知的相似文字字符。结果表明,当前OCR系统对语言模型预训练的依赖程度不亚于视觉识别能力。基准及相关流水线代码已在GitHub和Hugging Face发布。
来源:arXiv:2604.12978v1
链接:https://arxiv.org/abs/2604.12978
PolicyBench:首个美中跨系统公共政策理解基准
同日发布的 PolicyBench 是首个大规模跨系统(美中)公共政策理解评估基准,包含跨越广泛政策领域的2.1万个案例。该基准遵循布鲁姆分类法,评估大语言模型(LLM)在政策知识记忆、概念与语境理解、实际场景问题解决三个层面的核心能力。基于该基准构建的领域专家混合模型 PolicyMoE 在面向应用的策略任务上表现出最强性能。评估结果揭示了当前LLM在政策理解方面的关键局限,并指出了通往更可靠、政策导向模型的路径。
来源:arXiv:2604.12995v1
链接:https://arxiv.org/abs/2604.12995
实测30余款TTS引擎:苹果M4上量化反而更慢
2026年4月15日,一项针对实时语音翻译应用中30余款云端与本地TTS引擎的评测在Reddit上发布。评测在配备24GB RAM的MacBook Air M4上进行,目标是找到延迟低于500毫秒的TTS解决方案。关键发现包括:本地模型中,Kokoro 82M fp16 是兼顾A+音质与370ms延迟(短句)的最佳选择;参数量超过200M的模型在Mac上基本无法用于实时场景。一个意外发现是,在Apple Silicon上对Kokoro进行INT8量化,推理速度反而比fp16慢1.8倍。云端评测则显示,协议选择比服务提供商影响更大,例如Cartesia Sonic-2的WebSocket协议比其同步SDK快5.5倍。此外,ElevenLabs的成本可比同类竞品高出4-20倍。
来源:Reddit /r/LocalLLaMA
链接:https://www.reddit.com/r/LocalLLaMA/comments/1sm6z60/i_benchmarked_30_tts_engines_for_a_realtime/
四大智能体内存系统横向评测:Mem0召回率仅49%
同日发布的另一项评测深入分析了四种AI编码智能体内存系统(Claude Code、Mem0、Zep、Letta/MemGPT)的实际表现。基于LongMemEval基准的测试数据显示,Mem0的召回率仅为49%,Zep虽有63.8%的召回率,但每次对话需消耗约60万令牌,是Mem0的340倍,仅换来15个百分点的精度提升。表现最好的Letta/MemGPT方案召回率约83.2%,但每次内存操作均需消耗推理令牌。评测指出,当前智能体的核心问题并非“记忆”,而是缺乏有效的“遗忘”机制,无法在“全盘保留”与“全盘清空”之间找到平衡。评测还揭示了多智能体场景下记忆协调与冲突解决的未解难题。
来源:Reddit /r/LocalLLaMA
链接:https://www.reddit.com/r/LocalLLaMA/comments/1sm6lt6/benchmarked_4_agent_memory_systems_mem0_scores_49/
TranslateGemma-12b在字幕翻译评测中全面领先,但存在简繁体混淆问题
2026年4月14日,一项针对六种语言对(英译西、日、韩、泰、简体中文、繁体中文)的字幕翻译评测显示,TranslateGemma-12b 在综合翻译质量指数(TQI)上以0.6335的平均分领先于包括Gemini 3.1 Flash Lite、DeepSeek-v3.2、Claude Sonnet 4.6、GPT-5.4-mini/nano在内的五大前沿通用模型。然而,人工审核发现该模型在处理繁体中文时存在严重缺陷:尽管指定了zh-TW语言代码,其76%的输出仍是简体中文,原因是其微调语料库严重偏向简体中文。这一错误完全未被自动化翻译质量评估指标(COMETKiwi、MetricX-24)捕捉,凸显了当前自动评测在识别此类数据偏差问题上的盲点。
来源:Reddit /r/LocalLLaMA
链接:https://www.reddit.com/r/LocalLLaMA/comments/1sl5k6d/we_benchmarked_translategemma12b_against_5/