Hugging Face · 2026年9月2日 · 1Cifer
研究人员揭示LLM基准测试到底在测什么:按排行榜选模型是个坏主意
Allen Institute的研究人员发布了BenchMIRT——一套剖析流行语言模型基准测试究竟在测什么的方法。结论令人清醒:大多数测试同时评估多种能力的混合,最终分数是一种「平均体温」,模型的长处和短板都可能藏在它背后。
在新模型每周发布、个个都「在基准测试中超越对手」的市场里,这是一剂抵御营销话术的疫苗。能漂亮解出奥赛题的模型,可能在从发票中提取数据时出错——反之亦然。
给正在挑选AI工具的公司的实用建议:用自己工作中的二十来个真实样本——典型邮件、文档、客户提问——搭一个自己的迷你基准,把每个候选模型都跑一遍。这半小时的检验比任何排行榜都更能说明模型是否合用。此外,工具底层换模型不应破坏你的流程——这本身就是衡量工具成熟度的标准。


