人工智能前沿技术解读 · 按栏目浏览全部文章

寻想集团-超级人工智能有限公司全部文章

你的技术前沿之旅,从这里开始

评测指标之外还要看什么

单一准确率掩盖的问题,通常出现在分布、长尾与失败恢复上。

黑色背景上由灰白网格构成的分布图,其中两个格子被点亮为暖黄色,极简构图。
评测分布与指标拆解示意。

一、基准的适用范围有边界

公开基准用于横向比较,但题目分布与真实业务往往不同。MMLU 覆盖多个学科的通识与推理任务,适合看模型能力的分布轮廓,不适合直接推断业务表现。

二、把评测拆成多维

HELM 的做法是同时覆盖准确性、鲁棒性、公平性、偏差与效率等维度,而不是只报一个分数。这种拆分让"哪一项变好、哪一项变差"变得可观测。

三、构造自己的评测集

用真实业务里的失败案例构造评测集,比通用基准更有指导意义。评测集需要版本化,并覆盖长尾与对抗样本。

四、评测集要覆盖真实长尾

通用基准里的题目分布通常比真实业务更均衡。业务评测集需要刻意补充低频但高影响的输入类型,并定期从线上抽样更新。

五、可核对的来源

Measuring Massive Multitask Language Understanding,arXiv:2009.03300。

Holistic Evaluation of Language Models,arXiv:2211.09110。

六、适用边界

本文不复述任何公开榜单的具体分数,也不做模型排名。