中文评测基准高频术语释义:从C-Eval到人类对齐
中文评测基准数量激增,但其中术语常让人困惑。这篇小词典为你逐条拆解核心概念。
基准集(Benchmark)是什么
基准集是一组标准化的测试题目或任务,用来衡量模型在特定方向上的表现。对于中文场景,评测基准需要覆盖汉字理解、成语语境、多音字处理、方言表达等特色问题。
通用型基准
- 综合知识类:涵盖数学、历史、科学、法律等不同学科,按多选题或简答题形式出题。题目难度从常识到专业依次递补,目的是考察模型的多领域知识储备。
- 封闭式问答:每个问题有少有的正确答案,能够快速计分,适合自动化测试。缺点是可能被训练集污染,导致模型只是“记住答案”。
中文特有题型
- 成语填空:考察对四字成语固定用字和语境的理解,例如“画蛇添足——。”
- 诗词对仗:给出上句,让模型补全下句,必须符合平仄与语义。
- 中式逻辑:类似“如果所有A都是B,有些B是C,那么……”这类受中文表述方式影响的推理题。
从2026年起,越来越多基准开始加入“阅读障眼”设计——故意插入错别字或冗余信息,检验模型是否具备真正理解而非模式匹配的能力。
评测任务(Task)的分类
评测任务按难度和产生方式分为几类,每类对模型的要求不同。
判别式任务(Discriminative)
- 多项选择:从4~5个选项中选出一个答案,适合考核知识记背。主流基准如C-Eval、CMMLU都用这种形式。
- 是非判断:针对陈述句回答“对/错”,可快速大规模测试,但选项少易受猜测影响。
生成式任务(Generative)
- 开放式问答:不限制答案形式,需模型自主组织语言。评价时常用人工或自动匹配关键词,难度较高。
- 文本续写:给定开头写一段连贯文字,考察创意与逻辑,但评价标准不易统一。
对抗性任务(Adversarial)
- 扰动测试:在原题上微调表述(如把“小明”改成“小红”),看答案是否变化。如果变化大,说明模型过度依赖表面词汇而非真实推理。
- 反事实例:给出与现实矛盾的假设情境,要求模型按假设逻辑作答,测试常识推理的鲁棒性。
评测任务的选择直接决定了基准的“偏科”倾向。譬如只做选择题的基准可能让模型擅长排序而非理解,因此在2026年的新基准中,混合任务类型逐渐成为主流。
指标(Metric)与评分方法
指标是把模型输出量化为分数的规则,不同指标侧重点完全不同。
准确率(Accuracy)
- 简单、直观:回答正确的题目数除以总题数。适用于封闭式问答,但无法反映答案质量差异。
- 缺陷:若某类题目占比过高,准确率会被稀释;且随机猜测也会得到一定分数。
宏平均与微平均(Macro / Micro)
- 宏平均:先分别计算各知识领域的准确率,再取算术平均。每个领域权重相同,避免大领域掩盖小领域短板。
- 微平均:所有题目加总后算总体准确率。如果某领域题目多,它的表现就会主导总分。
BLEU 与 ROUGE
- BLEU(双语评估替身):通过计算生成文本与参考答案的n-gram重合度打分,常用在翻译和摘要任务。但容易偏好短句、与语义脱节。
- ROUGE(面向摘要评估替身):以召回率为核心,衡量生成文本覆盖了多少参考内容,对于中文长文本尤其需要调整分词器。
人类评分(Human Evaluation)
- 邀请标注员对模型答案进行1~5分打分,标准包括准确性、连贯性、有用性。虽然可靠,但成本高、难以大规模重复。
- 2026年出现了一些“半自动人类评分”工具,用小型模型预估人类偏好,再抽检校准,试图平衡成本与质量。
零样本学习(Zero-shot)与少样本学习(Few-shot)
这两个术语描述模型在评测时的输入方式,直接决定评测的难度和公平性。
零样本
- 直接给出测试问题,不提供任何例子或上下文。考验模型能否仅凭预训练中学到的知识作答,是衡量“泛化能力”的常用做法。
- 对于中文大模型,零样本时可能因缺乏同主题示例而答得较差;细读该类分数能反映模型的真实知识深度。
少样本
- 在每个问题前附上若干(通常3~5个)类似题目的标准答案,帮助模型理解答题格式。这更接近人类使用范例学习的方式。
- 常见做法是:先给两个英文示例再问中文问题——这实际是在考验模型的跨语言迁移能力而非纯中文能力。
指令遵循(Instruction Following)
- 虽然不属于零/少样本,但密切相关:评测时模型需理解任务描述(“请回答以下问题”),好的指令遵循能力让基准成绩更可信。
- 2026年的一些中文基准专门设计了“指令陷阱”,比如故意在指令中加入不相关要求,测试模型是否会跑偏。
这些方法的组合能反映模型在不同使用场景下的表现:日常对话偏零样本,专业问答偏少样本。
人类对齐(Alignment)与鲁棒性评估
随着模型能力增强,评测已不满足于“答对”,更关注是否符合人类价值观与使用习惯。
安全性评测(Safety)
- 偏好对齐:考察模型是否回避暴力、歧视、违法内容,且拒绝方式是否自然合理。常通过红队测试(人类专家模拟攻击)来发现漏洞。
- 一致性:同一问题在不同表述下给出不矛盾的答案。例如“鲁迅姓什么?”和“周树人的笔名是什么?”应指向相同结论。
鲁棒性评测(Robustness)
- 小扰动:给句子加一个错别字或删除一个符号,看答案是否剧烈变化。稳定模型应当对微小干扰不敏感。
- 长尾问题:训练数据中很少出现的罕见知识(如冷门古诗、方言词汇),正常模型应主动识别不确定并说“不知道”,而非胡乱编造。
评价基准本身的反思
- 数据重合检查:评测题目是否与模型训练数据有重叠,若有则成绩虚高。2026年的中文基准开始强制发布“未见数据集”用于最终排名。
- 动态题库:定期更换部分试题,防止模型通过记忆答案刷分。但这增加了组织方的工作量。
综合评价框架
- 一些机构提出“能力雷达图”,从知识、推理、安全、生成等维度综合打分,避免单一分数误导。
- 同时要注意:基准只是抽样,不能完全代表模型在真实应用中的表现。实际使用时还需结合场景做针对性测试。
理解这些术语有助于读者更透彻地看待各种排行榜和评测报告,避免被表面分数牵着走。
常见问题
中文评测基准有哪些常见数据集
常用数据集包括C-Eval、CMMLU、CLUE、SuperCLUE、AGIEval等。它们侧重不同,比如C-Eval侧重知识,CMMLU侧重推理。
零样本和少样本评测有什么区别
零样本直接给问题无示例,少样本提供几个例子。零样本更难,反映模型泛化能力;少样本更接近实际使用,但也更依赖示例质量。
模型在评测中得分高就代表好用吗
不一定。评测只能反映特定任务表现,可能忽略安全性、生成流畅度、鲁棒性等。实际使用中还需考虑响应速度、成本等因素。
为什么中文评测要单独设计成语题
成语是中文特有结构,模型需要理解固定搭配和语境。若成语题答不好,说明模型对中文精妙之处把握不足。
人类评分为什么不能完全取代自动指标
人类评分成本高、速度慢、主观性强,且难以重复。自动指标虽便宜但可能偏离真实质量,二者常结合使用。
2026年中文评测基准有什么新趋势
更注重动态题库、对抗性测试和多任务混合,以减少数据污染影响,并强调模型安全性与用户偏好对齐。
鲁棒性评测为什么越来越受重视
鲁棒性体现模型在输入模糊、错误或挑唆下的稳定性。在实际应用中,用户提问往往不标准,鲁棒性差的模型容易给出错误回答。