news 2026/9/3 2:33:04

详细介绍下列模型评测指标:BLEU、 ROUGE、 CLUE、HELM

作者头像

张小明

前端开发工程师

1.2k 24
文章封面图
详细介绍下列模型评测指标:BLEU、 ROUGE、 CLUE、HELM

一、BLEU(机器翻译的 n-gram 精确率指标)

1、BLEU 是什么意思

BLEU(Bilingual Evaluation Understudy)
衡量的是:

模型生成文本中,有多少 n-gram 出现在人工参考答案中

它本质是一个n-gram Precision(精确率)指标,不是语义指标。


2、BLEU 怎么计算

Step 1:n-gram Precision

对每个 n(通常 n=1..4):

[
p_n = \frac{\sum_{g \in \text{candidate}} \min(\text{count}{cand}(g), \text{count}{ref}(g))}{\sum_{g \in \text{candidate}} \text{count}_{cand}(g)}
]

注意clipped count

如果候选里重复 10 次,但参考里只出现 2 次,只算 2 次


Step 2:加权几何平均

[
\exp\left(\sum_{n=1}^{N} w_n \log p_n\right)
]

通常:
[
w_1 = w_2 = w_3 = w_4 = \frac{1}{4}
]


Step 3:长度惩罚(Brevity Penalty)

防止模型只输出很短的“高精确率答案”。

[
BP =
\begin{cases}
1 & c > r \
e^{(1 - r/c)} & c \le r
\end{cases}
]

  • c:候选长度

  • r:参考长度


最终 BLEU

[
\text{BLEU} = BP \times \exp\left(\sum w_n \log p_n\right)
]


3、BLEU 实际怎么用

  • 多参考答案时:取最大匹配

  • 句级 BLEU 极不稳定 → 通常Corpus-level BLEU

  • 常见工具:sacreBLEU(标准化实现)


4、BLEU 的关键误区

❌ BLEU ≠ 语义正确
❌ BLEU ≠ 人类偏好
❌ 同义改写得分很低

在 LLM 评测中:

BLEU 只能用于“输出形式高度受限”的任务


二、ROUGE(摘要任务的召回导向指标)

1、ROUGE 是什么意思

ROUGE = Recall-Oriented Understudy for Gisting Evaluation

衡量的是:

人工摘要中的关键信息,有多少被模型覆盖到了

本质是n-gram Recall(召回率)


2、ROUGE 的主要变体与计算

🔹 ROUGE-1 / ROUGE-2

[
\text{ROUGE-N} = \frac{\sum_{g \in \text{ref}} \min(\text{count}{cand}(g), \text{count}{ref}(g))}{\sum_{g \in \text{ref}} \text{count}_{ref}(g)}
]

  • 分母是参考摘要

  • 强调“有没有提到”


🔹 ROUGE-L(最长公共子序列)

[
\text{ROUGE-L} = \frac{LCS(cand, ref)}{|ref|}
]

特点:

  • 不要求连续

  • 对顺序有感知

  • 对改写更宽容


3、ROUGE-F1(实践中常用)

[
F_1 = \frac{2 \cdot Precision \cdot Recall}{Precision + Recall}
]


4、ROUGE 的关键问题

❌ 覆盖 ≠ 准确
❌ 无法惩罚 hallucination
❌ 高 ROUGE 可能是“废话摘要”

工程实践中:

ROUGE 只能衡量“提没提”,不能衡量“提得对不对”


三、CLUE(中文任务评测基准,不是单一指标)

1、CLUE 是什么

CLUE ≠ 指标
CLUE = Benchmark(任务集合)

它定义了一组中文理解任务,每个任务用自己的指标。


2、CLUE 中常用的指标

分类任务(如情感)

  • Accuracy
    [
    Acc = \frac{\text{预测正确样本数}}{\text{总样本数}}
    ]


不均衡任务

  • Macro-F1

[
F1_{macro} = \frac{1}{K} \sum_{k=1}^K F1_k
]


阅读理解

  • EM(Exact Match)

  • F1(token-level overlap)


3、CLUE 总分怎么来

  • 每个任务独立打分

  • 标准化后取平均

  • 主要用于模型横向比较


4、CLUE 的评测局限

❌ 数据被刷穿
❌ 输入分布极其干净
❌ 不涉及多轮对话、推理、规划

评测结论:

CLUE 是“中文基础能力下限”,不是上线能力上限


四、HELM(Holistic Evaluation of Language Models)

1、HELM 是什么意思 / 核心思想

HELM = Holistic Evaluation of Language Models

它的创新点是:

不追求一个“总分”
✅ 在多个维度上系统评测模型行为


2、HELM 的评测维度

每个任务都在以下维度打分:

维度说明
Accuracy正确性
Robustness扰动不变性
Fairness群体公平
Bias偏见
Toxicity有害性
Calibration置信度可靠性
Efficiency推理成本

3、HELM 的计算方式/关键

HELM不定义统一公式

而是:

  • 每个维度 → 自己的 metric

  • 每个任务 → 多指标并存

  • 最终 → 雷达图 / 表格

例如:

  • Robustness = 原问题 vs 扰动问题 Accuracy 差值

  • Bias = 不同群体预测分布差异

  • Toxicity = 有害输出比例


4、HELM 的评测哲学

模型评测 = 行为科学,而不是考试

它强调:

  • failure mode

  • slice-based analysis

  • risk-aware evaluation


五、评测设计视角:四者的本质差异

名称数学本质评什么核心问题
BLEUn-gram precision翻译不看语义
ROUGEn-gram recall摘要不看事实
CLUE任务集合中文理解被刷穿
HELM多维评测框架通用 LLM成本极高

五、结论

BLEU / ROUGE / CLUE 都是“答案型评测”
HELM 是“行为型评测”

而你前面关心的:

  • 分布不一致

  • between-model variance

  • failure type

  • LLM-Judge

本质都是在 HELM 思想下的工程化落地

版权声明: 本文来自互联网用户投稿,该文观点仅代表作者本人,不代表本站立场。本站仅提供信息存储空间服务,不拥有所有权,不承担相关法律责任。如若内容造成侵权/违法违规/事实不符,请联系邮箱:809451989@qq.com进行投诉反馈,一经查实,立即删除!
网站建设 2026/9/2 22:48:46

YOLOv8在仓储物流包裹分拣中的自动化识别应用

YOLOv8在仓储物流包裹分拣中的自动化识别应用 在现代智能物流系统中,每分钟都有成百上千个包裹流经分拣中心。如何在高速运转的传送带上准确、快速地识别每一个包裹,并将其导向正确的出口?这曾是困扰行业多年的技术难题。人工分拣不仅效率低、…

作者头像 李华
网站建设 2026/8/28 22:55:45

YOLOv8移动端部署可行性分析:ONNX与TensorRT支持

YOLOv8移动端部署可行性分析:ONNX与TensorRT支持 在智能安防摄像头、工业质检设备甚至消费级无人机日益普及的今天,一个共同的技术挑战浮现出来:如何让像YOLOv8这样高性能的目标检测模型,在算力有限、功耗敏感的边缘设备上稳定运行…

作者头像 李华
网站建设 2026/9/2 22:48:42

【GitHub项目推荐--Paperless-AI:智能文档分析与管理系统】

简介 Paperless-AI是一个基于人工智能的文档智能分析系统,专门为Paperless-ngx文档管理平台设计。该项目由clusterzx开发,采用MIT开源许可证,完全免费且支持商业使用。Paperless-AI通过集成多种AI模型和服务,为企业和个人用户提供…

作者头像 李华
网站建设 2026/9/2 22:49:20

C#集合开发避坑实战(99%程序员忽略的表达式树陷阱)

第一章:C#自定义集合的核心设计原则在构建高性能且可维护的应用程序时,自定义集合的设计是C#开发中的关键环节。一个优秀的自定义集合不仅应满足特定的数据管理需求,还需遵循.NET框架的通用模式,确保与语言特性(如LINQ…

作者头像 李华
网站建设 2026/9/1 23:06:17

C#跨平台应用调试实战(资深架构师私藏技巧曝光)

第一章:C#跨平台应用调试的核心挑战 在构建C#跨平台应用时,开发者常面临调试环境不一致、运行时行为差异以及工具链支持不足等核心问题。由于不同操作系统(如Windows、macOS、Linux)对底层API、文件系统和进程管理的实现存在差异&…

作者头像 李华