news 2026/9/7 22:46:36

Google DeepMind双盲AI评测深度解析:模型看不到考题、评测方看不到权重——机密计算如何根治基准污染

作者头像

张小明

前端开发工程师

1.2k 24
文章封面图
Google DeepMind双盲AI评测深度解析:模型看不到考题、评测方看不到权重——机密计算如何根治基准污染

引言:一场AI评测的信任危机

2026年8月27日,Google DeepMind联合新加坡AI安全研究所(Singapore AISI)、OpenMined、AVERI和MLCommons,正式发布了全球首个面向专有前沿模型的双盲评测(Double-Blind Evaluation)试点。这不是一次普通的榜单跑分,而是对"AI评测过程本身能否被信任"的一次根本性工程化尝试。

这个方案的核心思想极其简洁,但技术实现极其精密:让保密基准和模型权重在机密计算环境中相遇,评测方看不到模型权重,模型方看不到基准测试题,双方都看不到对方资产,只得到可验证结果。

为什么AI评测需要"双盲"?

想象一个学生即将参加一场高风险的考试。如果他在考前意外看到了试题,那么满分成绩就不再是能力的真实反映,而是信息泄露的结果。这正是当前AI行业评估前沿模型时面临的挑战——基准污染(Benchmark Contamination)

基准污染是指模型在训练过程中无意或有意地"记住"了测试集中的数据,导致评测分数不能反映真实能力。根据Freelan等人2026年发表的论文,在对17个前沿语言模型和18个公开基准的大规模测量中,整体污染率达到57.3%,所有模型和所有基准都有可检测的污染迹象。更令人担忧的是,Schaeffer等人(2026)的研究表明,测试集污染不仅会虚高分数,而且这种虚高程度会随着污染程度和模型规模的增长而增长。

来源:Freelan, D. (2026). “Measuring Benchmark Data Contamination in Frontier Language Models at Scale.” NE2NE. https://ne2ne.com/static/papers/contamination_paper.pdf


一、基准污染:AI评测的"房间里的大象"

1.1 什么是基准污染?

基准污染发生在模型的训练数据中包含了评测基准的测试集。当一个模型在训练时已经"见过"考题,它在评测中的高分就不再是真实能力的体现,而是记忆力的体现。

┌─────────────────────────────────────────────────────────────────────┐ │                  基准污染(Benchmark Contamination)全景图             │ │                                                                     │ │  ┌─────────────────────┐    ┌──────────────────────────────────┐    │ │  │   训练数据收集阶段    │    │       公开互联网数据爬取          │    │ │  │                     │    │                                  │    │ │  │  Common Crawl ──────┼───>│  MMLU测试题 ✓                    │    │ │  │  GitHub ────────────┼───>│  HumanEval代码 ✓                 │    │ │  │  arXiv论文 ─────────┼───>│  GSM8K数学题 ✓                   │    │ │  │  Reddit讨论 ────────┼───>│  BIG-bench子集 ✓                │    │ │  │  维基百科 ──────────┼───>│  HotpotQA ✓                     │    │ │  └─────────────────────┘    └──────────────────────────────────┘    │ │                                    │                                │ │                                    ▼                                │ │  ┌──────────────────────────────────────────────────────────────┐   │ │  │                     模型训练过程                               │   │ │  │                                                              │   │ │  │  预训练阶段:模型在万亿token上学习,无意中"记住"了测试题         │   │ │  │  微调阶段:人工标注数据可能包含基准题目                          │   │ │  │  RLHF阶段:偏好数据中可能混入标准答案                           │   │ │  │  持续训练:新数据批次可能包含最新发布的基准                      │   │ │  └──────────────────────────────────────────────────────────────┘   │ │                                    │                                │ │                                    ▼                                │ │  ┌──────────────────────────────────────────────────────────────┐   │ │  │                  评测结果失真                                  │   │ │  │                                                              │   │ │  │  模型在MMLU上得分85% → 但30%的题目已在训练数据中出现过          │   │ │  │  真实能力可能只有55% → 评测分数虚高30个百分点                   │   │ │  │  用户根据虚高分数选模型 → 部署后实际表现远不如预期               │   │ │  └──────────────────────────────────────────────────────────────┘   │ │                                                                     │ │  污染类型: 无意污染(爬虫数据包含基准)  │  有意污染(针对性训练)    │ │  检测难度: 几乎无法完全检测              │  可通过行为探针发现       │ └─────────────────────────────────────────────────────────────────────┘

1.2 基准污染有多严重?

多项研究揭示了基准污染的严重性:

大规模测量结果:Freelan等人(2026)对17个前沿模型和18个基准的测试显示:

  • 整体污染率:57.3%
  • 开放权重模型(Llama、Mistral、DeepSeek、Qwen):74-79%
  • 闭源API模型(GPT-4、Claude、Gemini):40-64%
  • 污染最严重的基准:HotpotQA、QuAC、FEVER(维基百科衍生数据集)
  • 污染最轻的基准:MATH、HellaSwag(数学和常识推理类)

行为退化证据:Schaeffer等人(2026)发现,将MMLU测试题改为间接引用形式后,模型准确率平均下降7个百分点,法律和伦理类题目下降高达19.8个百分点——这恰恰是污染最严重的领域。

1.3 传统评测方式的困境

在双盲评测出现之前,外部评测方和模型提供方面临一个"双重机密困境":

┌──────────────────────────────────────────────────────────────────────────┐ │                    传统评测模式:无法回避的权衡                             │ │                                                                          │ │  模式A:评测方提供测试题,模型方运行评测                                  │ │  ┌──────────────┐        测试题明文         ┌──────────────┐             │ │  │   评测方      │ ────────────────────────> │   模型方      │             │ │  │  (测试题)     │                           │  (权重+代码)  │             │ │  │              │ <──────────────────────── │              │             │ │  └──────────────┘        返回结果           └──────────────┘             │ │  ⚠️ 风险:测试题可能被模型方看到,泄露到训练数据中                         │ │                                                                          │ │  模式B:模型方提供权重,评测方本地运行评测                                │ │  ┌──────────────┐        模型权重明文       ┌──────────────┐             │ │  │   评测方      │ <──────────────────────── │   模型方      │             │ │  │  (测试题+权重) │                           │  (权重+代码)  │             │ │  └──────────────┘                           └──────────────┘             │ │  ⚠️ 风险:模型权重可能被评测方泄露,知识产权受损                           │ │                                                                          │ │  模式C:通过API调用,双方签署NDA和零日志协议                             │ │  ┌──────────────┐   API调用(含测试题)     ┌──────────────┐             │ │  │   评测方      │ ────────────────────────> │   模型方      │             │ │  │  (测试题)     │      NDA + 零日志       │  (权重+API)   │             │ │  └──────────────┘                           └──────────────┘             │ │  ⚠️ 风险:依赖信任而非技术保障,法律约束不等于技术保障                     │ │                                                                          │ └──────────────────────────────────────────────────────────────────────────┘

如DeepMind官方博客所述:“历史上,高风险的第三方评测需要一种权衡。要么评测方交出测试题(冒着模型提供方提前看到题目的风险),要么模型方交出模型权重(冒着知识产权泄露的风险)。”

来源:Isaac, W., Messing, S., & Lum, K. (2026). “Piloting the world’s first double-blind AI evaluations.” Google DeepMind Blog. https://deepmind.google/blog/piloting-the-worlds-first-double-blind-ai-evaluations/


二、双盲评测:技术方案深度解析

2.1 双盲评测的总体架构

Google DeepMind的双盲评测(DBE)框架建立在Google Cloud Confidential Computing产品组合中的Confidential Space之上,结合Intel TDX主机内存加密和NVIDIA H100 80GB Confidential GPU,实现了硬件级的机密计算环境。

┌─────────────────────────────────────────────────────────────────────────────┐ │                    双盲评测(Double-Blind Evaluation)整体架构                 │ │                                                                             │ │  ┌──────────────────┐          ┌──────────────────────────────────┐        │ │  │   模型方(DeepMind) │          │        机密计算飞地(Enclave)        │        │ │  │                   │          │                                  │        │ │  │  ┌─────────────┐  │  加密通道  │  ┌──────────────────────────┐  │        │ │  │  │ Gemini 2.5  │  │ ────────>│  │  Intel TDX加密内存         │  │        │ │  │  │ Flash Lite  │  │          │  │  ┌────────────────────┐   │  │        │ │  │  │ 模型权重    │  │          │  │  │ NVIDIA H100 GPU    │   │  │        │ │  │  │ JAX推理代码  │  │          │  │  │ 机密GPU飞地        │   │  │        │ │  │  └─────────────┘  │          │  │  └────────────────────┘   │  │        │ │  │                   │          │  │  PySyft Datasite运行时    │  │        │ │  └──────────────────┘          │  └──────────────────────────┘  │        │ │                                 │              ▲                │        │ │  ┌──────────────────┐          │              │加密通道          │        │ │  │   评测方(MLCommons)│          │  ┌──────────────────────────┐  │        │ │  │                   │          │  │  AILuminate保留基准        │  │        │ │  │  ┌─────────────┐  │  加密通道  │  │  CBRNE/网络攻击/仇恨言论  │  │        │ │  │  │ 私有测试题   │  │ ────────>│  │  AI安全评测脚本           │  │        │ │  │  │ 评测脚本     │  │          │  └──────────────────────────┘  │        │ │  │  │ 评分标准     │  │          └──────────────────────────────────┘        │ │  │  └─────────────┘  │                        │                             │ │  └──────────────────┘                         ▼                             │ │                                     ┌──────────────────┐                   │ │                                     │  可验证聚合结果    │                    │ │                                     │  (双方均不可见    │                   │ │                                     │   对方资产)      │                    │ │                                     └──────────────────┘                   │ │                                                                             │ │  ✅ 评测方看不到模型权重          ✅ 模型方看不到测试题                        │ │  ✅ 双方独立验证远程证明          ✅ 结果可密码学验证                          │ │  ✅ 计算完成后飞地立即销毁         ✅ 无中间数据泄露风险                        │ └─────────────────────────────────────────────────────────────────────────────┘

2.2 机密计算TEE原理

双盲评测的基础是硬件级可信执行环境(TEE),其核心信任根建立在芯片制造商的硬件安全机制之上。

┌─────────────────────────────────────────────────────────────────────────────┐ │                   机密计算TEE(可信执行环境)原理                               │ │                                                                             │ │  ┌──────────────────────────────────────────────────────────────────┐       │ │  │                    云服务器物理硬件                              │       │ │  │                                                                  │       │ │  │  ┌──────────────────────────────────────────────────────────┐   │       │ │  │  │              主机操作系统(Hypervisor)                    │   │       │ │  │  │  ❌ 无法访问TEE内部内存         ❌ 无法篡改TEE内部代码      │   │       │ │  │  └──────────────────────────────────────────────────────────┘   │       │ │  │                          │                                       │       │ │  │  ┌──────────────────────────────────────────────────────────┐   │       │ │  │  │  │                 TEE安全飞地(Enclave)              │   │       │ │  │  │  │                                                     │   │       │ │  │  │  │  ┌─────────────────────────────────────────────┐    │   │       │ │  │  │  │  │     硬件级内存加密(Memory Encryption)       │    │   │       │ │  │  │  │  │  - 所有RAM中的数据自动加密                    │    │   │       │ │  │  │  │  │  - 密钥仅存在于芯片内部,OS无法读取           │    │   │       │ │  │  │  │  │  - 即使物理拔插内存条也无法获取明文           │    │   │       │ │  │  │  │  └─────────────────────────────────────────────┘    │   │       │ │  │  │  │                                                     │   │       │ │  │  │  │  ┌─────────────────────────────────────────────┐    │   │       │ │  │  │  │  │     远程证明(Remote Attestation)            │    │   │       │ │  │  │  │  │  - 芯片内置唯一密钥,生产时烧录               │    │   │       │ │  │  │  │  │  - 对运行中所有软件栈进行哈希签名             │    │   │       │ │  │  │  │  │  - 外部方可通过签名验证飞地可信性             │    │   │       │ │  │  │  │  └─────────────────────────────────────────────┘    │   │       │ │  │  │  │                                                     │   │       │ │  │  │  │  ┌─────────────────────────────────────────────┐    │   │       │ │  │  │  │  │     可信计算基(TCB)                         │    │   │       │ │  │  │  │  │  - 固件 / 客户内核 / 初始化系统               │    │   │       │ │  │  │  │  │  - 容器运行时 / 应用镜像                     │    │   │       │ │  │  │  │  │  - 可复现构建:每层均可从源码重建验证          │    │   │       │ │  │  │  │  │  - SSH/键盘/鼠标/屏幕全部禁用                │    │   │       │ │  │  │  │  └─────────────────────────────────────────────┘    │   │       │ │  │  │  └─────────────────────────────────────────────────────┘   │       │ │  │                                                                  │       │ │  │  硬件信任根:Intel TDX / AMD SEV-SNP / NVIDIA H100机密GPU       │       │ │  │  - CPU微码和固件为闭源,信任CPU厂商                             │       │ │  │  - 厂商公钥证书链确保芯片签名真实可信                            │       │ │  │  - 如云厂商和硬件厂商共谋可攻破,但双方共谋概率极低              │       │ │  └──────────────────────────────────────────────────────────────────┘       │ └─────────────────────────────────────────────────────────────────────────────┘

2.3 双盲评测的七步流程

根据DeepMind技术报告,双盲评测的完整流程分为七个关键步骤:

┌─────────────────────────────────────────────────────────────────────────────┐ │                     双盲评测完整流程时序图                                     │ │                                                                             │ │  模型方(DeepMind)           机密飞地(Enclave)           评测方(MLCommons)│ │       │                            │                           │            │ │       │  (1) 发布模拟接口          │                           │            │ │       │ ─────────────────────────>│                           │            │ │       │                            │                           │            │ │       │                            │ (2) 使用模拟接口开发测试脚本 │            │ │       │                            │ <────────────────────────── │            │ │       │                            │                           │            │ │       │  (3) 双方独立验证远程证明  │                           │            │ │       │ ─────────────────────────>│ <────────────────────────── │            │ │       │  验证硬件签名&TCB哈希     │  验证硬件签名&TCB哈希      │            │ │       │                            │                           │            │ │       │  (4) 加密上传模型权重      │                           │            │ │       │ ─────────────────────────>│                           │            │ │       │                            │  (4) 加密上传测试题和脚本  │            │ │       │                            │ <────────────────────────── │            │ │       │                            │                           │            │ │       │  (5) 双方审批对方代码      │                           │            │ │       │ ─────────────────────────>│ <────────────────────────── │            │ │       │  审核代码仅调用白名单方法  │  审核代码仅调用白名单方法  │            │ │       │                            │                           │            │ │       │                            │ (6) 飞地执行评测           │            │ │       │                            │  ├─ 加载模型权重到GPU      │            │ │       │                            │  ├─ 运行推理               │            │ │       │                            │  ├─ 计算聚合指标           │            │ │       │                            │  └─ 加密输出结果           │            │ │       │                            │                           │            │ │       │  (7) 接收加密聚合结果      │  (7) 接收加密聚合结果      │            │ │       │ <─────────────────────────│ ──────────────────────────>│            │ │       │  仅可见约定的指标          │  仅可见约定的指标          │            │ │       │                            │                           │            │ │       │                            │ 飞地销毁,所有数据清零     │            │ │       │                            │                           │            │ └─────────────────────────────────────────────────────────────────────────────┘

2.4 关键技术组件

本次试点使用的技术栈非常丰富:

组件用途技术细节
Google Cloud Confidential Space机密计算平台提供硬件级隔离的虚拟机环境
Intel TDXCPU内存加密Trust Domain Extensions,主机内存加密
版权声明: 本文来自互联网用户投稿,该文观点仅代表作者本人,不代表本站立场。本站仅提供信息存储空间服务,不拥有所有权,不承担相关法律责任。如若内容造成侵权/违法违规/事实不符,请联系邮箱:809451989@qq.com进行投诉反馈,一经查实,立即删除!
网站建设 2026/9/7 22:45:59

Python数学建模模板:标准化流程提升竞赛与项目开发效率

1. 项目概述&#xff1a;为什么我们需要一个Python数学建模模板&#xff1f;如果你参加过数学建模竞赛&#xff0c;或者在工作中处理过需要量化分析、预测或优化的复杂问题&#xff0c;你大概率经历过这样的场景&#xff1a;赛题发布或任务下达后&#xff0c;你打开一个空白的P…

作者头像 李华
网站建设 2026/8/30 3:05:12

蓝桥杯单片机国赛:智能物料传送系统设计全解析

1. 项目概述与核心价值 “智能物料传送系统”这个题目&#xff0c;乍一听可能觉得是个大型工业项目&#xff0c;但在蓝桥杯单片机国赛的舞台上&#xff0c;它实际上是一道非常经典的综合性嵌入式系统设计考题。我当年带队备赛&#xff0c;看到这个题目时&#xff0c;第一反应是…

作者头像 李华
网站建设 2026/8/29 22:14:51

30分钟搭好环境音识别:Transformers音频分类完整实践

30分钟搭好环境音识别&#xff1a;Transformers音频分类完整实践 【免费下载链接】transformers &#x1f917; Transformers: the model-definition framework for state-of-the-art machine learning models in text, vision, audio, and multimodal models, for both infere…

作者头像 李华
网站建设 2026/8/30 23:16:58

5个Agent技能实战:从合同改期到自动报表的完整指南

5个Agent技能实战&#xff1a;从合同改期到自动报表的完整指南 【免费下载链接】skills Public repository for Agent Skills 项目地址: https://gitcode.com/GitHub_Trending/skills3/skills skills 仓库是 Anthropic 官方开源的 Agent Skills 项目&#xff0c;把 docx…

作者头像 李华
网站建设 2026/9/3 12:49:28

端侧AI与物理AI崛起:Android端目标检测模型部署实战

1. 背景&#xff1a;端侧 AI 与物理 AI&#xff0c;为什么同时被资本重仓 最近一条融资消息在 AI 圈子里引起了不少讨论&#xff1a;前海母基金以数亿元级别资金押注 Om AI联汇&#xff0c;重点推动端侧 AI 的商业化落地。单看消息本身似乎只是又一次资本注入&#xff0c;但结合…

作者头像 李华