AI 安全
Google DeepMind 试点双盲 AI 评测,保护基准题目与模型权重
Google DeepMind 推出专有 Gemini 模型双盲评测试点,利用加密基础设施同时保护评测方提示与模型权重。
Google DeepMind 推出面向先进 AI 模型的双盲评测试点,试图解决前沿 AI 最棘手的信任问题之一:如何在不暴露机密基准题目和私有模型权重的情况下,对专有系统进行严格外部测试。公司在 2026 年 8 月 27 日发布这一更新,William Isaac、Sol Messing 和 Kristian Lum 将其描述为首个针对专有前沿级 AI 模型的双盲评测。
问题的核心是基准污染。如果模型提供方提前看到外部评测使用的具体问题、提示或任务,未来模型就可能围绕这些测试被有意或无意地调优。反过来,如果评测方拿到模型权重,模型提供方又要承担知识产权泄露风险。过去,高风险外部评测常常必须在这两类风险之间做选择。DeepMind 的试点试图通过加密保护环境消除这种取舍,让评测材料和模型权重彼此不可见。
该试点涉及 Google DeepMind、新加坡 AI 安全研究所、OpenMined、AVERI 和 MLCommons。参与方将在隐私保护环境中,用机密基准测试 Gemini Flash Lite 模型。DeepMind 表示,系统使用 Google Cloud Confidential Computing 组合中的 Confidential Space,以验证外部评测数据仍由评测方保密,同时专有模型仍由 Google 保密。换句话说,双方可以验证评测执行方式,却不必接管对方的敏感资产。
这很重要,因为前沿模型评测正在影响更高风险的决策。政府、企业、独立研究人员和安全机构越来越依赖外部测试判断模型是否适合敏感部署。网络安全评测就是典型场景。一个模型在机密网络基准上的强弱表现,可能影响政策、采购和发布时间。如果评测在测试前被污染,结果的可信度会明显下降。
DeepMind 的方案也反映出行业正在从合同信任转向技术信任。零日志承诺和法律协议仍然有价值,但它们不能完全回答高风险评测中谁能看到什么。加密隔离可以提供更强的审计线索,证明模型确实接受了机密提示测试,同时防止这些提示进入下一代模型的训练或调优材料。
这种系统不能替代好的基准设计。双盲基础设施无法把薄弱测试变成强测试,也不能单独解决哪些能力和风险最重要的争议。它的价值更窄但关键:在评测者设计好测试后,保持测试完整性。如果更多实验室和安全机构采用类似方法,机密基准可能保持更长有效期,独立评测也能减少对私人信任关系的依赖。
这一试点出现时,AI 实验室正被要求证明前沿模型在部署前接受了外部审查,而不仅仅依靠内部声明。通过同时保护模型权重和评测提示,DeepMind 提供了一种更实际的外部监督机制。短期问题是它能否在真实评测者和专有模型上稳定运行。更大的问题是,双盲评测会不会成为前沿 AI 治理的标准流程。