AI安全性

Google DeepMind、ベンチマークとモデル重みを守る二重盲検AI評価を試行

Google DeepMindは、評価プロンプトと独自モデル重みの双方を秘匿する暗号化基盤を用いた二重盲検評価を発表した。

公開日 更新日
Google DeepMindAI評価AI安全性

Google DeepMindは、高度なAIモデル向けの二重盲検評価パイロットを発表した。狙いは、フロンティアAIにおける難しい信頼問題を解くことだ。つまり、機密ベンチマークを外部に漏らさず、独自モデルの重みも渡さずに、厳密な評価をどう実施するかである。同社は2026年8月27日にこの取り組みを公開し、William Isaac、Sol Messing、Kristian Lumは、独自のフロンティア級AIモデルに対する初の二重盲検評価だと説明した。

背景にあるのはベンチマーク汚染である。モデル提供者が外部評価で使われる具体的な質問やプロンプトを事前に見れば、将来のモデルが意図的でなくてもそのテストに最適化される可能性がある。一方で評価者がモデル重みを受け取れば、提供者は知的財産の流出リスクを負う。高リスク評価は従来、この二つの危険の間で妥協を迫られてきた。DeepMindのパイロットは、暗号的に保護された環境でこの妥協を取り除こうとしている。

この試行にはGoogle DeepMind、Singapore AI Safety Institute、OpenMined、AVERI、MLCommonsが参加する。参加者は、プライバシー保護環境の中でGemini Flash Liteモデルを機密ベンチマークにかける。DeepMindによれば、Google CloudのConfidential Computingに含まれるConfidential Spaceを使い、外部評価データが評価者に秘匿され、独自モデルがGoogleに秘匿されたままであることを検証できる。

これは、フロンティアモデル評価の重みが増しているため重要だ。政府、企業、独立研究者、安全機関は、モデルが敏感な用途に使えるか判断するため外部評価に頼り始めている。サイバーセキュリティ評価はその代表例だ。機密ベンチマーク上の性能は、政策、調達、リリース判断に影響し得る。テスト前に評価が汚染されれば、その結果の価値は大きく下がる。

この提案は、契約上の信頼から技術的な信頼への移行も示す。ゼロログの約束や契約上の保護は重要だが、高リスク評価で誰が何を見られるかという問題を完全には解決しない。暗号的隔離は、機密プロンプトでモデルが試験されたことを示しつつ、そのプロンプトが次世代モデルの訓練や調整素材になることを防ぐ監査性を与える。

もちろん、二重盲検の基盤は良いベンチマーク設計の代わりにはならない。弱いテストを強いテストにはできず、どの能力やリスクを測るべきかの議論も解決しない。それでも価値は明確だ。評価者が設計したテストの完全性を守ることで、機密ベンチマークを長く有効に保ち、独立評価を私的な信頼関係だけに依存させにくくする。

AI企業は、配備前の評価を内部主張だけでなく外部監督で示すよう求められている。DeepMindの仕組みは、モデル重みと評価プロンプトの両方を保護する実務的な方法を提案する。今後の焦点は、実際の評価者と独自モデルで安定して機能するか、そして二重盲検評価がフロンティアAIガバナンスの標準になるかである。