DeepMind试点双盲AI评测:用机密计算减少基准污染
Google DeepMind introduced a pilot that keeps both a proprietary model and an external evaluator's test prompts private inside a cryptographically verifiable environment. The goal is to reduce benchmark contamination and make independent evaluations more trustworthy.

如果考生提前偷看了试卷,满分还有什么意义?AI 评测正面临同样的尴尬——模型可能在训练时就"见过"考题,这个被称为"基准污染"的问题,让许多排行榜分数变得可疑。8 月 27 日,Google DeepMind 宣布试点所谓"全球首个"针对专有前沿级 AI 模型的双盲评测,试图用密码学手段把出题方和答题方隔开[1][3]。
双方都"看不见"
据 DeepMind 官方博客介绍,这套机制把外部评测方的测试提示词封存在一个密码学"盒子"里,模型无法提前获取这些题目来优化性能[1]。具体而言,外部评测者拿不到模型权重,DeepMind 也看不到对方的私有测试提示词,双方在同一个经过密码学验证的环境中运行[3][4]。博客将这一设计类比为高风险考试:考生在开考前不应看到题目,否则成绩就失去意义[1]。

*图1:Google DeepMind logo(DeepMind Technologies Limited (Alphabet, Inc.). / Public domain,Wikimedia Commons)*
"双盲"概念直接借自临床试验和科研设计——在双盲药物试验中,患者和给药医生都不知道谁用了真药、谁用了安慰剂,从而排除预期偏差[3]。DeepMind 把这套逻辑搬到了模型测试上,只不过对立的不是两个组,而是两方主体[3]。
合作方与测试对象
DeepMind 表示,此次试点与新加坡 AI 安全研究所、OpenMined、AVERI 和 MLCommons 合作,用一个 Gemini Flash Lite 模型在隐私保护环境中对抗机密基准测试[1]。公告署名作者为 William Isaac、Sol Messing 和 Kristian Lum[1][3]。据 explainx.ai 报道,官方在 X 上的帖子获得了 26.5 万以上浏览量[3]。

*图2:ARS - Bee Traits and Genome Research (20211210-ARS-LSC-1389)(USDAgov / Public domain,Wikimedia Commons)*
信息缺口与未证实之处
不过,这套试点目前披露的细节相当有限。runtimewire 的报道指出,公告、技术报告及现有材料均未说明参与模型、外部评测方、评测领域、技术安全架构或评测结果,也没有足够信息判断谁控制评测环境、流程是否独立于模型所有者[4]。DeepMind 称其为"行业首创",但这一说法尚未获得独立验证[4]。该媒体还提到,闭源模型的审计往往迫使评测方公开私有测试,或让开发者交出宝贵的模型权重,一个可信的双盲流程本可同时保护双方,但目前披露不足,难以评估其安全性、结果或评测方独立性[4]。

*图3:AI research robots key to ‘democratizing and revolutionizing science’, world-class AFRL researcher says (8274977)(U.S. Air Force AFRL by David Dixon / Public domain,Wikimedia Commons)*
点评
从"基准污染"到"评测独立性",DeepMind 这次试点的价值或许不在于刷新某个分数,而在于提出了一种新协议:能否在不泄露任何一方敏感材料的前提下完成测试[3]。机密计算能否真正改变前沿模型评测的信任模型,取决于后续是否公开更多技术细节与可复现的结果——就目前而言,这仍是一个需要被独立审视的承诺。
参考来源
[1] Piloting the world's first double-blind AI evaluations
https://deepmind.google/blog/piloting-the-worlds-first-double-blind-ai-evaluations/
[2] Google DeepMind Pilots Double-Blind AI Evaluation
https://academy.evalcommunity.com/google-deepmind-pilots-double-blind-ai-evaluation/
[3] DeepMind Double-Blind AI Eval: No Peeking (2026) - explainx.ai
[4] Google DeepMind pilots double-blind AI evaluations without ...
https://runtimewire.com/article/google-deepmind-double-blind-gemini-ai-evaluations
本稿由 AI 生成,发布状态:pending_human_review。正式发布前以人工审核为准。