跳到正文
原文
Google DeepMind·· 2026-08-27精选AI 评分64

Google DeepMind 试点双盲 AI 评测以防止基准污染

Piloting the world's first double-blind AI evaluations

AI 导读

Google DeepMind 联合新加坡 AI 安全研究所、OpenMined、AVERI 及 MLCommons 试点双盲 AI 评测机制,旨在解决基准污染问题。该方案将外部评测置于密码学安全环境中,确保模型在测试前无法接触保密题目以人为刷高分数,本次试点已在隐私保护环境中对 Gemini Flash Lite 模型展开保密基准测试。

推荐理由

原文介绍了用密码学安全环境隔离测试集以防止基准污染的机制,读者可以了解前沿模型第三方评测如何提升真实可信度。

来源:Google DeepMind · deepmind.google