最新动态

谷歌推出创新双盲评估技术,确保AI基准测试的公正性

2026-08-28
5279次

随着技术的发展,AI模型的评估方法也在不断演变。谷歌于8月27日宣布,他们推出了一种全球首创的双盲评估机制,专为前沿的专有AI模型设计。这一方式在加密的“黑箱”环境中进行外部评估,从而有效避免模型在测试前获取到任何测试信息的机会,以此来提高评估的公正性和准确性。就如同学生在考试前不应事先接触试题,才能真实反映他们的水平,AI模型的评估同样面临信息提前透露的问题,若模型提前了解测试内容,便会导致所得到的评估结果失去可信度。

about image

谷歌与新加坡人工智能安全研究所、OpenMined、AVERI及MLCommons等合作,在一个保护隐私的环境中对Gemini Flash Lite模型开展机密的基准测试,以增强评估结果的完整性。往常,针对高风险的外部评估常常陷入进退两难的境地,要么评估方将测试提示词交出,可能导致模型提前接触测试内容的风险;要么模型方交出模型权重,则可能面临知识产权的泄露。双盲评估通过谷歌云的保密计算产品系列中的Confidential Space,成功破解了这一难题。该技术通过加密验证,确保外部评估数据和专有模型对各自所有者保持隐私,评估方不能查看Gemini模型的权重,而谷歌也无法获知评估方的测试提示词。

about image

这样的加密手段不仅能有效防止基准污染,还能保护敏感数据,对于进行敏感性高的网络安全或政府机构的评估尤为关键。双盲评估使独立机构得以在不损害数据主权和安全的前提下,对先进的AI模型实施严格的测试。谷歌表示,希望这一试点为模型监督开辟新的方向,助力整个行业建立一个更安全、更可靠、更受公众信任的AI体系。

about image

全国咨询热线

13594780174

球盟会·qmh(中国)-官方网站

联系电话:13594780174

联系人:李总

邮箱:postWorld@att.net

公司地址:武威市夕响神殿23号


微信扫一扫

手机官网