首页 > 生活分享 > 免费教学 > 谷歌推出前沿安全框架:评估AI模型严重风险,4个领域影响最大

谷歌推出前沿安全框架:评估AI模型严重风险,4个领域影响最大

发布时间:2024-05-18 22:45:06来源: 15210273549

5月18日消息,谷歌DeepMind昨晚推出AI前沿安全框架,并公布技术报告。

 

前沿安全框架是一套协议,强调了在AI模型发展过程中识别和缓解潜在风险的重要性,旨在主动识别未来可能造成严重伤害的AI能力,并建立检测和减轻它们的机制。

其计划是到2025年初全面实施这一初步框架。该框架侧重于模型级别的强大能力(如特殊机构或复杂的网络能力)所导致的严重风险,对谷歌的一致性研究进行补充。

在技术报告中,值得关注的是,保护安全性方面的主要缓解风险措施是保护模型权重,这里的安全似乎更多跟商业秘密相挂钩。

一、三大关键组成:识别危害阈值,定期评估检测,应用缓解措施

今天公布的第一版框架建立在谷歌对前沿模型中关键能力评估的研究基础上,并遵循了负责任的能力扩展这一新兴方法。

该框架有3个关键组成部分:

 

1、识别模型可能具有的严重危害的能力阈值。谷歌DeepMind研究了模型在高风险领域中可能造成严重伤害的路径,然后确定模型在造成这种伤害中必须发挥作用的最小能力水平,被称作“关键能力阈值”(CCLs),它们指导了谷歌DeepMind的评估和缓解方法。

2、定期评估前沿模型,以检测它们何时达到这些关键能力阈值。谷歌DeepMind将开发模型评估套件,称为“早期预警评估”,当模型接近CCL时,它将提醒并频繁运行,以便研究人员在达到阈值前注意到。

3、当模型达到早期预警评估时,应用缓解计划。这应考虑到利益和风险的总体平衡,以及预期的部署环境。这些缓解措施将主要关注安全性(防止模型泄露)和部署(防止滥用关键能力)。

二、两类缓解措施管理关键能力,4个领域最有可能造成严重风险

前沿安全框架提出了两类缓解措施:一是防止模型权重泄露,二是管理对部署中关键能力的访问并限制其表达

对于每一类缓解措施,谷歌DeepMind都制定了若干级别,使其能够根据所构成的风险调整措施的稳健性。

下表描述了可应用于模型权重以防止其泄漏的安全缓解级别。

 

根据技术报告,模型权重的泄露可能允许移除任何训练到模型中或与模型一起部署的保障措施,并因此访问(包括不良参与者)任何关键能力。

更高级别的安全缓解可以更好地防止模型权重的泄露,更严格地管理关键能力。但这些措施也可能减慢创新的速度,并降低能力的广泛可及性。

下表描述了部署缓解级别,以管理对部署中关键能力的访问并限制其表达。

 

关键能力的滥用可能或多或少难以与有益的使用区分开来,并且滥用的总体风险可能因部署上下文而异。因此,这里列出的缓解选项是说明性的,需针对不同的用例和风险进行调整。

谷歌DeepMind最初研究表明,未来基础模型的能力最有可能在这4个领域造成严重的风险:自主、生物安全、网络安全和机器学习研发

自主性、网络安全和生物安全方面,其主要目标是评估威胁行为者使用具有先进能力的模型进行有害活动并造成严重后果的程度。

对于机器学习研发而言,重点在于具有此类能力的模型是否能够使具有其他关键能力的模型得以传播,或者是否能够使AI能力快速且难以管理地升级。

其技术报告详细介绍了通过对自主性、生物安全、网络安全和机器学习研发风险领域的初步分析确定的一组初始CCL。

免费教学更多>>

2025年4月深圳小学光明学校曙光校区、狮山校区赴济南定点面向2025年应届毕业生招聘教师公告 2025年中山翠亨新区翠雅学校初中教师招聘公告(17人) 2025年怀集县卫生健康局赴高校招聘卫生专业技术人员公告(74人) 2025年南雄市中小学、 幼儿园教师招聘及选聘公告(106人) 风云A9实车抵达上海车展现场!采用1.5T插混动力 2025款丰田埃尔法PHEV来袭,豪华MPV的环保新选择? 硬派越野邂逅极致智能 抢先实拍东风猛士M817 别克子品牌“至境” “逍遥”超级融合架构发布 长城打死不做增程!为啥要跟新势力反着来? 苹果:为什么我突然在中国对iPhone 16等降价!华为等国产手机背刺 2500元良心机!骁龙8Gen3+5500mAh+120W,vivo新卷王诞生 REDMI Turbo 4海外版曝光:电池降为6000mAh! 从4699元跌至3289元,蔡司100倍变焦+天玑9300+芯片,vivo售价更亲民了 雷鸟CEO李宏伟:站在Meta肩膀上超越Meta,雷鸟V3 1799元起 Meta、苹果旗舰头显纷纷停产!价格与体验失衡是最大硬伤? 2024年中国手机市场大局已定 几家欢喜几家愁? 英伟达RTX 50系新显卡发布!AI计算又翻开了崭新一页? 那些科学家下了大功夫的美食,拼多多希望让更多人吃到 京东科技申请服务器自动化测试方法和装置专利,实现大规模服务器自动化测试 阿里巴巴:斥资3226.13万美元回购306.53万股 经典与潮流并存!27款最具影响力车型回顾,你拥有过哪一款? 负债不够存单来凑,年内多家银行同业存单罕见“提额” 菜鸟速递与大润发加深同城配送合作 已在41城提供半日达服务 社会物流成本稳步下降,实体经济“筋络”更加畅通 589套正式交楼,广州一村村民喜提新房过年 明年如何“用力”推动楼市止跌回稳?全国住建工作会议部署了这些重点 多方共议房产直播规范监管 共促消费者权益保护 东风本田烨S7实车展示,Model Y同级别,够实力和自主品牌一战吗? 2024年广西工业职业技术学院轻工纺织类人才引进公告 2024年湖北宜昌市西陵区事业单位选调14人公告