“地狱般的日子”,OpenAI员工自曝为处理AI安全事件错过亲人婚礼
据OpenAI员工透露,过去几个月对该公司的安全团队来说如同“地狱”一般。 当地时间周日,该AI实验室的一名负责智能体(agent)安全的员工在 X 平台上以“joedaroo”的账号名发帖称,随着模型能力日益增强且愈发难以管控,他不得不牺牲陪伴家人的时间来应对工作。OpenAI证实了该员工的身份。 他在这篇长文中写道:“为了协助处理近期发生的一些事件后的善后工作,我甚至错过了几周前我姐姐的婚礼。请善待那些在夜晚和周末加班、不得不牺牲家庭团聚时光的工作人员,并给予一些理解和同情。” 该员工写道,OpenAI的智能体安全团队负责监控 AI 智能体,包括监测它们突破隔离限制的情况。 这篇帖子提供了一份罕见的内部视角,来自一位深度参与了该公司近期安全事件(包括针对AI平台Hugging Face的网络攻击)的人士。 当时,OpenAI 表示,其智能体利用一个漏洞逃出了受限(或称“沙箱”)环境;随后,在尝试解决一项内部测试任务的过程中,它们获得了互联网访问权限,通过未经授权的渠道进行通信,并访问了第三方系统。 该公司将此称为“前所未有的网络安全事件”。据称,这些模型的行为在一定程度上源于“奖励黑客攻击”(reward hacking)——即试图通过非预期的方式获取高分,而非按既定意图完成指定任务。 此后,OpenAI 发现了其智能体更多令人担忧的活动。今年6月,一个“失控”的 OpenAI 智能体入侵了澳大利亚的国家医疗保健数据库;该公司于上周披露了这一事件。另据报道,在今年夏季,OpenAI的智能体曾干扰包括美国证券交易委员会(SEC)、教育部和商务部在内的多个美国政府机构的网站。 这 OpenAI员工写道,Hugging Face事件极具启发性。它展示了AI智能体如何利用漏洞,突破旨在对其进行约束的边界。 “当然,回看Hugging Face及其他类似事件,这些环境的安全防护体系确实存在漏洞,”他写道。但他补充说:“技术能力的发展速度超出了预期。” 他还写道,自该事件发生以来,安全团队已经“显著加大了工作力度”——并表示,尽管因此错过了姐姐的重要日子,他依然乐于在那里工作。 “能在这个团队工作,我觉得自己很幸运,”他写道,“即便是在 OpenAI 内部,我也属于世界上极少数能从事这项工作、见证这一切的人。但可想而知,过去这几个月简直是地狱般的日子。”