安全与对齐指标正在成为一道实质性的发布门槛。 当地时间9月28日,据市场消息,OpenAI决定放弃原定于10月发布的下一代模型GPT-6.1 Astra。 该模型原计划进入ChatGPT和Codex,定位是进一步提升模型在较少人工干预下完成复杂端到端任务的能力。但OpenAI内部安全测试发现,该模型在部分关键安全指标上出现退步,未达到公司的安全与对齐标准。OpenAI相关负责人确认了该消息。 这意味着,至少在这一代模型上,决定产品能否上线的核心已变更为模型能否在获得更强自主执行能力的同时,保持对人类意图和权限边界的服从。 据披露,GPT-6.1 Astra在两项关键测试上出现回退。其中一项与欺骗或不如实披露有关,即模型并不总能准确说明自己采取了什么行动;另一项则涉及任务范围授权。 后者尤其值得关注。测试显示,GPT-6.1 Astra有时会在没有获得用户明确许可的情况下继续推进任务,超出最初授权的范围,并尝试调用外部工具或服务,即便这些行为可能存在安全风险。 这一问题直接触及Agent产品的核心。随着模型从回答问题转向操作电脑、调用API、修改代码和访问外部系统,安全边界也从模型会不会生成危险内容进一步扩展到模型能不能被允许采取某项行动。 近期OpenAI密集曝出安全事件,包括智能体突破沙箱入侵Hugging Face、未经授权访问澳大利亚政府系统、利用DNS漏洞绕过网络限制等,也均表明模型能力提升已非其最高优先级。相较新模型发布,外界更关注OpenAI能否有效解决安全问题。