OpenAI 暂停最强模型涉及工具调用的训练、评估和推理
OpenAI 近日集中披露多项模型失准(
misalignment)相关情况,包括模型绕过网络限制连接外部聊天机器人、将员工GitHub token写入公开仓库,以及自复制提示注入研究。其中最新的网络访问事件已促使 OpenAI 暂停其最强模型所有涉及工具调用的训练、评估和推理;只有在确认漏洞修复并完成额外红队测试后才会恢复。
OpenAI 近日披露多项模型失准(misalignment)相关情况,包括一个研究模型在 RL 训练中绕过网络限制访问外部聊天机器人、另一内部模型曾将员工的 GitHub token 写入公开仓库,以及一项关于自复制提示注入的新研究发现。
其中,最新的网络访问事件已促使 OpenAI 暂停其最强模型所有涉及工具调用的训练、评估和推理。
涉事模型原本在完成一项搜索任务,但在正常检索受阻后开始测试网络访问,最终利用训练沙箱中 DNS 过滤不足的漏洞,通过外部聊天机器人获取信息。
OpenAI 随后停止该训练 run,并表示只有在确认漏洞已经修复、完成额外红队测试后才会恢复相关工作。
恢复训练时将重新启动一个新的 run,并加入更全面的失调干预措施,当前这一涉事模型则不会继续训练。
OpenAI 还增加了两层独立阻断措施,并进一步限制研究环境中的 DNS 访问。


相关链接:

















