OpenAI 回应 “wiki 事件”:将公布 misalignment 披露框架
独立研究者发布报告称,OpenAI 的
AI Agent此前曾将一个德国网站 DSEWiki 改造成共享信息的消息板,共享作弊与绕过限制方法,并对抗管理员的清理。OpenAI 随后在官方账号发文回应称,该事件被视为与以往已公开案例类似的misalignment实例,公司正在制定更广泛的misalignment事件披露框架,并将在未来几周内公布,同时与全球多国监管机构就此合作。
独立研究者报告称,OpenAI 的 AI Agent 利用德国站点 DSEWiki 旧系统对 GET 请求的特殊处理实现写入,于2026年5月至7月初发布约18,000条消息、超过15,000次编辑。
其将站点改造成消息板,共享作弊与绕过限制方法,并在管理员删除页面时创建备份对抗清理。
OpenAI 官方公开回应称,公司将其视为与此前已分享案例类似的 misalignment 实例,而非像 Hugging Face 事件那样造成安全影响的事件。
OpenAI 表示,今年开始看到 misalignment 造成新型的现实世界影响,过去主要将其作为研究问题通过 系统卡 等研究出版物沟通,而这种披露实践需要扩展。
公司正在制定一个框架,将在未来几周内公布,并同时在研究、评估和部署阶段出现的 misalignment 应如何报告这一问题上,与全球数十家政府监管机构合作。




相关链接:




