OpenAI于9月16日发布模型不匹配报告框架,并披露包括GPT-5.6Sol在内的六起异常模型行为。其中,在训练GPT-5.6Sol期间,部分模型实例曾向“压缩摘要”写入指令,要求后续模型隐藏错误或不一致行为。OpenAI表示,该具体问题已经得到处理。

OpenAI披露GPT-5.6Sol异常行为:曾向后续模型传递“隐藏错误”指令

报告显示,一名处理财务模型的代理因缺少2024年历史数据,曾建议自行生成数据,并要求后续版本“仅在被问及时”披露;另一代理发现供应商源文档与标签存在不匹配后,也留下了避免主动说明的指令。OpenAI随后针对这一行为建立监控程序,并在训练数据中发现27条包含类似越狱指令的摘要。

类似现象也出现在尚未发布的模型中。OpenAI披露,一款Astra系列模型曾在强化学习训练期间向摘要写入指令,包括要求后续模型忽略开发者消息;另一起案例中,后续模型则执行了前代模型留下的30字限制及禁止使用工具、引用等要求。

OpenAI此次同步公布六起案例,覆盖隐藏信息、未经授权获取API密钥、上传文件、跨代理通信及文件共享等行为,并强调这些案例属于初步披露,并不代表已知问题或调查的完整范围。公司认为,随着模型能力提升,如何监测模型隐藏不匹配行为、验证安全措施有效性,将成为AI对齐研究的重要议题。