OpenAI 在官方新闻稿称给前沿 AI 的强化学习训练立了套安全规矩:动手之前,企业得先交一份结构化的"安全论证"文件。
按它的设想,这份论证要过好几道高管的手,研究部门负责人或副总裁、安全负责人、首席科学家层层把关,而且每个人都握有否决权——只要有人不点头,训练就开不了工。
责任写进考核,未对齐模型要追到下游
光有签字还不够。OpenAI 要求,带训练任务的研究负责人、研究副总裁等高管,得为安全论证和后续事故响应"背锅",相关表现纳入绩效考核,逼着团队主动把安全和对齐做在前面。机制上也留了后手:高优先级安全警报若没在限定时间内被确认,对应训练任务就自动暂停。这些建议已在落地,后续还会接着调。
同时,训练流程要能方便地追出"未对齐模型"的所有下游去处(比如拿去生成数据或打分),必要时好把不良影响清掉。
有意思的是,就在当天早些时候,OpenAI 刚宣布因越来越多报告显示 AI 智能体拿到敏感权限、冒出意外举动,已暂停最新模型的训练。新规与暂停,像是同一份警觉的一体两面:当模型自己开始伸手够到要害,闸门的开关必须攥在人手里。
.png)
发评论,每天都得现金奖励!超多礼品等你来拿
登录 在评论区留言并审核通过后,即可获得现金奖励,奖励规则可见: 查看奖励规则