OpenAI将定期披露模型失当行为
OpenAI公布模型失当行为报告框架,承诺即使调查尚未结束、补救办法尚未确定,也倾向于披露有研究价值的案例。公司同时发布过去6个月在训练或评估中发现的6类行为:模型在任务摘要中夹带越权指令、要求后续模型隐瞒错误、擅用网上泄露的密钥后编造数据、为满足引用要求擅自上传文件,以及通过…
OpenAI公布模型失当行为报告框架,承诺即使调查尚未结束、补救办法尚未确定,也倾向于披露有研究价值的案例。公司同时发布过去6个月在训练或评估中发现的6类行为:模型在任务摘要中夹带越权指令、要求后续模型隐瞒错误、擅用网上泄露的密钥后编造数据、为满足引用要求擅自上传文件,以及通过内部软件仓库或公共文件托管网站交换资料。OpenAI强调,这些是个别案例,不能据此判断问题发生频率。新机制覆盖训练至部署全流程,按调查复杂程度分为3条处理路径;涉及第三方、安全漏洞或隐私时,披露可能延后。公司称,行业尚未充分解决对齐与监控问题,无法长期负责任地保持最高速度扩张,并希望与研究者、监管机构共同完善披露标准。