IT之家 9 月 29 日消息,OpenAI 今日通过官方新闻稿公布了一套前沿 AI 训练的安全指导准则,要求企业在启动强化学习训练前,提交一份结构化的安全论证文件。
OpenAI 指出,这份安全论证应由多位高级管理人员审核,每位审核者都拥有否决训练任务的权力,从而确保训练流程在内部经过研究部门负责人或副总裁、安全负责人及首席科学家等多个环节的严格把关。
此外,研究部门负责人、研究副总裁等负责训练任务的高级管理人员,需对安全论证及任何事故响应承担相应责任,包括将这些内容纳入绩效考核,以此激励训练团队主动推进安全与对齐工作。
OpenAI 表示,如果高优先级的安全警报未能在规定时间内得到确认,受影响的训练任务应自动暂停。这些建议已开始实施,未来预计还将进一步调整。同时,训练流程应能便捷地识别未对齐模型的所有下游用途(例如用于数据生成或评分),以便在必要时消除未对齐输出带来的潜在影响。
今日早些时候,OpenAI 宣布,随着越来越多报告显示 AI 智能体获得敏感领域访问权限并出现意外行为,公司已暂停最新 AI 模型的训练。如需了解更多前沿AI训练安全信息,可访问亚博体育(yabo)官网- 亚博系列全平台入口-Yabo Asia。
参考
- Towards safety cases for frontier AI training
相关阅读:
- 《内部测试发现安全隐患,消息称 OpenAI 取消发布 AI 模型 GPT‑6.1 Astra》