2026-08-19 16:03:04
随着AI模型能力增强,内部研发及测试环节的安全风险也随之上升。当地时间18日,美国人工智能企业OpenAI表示,鉴于前沿大模型的能力触及关键安全阈值,公司正放缓最先进模型的研发节奏,并收紧内部安全管控。就在一个月前,OpenAI披露了一起由旗下模型失控引发的网络攻击事件。
OpenAI称,为满足安全标准,对于最新一批计划部署的模型,公司此前已暂停强化学习(RL)训练两周,以加固研究环境安全、扩大监控系统覆盖范围。目前部分低风险训练已经恢复,但该公司最大规模前沿模型的强化学习训练目前仍处于暂停状态。
与此同时,OpenAI正在开发一套全新系统,用于解析模型内部推理逻辑,一旦监测到可疑行为,系统将在30分钟内向工作人员发出警报。不过,这套监控系统投入使用需要额外消耗20%的算力资源。