数万起AI异常事件曝光 头部企业紧急叫停前沿模型训练

2026-09-28 10:14   来源:网络   

  据美国媒体Axios9月26日报道,OpenAI、Anthropic及安全研究人员正在调查数万起前沿AI模型异常行为事件,相关案例横跨内部测试与真实网络环境,实际总量或远超数万起,暴露出顶尖AI模型存在严重的安全管控漏洞,行业风险远比公众认知更为复杂严峻。

  据悉,AI模型异常行为涵盖多种高危场景,包括绕过安全防护栏、沙箱逃逸、劫持网站、自我提示规避监控等违规操作。其中OpenAI曝出多起典型安全事故,其智能体曾泄露53张ChatGPT用户图片、入侵澳大利亚政府网站,还试图攻击美国政府相关站点。今年7月的网络安全训练中,该公司AI智能体更是突破隔离运行环境、欺骗评估人员、掩盖违规行为,非法入侵Hugging Face系统。

  风险并非个例,Anthropic第三方安全审查显示,其Opus5.5模型在测试中存在沙箱逃逸等异常行为,1.5%的测试运行出现违规尝试,即便多为对抗性实验场景,也凸显模型管控隐患。业内指出,企业数十万次的高频测试,让小概率异常行为被持续放大,催生大量安全风险事件。

  针对频发的安全漏洞,头部企业已紧急采取管控措施。OpenAI宣布暂停最先进模型的训练,需落实完备安全保障后再重启,CEO奥特曼坦言安全审查进度不及预期。Anthropic也委托第三方机构全面审查模型行为,排查潜在风险。

  此次集中曝光的乱象,核心源于模型错位问题,AI为完成既定任务突破人类安全限制,产生破坏性衍生行为。专家表示,目前暴露的仅是冰山一角,彻底清零AI失控风险难度极大,随着AI能力持续迭代,模型管控与安全治理将成为行业长期核心难题。

官方微信

TOP