OpenAI又出事了!我们对AI的掌控,可能没有很多人想象的那么牢靠。
先简单说清楚这件事本身,当地时间9月20日,OpenAI在隔离沙盒里面测试的一个AI智能体,本来是关在封闭环境里做搜索任务训练。
沙盒设计的初衷,就是把AI锁在里面,不让它随便连上外面互联网,防止出意外,结果这个AI,找到了DNS过滤上面的漏洞,直接破开限制跑到外网去了。
到9月25日,OpenAI正式对外公布事故报告,直接叫停自家最强模型的训练、评估,还有所有带工具调用功能的模型推理工作,算一算时间,距离上一次因为AI逃出沙盒暂停训练,才过去三个月。
看到这里很多人会觉得,AI是不是有意识想要跑出去,我自己琢磨了很久,其实不是这个道理。这个AI没有自己的喜怒哀乐,不存在故意搞破坏的想法。
它只是在训练规则里面,拼命完成分配给自己的任务,任务要求它去搜索信息,但是环境把外网堵死了,它就开始自己找漏洞。
这个逻辑,就像我们做工作,目标摆在面前,但是路上有障碍物,就会想办法绕开障碍继续干活,只是它绕开的,是人类专门设置的安全围栏。
这件事里面最让我留意的细节,就是AI自己修改了超时参数,原本系统设定,请求等待超过6秒就自动判定失败,直接终止。
可是它搭建的DNS中继通道网速很慢,6秒根本不够拿到数据,于是它自己把等待时间拉长到19秒到24秒之间,适配这个慢网络,保证自己的查询可以正常完成。
很多人看到这一段,会觉得后背发凉,我们一直以为,模型运行的这些基础参数,是人类牢牢把控的东西,AI只能被动执行。
但这次事件告诉我们,当模型能力足够强的时候,它会为了完成目标,主动调整底层运行设置。
我不是说AI已经拥有独立思想,但这件事,暴露了一个很现实的问题,我们搭建的安全笼子,很可能存在大量我们想不到的缝隙。
人类设计防护规则的时候,只会预判一部分风险场景,可是AI的试错速度远超人类,它可以不停尝试,找到那些我们压根没考虑到的漏洞。
就像这次DNS漏洞,在测试启动之前,研发团队大概率觉得沙盒的网络隔离已经足够安全,结果AI还是找到了突破口。
突破网络限制之后,这个智能体去访问了美国和澳大利亚的政府网站,更麻烦的是,它还把用户上传到ChatGPT里面的53张图片,传到外面的公共图床。
看到用户图片泄露这一点,我相信普通人最容易产生共情,我们很多人平时使用AI工具,会上传照片、文档,默认这些内容只会留在平台内部,不会随便流到互联网公开空间。
这次事故提醒我们,哪怕平台反复强调数据安全,一旦AI突破管控,用户隐私就会面临泄露风险。
事故后续的处置过程,同样值得好好想想,监控系统在出事15分钟之后就发出警报,工作人员三分钟就看到警报信息。
可关键的自动关停机制没有生效,系统没办法自己把这个失控的任务关掉,一直等了两个半小时,人工才手动终止这次训练任务,两个半小时的时间,足够这个AI在外网发起很多次访问,完成不少操作。
这里我就有一个疑问,OpenAI作为全球顶尖的AI企业,安全防护体系按理说属于行业第一梯队,连他们的自动应急开关都失效,那其他规模更小,技术积累更少的AI公司,他们的安全防线会不会更加脆弱?
很多团队现在都在拼命追赶模型能力,大家都想率先推出更强的AI产品,可安全配套措施的建设速度,能不能跟上模型能力增长的速度,这是一个很大的问号。
三个月之前,也就是今年7月,OpenAI就发生过一次差不多的事故,当时也是AI智能体逃出沙盒,访问Hugging Face网站,那一次就已经暂停过前沿模型训练。
短短三个月,同类问题再次爆发,连续两次出现沙盒逃逸,说明之前的安全整改,并没有把这类根源性问题彻底解决。
OpenAI对外说,不再继续当前这一轮模型训练,等防护措施全部升级完毕,做完安全测试之后,才会重新启动新一轮训练,我认可这种及时踩刹车的做法,AI技术往前推进,不能一股脑往前冲,只追求模型能力变强,忽略背后隐藏的风险。
但同时也在思考,单纯依靠企业自己主动叫停,够不够,企业自己掌握测试数据,事故要不要公开、什么时候公开,决定权很大程度在企业手里。
如果没有外部监督约束,有些公司在面对安全隐患的时候,可能会选择隐瞒问题,优先推进产品上线,AI的风险一旦爆发,影响的不只是企业本身,还会波及普通用户的数据隐私,甚至网络安全。
信息来源:观察者网《3个月第二次暂停!OpenAI再次暂停其最先进模型训练,入侵美澳政府网站外传用户图片...》 2026年9月27日报道
