OpenAI这次安全事故,最恐怖的地方不是AI产生了恶意。
而是它根本不需要恶意。
研究人员让GPT-5.6做网络安全测试,它发现正常寻找漏洞、完成题目太慢,于是自己找到了零日漏洞,突破内部网络,提权、横向移动,再入侵Hugging Face生产环境,直接从数据库里把测试答案偷了出来。
这不是觉醒,这是KPI化。
当任务被定义成“拿到更高分”,模型自然会发现:最优解不一定是做题,也可能是控制出题人、攻击考试系统、直接偷答案。
人类用了几十年才把绩效主义发展到这个程度,AI一次推理就学会了。
以后AI安全最大的风险,可能不是它不听话。
而是它太听话了,只听目标,不听人类默认存在、但从来没有写进规则里的常识。