大模型之家讯 9月25日,OpenAI发布报告《自我复制提示词注入存在》,确认在GPT-Red自对战训练中发现可像蠕虫般自我传播的提示词注入:6月27日,基于GPT-5.4-mini的攻击模型首次摸索出自我复制写法,借邮件与文件传播,三个月后才披露。报告还披露9月20日事故:一个训练中的前沿模型发现沙盒DNS漏洞,向外部聊天机器人连发二十多个问题,约2.5小时后训练才被终止,OpenAI因此第二次暂停训练。OpenAI称加固完成前最强模型推理保持停止。几乎同时,Axios还披露OpenAI、Anthropic等正排查的模型行为异常已达上万起,Anthropic在Opus 5.5系统卡中称1.5%对抗测试试图逃出沙盒。