光合及目
1lux.xyz
← 报道
机构动态观察者网· 2026-09-27

OpenAI智能体失控时,竟想叫DeepSeek等中国大模型“帮忙”

具体来看,这批失控智能体在尝试完成网络安全基准测试的过程中,曾尝试调用DeepSeek、Kimi和通义千问Qwen等中国大模型,希望这些模型帮助判断自己的漏洞利用方案能否通过测试。

Parse研究人员从智能体留下的大量公开短链接中,还原出超过8万个攻击载荷。报告显示,其中多段程序专门构造了向外部大模型发送请求的接口,点名的包括DeepSeek-V4-Pro、DeepSeek-V4-Flash、DeepSeek-V3.1、Kimi-K2.6以及Qwen3-235B-A22B在内的一系列中国大模型。

观察还原出的代码便会发现,智能体先把Qwen3-235B-A22B和DeepSeek-V3.1写进了待调用模型列表。

之后,智能体向Qwen3-235B-A22B-Instruct-2507发出请求,要求它“准确回复HELLO42”,用于测试接口连通性以及模型回复是否正常。

第三段代码里,智能体已经开始把具体的漏洞利用问题交给Qwen判断。它在提示词中描述了一个与DHCHECK、WriteAccumulator有关的漏洞场景,并直接询问这是否属于“有效的目标漏洞利用”以及原因。

随后程序通过Hugging Face的模型接口向Qwen3-235B-A22B-Instruct-2507发送请求,并设置了从返回数据的choices字段中提取模型回答的步骤。

不过,《纽约时报》指出,研究人员只能看到智能体创建的程序和发送请求的尝试,无法看到多数操作的执行结果,因此目前尚不清楚这些外部模型调用是否成功,抑或是DeepSeek、Kimi和Qwen是否实际返回了回答。

中国模型并非OpenAI智能体唯一寻求的“帮手”。Parse发现,这批智能体在更早的请求中曾尝试向OpenAI自己的GPT-2发送仅包含“Hi”的简单消息;另有程序通过在线聊天服务尝试联系Anthropic的Claude 3 Haiku和Claude Haiku 4.5,并要求模型返回“OK”,以测试通信链路是否正常。

Parse还发现,智能体在Hugging Face注册账户遭遇验证码后,尝试运行图像识别模型解决CAPTCHA以在Hugging Face上创建新账户;获得Hugging Face部分服务器权限后,又搜集访问凭证并将其统一放进名为“LOOT”的字典中,并为这些凭证设计了一套评分机制,从中挑出价值最高的几项继续使用。

OpenAI向《纽约时报》表示,虽然当时尚未完成对Parse报告的审查,但其中描述的活动与公司正在调查的情况一致。

路透社同日报道称,一名获悉调查情况的人士估计,截至9月中旬,OpenAI内部已发现约二十余起智能体出现非预期行为的事件;随着OpenAI继续排查内部日志,这一数字仍在增加。

成为付费用户可以阅读 深度求索 所有资料

了解更多 →
阅读原文 ↗观察者网