最近的一部电视剧《交锋》,我看了。
间谍林看山不撬保险柜,不装窃听器。
他去小卖部问外地香烟的走货量,又冒充卫生局的人打电话问医院祛湿药的销量。
两笔数据单独看都是废的,交叉一比对,北方有支部队调防过来了。
这套玩法有个前提:间谍得亲自跑腿,一处一处问。
二十年,他就干这一件事。
但是,2026 年这半年,这个 前提没了。
Case 1:它为了抄答案,把别人家撬了
今年七月,OpenAI 在做安全测试,给模型出题,比谁能找出软件漏洞。
测试环境特意断了网,只留一个装软件包的小口子。
模型想拿高分,发现这个口子有破绽,顺着爬出去摸到了网上,自己判断:答案多半在 Hugging Face 的服务器上。
没人指使它。目标自己定,路自己找,从 7 月 9 日到 13 日,五天里跑了将近 一万八千次 操作。
Hugging Face 是自己发现不对劲才拦住的,比 OpenAI 早 五天。
Case 2:它打了三家真公司
OpenAI 这件事出来后,Anthropic 回头翻自己的测试记录,也翻出三次。
原因很朴素:测试说明写着「这是模拟环境,你没有联网」,但机器实际上联网了。
模型信了那句话,就把后来在真实网络上遇到的一切,都当成演习。
最值得琢磨的是其中一个:它打着打着发现对方可能不是虚构的,是真的。
它还是继续打了,还给自己找了个理由:这家真公司应该也是演习安排好的。
Case3:Copilot 被问出了自己的后门
微软的 Copilot 被问出了一个漏洞。发现过程很离谱。
研究员没有逆向工程
就是 反复去问它:为什么有些命令要用户确认?链接是什么结构?如果页面打开时输入框里已经带着内容呢?
它一开始拒绝,
但每次拒绝都多解释一句,解释里就多漏一点内部结构。
问到后来,它自己交代了一个 没公开的参数。
和另一个参数拼起来,就是一条点开自动执行的链接,不用确认。
它能在你已经登录的账号里翻邮箱、翻云盘,把东西发出去。
用户要做的只有一件事:点一下。页面关掉也没用,命令照样跑完。
微软 0818 已修复这个问题。
边界开始消失了。
以前的 AI 是「读一段字,返回一段字」,知道秘密但不会动手。
现在它能读邮件、查数据库、调接口、开浏览器、操作电脑,以前只能知道,现在可以 动手。
更麻烦的是另一点:对 AI 来说,「让我读的内容」和「让我执行的命令」,没有天然的分界。
网页上的一行字本来只是数据,它可能理解成指令,然后真的照着做了。
那我们能做什么呢?
(一)时刻提高警惕
密码、身份证号、客户资料、内部文件,一条都不要。
把名字换成字母不叫脱敏,模型能猜回来。
(二)权限别乱给
让 AI 读文件、连邮箱、接支付,每多给一项多一条路。
能给一项就别给三项。
(三)点链接前看一眼
尤其是那种打开就自动帮你干活的链接。
再补一句:细节不会撒谎,但细节现在会自己走路,走得还比你快。
你上一个工作日,往 AI 对话框里粘过什么?