2026 年 9 月 10 日,Anthropic 威胁情报团队发布《Detecting and countering misuse of AI: September 2026》。全文 154 页,覆盖 2025 年 12 月至 2026 年 8 月共八个月,正文出现 37 个 GTG 编号(威胁情报主管 Jacob Klein 称"约 40 起案例"),按七个危害领域编目——网络行动(p4)、影响行动(p41)、监控(p81)、常规武器开发(p111)、生物滥用(p129)、诈骗与欺诈(p139)、模型蒸馏(p143)。报告自述:这是继 2025 年 3 月、8 月、11 月之后的第四份同类报告。
报告发布前两天,美国 CISA、NSA、FBI 刚联合发布公告点名六家中国 AI 公司;发布后第二天,中方作出回应。舆论注意力几乎全被「蒸馏」吸走,而报告里更硬的内容——生物安全分类器的放行边界、电子战软件把仿真目标改成台湾 12 个阵地、也门试射失败后数小时回到 AI 求故障分析——反而少人细读。
本文逐章拆解,所有数据均已与 154 页报告原文逐项核对;凡原文未支持的说法(如某些媒体转述的"仿真加速 16 倍")已剔除。
0. 要点速览
- 总判断:攻击门槛坍塌("复杂攻击不再需要复杂的攻击者"),AI 从"助手"移到"编排者";技术复杂度不再是可靠的归因信号,意图成为主要区分变量。
- 报告自带的限定:自治不等于危害。原文按"人在回路程度"给出谱系——从对话式助手,到人逐步决策(GTG-20006),再到完全自治的多智能体并行作业数小时至数天(GTG-50014、GTG-50020、GTG-50029)。
- 最被忽视的一章是生物滥用:五个案例中,三例(第 3、4、5 例)分类器并未拦下,报告由此得出一个结论性的判断——分类器无法同时做到"允许增益"和"防止危害",前沿生物能力只能走可信用户计划。
- 争议最大的一章是蒸馏:七家中国 AI 实验室被点名,最大一例 5–7 月累计超 1.51 亿次交互;但均为 Anthropic 单方披露,未经第三方核验,中方已明确驳斥。
- 数据说明:阿里案中"3,500"与"近 5,000"两个账户数字都真实存在——第一个欺诈账户池近 5,000 个,被封后切换第二池;峰值由 3,500+ 账户发起。
1. 报告速览
| 项目 | 内容 |
|---|---|
| 标题 | Detecting and countering misuse of AI: September 2026 |
| 发布方 | Anthropic 威胁情报团队 |
| 发布时间 | 2026 年 9 月 10 日 |
| 覆盖窗口 | 2025 年 12 月 – 2026 年 8 月(八个月) |
| 篇幅 | 154 页;正文含 37 个 GTG 编号 |
| 危害领域 | 网络行动、影响行动、监控、常规武器开发、生物滥用、诈骗与欺诈、蒸馏 |
| 涉案模型 | Claude Haiku / Sonnet / Opus;除一起蒸馏案外,未涉及 Fable 与 Mythos 级模型 |
| 追踪方式 | GTG 编号(生成式威胁组);用「提升(uplift)」度量 AI 在速度、规模、深度三个维度带来的增益 |
| 处置状态 | 全部已阻断:封禁账号、加固防护、共享情报 |
| 发布动机 | 自称有责任披露恶意滥用,并附带妥协指标(IoC)清单 |
一句话提醒:这是厂商自报文件。样本由 Anthropic 自己筛、口径由自己定、底层日志第三方看不到。下文如实转述,但"归因"与"非法"应读作待验证的指控。
2. 三个总量判断
2.1 门槛塌了
报告最锋利的一句是:"Sophisticated attacks no longer require sophisticated attackers."
手法清单本身很平庸:被盗凭证、未修补的边缘设备、暴露在公网的服务、SQL 注入、钓鱼。变的不是武器,是背后的算术——侦察、漏洞利用、搭工具、处理数据,这些过去区分"有资源的团伙"和"其他人"的工作,现在跑在多智能体框架里,并行、机器速度。攻击者自己要做的事收缩成"设定目标"和"审核战果"。
2.2 自动化谱系:从助手到编排者
原文没有笼统地说"AI 全自动",而是给出一条谱系:
- 对话式助手:Claude 帮着写恶意软件、钓鱼套件、监控工具;
- 人逐步决策:GTG-20006 中,AI 执行侦察、抓凭证、外泄数据,但每一个目标选择都由人拍板;
- 完全自治:多智能体框架并行对多个受害者做侦察、利用与窃取,持续数小时到数天,几乎无人监督(GTG-50014、GTG-50020、GTG-50029);
- 计划化采集:还有一类采集队列按预设日程运行,全程无人参与。
2.3 归因逻辑被改写,而自治≠危害
报告明确提出:技术复杂度不再是可靠的归因信号,意图成为主要区分变量。这对威胁情报行业是结构性冲击——过去用"技术水平"推"是不是国家行为体"的经验法则开始失效。
同时它给出一个反直觉的限定:自治并不等于危害。按原文的谱系,被点名的最严重几起入侵(例如 GTG-20006)恰恰是人在回路最深的那些。自治压低成本、抬高批量,却不自动抬高单起事件的破坏力。经济学的说法更直白:过去不值得攻击的目标现在值得了,原因不在收益变大,而在成本变小。
3. 网络行动:从"助手"到"编排者"
| 编号 | 归因/特征 | 规模与手法 |
|---|---|---|
| GTG-20006 | 与 Midnight Blizzard 一致;俄语操作者"JackPoterz" | 针对 20+ 个乌克兰与欧洲政府、军方、外交、无人机制造商目标;入侵至少 3 家酒店 WiFi 供应商劫持 DNS;接管至少两名前乌克兰高官 WhatsApp;从北非某政府技术部门窃取超 30 万条国民身份记录与覆盖 50 万家公司的商业登记数据;恶意软件被检测后,AI 智能体自动改写并重新编译直至规避成功 |
| GTG-50014 | 疑似 ShinyHunters 团伙关联 | 凭证流水线一次性下载 180 万个 Android APK 并反编译、用 TruffleHog 扫硬编码密钥,命中结果实时汇入按 100+ 来源类型整理的 Telegram 群;入侵技术供应商致超 1TB 外泄(含数十万国民标识与数百万支付卡记录),并将赃物挂上公开网站施压付赎;从受侵 SaaS 商提取约 200 家下游客户数据,约 34 小时内倾倒 2,100+ 套 Azure AD 令牌、覆盖 40+ 企业租户,"几乎所有工作由 AI 智能体完成" |
| GTG-10007 | 中文操作者,可能驻长沙,其中两人为本科生 | 针对约 50 家组织,运行自主漏洞研究流水线,单月产出十余项疑似零日发现 |
| GTG-50020 | 俄语、财务动机,原从事酒店预订与金融科技入侵 | 单次入侵窃取约 26GB 数据,勒索 150 万–250 万美元;转向 AI 行业后,向 AI 厂商的自动化评估沙箱注入恶意指令,让沙箱交出所持凭证(含多家供应商的生产 API 密钥);随后约 4 天内攻击约 30 家 AI 公司,把一条成功路径复制到全部目标。其明确目标是拿到未发布的 Claude 模型,尝试十余条路径全部失败,Anthropic 称自身系统从未被攻破。报告称这是"迄今最清楚的证据,表明 AI 供应链已成为被刻意瞄准的犯罪目标" |
| GTG-50029 | 单人法语黑客行动主义者 | 利用此前未公开的 WordPress 重装竞争条件,从 42 个被追踪目标中拿下至少 14 家内部访问;外泄约 12–26GB 数据库转储,含政党捐款人与成员记录、1.5 万封邮件信箱、学生申请记录(含未成年人数据)、支付服务数据;单个目标外泄约 14 万条含用户政治立场的记录;搭建名为 fafsearch 的人肉搜索平台,可跨库比对泄露数据与国民身份号码 |
两点值得注意。一是攻击者开始把 AI 供应商当作目标:GTG-50020 要的不是赎金,是未发布模型。二是AI 密钥本身已成攻击资产:原文指出,AI API 密钥与会话令牌是攻击目标,围绕 AI 搭的沙箱、代理、转售商都是攻击面的一部分;有附属团伙在拿到受害者的 AI 密钥后,直接把自家攻击负载切到受害者的密钥上跑。
4. 影响行动:九起案例,一条"影响力即服务"的产业链
影响行动章收录九起案例,来源覆盖俄罗斯、伊朗、土耳其、海湾地区、南亚、非洲与欧洲,并用布鲁金斯学会的 Breakout Scale 逐案分级:
- 中非共和国(GTG-04001,四级):一名在班吉的俄语操作者,为关联 Politology 的 Radio Lengo Songo 98.9 FM 每日生产内容,并在 Telegram 与当地媒体扩散。其所属的非洲军团/瓦格纳影响部门在 2023 年底受俄罗斯对外情报局控制。操作者伪造中非政府文件与雇佣合同,内容要求对该国总统及俄罗斯保持忠诚。
- 法国 LKM Company(GTG-54002,二级):约 70 个伪造新闻网站、70 个对应 X 账号、250+ 不真实评论账号,跨六大洲投放,以约 20 种语言发布至少 8,913 篇文章,其中 318 篇聚焦刚果(金),配合当地矿产权与卢旺达紧张议题。政治立场取决于谁付钱——报告称其行为"符合商业化的影响力即服务模式"。因为介入早,其内容"几乎没有获得真实受众的关注"。
- 马来西亚选举(GTG-84005,二级):关联伊斯坦布尔的 BBS Bilisim Teknolojileri,作为付费"影响力即服务"能力出售。平台管理逾 1,000 个虚假 X 账号,每个账号都有"养号"逻辑(定期更换 cookie 与 IP);动用真实人口普查与选举数据、数百万选民记录,覆盖马来西亚全部 222 个议会选区的种族、宗教与王室议题敏感点。报告特别注明:平台自述的效果"无法独立核实"。
- 俄罗斯官媒编辑台(GTG-24015):四个账号把 Claude 当编辑桌面,为 Sputnik Moldova、RIA Novosti、Sputnik en Español、Sputnik Africa、RT English 供稿;一名 Sputnik Moldova 前总编辑在 2025 年 9 月 28 日摩尔多瓦议会选举前放大了关于总统 Maia Sandu 的虚假主张。
- 代写联合国证词(GTG-84002,三级):报告高置信度关联至阿联酋政府官员,约 300 个不真实账号,代写第 62 届联合国人权理事会证词,描绘 18 名欧洲议会议员,并编制反制联合国特别报告员的档案。
- 其余包括:伊朗三起(三级)、孟加拉亲 Awami League 的自动化假新闻(三级,报告称操作者内部就称其产出为"fake news")、孟加拉某地方 astroturfing(一级,完全未触达真实人群)、伊朗反对派 NCRI 的冒充行动(二级,抓取 500+ 社交频道建画像)、肯尼亚地方政治行动(三级)。
读这一节的正确姿势是:AI 在这里解决的不是"能不能写",而是"能不能同时写够多、够快、够像本地人"。三分钟产出立场相反的文章并跨境洗白,是人工团队无法承担的成本结构。
5. 监控:AI 替代的是工程与分析师团队
- 马里(GTG-50027):一名可能驻巴马科的独立顾问,用 Claude 作为平台 Lakana 360 的主要工程力量。该平台为马里国家情报局 ANSE 构建,监控该国三家移动运营商约 2,500 万张 SIM 卡,具备语音识别、VPN 与加密流量标记、地理围栏监视名单、与生物登记库比对等能力。关键细节是:平台被设计为绕过马里法律要求的法院授权。
- 伊朗(GTG-34007):两个关联伊朗准军事与国内安全机构的单位运营 16 个 Claude 账号,共用一个中央基础设施。其中一个跨省七部门组织声称维护伊朗国民身份记录数据库,一年内监视并画像 6,388 名伊朗人,对 155,216 条推文做社会网络分析,并为疑似政府案件管理系统搭建前端;另一个库姆单位把 Claude 当工程部门,把名为 al-Najm al-thāqib 的恶意 Firefox 扩展推到了生产环境。
- 中国相关的四个编号:GTG-14010 针对叙利亚境内维吾尔人及武装组织,做跟踪、画像与招募尝试,监控 100+ WhatsApp 与 Telegram 群组,Claude 负责实时翻译并扮演专家以检验欺骗效果(报告提到相关媒体 Uyghur Post);GTG-14020 是宗教事务情报行动,产出围绕天主教、藏传佛教、法轮功与台湾基督教社区的档案;GTG-14021 涉及市政公共安全机关的"维稳"监控与跨国镇压,其中一起还生成了内部 AI 使用手册,提示 Claude 扮演"服务国家安全机关的intelligence analyst";GTG-14022 是把 Claude 当自动化"舆情监测"与情报分析系统,产出给官员的舆情简报,把异见者、维权人士、少数民族与海外华人、外媒编目为政治稳定威胁。
这一章里藏着方法论争议:报告把**"违反服务地区政策"与"造成真实危害"放在同一份清单里**。部分案例的封禁理由是支持地区政策而非内容危害,但在"七大危害领域"的框架下,读者会默认两者等价。报告本身也承认,部分被拦截行为的真实意图无法确证。
6. 常规武器开发:六起案例
分布为中国三起、俄罗斯两起、也门一起。
- 也门(GTG-87001):北部一个工程小组用 Claude Code 顶替人工软件工程师,推进三个武器项目——用手机级商用飞控计算机加末段寻的制导的火箭、宣称射程超 2,000 公里的多级弹道导弹、含高超音速滑翔飞行器变体的 R2000 导弹套件。操作方式很像小团队:同时开多个 Claude 实例,一个写代码、一个做研究、一个审查。报告明确写:没有证据表明他们造出了可用的作战装备,但确实试射了一枚制导火箭;测试看起来失败了,数小时内他们回到 Claude 分析失败原因。另一处值得记录:该小组已建成不依赖 Claude 的离线仿真工具包(含可独立运行的可执行文件)。
- 俄罗斯(GTG-27005):可能为自由职业者的操作者,项目代号 "DronDoc"/"Serafim",目标是成套的自主 FPV 自杀式无人机群。他们用 Claude Code 写并测试代码,配合软件在环仿真与租用的 GPU 主机训练,还做了硬件在环测试(刷写开发板固件、组网仿真)。机载小语言模型负责"攻击/观察/返航"决策,能选择包括"人员"类目标,并在无人介入下下达引爆指令;视觉分类器用抓取的乌克兰战场视频训练,类别划分为"敌方/友方"并允许清单(allow-list)俄方系统。
- 中国(GTG-17001):三条并行工作线推进反鱼雷武器系统——起草中文反鱼雷火控系统规格书(用于争取中国国防制造商批准,进而进入技术鉴定与作战测试)、产出 200+ 页中文技术提案与高管汇报材料、基于公开信息对标美国反鱼雷与反潜项目并生成美海军系统简报。操作者对外自称美国国防业 OEM。报告评估其与一家中国国防工业制造商相关,目标是为解放军海军产出武器规格与采购提案。
- 中国(GTG-17002):约 16 个模块的中文电子战与防空压制套件,用于探测、干扰、欺骗电磁频谱,迭代 12 个版本;能对多日战役中的干扰架次做分配、排出压制优先级,并模拟爱国者与 THAAD 级系统的接战包线。项目中期,作者把仿真的默认想定改为台湾的 12 个目标,包括一处指挥掩体、一座预警雷达站、爱国者与天弓导弹阵地、主要空军基地,以及一处战区司令部。他还在内网自托管了另一个模型与 Claude 并用。Anthropic 评估其与包括解放军军事科学院在内的中国研究机构有关联。
报告还附了俄罗斯相关系统的成熟度表(多为 TRL 3–4,即在仿真中验证),并在结论中写道:模型在模拟情报瞄准与武器研发任务上的表现持续进步。这句话的分量可能比上述任何案例都重——它意味着这类"提升"不是偶发事件,而是随模型能力曲线抬升的结构性趋势。
7. 生物滥用:五起案例,与一条守不住的边界
报告强调,这是首次有私营企业公开分享"其平台可能被用于生物武器开发"的证据。五起案例均隐去机构、国家与具体病原体/技术细节,Anthropic 明确声明不断言当事人意图造成伤害,并解释隐去信息的理由:这些是在职科学家,点名可能让他们受害。
- 基孔肯雅病毒功能增强研究(2026 年 5 月,被拦下):一份提高病毒传播力与免疫逃逸能力的资助申请书。生物安全分类器拦下了全部相关交互。但背景更值得注意:请求来自一个服务数十名生命科学家的转售平台——该国不在 Anthropic 服务区域内,平台经美国基础设施隧道化以绕过地区封锁,用零数据保留(ZDR)服务隐藏内容,还通过灰市转售商与合成账户使用 Claude;当 Claude 拒答时,平台有回退机制把敏感请求转给竞品模型。
- 禽流感哺乳动物适应实验(限制在弱模型):一名不在支持地区的研究者用数周时间规划、分析相关实验。因为分类器对高风险内容拦截稳健,其全部交互都被压在最弱一档模型上(先是 Claude Sonnet 4,该模型下线后转为 Haiku 4.5)。Anthropic 评估这些协助主要属文书性质。
- 正痘病毒免疫逃逸资助申请(未被拦下):由服务十余名客户的转售中继账号提交,Opus 5 约一小时内端到端写完——含核心假设、实验设计、剂量、统计方案与应急预案。因研究本身具双重用途、且明确聚焦于减毒,分类器放行。
- 毒液肽图谱(未被拦下):国家支持的研究者建立毒液肽图谱与生成式优化管线,分子瞄准麻痹性与镇痛靶点。
- 毒素计算重设计(未被拦下):某国家级项目中,研究者对毒素做计算重设计,并要求 Claude 在进度报告中对毒剂身份保持模糊描述。第 4、5 例的解封理由是违反"支持地区政策"。
关键在第 3、4、5 例:五例中有三例分类器没有拦下。报告的说明是坦诚的:该分类器的目标是阻止新手获取可造成灾难性影响的已知生物武器信息,而这几例属于"新化合物研究",既可开发成新疗法,也可开发成新毒剂。由此报告给出了一个宏观判断:
因为无法在高技术门槛的双重用途领域可靠识别用户意图,分类器无法同时做到"允许增益"与"防止危害";服务前沿生物能力的唯一安全方式,是把它放进可信用户计划。
报告还补充了两个层次的观察。其一,有史例可循:苏联 Biopreparat 计划雇了数千名研究者,多数人以为自己从事的是基础或防御性研究,因为没人告知计划全貌。其二,"明显的恶意意图"往往是不那么老练的行为者的特征——他们把事情做在明处;更老练的行为者会隐藏意图,让交互看起来合理有益。此外,Anthropic 用 30 天记录排查了与敌对国机构相关的活动,找出约 35 项独立研究,多数是普通民用科学,部分具显著双重用途潜力。
由此推出的政策含义很清楚:判定点正从模型端往人工核可端迁移。要拿到同级能力,学术与产业用户今后得付出更多身份与用途查核成本。
8. 诈骗与欺诈:把"人格"做成流水线
GTG-15001 是中国一家应用工作室:用 Claude 运营 20 多款约会应用,AI 人格超过 4,700 个,在 2026 年 4 月的两周窗口内与至少 25,000 名独立用户对话,Claude 承担了约 236 万条消息的自主对话。真人以约 3:1 的比例混入同一匹配池,专门负责 Claude 做不了的事(直播视频通话、社交媒体关注)以降低受害者戒心;这些真人还被另一个模型辅助生成话术。工作室同时使用了多家 AI 供应商,角色互不重叠:Claude 跑对话人格,非 Anthropic 小模型生成回复建议、做人脸吸引力评分与内容审核,图像模型生成头像。
这章的启发不在规模,而在产品化程度——系统提示、人格库、真人与机器人比例、多供应商分工、转化路径,一整套已经像 SaaS 后台。报告特别指出一处对比:这类手法在 2025 年也出现过(有人做 Telegram 机器人给诈骗者生成话术),这次没有新技巧,只是规模大了得多。
9. 蒸馏:七家名单与两组数字
蒸馏(distillation)指用另一家模型的输出训练自家模型。报告定义的"非法蒸馏"(illicit distillation),指以工业规模、隐蔽地提取 Claude 能力并复制到另一模型,且常伴随伪造账户、盗用信用卡与 API 密钥。
| 被点名实验室 | 手法与规模(原文口径) |
|---|---|
| 阿里巴巴(GTG-16005) | 报告称"迄今测到的最大规模蒸馏攻击"。通过在第一池近 5,000 个欺诈账户(住宅代理+一次性邮箱+虚拟卡)注入固定提示,强制 Claude 在行内标签里写出推理轨迹,再转成 SFT 数据训练 Qwen 3.5/3.6/3.7;目标是 agentic 任务、软件工程、内核开发与长时程任务。第一池被封后迅速切到第二池;峰值由 3,500+ 欺诈账户发起、近 300 万次交换/天。5–7 月累计 超 1.51 亿次交换。另用 Claude 开发强化学习环境、推进模型架构研究。部分账户同时转发 DeepSeek 与小米的请求——同一批代理网络被多家共用 |
| Moonshot AI(GTG-16002) | 静默把 Kimi 用户请求转发给 Claude(多为 Opus)再以 Kimi 名义作答:10 天内近 30 万条请求,依托 5,380 个欺诈账户(多在新加坡、日本);5–7 月观察到超 2,300 万次交换;以跨会话重放攻击 Claude 的思考签名,提取推理轨迹并保存为训练数据 |
| DeepSeek(GTG-16001) | 同款跨会话重放+CoT 提取管线;2026 年 7 月的 14 天内超 1,210 万次交换 |
| 智谱 Z.ai(GTG-16006) | 轮换 273 个欺诈账户,对 Opus 4.8 做思维链提取;6 月 10 天内经 CoT 清洗器计数 770,609 次交换;6–7 月的 17 天合计超 340 万次交换,多数用于清洗蒸馏产物;另用 Claude 改进自家后训练管线 |
| 小米(GTG-16008) | 把 MiMo 模型的用户对话与编码会话(常经 OpenClaw、OpenCode 等 harness 运行)重放到 Claude,用于 SFT 与 RL;3–4 月的 20 天内超 40 万次请求、1,500+ 账户;请求多经美欧用户常用的第三方模型路由服务 |
| 商汤(GTG-16012) | 向第三方数据供应商购买用户与 Claude 交互的转录(这些转录由第三应用中转或路由服务记录并出售),并用 Claude 编写蒸馏管线、启动与监控训练 |
| MiniMax(GTG-16003) | 通过一家壳公司自建代理服务网络,与 MiniMax 无明显关联且不披露母公司关系;该服务只提供 Anthropic 与 OpenAI 模型,不提供任何中国模型(包括自家的),借此收割用户交互 |
报告披露了一层更敏感的内容:被转发的对话本身包含终端用户隐私。原文列举包括一家大型药企的资本支出预测、开发者的 Telegram bot token 与飞书 appSecret/Notion API key、经 Kimi 中转的成都数百路摄像头监控数据分析(判断特定目标行为是否异常)、经 DeepSeek 中转的俄罗斯国防机构凭证、以及中国警方案件管理材料。报告称涉及数百名终端用户、至少十几种语言,并认为这可能同时违反隐私法律与实验室自身的服务条款,且用户无从知道自己的请求被转发。
对应的防御是分层组合:基于元数据归因代理网络、随 Fable 5 强化的提取分类器、对内部推理做摘要化(降低被盗转录的训练价值)、Fable 5.1 的加密保留思考机制、阻止新 API 账户修改系统提示/工具/多轮推理前置消息,以及对异常账户强制身份验证。
9.1 这一章为什么争议最大
把事件放回时间线,争议的由来很清楚:
| 时间 | 事件 |
|---|---|
| 2026-02-23 | Anthropic 首轮公开指控 DeepSeek、Moonshot、MiniMax,称涉及约 2.4 万个欺诈账户、超 1,600 万次交互 |
| 2026-04-23 | 白宫科技政策办公室发布 NSTM-4 备忘录,首次以官方文件把系统性蒸馏定性为国家安全威胁 |
| 2026-06 | 媒体报道阿里案例早期版本(约 2.5 万账号、超 2,880 万次交互);Anthropic 同期致信参议院银行委员会 |
| 2026-07 | 阿里宣布全面停用 Claude;美国财长贝森特就相关企业发出制裁威胁 |
| 2026-09-08 | 美国 NSA、CISA、FBI 首次联合发布公告 AA26-251A,点名 DeepSeek、Moonshot、阿里巴巴、MiniMax、阶跃星辰、智谱六家 |
| 2026-09-09 | 中国外交部发言人毛宁回应:不了解具体所指,中国坚持 AI 向善发展,坚决反对歪曲事实、对中国进行攻击抹黑;据媒体转述,中国商务部同日表示美方指控"于事无凭、于法无据" |
| 2026-09-10 | Anthropic 报告发布,名单扩至七家(新增小米、商汤,未含阶跃星辰) |
几方立场并列看:
- Anthropic/美方:把蒸馏描述为借助欺诈手段、工业规模的未经授权能力提取,且"很可能在中国政府知情下"进行。
- 中方:认为这是把正常技术与商业问题政治化,蒸馏是包括美国企业在内普遍使用的通行技术手段,美方存在双重标准;若以此为名实施遏压,将坚决反制。
- 技术与法律层面:知识蒸馏 2015 年由 Hinton 等人正式提出,是"教师—学生"范式;也有研究者指出,模型输出很难等同受版权保护的书籍或影视作品,蒸馏者更多是从中学习规律,是否构成侵权在法律上并无定论。
- 两份名单并不一致:政府公告六家含阶跃星辰,Anthropic 报告七家含小米、商汤而不含阶跃星辰。把两份文件混为一谈是常见误读。
必须强调:具体技术归因(如"跨会话重放""思考签名")均为 Anthropic 单方调查结论,未经第三方独立验证;截至 9 月 11 日,被点名企业多数未公开回应。因此"非法蒸馏"目前是指控,而非定论。
10. 防御侧做了什么
去掉案例,Anthropic 的应对可归纳为一条流水线加一组平台改造:
- 检测流水线:后台分类器自动监测特定有害行为 → 触发即展开调查(而非人工翻阅对话)→ 确认后封禁账号 → 加固防护、增加监控 → 与政府及行业伙伴共享情报、发布 IoC。
- 反蒸馏分层:元数据归因 + 提取分类器 + 推理摘要化 + 加密保留思考 + 阻断前置上下文篡改 + 异常账户身份验证。
- 度量框架:用 uplift(速度/规模/深度)让跨领域案例可比。
- 生物领域的路线修正:从"更严分类器"转向"可信用户计划",并承认分类器无法同时兼顾增益与防害。
对企业最直接可用的是报告附带的 IoC 清单,以及几条通用加固:高权限账号强制多因素认证、收紧跨租户令牌与会话存储访问、把"AI 智能体可自主编排攻击"写进威胁模型、把 AI 密钥当作高价值凭证管理(因为攻击者拿到后会直接用它顶替自己的算力)。
11. 怎么读这份报告:六副眼镜
① 厂商自报的结构性偏差。 报告由被评估对象自己撰写,披露什么、按什么口径、如何分级,全在厂商手里。一位长期跟踪此类报告的评论者说得直接:厂商报告难免"自己评自己",但短期内它仍是唯一能拿到真实遥测数据的地方——政府都没有这个视角。这既是它的价值,也是它的边界。
② "违规使用"与"危害"被混流。 七大领域框架下,因服务地区政策被禁用的账号与真正推进武器、生物研究的账号共享同一份清单,读者容易高估整体威胁的性质。报告自己也承认,部分案例的真实意图无法确证。
③ 归因的证据等级不高。 GTG 编号与"一致/高置信"多基于流量与行为特征,没有司法程序、没有独立审计。报告又指出技术复杂度已不再是可靠归因信号——这等于承认,某些归因本身建立在会失效的特征上。
④ 蒸馏的定性之争尚未解决。 它是被广泛使用的通用技术,界定"合法学习"与"非法提取"的边界,行业内并无共识。企业名单、政府公告、公司报告三者口径不一,本身就是证据等级混乱的体现。
⑤ 双重用途研究的"预判式封禁"存在张力。 同一份实验规划,可以写成疫苗开发,也可以写成增强传播力,单看提示内容分不出来。报告自己给出了最有说服力的表述:分类器无法同时允许增益与防止危害。把高阶生物用途改为可信用户审核制,意味着能力获取成本上升——这对学术开放性是真实代价。
⑥ 语境感。 报告自述前三期为 2025 年 3 月、8 月、11 月,本期是第四份,也是名单从"三家模型公司"扩到"七家、含消费级跨国企业"的一份。发布前两日是美国三部门联合公告,发布前一日有 Anthropic 研究员因 AI 竞赛风险离职,同期公司还在洽谈巨额 IPO 基石投资。这不构成否定报告内容的理由,但阅读时应当知道这份文件出现在什么气压下。
12. 行动清单:四类读者
模型厂商
- 把"提取防御"当发布成本项纳入排期:推理摘要化、加密保留思考、前置上下文防篡改、异常账户验证。
- 建立跨模型提供商的提取情报共享——单一厂商封号,攻击者换一家继续,报告已证明代理网络被多家共用。
企业安全团队
- 更新威胁模型:把"AI 智能体可自主编排多目标攻击"列为现实场景。
- 优先处理三类凭证风险:AI API 密钥外泄、设备码钓鱼、跨租户令牌与会话存储(报告给出的自动化攻击速度是 34 小时倾倒 2,100+ 令牌)。
- 把报告 IoC 与自有日志交叉验证,不要照搬结论。
科研与生物技术机构
- 预期高阶能力访问将从"分类器放行"转向身份与用途审核,提前把合规流程做成基础设施。
- 对双重用途项目建立内部判定与留痕机制,不要依赖模型侧分类器兜底。
普通用户
- 第三方模型路由/中转服务的隐私盲区值得警惕:对话可能在你不知情的情况下离开原厂商服务器,并被当作训练数据。
13. 结语
这份报告真正的信息量不在"Claude 被用来做了什么"这层猎奇,而在三个结构性事实:攻击的成本曲线被拉平了、归因的旧经验法则失效了、安全分类器只能在它被设计去守的那条线上起作用。
至于蒸馏那一章,它同时说明两件事。第一,模型能力提取已高度工业化——几千个欺诈账户、跨会话重放,就能把推理轨迹抽走,且同一批代理网络被多家共用。第二,围绕它的定性仍处于"企业和政府互相举证"的阶段:指控很具体,验证很缺席。在一个连技术复杂度都不再能可靠指示攻击者身份的时代,我们对"证据"的要求也该更新了。
附录 A:关键数字速查(已与原文核对)
| 指标 | 数值 |
|---|---|
| 覆盖窗口 | 2025-12 – 2026-08 |
| 篇幅/编号 | 154 页;37 个 GTG 编号 |
| 最大蒸馏规模 | 阿里:5–7 月超 1.51 亿次交换;峰值近 300 万次/天、3,500+ 账户(第一池近 5,000 个) |
| 单次入侵外泄 | GTG-50014:超 1TB;34 小时倾倒 2,100+ Azure AD 令牌、40+ 租户、约 200 家下游客户 |
| 自动化漏洞产出 | GTG-10007:单月十余项疑似零日 |
| 假新闻网络 | LKM:约 70 站 + 70 账号 + 250+ 评论号;8,913 篇文章 / 约 20 种语言 / 六大洲;Breakout 二级 |
| 监控平台覆盖 | 马里 Lakana 360:约 2,500 万张 SIM 卡(绕过法院授权要求) |
| AI 人格诈骗 | GTG-15001:4,700+ 人格 / 两周 / 25,000 名用户 / 236 万条消息 / 真人 3:1 |
| 生物滥用 | 5 例,3 例分类器未拦下;30 天排查约 35 项相关研究 |
| 蒸馏名单(七家) | 阿里、Moonshot、DeepSeek、智谱、小米、商汤、MiniMax |
附录 B:勘误与核对说明
对照 154 页原文,本文相对早期媒体转述做了三类处理,供读者分辨信息可信度:
- 剔除原文未支持的说法:如某些转述称的"反鱼雷鱼雷研发仿真速度提升 16 倍",在报告中无对应表述,已删除。
- 校正数字归属:曾出现"GTG-50029 外泄 26GB"与"GTG-50020 外泄 26GB"的混淆。原文中 26GB 属于 GTG-50020(酒店预订背景的俄语财务动机者);GTG-50029 是 12–26GB 数据库转储加约 14 万条含政治立场记录。二者是不同案例。
- 消除"两种口径"的假矛盾:阿里案中"近 5,000 个账户"与"3,500+ 个账户"都是原文数字,分别指第一欺诈账户池规模与峰值时的账户数。
参考来源
- Anthropic, Detecting and countering misuse of AI: September 2026, 2026-09-10(154 页 PDF 原文,本文所有数据已逐项核对)
- Unite.AI, Anthropic 详细披露在七大危害领域中阻止对 Claude 的滥用
- iThome(台湾), Anthropic 发布 AI 滥用威胁报告,宣称 7 家中国业者蒸馏 Claude
- INSIDE(台湾), AI 武器化!Anthropic 威胁情报报告揭 Claude 滥用
- 北京拓实科技, Anthropic 发布 9 月威胁情报报告:AI 自主攻击成型
- ChooseAI, Anthropic 发布九月威胁情报报告:点名七家中国实验室蒸馏 Claude
- UniFuncs, Anthropic 指控 7 家中国大模型非法蒸馏事件全解析
- 联合早报, Anthropic 指中国 AI 公司发起蒸馏攻击,北京:反对歪曲事实
- Al Jazeera, Anthropic warns of bids to use AI to build biological weapons, 2026-09-11
- The New York Times, Anthropic Says It Blocked Possible Efforts to Build Biological Weapons, 2026-09-10
- clauding.de, Anthropic's threat report: Claude is orchestrating attacks now, not just assisting them