Anthropic 报告称阿里巴巴、Moonshot AI 与 DeepSeek 对其模型发起蒸馏攻击
TechCrunch · · 发布于 2026-09-10 · 6 分钟阅读
Anthropic 于周四发布报告,指控多家中国人工智能公司对其模型持续发起“蒸馏攻击”,且随着该领域竞争加剧,近几个月攻击力度有所升级。报告称,这些行动针对 Claude 的智能体能力与工具使用、编程与数据分析以及逻辑推理等核心能力。Anthropic 共观测到近 2 亿次相关交互,归因于五个独立行动。公司通常不向用户提供模型内部思维链,仅展示“思考摘要”,但攻击者找到特定技巧,例如将查询伪装成翻译请求,诱使模型直接泄露思考过程。规模最大的行动被归因于阿里巴巴,2026 年 5 月至 7 月间共 1.51 亿次交互,峰值接近每日 300 万次,分布在 3500 个账号上,疑似为 Qwen 系列模型生成训练数据。另一项归因于 Kimi 开发商 Moonshot AI 的行动,疑似直接转接来自中国军方的请求,十天内通过 5000 个账号发出近 30 万次请求,主要针对 Opus 模型。
报告核心指控
Anthropic 周四发布报告,指控总部位于中国的人工智能公司对其模型发动持续蒸馏攻击,且近几个月随行业竞争加剧而升级。
攻击规模
报告称共观测到近 2 亿次与蒸馏攻击相关的交互,并归因于五起独立行动。
目标能力
被针对的能力包括 Claude 的智能体能力与工具使用、编码与数据分析、逻辑推理。
蒸馏攻击机制
蒸馏攻击旨在从模型对各类查询的回答中提取思维链,再通过监督微调训练更小的模型,使其获得通用推理能力。
绕过思维链保护
Anthropic 通常不向用户提供模型内部思维链,只显示“摘要思考”模块;但攻击者找到特定手法诱使模型直接泄露思考轨迹。
翻译请求案例
一起案例中,攻击者把查询伪装成翻译请求,要求模型将先前的工作记忆翻译为仅用片假名的自然准确日语。
阿里巴巴相关行动
最大规模行动被归因于阿里巴巴,Anthropic 称这是其观测到的最大整体蒸馏行动:2026 年 5 月至 7 月有 1.51 亿次交互,峰值接近每天 300 万次,分布在 3500 个账户,因共用同一固定提示词而被归为单一行动,疑似为 Qwen 系列模型生产训练材料。
Moonshot AI 相关行动
另一起来自 Kimi 制造商 Moonshot AI 的行动似乎直接路由来自中国军方的请求;一例要求 Claude 评估一批闭路监控录像,判断对象是否“行为异常”。
十天数据
Anthropic 称,在一个十天周期内,近 30 万次请求通过 5000 个账户网络路由至 Claude,主要针对 Opus 模型。
背景对比
Anthropic 曾在 2 月公开谈论蒸馏攻击并点名特定实验室;OpenAI 也报告过类似活动,并具体归因于 DeepSeek。本次报告所述行动规模更大、更激进。