NewsFi.AI
返回今日
已核验来源

Anthropic 报告称阿里巴巴、Moonshot AI 与 DeepSeek 对其模型发起蒸馏攻击

TechCrunch · · 发布于 2026-09-10 · 6 分钟阅读

NewsFi 导读6 分钟速览

Anthropic 于周四发布报告,指控多家中国人工智能公司对其模型持续发起“蒸馏攻击”,且随着该领域竞争加剧,近几个月攻击力度有所升级。报告称,这些行动针对 Claude 的智能体能力与工具使用、编程与数据分析以及逻辑推理等核心能力。Anthropic 共观测到近 2 亿次相关交互,归因于五个独立行动。公司通常不向用户提供模型内部思维链,仅展示“思考摘要”,但攻击者找到特定技巧,例如将查询伪装成翻译请求,诱使模型直接泄露思考过程。规模最大的行动被归因于阿里巴巴,2026 年 5 月至 7 月间共 1.51 亿次交互,峰值接近每日 300 万次,分布在 3500 个账号上,疑似为 Qwen 系列模型生成训练数据。另一项归因于 Kimi 开发商 Moonshot AI 的行动,疑似直接转接来自中国军方的请求,十天内通过 5000 个账号发出近 30 万次请求,主要针对 Opus 模型。

1

报告核心指控

Anthropic 周四发布报告,指控总部位于中国的人工智能公司对其模型发动持续蒸馏攻击,且近几个月随行业竞争加剧而升级。

2

攻击规模

报告称共观测到近 2 亿次与蒸馏攻击相关的交互,并归因于五起独立行动。

3

目标能力

被针对的能力包括 Claude 的智能体能力与工具使用、编码与数据分析、逻辑推理。

4

蒸馏攻击机制

蒸馏攻击旨在从模型对各类查询的回答中提取思维链,再通过监督微调训练更小的模型,使其获得通用推理能力。

5

绕过思维链保护

Anthropic 通常不向用户提供模型内部思维链,只显示“摘要思考”模块;但攻击者找到特定手法诱使模型直接泄露思考轨迹。

6

翻译请求案例

一起案例中,攻击者把查询伪装成翻译请求,要求模型将先前的工作记忆翻译为仅用片假名的自然准确日语。

7

阿里巴巴相关行动

最大规模行动被归因于阿里巴巴,Anthropic 称这是其观测到的最大整体蒸馏行动:2026 年 5 月至 7 月有 1.51 亿次交互,峰值接近每天 300 万次,分布在 3500 个账户,因共用同一固定提示词而被归为单一行动,疑似为 Qwen 系列模型生产训练材料。

8

Moonshot AI 相关行动

另一起来自 Kimi 制造商 Moonshot AI 的行动似乎直接路由来自中国军方的请求;一例要求 Claude 评估一批闭路监控录像,判断对象是否“行为异常”。

9

十天数据

Anthropic 称,在一个十天周期内,近 30 万次请求通过 5000 个账户网络路由至 Claude,主要针对 Opus 模型。

10

背景对比

Anthropic 曾在 2 月公开谈论蒸馏攻击并点名特定实验室;OpenAI 也报告过类似活动,并具体归因于 DeepSeek。本次报告所述行动规模更大、更激进。

SOURCES

来源与引用

共 1 个来源
官方原文TechCrunch 原始发布2026-09-10 · 一手信息
https://techcrunch.com/2026/09/10/anthropic-details-distillation-campaigns-from-alibaba-moonshot-ai-and-deepseek