详情

首页手游攻略 阿里对决五角大楼:被指控的模型能力提取到底是什么技术?

阿里对决五角大楼:被指控的模型能力提取到底是什么技术?

佚名 2026-07-25 17:01:57
![111.png](https://developer.qcloudimg.com/http-save/yehe-1416240/1638a6b4eebbcf6cbf80484dab86b715.png)

两条战线,同一场风暴

2026 年 6 月,阿里巴巴和大洋彼岸的两个机构同时较上了劲。

**第一条战线在法庭。** 6 月 23 日前后,阿里巴巴正式起诉**美国国防部(五角大楼)**,要求把自己从那份"中国军事企业"(业内称 1260H)清单上移除。阿里在诉状里态度强硬,称这一认定"武断、反复无常、缺乏实质证据",强调公司由独立董事会治理、业务只面向"零售、物流和企业服务",与军方毫无关联。

**第二条战线在国会。** 几乎同一时间,美国 AI 公司 **Anthropic**(Claude 的开发商)向参议院递交了一封信,指控阿里旗下团队用约 **25,000 个虚假账户**、在 4 月 22 日到 6 月 5 日的六周内,与 Claude 进行了 **2,880 万次对话**,目的是"非法提取 Claude 的能力",用来训练阿里自己的模型。Anthropic 称这是"迄今针对它规模最大的一次蒸馏攻击"。阿里则否认了相关指控。

这两件事并不是一个因果链——起诉国防部争的是"军事企业"标签,Anthropic 的指控走的是国会游说,二者是中美 AI 角力同时爆发的两条战线。但它们指向了同一个被推到聚光灯下的技术名词:**模型能力提取(Model Extraction)**。

>看到“阿里非法提取Claude能力”,作为优秀的架构师你肯定有疑问:**所谓"用对话提取模型能力",技术上到底是怎么实现的?2.5 万个账户在整套系统里扮演什么角色?**。本文就针对以上问题来:**透过这个现象,把背后那套"模型能力提取"技术彻底讲清楚**。这套技术本身是公开的学术领域,理解它,无论对于攻击者画像还是防御方建设都有价值。

我们要回答三个问题:

1. 所谓"提取模型能力",到底提取的是什么?

2. 如果要走通这条技术路径,完整的工程流程是什么?

3. 防御方有哪些手段,为什么这件事这么难防?

----

## 一、先厘清概念:提取的不是"权重",是"行为"

很多人第一反应是"把模型偷出来"——把那几千亿参数的权重文件拷走。这是个误解。

闭源大模型(如 Claude、GPT)的权重从不对外暴露,你能接触到的只有一个 **API 黑盒**:输入文本,输出文本(以及可能的 logprobs、token 概率等元信息)。所以"提取能力"提取的从来不是参数本身,而是模型的**输入-输出行为模式**。

这在学术上有精确的名字:

- **模型萃取 / 模型窃取(Model Extraction / Model Stealing)**:通过大量查询黑盒 API,重建一个行为高度近似的"复制品"。

- **黑盒蒸馏(Black-box Knowledge Distillation)**:把强模型(teacher)当作标注机器,用它的输出作为"软标签"去训练一个自己的模型(student)。

经典的知识蒸馏(Hinton 2015)发生在你**同时拥有** teacher 和 student 的场景下,能拿到 teacher 的完整概率分布(soft logits)。而 API 蒸馏是它的"黑盒变体":你拿不到内部 logits,只能拿到生成的文本,于是用**生成的文本本身**作为监督信号。

一句话总结这套方法的本质:

>**把一个昂贵的、闭源的强模型,当成一台可以无限调用的"自动数据标注工厂",用它产出的高质量数据,去喂养一个你自己拥有的模型。**

::: center

![01_concept.png](https://developer.qcloudimg.com/http-save/yehe-1416240/2d8469f1d64f9ad147191e59cd6860eb.png){ width=700px }

:::

----

二、为什么这条路有效?一个关键的成本不对称

理解整件事的经济动机,要抓住一个核心:**训练一个前沿模型,最贵的不是算力,而是高质量的对齐数据。**

一个现代大模型的能力大致来自三段:

|阶段|作用|数据来源|获取难度|

|:-:|:-:|:-:|:-:|

|预训练|习得语言与世界知识|互联网海量文本|相对容易(公开语料)|

|监督微调 SFT|学会"按指令好好回答"|高质量"指令-回答"对|**很贵**(需人工撰写/标注)|

|偏好对齐 RLHF/DPO|学会"符合人类偏好"|人类偏好排序数据|**极贵**(需大规模人工标注)|

前沿实验室花了数亿美元、雇佣大量标注员,才打磨出 SFT 和对齐阶段的数据。而这些数据的"成果",恰恰就**浓缩在模型的输出里**。

于是攻击者的算盘就清楚了:我不需要重走那条昂贵的标注流水线,只要**让你的模型替我生成等价的高质量数据**就行。teacher 模型的每一次回答,都相当于一份免费的、专家级的标注样本。

这就是成本不对称的核心:**你花十亿美元造出的能力,我可能用几百万美元的 API 调用就"蒸馏"个七八成。**

::: center

![02_cost_asymmetry.png](https://developer.qcloudimg.com/http-save/yehe-1416240/8483c5f68255e9aa5ca691a2cf645a69.png){ width=700px }

:::

----

## 三、完整技术路径:六个阶段拆解

如果真要走通这条路,工程上需要哪些步骤?下面是一条完整的、教科书式的技术链路。理解它,是为了知道**防御方该在哪些环节设卡**。

::: center

![03_pipeline.png](https://developer.qcloudimg.com/http-save/yehe-1416240/7f3d2a8559c87353de3b15d6d9568bab.png){ width=900px }

:::

### 阶段 1:能力定位与种子构造

你不会无目的地乱问。第一步是明确"我要提取哪部分能力"——是代码生成?复杂推理?长文本写作?还是工具调用(function calling)?

针对目标能力,构造**种子提示集(seed prompts)**:

- 从公开数据集(如各类 benchmark)取题

- 用模板批量生成变体(改变主题、难度、语言、格式)

- 用一个小模型自举(self-instruct)扩展出更多样的指令

目标是让查询覆盖目标能力的**输入分布**——你问得越全面,复制品在该能力上越接近。

### 阶段 2:大规模查询采集

这是被指控的"2,880 万次对话"对应的环节。把种子提示喂给目标 API,收集"输入-输出"对。

工程要点决定数据质量:

- **解码参数**:用较高 temperature 采样多样回答,或用 temperature=0 取确定性"最优答案"

- **多次采样**:同一个问题问 k 次,保留最优或全部(增加数据多样性)

- **结构化提取**:如果 API 返回思维链(reasoning / `` 块),这部分尤其珍贵——它直接暴露了模型的推理过程

>注意:这一步天然需要**绕过单账户的速率限制和用量上限**。这正是"2.5 万个虚假账户"指控的技术动机——海量查询必须分散到大量账户上,才能既凑够数据量、又不触发风控。**这一步也是从"合规研究"滑向"违规滥用"的分界线。**

### 阶段 3:数据清洗与质量过滤

原始采集的数据是带噪的,直接拿来训练会把 teacher 的错误也学进去。需要:

- **去重**:语义级去重,避免冗余样本主导训练

- **质量打分**:用规则或另一个模型给回答打分,丢弃低质量样本

- **拒答过滤**:teacher 拒绝回答的、报错的、被安全机制截断的样本要剔除

- **格式规整**:统一成训练框架要的格式(如 ChatML、ShareGPT 格式)

数据质量直接决定 student 的上限——这一步往往比采集本身更花心思。

### 阶段 4:构造蒸馏数据集

把清洗后的数据组织成监督信号。根据能提取到的信息丰富度,有几个层次:

|可获取信息|蒸馏方式|信号强度|

|:-:|:-:|:-:|

|仅最终文本|序列级蒸馏(拿回答当 SFT 标签)|中|

|文本 思维链|推理蒸馏(学推理过程,不只学答案)|强|

|token 概率 logprobs|软标签蒸馏(逼近概率分布)|很强|

绝大多数闭源 API 只暴露第一层(有时第二层),所以现实中的 API 蒸馏主要是**序列级蒸馏**——把 teacher 的输出文本,当作 student 的训练目标。

### 阶段 5:训练学生模型

拿一个开源基座模型(student 的"骨架"),用上面构造的数据集做微调:

- **SFT 阶段**:用"指令-teacher回答"对做监督微调,让 student 模仿 teacher 的回答风格与能力

- **可选偏好对齐**:如果采集了 teacher 对多个回答的偏好信号,可进一步做 DPO/RLHF

关键点:student 的基座可以远小于 teacher。蒸馏的魅力就在于**用大模型的"教学",把小模型的能力撬到远超它自己从头训练的水平**。

### 阶段 6:评测与迭代

用 benchmark 对比 student 和 teacher 的能力差距,找出薄弱环节,**回到阶段 1 针对性补充查询**——哪类能力没学到位,就针对那类构造更多种子提示,再采一轮数据。

这是一个闭环:定位弱点 → 定向采集 → 再训练 → 再评测。迭代几轮后,student 在目标能力上会无限逼近 teacher。

----

四、系统架构:一座"蒸馏工厂"的工程全貌

前面讲的是"逻辑流程",但要真正在"六周、2880 万次对话"这个量级上跑通,背后必须是一套**工业级的分布式采集系统**。把它拆开看,大致是五层。理解这套架构,你才能明白为什么这件事"既能做成、又终会暴露"。

::: center

![05_system_arch.png](https://developer.qcloudimg.com/http-save/yehe-1416240/bf308678a4498daf594bfd37870fcbda.png){ width=900px }

:::

### 第 1 层:身份与接入层(账户池 袋里池)

这是整个系统的"伪装层",也是"2.5 万虚假账户"在工程上的真实位置。

单个账户有速率限制(RPM/TPM)和总量配额,2880 万次请求绝不可能由少数账户完成。于是需要:

- **账户池(Account Pool)**:批量注册、用不同邮箱/手机号/支付方式养号,把海量请求摊薄到每个账户的"正常用量"区间之下。

- **袋里 IP 池(Proxy Pool)**:配合住宅袋里/机房 IP 轮换,让请求来源在地理和网络特征上分散,规避 IP 维度的风控聚类。

- **指纹伪装**:轮换 User-Agent、设备指纹、请求头,模拟"很多个不同的真人用户"。

>这一层是整套系统**合规性的分水岭**:用自己的合法账户做研究是一回事,用大规模伪造身份系统性绕过风控是另一回事。技术相同,性质却完全不同。

### 第 2 层:调度与限流规避层

有了账户池,还需要一个"大脑"来编排它们:

- **任务队列**:把海量种子提示拆成任务,分发给空闲账户。

- **限流感知调度**:实时跟踪每个账户的剩余配额,遇到 429(限流)/封禁自动降速、切换账户、退避重试。

- **拟人化节奏**:刻意加入随机延迟、模拟作息曲线,避免"7×24 匀速打满"这种一眼假的机器特征。

这一层的工程质量,直接决定系统能"潜伏"多久不被发现。

### 第 3 层:采集网关层

真正与目标 API 对话的执行单元:

- **高并发请求引擎**:异步并发、连接池复用,把吞吐拉满。

- **响应解析**:抽取正文、思维链(若有)、token 概率(若暴露)、错误码。

- **失败重试与幂等**:网络抖动、超时、空响应的自动重采,保证数据完整率。

### 第 4 层:数据管道层(最容易被低估的核心)

采回来的原始数据是"矿石",要变成能喂模型的"精料",全靠这条流水线——**它往往比采集本身更决定最终质量**:

- **流式去重**:语义级查重(embedding 相似度),剔除大量冗余问答。

- **质量过滤**:用规则或裁判模型给每条样本打分,丢弃低质、跑题、被截断的回答。

- **拒答清洗**:teacher 触发安全机制的拒答样本必须剔除,否则会把"不回答"也蒸馏进去。

- **格式规整**:统一成 ChatML / ShareGPT 等训练框架要的结构。

### 第 5 层:训练与回流层

- **数据仓库**:清洗后的高质量样本入库,按能力维度打标签。

- **训练集群**:在开源基座上做 SFT,必要时叠加 DPO/RLHF。

- **评测回流**:benchmark 测出短板 → 自动生成新一批种子提示 → 回灌第 1 层,形成闭环。

把这五层连起来看,结论很清晰:**它不是"写个脚本爬一爬",而是一套有调度、有风控对抗、有数据治理的分布式系统。** 也正因为它必须维持 2.5 万账户的庞大身份池长期运转,才在统计特征上留下了破绽——这就自然引出了下一个问题:防御方是怎么发现并应对的?

----

五、为什么这件事极难防御?

防御方(被提取的一方)面对的是一个**根本性的两难**:

>你的产品价值就在于"对外提供高质量回答",而高质量回答本身就是最好的训练数据。**你越是把产品做好,就越是把蒸馏素材送到攻击者手里。** 提供服务和防止提取,本质上是矛盾的。

但防御方并非束手无策,手段大致分四类:

::: center

![04_defense.png](https://developer.qcloudimg.com/http-save/yehe-1416240/5c92fc9e459f9bf0fdd3a7b489ad3c2f.png){ width=800px }

:::

### 1. 行为检测层(识别异常查询模式)

正常用户和"数据采集机器人"的行为分布不同:

- **查询模式异常**:短时间内系统性遍历某个能力空间、提示高度模板化、问题分布过于均匀

- **账户行为异常**:注册即高频调用、无正常使用节奏、IP/设备指纹聚集

- **用量画像**:单账户用量曲线不符合人类作息

这正是"2.5 万虚假账户"被发现的技术路径——**当查询量大到一定规模,分布特征会暴露意图**。

### 2. 输出侧防护(降低输出的"可蒸馏性")

- **限制元信息**:不返回 logprobs、不暴露完整 token 概率,掐断软标签蒸馏的可能

- **水印(watermarking)**:在生成文本里嵌入统计学上可检测、但人类不可见的信号。如果某个新模型的输出带着你的水印特征,就是它"喝过你的数据"的证据

- **速率与配额**:限制单账户的查询量与频率,抬高大规模采集的成本

### 3. 接入层防护(抬高账户造假成本)

- 实名/企业认证、支付验证,让"批量注册 2.5 万账户"变得昂贵且可追溯

- 设备指纹、IP 信誉库识别批量自动化

- 异常账户的关联分析(同一批账户的注册时间、付款方式、调用模式聚类)

### 4. 法律与协议层(事后威慑)

- **服务条款(ToS)**:几乎所有大模型 API 的条款都明确禁止"用输出训练竞品模型"

- **取证留痕**:完整的查询日志是事后追责的关键证据——这次 Anthropic 能拿出"2,880 万次对话""25,000 账户"的精确数字,本身就说明日志取证是防御体系的一环

- **行业政策**:推动立法和出口管制,把技术问题上升为合规与地缘问题

值得注意:**水印和行为检测是"概率性"的**,不是铁证。它们能提供强烈的统计学怀疑,但要形成法律意义上的铁证依然困难——这也是这类纠纷往往打成"罗生门"的技术根源。

----

六、技术之外:一个绕不开的张力

把镜头拉远,这件事折射出整个行业的深层矛盾:

**知识蒸馏本身是中性的、甚至是被鼓励的技术。** 学术界用它压缩模型、降低部署成本;开源社区用强模型生成数据训练小模型(很多知名开源模型都公开承认用了 GPT/Claude 的输出做 SFT)。蒸馏让能力得以"普惠",这是它正面的一面。

它变成"攻击"的临界点,在于三个要素的叠加:

1. **未经授权**——违反了服务条款的明确约定

2. **规模化欺诈**——用虚假账户系统性绕过技术管控

3. **竞争性意图**——目的是训练直接竞争的产品

技术是同一套技术,**区别在于授权、手段和意图**。这也是为什么这类事件最终往往不在技术法庭、而在监管和立法层面收场——纯技术手段既无法完全防住提取,也无法单方面证明提取。

----

结语

回到最初的现象。无论这起具体纠纷的结论如何,它都把一个长期存在于学术论文里的技术,推到了产业和地缘的聚光灯下:

- **提取的是行为,不是权重**——通过黑盒查询重建模型的输入输出映射

- **驱动力是成本不对称**——蒸馏让"抄能力"远比"造能力"便宜

- **路径是一条六阶段闭环**——定位、采集、清洗、构造、训练、迭代

- **防御是纵深的、概率性的**——从行为检测到法律威慑,没有单点银弹

对于每一个做 AI 产品的团队,这件事的启示很实际:**如果你的模型对外提供 API,你就同时在运营一座"数据金矿"。** 风控、水印、日志取证、条款设计,都不再是可选项,而是基础设施的一部分。

技术没有立场,但使用技术的人有。理解这套机制,是为了在攻防的两端都能站得更清醒。","createTime":1782713323,"ext":{"closeTextLink":0,"comment_ban":0,"description":"","focusRead":0},"favNum":0,"html":"","isOriginal":0,"likeNum":0,
相关资讯
点击查看更多
游戏推荐
推荐专题
热门阅读
推荐下载