xiejin77 发表于 昨天 14:55

蒸馏偷不走灵魂

我写这篇文,是indy老师之前在群里发我,后来苏小老师又专门找了给我看的这篇文章触发的(@indy ):
这篇原文



蒸馏偷不走灵魂:从国产大模型风波看能力对齐、评测幻觉与创新边界
围绕国产大模型的这一轮“蒸馏风波”,最容易形成两种截然相反的叙事。

一种叙事认为,国产模型突然变强,是因为破解了海外模型的加密思维链,将Claude、GPT等模型的“内功心法”成规模地灌进了自己的参数;所谓架构创新、训练方法和工程优化,不过是掩盖技术依赖的烟幕。另一种叙事则把所有关于蒸馏的质疑都视为对国产技术进步的抹黑,仿佛只要模型跑出了足够高的分数,便已经证明了完整的自主创新。

这两种叙事看似对立,其实共享着同一个错误前提:它们都把模型能力想象成一种可以整体搬运、整体拥有的东西,仿佛从教师模型那里取得了足够多的数据,就等于复制了教师模型的全部智能;或者反过来,只要学生模型在若干榜单上追平了教师,就能证明它已经获得了同等层次的能力。
真正的问题并不这么简单。

这篇《国内大模型蒸馏风波的来龙去脉》最被诟病之处,不仅仅只是部分事实缺乏证据,而是它事实上将若干性质完全不同的问题压缩成了一条过于流畅的故事线:加密推理状态能够重放,于是完整思维链已经泄露;某些国内厂商可能进行过大规模蒸馏,于是某个具体模型的性能必然来自这些数据;模型在特定榜单上大幅跃升,于是必然存在测试集污染或后台路由;企业采取某种复杂架构,于是这种架构必然是用于掩盖蒸馏的技术烟幕。

文章说的每一步似乎都有可能发生,但每一步之间都也都似乎缺少必要的证明。

一、从“行业轶事”到“完整内幕”
这个GitHub仓库自己将内容定位为“行业轶事记录”,并明确把非正式聊天记录和群聊截图列为主要材料。 但经过文章言之凿凿地整理之后,原本充满不确定性的聊天内容,被重新写成了一份拥有明确起因、传播路径、责任主体和行业后果的“完整记录”。

在原始聊天中,关于智谱首先获得Claude相关技术的信息,最初只是:
“具体不知道是什么。”
“也有可能是把CoT搞到了。”
“最可能是这个,因为前几天有GitHub仓库。”

也就是说,原始信源甚至不能确认智谱取得的究竟是输出数据、推理轨迹、代理日志、接口漏洞,还是其他训练资源。 但到了整理后的文章里,它已经变成了一个确定结论:智谱率先破解了Claude的完整加密思维链,并主动将方法和数据共享给其他国内厂商。

这可不是啥普通的推理揣测,而是证据类型的实质性认定与改变:从猜测变成事实,从传闻变成因果链,从未经核验的二手信息变成了仿佛已经完成调查的行业内幕。

更明显的例子,是文章将Kimi在对话中偶尔自称Claude称为“蒸馏的硬证据”。
仓库保存的后续聊天却明确承认:“这也不是蒸馏的硬证据。”

模型自称Claude,当然可能说明其训练数据中存在大量Claude生成内容,但也可能来自身份幻觉、上下文残留、诱导性问题、系统提示错误乃至服务路由异常。它可以是线索,却远远不能独立证明某个模型使用了完整Claude思维链,更不能证明这些数据来自某一家国内厂商破解并共享。

因此,这篇文章首先犯下的是一个调查方法上的错误:它没有区分或者也根本懒得区分“存在迹象”“高度可疑”“多方指控”“能够复现”和“已经证实”。

Anthropic确实在2026年2月公开指控DeepSeek、Moonshot和MiniMax通过约2.4万个虚假账户,与Claude进行了超过1600万次交互,以提取和蒸馏Claude的能力。Anthropic同时也承认,蒸馏本身是一种广泛使用的正常技术,争议主要来自是否违反服务条款、规避地域限制以及是否以竞争性方式大规模提取能力。

这当然足以证明“大规模蒸馏活动可能真实存在”,但却不能自动证明GitHub文章所描述的每一个具体环节。

从大规模调用Claude,到提取完整加密思维链;从取得训练数据,到将数据用于某一代模型;从使用蒸馏,到裁撤强化学习团队;从榜单跃升,到后台路由作弊——这些是五个不同的问题。不能因为第一个问题已有公开指控,就把后面四个问题一并视为已经坐实。

二、蒸馏真正复制的,不是模型的“灵魂”
撇开具体企业的是非,蒸馏究竟能够把什么从教师模型传递给学生模型?

用更加严格的语言来说,通过API输出进行的黑盒蒸馏,首先对齐的并不是教师模型内部的完整“特征空间”,而是教师模型在特定输入分布上的条件输出分布和决策边界。

假设教师模型为 (T),学生模型为 (S),训练数据来自某一输入分布 (D)。蒸馏所做的,是让学生在从 (D) 中采样的问题上,尽量逼近教师的输出。

如果能够获得教师模型的logits、中间层表示乃至详细推理轨迹,学生得到的监督信号会更加稠密,对齐程度也会更深。但即使学生能够高度复现教师的输出,也不能由此推出学生形成了完全相同的内部表示。已有蒸馏研究早已指出,输出层面的软标签接近,并不能保证教师与学生拥有相同的内部知识结构,而内部表示差异会直接影响模型在分布外任务上的泛化能力。

因此,“特征空间对齐”这个说法也还需要再详细解释一下。

如果厂商只能取得教师的答案、代码、工具调用和代理轨迹,它真正完成的是外显行为空间的对齐。学生模型会在训练覆盖到的区域内,逐渐形成一套能够重现教师决策的内部表征。这个内部表征未必与教师相同,但在局部任务上可以产生相似结果。

如果厂商还取得了完整推理轨迹,那么学生不仅学习“答案是什么”,还能够学习“教师通常怎样把问题拆开、怎样选择中间步骤、怎样在若干候选路径之间作出决策”。这会显著扩大可对齐的范围,却依然不等于复制教师的全部世界模型、全部参数结构和全部潜在能力。

换言之,蒸馏不是把教师的智能整体搬进学生,而是在一个被采样数据限定的认知空间中,重建教师的决策曲面。

这就是为什么蒸馏可以极其有效,也必然存在边界。

三、模型能力更像飞行包线,而不是一张总分表
把模型能力理解成飞行包线,可能比“智商分数”更准确。

一架飞机在某个高度、某个速度和某种载荷条件下达到设计指标,并不意味着它在整个飞行包线内都拥有相同的稳定性、操纵性和安全裕度。某个学生模型在代码补全、网页生成、数学竞赛或者工具调用上追平教师模型,也不意味着它已经复制了教师模型的整体能力结构。

蒸馏数据覆盖的任务区域,就像试飞时被密集验证的若干工况点。厂商可以在这些区域内大量采样教师模型,通过过滤、重写、拒绝采样、难度分层和结果验证,将学生模型的局部决策边界不断推向教师。

只要目标足够集中,学生甚至可能在这个局部区域超过教师。

这并不神秘。学生模型可以拥有更合适的架构、更集中的训练预算、更少的安全限制,或者专门针对某类任务进行优化。一个被高度压缩和专门训练的模型,可以在某项代码任务上超过为广泛任务设计的教师,就像专门设计的截击机可以在爬升率上超过大型多用途飞机。

问题在于,这种局部超越很容易被榜单包装成整体超越。

评测集通常只能覆盖有限的任务类型、提示方式、工具环境和评分规则。当模型开发开始围绕公开榜单进行定向优化时,所谓“能力提升”可能只意味着飞行包线中的几个测量点被抬高了,而点与点之间仍然存在巨大的空洞。

更换提示方式、更换代理框架、更换工具协议,或者把问题稍微移出训练数据的分布,模型性能就可能快速下跌。这种现象既可能来自测试集污染,也可能只是来自训练分布过窄、工具依赖过强或后训练过拟合。它值得警惕,却不能仅凭“换一个harness就掉分”便直接认定存在作弊。

同样,某个模型在榜单上快速追近Claude,也不能单独证明它蒸馏了Claude。模型蒸馏、架构改进、数据污染、评测过拟合和服务端路由,可能表现出相似的外部症状。要区分它们,需要盲测、隐藏题、网络指纹、延迟分布、tokenizer特征、跨框架测试以及服务端日志,而不是依靠“输出很像”或者“进步太快”的直觉。

这篇文章的错误,恰恰是把“飞行性能看起来异常”直接等同于“发动机一定是偷来的”。

四、从追求统一AGI,到构造可调用的局部ASI
但这场争论背后还有一个更深的变化。

以Claude Fable 5和GPT-5.6 Sol为代表的前沿模型,越来越不像是在追求一个在所有领域均匀领先的“万能智力”。它们更像是在构造一个广阔的基础认知平台,再通过推理预算、工具系统、子代理、外部检索和领域后训练,把能力集中到特定任务空间中。

OpenAI自己公布的GPT-5.6评测结果就呈现出明显的非均匀性:Sol在部分代理、终端操作、浏览和代码任务上领先,而Fable 5在SWE-Bench Pro、部分专业工作和高难度数学评测中仍然占优。不存在一个模型在所有指标上统一压倒其他模型。

这说明当前前沿模型的发展方向,不一定是先完成一个无所不能的AGI,然后再将它用于各个领域。更现实的路线可能是:
先建立一个足够宽广的通用认知底座,再通过数据、工具、验证器、环境反馈和推理资源调度,在特定认知空间中形成接近ASI的能力。

这里的ASI不是指一种凌驾于人类整体文明之上的全知智能,而是指在一个边界相对明确的任务空间中,模型能够超过绝大多数人类个体,甚至超过大多数专业团队。

例如,在代码库检索、漏洞定位、合约审查、蛋白质结构分析或者金融材料抽取中,模型完全可能通过长时间运行、并行代理和海量工具调用,获得远高于普通人的局部能力。但同一个模型在文学判断、政治推理、开放世界决策或者陌生科学问题上,可能表现出完全不同的能力上限。

因此,未来的前沿智能或许不是一个均匀发光的“人工大脑”,而是一个由多个高密度认知区域组成的能力星群。模型通过路由机制,把不同任务送入不同的推理深度、工具链和专业子空间。

蒸馏在这里扮演的角色,是快速复制和扩大这些已经被前沿模型开辟出来的高密度区域。

它可以让后来者迅速进入某一片成熟的认知空间,却不必然赋予后来者开辟新空间的能力。

五、牛顿以前的模型,能不能独立推出相对论
这正好对应那个经典问题:
如果一个大模型只学习过牛顿以前的知识,它能否独立推演出相对论?

这个问题真正考察的不是知识储量,而是模型能否突破既有表征空间。

首先我们必须区分三种情况。

第一种情况,是模型只有牛顿以前留下的文本,并且不能接触新的实验数据,也不能主动观察世界。

在这种条件下,它几乎不可能严格推导出爱因斯坦的相对论。原因并不只是它“不够聪明”,而是相对论不是从古典文本中通过形式逻辑必然推出的唯一结论。

在有限的前牛顿知识和观测条件下,可以构造出许多彼此竞争、同时又与当时经验相容的世界模型。仅凭已有文本,模型没有充分理由选择光速不变、洛伦兹变换、时空统一这一套理论,而放弃其他可能解释。

这不是推理能力的问题,而是证据不足导致的理论欠定。

第二种情况,是模型只从前牛顿知识开始,但能够继续观察世界、设计实验、发展数学工具,并不断根据新现象修正理论。

在这种条件下,它原则上可能独立走出一条从经典力学到电磁理论,再到相对论的道路。它不一定沿着人类历史的顺序,也不一定使用爱因斯坦的概念,但只要它能够发现旧理论无法解释的新证据,并有能力创造新的数学表征,就可能形成某种与相对论等价的理论。

这里真正决定成败的,不是它是否背过相对论,而是它能否完成三个动作:
发现现有坐标系中的矛盾;
构造新的概念和表示方式;
通过新的观测与实验,在多个可能理论中作出选择。

第三种情况,是模型表面上只拥有前牛顿知识,但训练过程中接受了另一个知道相对论的教师模型生成的大量答案、推理链和合成实验。

这种模型当然可能输出相对论,甚至可能用自己的语言重新论证相对论。但这不能被称为“从前牛顿知识中独立推出相对论”,因为决定性的概念结构已经通过教师数据进入了它的训练空间。

它学到的并不只是几个结论。它已经从教师那里获得了新的坐标系、新的问题拆分方式以及哪些矛盾值得被关注。

这就是蒸馏问题最深的边界。

一个模型可以在教师已经划定的特征空间中表现出极强的创造性,因为所谓创作并不是简单重复。它可以组合、变形、迁移和重构教师提供的模式,甚至在局部任务中超过教师。

但真正意义上的科学突破,要求模型能够在现有特征空间无法容纳现实的时候,创造一个新的特征空间。

蒸馏擅长的是让学生更好地在地图上行走;原创理论要求模型在地图失效时重新绘制地图。

六、思维链也不是“内功心法”
原文章反复把完整思维链称为模型的“内功心法”,仿佛只要获得思维链,就能够复制模型最核心的智能。

这种理解过高估计了思维链(其实A家七月份号称发现的J-space已经完全的将COT的功能机理覆盖掉了)。

模型输出的推理链,无论是自然生成的,还是经过整理的,本质上都是一次具体推理过程中可见或半可见的轨迹。它能够告诉学生模型,在某类输入下,教师倾向于采用哪些中间步骤。

但教师为什么能够在新的问题上生成这些步骤,仍然依赖于它的参数结构、预训练形成的世界模型、后训练塑造的偏好、搜索策略和推理时计算。

拿到大量棋谱,可以训练出一个很强的棋手;但棋谱不等于产生这些棋谱的全部搜索树,更不等于棋手在从未出现过的棋局中重新评估局面的能力。

思维链数据的价值确实比最终答案更高,因为它提供了更密集的监督信号,减少了学生自行搜索中间步骤的难度。它可能显著改善数学、代码、代理规划和工具调用。但它仍然是一组被教师选中过的轨迹,而不是教师潜在能力空间的完整展开。

更何况,教师模型输出的推理链本身也可能包含事后合理化、冗余步骤、隐含跳跃和错误路径。将其大规模蒸馏,不仅会传递教师的能力,也会传递教师的偏见、习惯和盲点。

如果一代又一代模型主要依赖其他模型生成的数据,而缺少真实世界数据、人类创造和环境反馈,模型还可能逐渐丢失原始数据分布中的长尾信息。关于递归使用模型生成数据的研究已经表明,不加区分地反复使用合成数据,可能导致稀有模式消失和“模型坍缩”。

因此,蒸馏能够提高模型,却不能成为无限自举的永动机。

七、真正应该怎样检验国产模型
如果要严谨判断一个国产模型究竟是通过自主训练、蒸馏、榜单过拟合还是后台路由获得了高分,最重要的不是继续收集更多群聊,而是设计能够区分不同假设的实验。

首先要做的是分布外测试。不能只更换几道题,而要改变任务的表述方式、工具环境、代理框架、输入长度和评分目标,观察模型能力是否形成连续的“飞行包线”,还是只在若干训练密集区域出现突起。

其次要测试反事实和表征重构能力。给模型一个与常见训练范式不同的世界规则,要求它从观测中建立新概念,而不是调用已有术语。这比让模型回答一道更难的竞赛题,更能够检验它究竟是在调用已有能力模板,还是能够重建问题空间。

再次,要区分答案模仿和过程能力。一个模型能够生成与Claude相似的文字,并不意味着它具有Claude相同的长程规划能力。应当把长期任务拆成信息发现、状态维护、错误恢复、策略调整和最终交付等环节,观察能力究竟在哪一层发生断裂。

最后,关于秘密路由和测试集污染的指控,需要能够复现的工程证据。包括请求响应延迟、模型指纹、tokenizer行为、拒绝模式、缓存特征、隐藏测试集以及多次重复实验。仅凭模型“说自己是Claude”,或者某次输出特别像Claude,无法承担如此严重的结论。

结语:真正的分界线,是在教师没有答案的地方
国内模型是否使用Claude、GPT或Gemini进行数据合成和能力蒸馏,当然值得调查。大规模违反服务条款、伪造账户、规避访问限制,也涉及真实的商业伦理、安全治理和知识产权问题。

但从技术发展的角度看,蒸馏并不是一种可以简单归入“自主”或者“抄袭”的二元行为。前沿模型厂商同样会使用自己的强模型训练较小模型,也会用合成数据、验证器和自动反馈扩大训练规模。真正需要讨论的,是数据来源是否合法、是否如实披露,以及蒸馏在模型能力形成中究竟占据多大比重。
更重要的是,不应该把某个榜单上的追平,误认为整体智能已经完成追平。

蒸馏可以让学生模型在特定认知空间内迅速逼近教师,甚至通过更集中的训练形成局部超越。它可以让一架飞机在几个关键工况点上达到世界一流水平,也可以让一个模型在代码、数学或工具调用中表现出近似“局部ASI”的能力。

但飞行包线不是几个极值点,智能也不是若干排行榜分数的总和。

真正决定一个模型是否具备原创智能的,不是它能否复现Claude已经完成的推理,而是当Claude、GPT和人类都没有现成答案时,它能否发现原有表征中的矛盾,构造新的概念体系,通过现实反馈修正理论,并最终进入一个教师从未抵达过的认知空间。

所以,这场所谓“国产大模型蒸馏风波”最值得追问的问题肯定不是国内厂商究竟从Claude那里拿走了多少答案。

真正的问题是:
它们是否只能沿着前沿模型已经绘制的地图前进,还是有一天能够走到地图的尽头,并从那里开始重新测绘并创造新世界。


老票 发表于 昨天 22:45

以为谢兄是同好,兴冲冲跑进来准备好好扯扯,结果发现说的不是威士忌,囧......

孟词宗 发表于 5 小时前

老票 发表于 2026-7-26 22:45
以为谢兄是同好,兴冲冲跑进来准备好好扯扯,结果发现说的不是威士忌,囧...... ...

俺也是啊,握手握手。{:191:}

不过俺倒是想写威士忌的,但老票同学你太吝啬给俺的帖子高分加精啥的,俺也没动力啊。{:190:}

孟词宗 发表于 5 小时前

不过有一句说一句,国内大模型在对话中自称 ChatGPT 或 Cluade的常见。但反过来 ChatGP、 Cluade 或 Gemini 自称国内大模型也屡见不鲜。

下面这篇就很有意思:美国最强大模型 Claude Opus 4.8 刚上线就被曝“蒸馏”中国模型:自称是千问和 DeepSeek

天下文章一大抄。现在搞 AI 的都是中国人师兄弟。互相蒸馏一点都不奇怪。

xiejin77 发表于 1 小时前

老票 发表于 2026-7-26 22:45
以为谢兄是同好,兴冲冲跑进来准备好好扯扯,结果发现说的不是威士忌,囧...... ...

哈哈哈哈,票兄原来好这一口啊。

我已戒酒七年有余。

不过就算是当年喝酒的时候,也是牛二为主,波汾偶尔,西凤和景芝也算尝新。

洋酒不碰,酱香不沾。

家里领导对我的嗜好倒是甚为赞许,因为不需要细糠便可满足。

实在实在要蒸馏的话,我有一个英文名,Alex Gin;大约就知道我喜欢啥了吧。

五月 发表于 28 分钟前


如果蒸馏这么容易整出LLM,那小日本,南韩,印度阿三为啥不蒸它几个LLM出来?偏偏是中国蒸出来一个又一个领先的LLM?说明那些说中国模型靠蒸馏的人无法自圆其说。

五月 发表于 26 分钟前

老票 发表于 2026-7-26 22:45
以为谢兄是同好,兴冲冲跑进来准备好好扯扯,结果发现说的不是威士忌,囧...... ...


威士忌难喝死了。。。

{:188:}
页: [1]
查看完整版本: 蒸馏偷不走灵魂