“蒸馏”一词再次成为舆论的关注焦点。这一次,站在聚光灯下的不是多次指控国产模型蒸馏的强硬派Anthropic,而是久未公开露面的张一鸣。
张一鸣在最近的字节全员会上罕见发话:字节宁愿忍受模型的落后,也不希望依赖蒸馏实现短时的智能爬坡。
当字节的Seed模型被认为落后,蒸馏已经成为模型公司竞赛的常用手段时,张一鸣的表达,让字节的技术身位显得非常独特。在媒体的报道中,Seed成立以来,内部动过三次大的蒸馏念头,但都被集团掐断了。
一个模型的好坏,涉及到架构、数据、infra和评估四部分。高质量的数据几乎成为模型好坏的关键。今年5月,梁文锋在和投资人交流中也提到,DeepSeek差不多有一半的研究员,都在标注数据。高质量的数据成本非常昂贵。
这也让蒸馏SOTA模型数据,变成了一条极具诱惑力的捷径。一位基础模型研究员也告诉我们,现在模型能力最容易被短期改善的变量就是数据。用更强的模型产生高质量数据,技术风险明显小于推翻原有架构、重新做大规模训练。而且成本也要小得多。
既然蒸馏好处很多,为什么还有人那么坚定反对蒸馏。蒸馏的代价是什么?
蒸馏本身是个中性技术,主要是让一个参数庞大、性能更强的模型,通过输出的概率分布,训练出一个轻量级的模型,在保持高性能的同时,大幅减少参数规模和推理成本。比如OpenAI用GPT-4o、o1等作为教师模型,训练GPT-4o mini等学生模型。
但这两年当其他模型未经允许,大幅蒸馏SOTA模型的数据进行训练时,蒸馏的情感色彩变得更复杂了。Anthropic、OpenAI、Google等多家模型公司都明确反对这种未经允许的蒸馏,甚至直指一些中国的模型公司。
这背后自然有他们的商业考量。OpenAI、Anthropic已经花费了数十亿美元,打造模型。竞争对手能用极低的成本,绕过自己数十亿美元的研发投入,快速复制模型能力,很可能打破它们原有的定价体系和商业策略。
本质上看,蒸馏真正触碰到的,是基础模型公司的投资回报逻辑。
通过压缩其他SOTA模型,复制竞争对手的能力,在国外也很有争议。今年5月,马斯克表示,AI公司一般都会蒸馏其他的模型,xAI就部分蒸馏了OpenAI来训练。
不过,同月Meta则在团队内部明确了使用外部模型工具的边界,要求工程师必须独立设计编程测试题目,依托自身专业技术能力构思方案,严禁直接采用AI生成的创意思路。为防止Claude模型生成内容流入Meta自身训练数据,部分团队还被要求暂停相关调用。
这说明,蒸馏并不是一个简单的“中国公司做、美国公司反对”的故事。
长期来看,随着SOTA模型的防守增强,过度依赖蒸馏会制约模型公司的自研能力。但不少公司仍然通过调用API的方式进行蒸馏,某种程度上,这甚至像开源一样成为一种趋势。
在具体实践中,蒸馏的代价或许还在于边界的模糊和人的惰性。
不少研发人员都提到蒸馏会“上瘾”。对许多面临竞赛压力的研究员来说,诱惑非常现实。因为相比自己从零开始寻找高质量数据、设计复杂的训练方案,SOTA模型蒸馏出来的高质量数据,无疑是一条更高效、成本更便宜的路径。
问题也在这里。蒸馏最大的诱惑是,让人可以暂时绕开那些最困难的事情。一旦模型竞赛方向发生变化,或者模型公司产生了依赖,它失去的不只是数据的原创性,还有自己发现数据、训练模型和解决问题的能力。
这或许也是张一鸣宁愿接受Seed暂时落后的真正原因,模型可以暂时落后,但不能失去追赶模型的能力。