
文 | 李炤锋
编辑 | 张雨忻
"个正常的训练管线,应该把蒸馏作为种冷启动,让模型快速走到 90 分,然后再去解决后面的的那 10 分。"谈及蒸馏在当前 LLM(大语言模型)训练的作用,位基模研究员这样说道。
他所说的"冷启动",是指让能力较弱的模型先学习强模型已经跑通的答案和任务轨迹,尽快得到个可以继续训练的基础版本。
对模型公司而言,"不蒸馏"则意味着要放弃这段加速过程,从基础能力开始自行探索。这样做的好处是,可以拥有套立的训练体系,但也需要付出长的模型迭代时间。
《智能涌现》此前曾报道,字节跳动 Seed 成立之初便定下"不做蒸馏"的原则。名字节人士解释,团队希望进入全球梯队,而这"通过蒸馏难以达到"。张鸣在 7 月底次 Seed 内部会议上也明确表示,即使暂时落后于国内同行,字节也不会把蒸馏当作提升模型能力的捷径。
这番关于"不蒸馏"的表态,不只是个训练法上的技术判断,而是对长期路线的选择。
另面,在张鸣表态"不蒸馏"的前周,英伟达 CEO 黄仁勋在接受 Axios 联创始人迈克 · 艾伦采访时曾表达过相反的观点:"蒸馏,也就是向 AI 学习、向其他知识来源学习,是智能的基础。"
在这场采访结束几天后,黄仁勋转发了封由英伟达、Meta、微软和戴尔等公司支持的开放模型联名信。信中主张建立能够进入各行各业的开放模型生态,并将蒸馏列为模型改进、测试和验证中广泛使用的法。
到底该不该蒸馏?不蒸馏的代价和回报分别是什么?《智能涌现》跟多位大模型研究员交流了相关问题。
01 不蒸馏,要付出多少时间
"数据不够、力不够,也缺少相关的管线。"有研究员这样概括国内基模团队与海外头部厂商的对比情况。在他看来,国内预训练与北美前沿仍有差距,但已不像早期那样悬殊,而大的差距发生在后训练和质量数据层面。
蒸馏技术,正是能够帮助基座厂商快速补齐上述"短板"的有手段,进而压缩模型的迭代时间周期。
选择不蒸馏的字节,不需要面对这些问题吗?实际上并不是。7 月底,字节的新代基模 Seed-2.1 Pro 在 Code Arena WebDev 总榜列 16,落后于 2 的 Kimi K3 和 6 的 GLM-5.2。
而在交流中,多位研究员都认为,"不蒸馏肯定会慢很多,短期内不借助蒸馏把 Coding 和 Agentic 能力做到行业前列,似乎并不现实。"
模型能力提升的时间压力来自数据飞轮。模型先达到可用水平,才会进入真实开发环境。能力带来使用,使用产生回流数据贵港万能胶生产厂家,回流数据又进入下轮训练。
此前,名字节人士曾告诉《智能涌现》,其 Coding 模型此前难以突破的原因之,正是业务使用意愿不足、缺少足够的数据回流。
"如果冷启动步都做不了,后面的管线就转不起来。"位受访研究员说。他用"马太应"形容这过程:用户倾向于选择能力强的模型,多使用又会带来多真实任务和回流数据,进步拉开模型之间的迭代差距。
Agent 任务进步放大了这种时间差。当前 Agent 场景中,多轮工具调用需要模型连续规划、执行和纠错,前序步骤旦偏离,错误可能沿着任务链不断累积。模型从头探索条成功轨迹,通常比直接学习已经跑通的过程慢。
但"不蒸馏"带来的压力,在所有能力线上并不相同。与 Seed 在 LLM 域未能进入国内 Top 阵营不同,字节在生成域已经进入全球前列。
多位行业人士都将 Seedance 的成功概括为"场数据的胜利"。位接近字节的人士向《智能涌现》表示,Seedance 的训练链路不使用外部模型蒸馏,连用于数据筛选、理解等环节的 VLM,也不以其他模型的输出作为蒸馏来源。
生成与语言模型不同:AI 生成仍较容易呈现可辨认的" AI 感",外部模型产出的内容很难直接替代质量真实数据,蒸馏带来的增益也相对有限。
在生成赛道,字节凭借数据、架构和产品积累,已经在不借助外部模型蒸馏的情况下进入前沿;在 Coding 和 Agent 赛道,它仍需尽快补齐能力差距,获得多真实使用和回流数据。同条"不蒸馏"原则,在不同能力线上要付出的时间成本并不相同。
在 LLM 域,当其他大模型公司借助蒸馏完成冷启动、提前进入真实场景时,坚持不蒸馏的字节要用长的训练周期,验证这套自建数据体系能否转化为先能力。
这也能解释为什么字节要在近期成立部门" AI 数据与安全",为旗下大模型提供寻源采购、成清洗和质量评测等服务——在模型和产品之外,字节须把数据能力作为立的组织支柱,以支撑自己的训练体系。
02 蒸馏的回报和代价
现代知识蒸馏的经典范式,可以追溯到图灵得主、度学习先驱辛顿等人在 2015 年发表的《经网络中的知识蒸馏》。论文提出,让较小的"学生模型"学习大型"教师模型"的输出分布,泡沫板橡塑板专用胶从而以低成本承接其能力。
例如,2019 年发布的 DistilBERT 将 BERT 缩小 40,保留 97 的语言理解能力,并把理速度提 60。当时,蒸馏主要解决模型太大、部署太贵的问题。
生成式 AI 兴起后,强模型生成的答案、解释和任务轨迹,也开始被直接用于训练其他模型。2023 年 3 月,斯坦福团队用 OpenAI 模型生成 5.2 万条指令数据,以不到 500 美元的数据成本训练 Alpaca;同年,微软让 130 亿参数的 Orca 学习 GPT-4 给出的解释轨迹,在 Big-Bench Hard 复杂样本理上达到与 ChatGPT 相当的水平。
严格来说,利用"教师"模型生成数据再做监督微调,并不等同于传统知识蒸馏。但在大模型行业的语境中,这类"用强模型输出训练另个模型"的路线也被纳入广义蒸馏。2024 年发布 Llama 3.1 405B 时,Meta CEO 扎克伯格就已将蒸馏小模型列为开放旗舰模型的重要用途;Meta 同期还把成数据生成写进了该模型的主要工作流。
到 2026 年,蒸馏已经成熟应用在模型能力并上。DeepSeek V4 技术报告披露,团队先以监督微调和强化学习分别训练十多个数学、Coding 和 Agent 等域,再让通用模型在自己采样的轨迹上,学习各个的输出分布,以多教师在线策略蒸馏并能力。
Kimi K3 也把蒸馏放进后训练主流程。其技术报告显示,团队围绕通用理、Coding 和 Agent 任务,以及 low、high、max 三档思考强度,形成 9 个教师模型,再通过多教师在线策略蒸馏整到同个模型中。
"归根结底,蒸馏是种构造数据的法。"位研究员这样概括它的回报:与从搭建成数据管线、反复试错,或者为复杂任务组织标注相比,让强模型生成答案和操作轨迹,通常能快把模型送到可用的起点。
这种回报在 Agent 训练中尤其直接。上周,韩国科学技术院研究团队提交的项研究显示,从 GPT-5-mini 的成功轨迹中提取任务流程、子任务示例和工具调用经验,在三项工具使用基准中均提升了 4B 至 8B 模型的任务准确率。
蒸馏也可以把昂贵的强化学习留给难题。"稍微简单点的问题,直接蒸馏就好了,没要再让模型用强化学习探索,会浪费很多资源。"位研究员说。
苹果研究团队 2025 年发表的"蒸馏缩放定律"则给这笔成本了笔账:当教师模型已经存在,或需要反复训练多个学生模型时,蒸馏通常省力;如果只训练个学生,还要为此从头训练教师,直接训练往往划。
蒸馏节省了寻找答案的时间,却不能替模型公司决定应该解决什么问题。
"蒸馏说白了并不复杂,道题让强的模型跑遍,再把轨迹拿出来改成训练格式。"位研究员说,相比之下,"难度反而落在造题上":题目可以来自网络抓取、提供,也可以由团队自行构造。
蒸馏的回报是时间和力,但这种率也有代价。不少研究员向《智能涌现》表示,蒸馏通常用于把模型尽快过可用门槛;等多模型来到相近起点,继续提升未还要依赖蒸馏。"到了边际收益递减的时候,大就会慢慢把这个东西换掉。"
"但真正有能力把蒸馏、强化学习和正向研发同时进的团队不是特别多。"上述研究员坦言。
此外,蒸馏也会改变公司的资源分配。有研究员提到,蒸馏能让模型短期拿到个"还可以的成绩",但见太快,也可能让团队"比较贪恋这种式"。如果要进入顶的竞争,"光蒸馏是不够的,还是要回到法和正向研发上去做突破"。
几周前,在 Kimi K3 发布后,劳德研究所研究者、Snorkel AI 联创始人布雷登 · 汉考克表示,仅靠蒸馏,不可能在如此短的时间里训练出这种强度的模型。
艾伦人工智能研究所研究员内森 · 兰伯特也指出,如果蒸馏足以复制前沿能力,其他团队本应很容易追上 GLM 或 Kimi,但现实并非如此。
有研究员选择把答案留给接下来的模型迭代。在他看来,不蒸馏路线大的阻碍,在于能否承受段时间内没有"拿得出手的产出"。
围绕蒸馏,这场长期主义和时间成本的博弈还在继续,在资源和团队技术路线的比拼之外,也考验着行业等待结果的耐心。相关词条:罐体保温施工 异型材设备 锚索 玻璃棉 保温护角专用胶
奥力斯 PVC管道管件粘结胶价格 联系人:王经理 手机:18231788377(微信同号) 地址:河北省任丘市北辛庄乡南代河工业区/p>
1.本网站以及本平台支持关于《新广告法》实施的“极限词“用语属“违词”的规定贵港万能胶生产厂家,并在网站的各个栏目、产品主图、详情页等描述中规避“违禁词”。
2.本店欢迎所有用户指出有“违禁词”“广告法”出现的地方,并积极配合修改。
3.凡用户访问本网页,均表示默认详情页的描述,不支持任何以极限化“违禁词”“广告法”为借口理由投诉违反《新广告法》,以此来变相勒索商家索要赔偿的违法恶意行为。




