Skip to content

蒸馏风暴:一场无人公开谈论的技术竞赛

Episode 179 · August 17th, 2026 · 49 mins 33 secs

About this Episode

「关于蒸馏:误解、门槛与代价」

这期播客,又是一次“编辑部”节目:我和《晚点 LatePost》的主笔高洪浩一起来聊蒸馏。

这是一个所有人都在关注、却很少有人愿意公开谈论的话题,所以也很难邀请外部嘉宾。本期中,我们对蒸馏的讨论,来自过去一段时间,我们和数位来自不同中国 AI lab 的从业者的讨论以及一些公开资料。

相关文章蒸馏风暴:AI 公司不愿公开谈论的技术竞赛已在上周发布。

播客里,编辑了《晚点独家丨字节讨论训超 5 万亿参数模型,张一鸣:不蒸馏、别被 Coding 这种短期热点影响》的洪浩,也和我一起讨论了更多公司,如字节的更多做法和可能的原因。

蒸馏这种诞生多年的技术到底是什么?为何在 2026 年出圈?大规模蒸馏如何实现?蒸馏能否成为一个模型研发团队的壁垒?它的代价又是什么?

本期节目是一个引子,希望更多从业者、听友在评论区分享你们的想法、观察和思考。


图注:斩杀线。处在一个模型,右边(比它贵),和下方(智能程度比它低)区域的模型,被该模型”斩杀“。不过这个图里没有反映另一个非常重要的维度,就是推理速度。

本期嘉宾:
程曼祺,《晚点 LatePost》科技报道负责人

本期主播:
高洪浩,《晚点 LatePost》主笔

本期剪辑:甜食

时间线:
-蒸馏不是“抄答案”,蒸馏为何在 2026 年出圈
02:04 典型蒸馏:让学生模型逼近教师的输出行为
04:26 智能体轨迹蒸馏:可被“蒸”的数据越来越丰富
06:41 不是所有使用强模型输出的训练都是蒸馏,但都违反用户协议
08:05 蒸馏规模扩大的两个关键节点
10:17 从为了压缩,到为了变强

-字节为什么不蒸馏?
13:51 张一鸣的判断:最多只能逼近,很难真正超越
17:44 一个运动员可以既嗑兴奋剂,也勤加训练吗?
24:41 其它公司的蒸馏讨论

-蒸馏难在哪,如何实现?
28:52 账号、真实问题与数据管线:大规模蒸馏的 know-how
32:08 蒸馏行为可以被隐藏吗?
34:56 学生模型超越教师模型的可能性
37:29 一直逼近而不超越,问题是什么?

-学生能否超过教师:技术、规则与更大的商业问题
38:35 蒸馏的红线与“双标”争议
44:05 更便宜的智能,如何改变前沿模型商业逻辑

相关链接:

蒸馏风暴:AI 公司不愿公开谈论的技术竞赛

晚点独家丨字节讨论训超 5 万亿参数模型,张一鸣:不蒸馏、别被 Coding 这种短期热点影响

177 期:详解 Kimi K3:强到冲击 Anthropic 估值的模型什么样?

176 期:姚顺雨,来到腾讯 300 天

163 期:详解 DeepSeek V4:Infra 巨鲸、百万上下文走进现实、极致效率优化

80 期:OpenAI o1 来了!与硅流袁进辉聊 o1 新范式和开发者生态

Anthropic:Detecting and preventing distillation attacks

Google Threat Intelligence Group:Distillation, Experimentation, and (Continued) Integration of AI for Adversarial Use

DeepSeek-R1 技术报告

OpenAI 使用条款

小红书@曼祺_火柴Q即刻@曼祺_火柴Q

小红书@高洪浩 ALaNGo 即刻@高洪浩 ALaNGo

☆《晚点聊 LateTalk》建立「 播客听友群」啦!☆

欢迎关注科技、商业大公司动态和创业创新的小伙伴进群交流,第一时间收听新节目。
这里有更多互动,更多话题讨论。欢迎贡献选题 & 推荐嘉宾。

请先添加「晚点」小助手的微信号,备注:“晚点聊”,我们邀请您入群。

关注公众号《晚点 LatePost》和《晚点对话》,阅读更多商业、科技文章: