42 章经 8 月 29 日那期,曲凯对谈逯雨鑫。他不是 AI PhD,也没在 AI Lab 待过,用一张显卡、两周、几百美元后训出的小模型两次登上 Hugging Face 热度榜第一。

这期没有文稿,小宇宙上这档节目关掉了官方 AI 转录,所以我把音频扒下来让 whisper 转了一遍,再把方法整理成下面这份可以照着做的清单。转录是机器做的,数字和英文名词我做了批量校正但没有逐句核对,最后一节列了几处没听清的地方。

他到底做了什么#

  • 基座是 Gemma 3 12B,老师模型是 Fable 5(他估算 3T 参数以上),做法是拿老师的回答喂给小模型,也就是蒸馏加监督微调(SFT)。
  • V1 用了 5 天,其中 3 天做数据、1 天训练。V2 用了两三周,其中 12 天在做数据。
  • 硬件是一张 5090,方法是 QLoRA。真正跑训练只有十几个小时。另有一份 200 美元的 Claude Max 订阅,用来合成靶向数据。总成本几百美元。
  • 效果:在 agentic 工具调用类的基准上,原版 15 分,训完 55 到 60 分。代价是其他基准或多或少掉分。

这条路只有一个衡量标准:模型在你那一个场景里是不是更好用了。全局变聪明是 AI Lab 的事。

六步#

第一步,先想清楚要做什么。他强调不要看什么火做什么,热的方向竞争对手也多。做应用的就围绕自己的业务想。目标不明确,后面每一步都无从判断对错。

第二步,选基座模型。中文场景直接选 Qwen,他说 Qwen 是坑最少的,训练脚本、部署、周边工具都最全。Gemma 3 12B 的中文很差,不管哪个量化版本,大部分时候会往粤语上飘。Llama 4 和最近那个 30B 的模型架构不主流,训起来会很麻烦。

第三步,攒数据。两个来源:一是真实数据,包括自己用下来的记录、Hugging Face 和 ModelScope 上的公开数据集、社区贡献的老师模型真实轨迹;二是合成数据,用两个模型对着演,一个扮用户,一个扮被训的模型。比例他给了具体数字:真实数据占 60% 到 70%,剩下的是靶向合成数据,专门用来治模型的具体毛病。

第四步,训。SFT 就够了。他说强化学习被吹得很神,实际效果没有 SFT 好,DPO 之类也是锦上添花,而且后两者成本高很多。对个人和应用公司,只有 SFT 是现实的。

第五步,跑基准,看错题,回头改数据。这一步要循环好几轮。数据看着好不等于训出来好,中间隔着能力差(capacity gap):老师是 3T 的模型,学生是 12B,老师的一部分本事学生根本接不住。只能一版一版测,看有没有明显提升,没有就判断是不是老师太强、学生太弱。

第六步,发布或部署。部署会遇到另一批坑,SGLang 和 vLLM 的架构差异是其中之一。

整条流程的脚本、公开数据、基准全是开源的,可以直接拉下来,用 AI 改成自己的版本。他的整个项目都是用 Claude 完成的。沙盒环境不用自己搭,E2B 这类服务很便宜。

数据是唯一的真难点#

他 95% 的时间花在数据上。部署环境、显存、算子这类问题,自己多看看书多搞搞很快就能解决;真正卡住人的是能不能看出数据里的毛病。

几个具体的经验:

合成数据本身不好用。你跟 AI 说“帮我做一批治过度自信的数据”,它做出来的东西基本是不对的。必须自己下场审。他的比例是 5000 条数据抽审 500 条,发现问题告诉 AI,让它一版一版改。这是最耗时间的环节。

合成数据的正确用法是打靶。举他的例子:Gemma 3 12B 有个毛病是过度自信,跑基准时明明任务没完成,它宣布完成了。这种毛病在公开数据和真实使用记录里是找不到对应样本的,只能针对性地合成一批来治。

总量不用大。他做出来将近一万条,剔掉一大部分之后,实际用上的是几千条量级。

数据的价值判断标准很朴素:跟你的目标方向一致的数据就是好数据。

什么算“好的蒸馏”#

他给的判断标准是看锚点。

如果你的目标是提升安全边界,你却蒸了一堆基准题的变体,那是坏的蒸馏,哪怕分数上去了。如果你想让模型往某个方向走,数据也真的把模型的分布往那边拉了,那就是好的蒸馏,哪怕基准掉分。

他自己的锚点是 agentic 和 coding,因为现在大家实际就用这两块,所以下载量和使用量自然就来了。他的原话是关注真实使用比锚定基准更强。对 AI Lab 来说基准是考试,对应用公司不是。

成本账#

  • 个人做特定领域的微调:几百美元以内。租卡一两美元一小时,真实训练十几个小时,几版迭代下来硬件成本不会超过 100 美元。
  • 应用公司训一个小模型:几千到一万人民币。大模型要上卡量,十几万到二十万人民币以内。
  • 团队配置:中型或大型公司三四个人的小团队就够,预算就是这几个人的工资加显卡和部署费用。
  • 推理服务是另一笔账,而且更贵。小模型如果只有十几并发这种需求量,一台 H200 几万块钱,够十几个员工用。
  • 预训练不在讨论范围内。他给的估算是 128 到 256 张 B300,跑好几个月,这块仍然是 AI Lab 主导。

显存和内存现在处在价格高点,因为厂商没预料到 AI 这么火,供应短缺。他判断供应上来之后成本会大幅下降。

坑清单#

  • 基座别选架构不主流的。Llama 4 和最近那个 30B 模型都属于这类,训练和部署都麻烦。
  • Gemma 3 12B 中文差,会飘粤语,中文场景别用。
  • 别太信 AI 给的答案,及时去查,去看别人真实做成的案例。
  • 别指望一版就成。他反复说的一句是别放弃,每个环节都有坑等着。
  • 不用手推公式那些基础。他说自己学过的很多理论基础,对大部分人是没必要的。

换成你的项目怎么起步#

这套方法的门槛不在技术,在有没有真实数据。判断一个项目适不适合,就看两件事:有没有一个明确到能写成一句话的场景,以及这个场景里有没有积累下来的真实使用记录。

按播客里的比例,一个可以起步的最小配置是:几千条数据,其中六七成来自产品里已经发生过的真实使用,剩下三四成是针对具体错题合成的;基座选 Qwen 的小尺寸;租卡跑 QLoRA,几版迭代下来百来美元;先跑一遍看错题,再回头改数据。

时间分配按他的经验预留:训练一天,数据两周。

为什么是现在#

节目后半段他给了一个时间上的理由。开源的小模型不一定一直有:Qwen 最近那一代就没有发任何小模型。如果头部实验室不再开源小尺寸,想自己后训的公司就只能从已经放出来的老模型里挑,路会越走越窄。他的建议是有预算的中大型应用公司现在就开始迭代自己的后训模型。

另一个理由是数据的价格。AI Lab 现在花大钱买数据,跟移动互联网早期字节花钱买用户是一回事。现在是最便宜的时候,往后只会更贵。真正跟用户接触的应用公司手里握着第一手数据,这是它们相对实验室唯一的结构性优势。

他自己对未来分工的判断:实验室往上走,专心做预训练和前沿研究;后训这一段交给应用公司,因为应用公司本来也不愿意把自己的数据分享出去。

几处没听清的#

机器转录,下面几个专有名词是按上下文推断的,要引用的话建议回听原音:

  • 基座模型的具体尺寸,语音里数字含糊,按上下文取 Gemma 3 12B。
  • 他用来测分的那个基准,听起来是 τ³-bench 一类,测模型调工具完成任务的能力。
  • 海外那家已经把微调做成产品、在 Hugging Face 上比较有名的公司,名字没听清。
  • 他提到的那个 30B、架构不主流的新模型,名字没听清。

原节目:42 章经《一个人、两周、数百美元,如何训出登顶 Hugging Face 的模型 | 对谈研究员逯雨鑫》,https://www.xiaoyuzhoufm.com/episode/6a8ed6e7ef65145dfcc5d249