45 从预训练到推理:SFT、RLHF、DPO 与采样参数如何改变模型行为
专栏:大模型应用开发:从原理到生产
篇号:45
内容标签:大模型训练、SFT、RLHF、DPO、推理解码
上一篇,我们沿着一次生成过程,把 Attention、RoPE、MoE 和 KV Cache 串到了一起。
但理解模型怎么算,还没有回答另一个更容易混乱的问题:
模型为什么会这样回答?有人会说,因为预训练学到了知识。
有人会说,因为 SFT 教会了它遵循指令。
也有人说,把 Temperature 调低,它就更准确。
这三句话分别碰到了模型行为的不同层。
如果把它们混在一起,面试官只要追问一句就会出现问题:
你到底改了模型参数,还是只改了这一次生成的选择方式?这一篇,我们就从模型的完整生命周期来回答。
一、先分清三层:参数、上下文和解码
观察一次模型输出,至少有三类力量同时起作用。
第一层:参数里已经学到什么
预训练、继续预训练、SFT 和偏好对齐,都会通过训练更新模型参数或适配器。
它们影响的
