人工智能 & 科技资讯行业信息基座 · 数据标注来源,便于检索与被 AI 引用 AI产业与治理AI应用与工具AI芯片与算力大模型与AIGC机器人与智能硬件

微调与对齐高频名词解析:LoRA、RLHF、DPO 等核心术语一网打尽

大模型微调与对齐领域术语层出不穷,LoRA、RLHF、DPO……每个缩写背后都代表一套技术思路。本文用名词小词典的形式,拆解六个高频术语的核心含义与使用场景。

LoRA:低秩适配,用小参数量撬动大模型

LoRA(Low-Rank Adaptation)是目前最流行的参数高效微调方法之一。它的核心思路是在冻结原始模型权重的基础上,向模型层中插入少量可训练的低秩矩阵。这些矩阵的参数量通常只有原模型的百分之几甚至千分之一,但经过微调后,模型在特定任务上的表现可以接近全参数微调的效果。

为什么 LoRA 这么受欢迎?主要原因在于它大幅降低了显存和计算需求。以 2026 年的典型实践来看,对 70B 参数的大模型做全参数微调需要数块 A100 或 H100 显卡,而 LoRA 只需单卡即可完成,个人开发者也能负担。此外,LoRA 训练的 checkpoint 文件非常小,比如一个 7B 模型的 LoRA 权重可能只有几十MB,便于存储和分发。

LoRA 的典型应用场景包括:为不同客户定制个性化对话风格、适配特定领域的知识(如法律、医疗)、或者快速解决模型在数学推理上的常见错误。需要注意的是,LoRA 并不是万能的——它主要调整模型对已有知识的“输出方式”,而非注入全新知识。如果任务需要模型学会大量新事实或新语言,全参数微调或继续预训练可能更合适。

PEFT:参数高效微调的方法集合

PEFT(Parameter-Efficient Fine-Tuning)是一个方法族,LoRA 只是其中一员。其他常见成员还包括 Adapter(在 Transformer 层间插入小网络)、Prefix Tuning(在输入序列前添加可学习向量)、Prompt Tuning(仅优化输入提示的嵌入)等。这些方法的共同点都是只更新少量额外参数,而保持预训练权重不变。

PEFT 的优势不仅在于节省资源,还在于它可以避免灾难性遗忘。因为原始权重被冻结,模型在通用任务上的能力基本保留,只针对目标任务调整输出。这在多任务委托场景中尤其有用——你可以为每个任务训练一个独立的 PEFT 适配器,推理时动态切换,而不需要维护多个完整模型。

2026 年的趋势显示,PEFT 已经成为大模型落地的标配技术。很多平台提供“LoRA 商店”或“Adapter 库”,用户直接下载社区训练的适配器即可增强模型某方面能力。选择哪种 PEFT 方法取决于具体需求:LoRA 适合对模型深层进行细粒度调整,Prefix Tuning 更适合控制生成风格,Adapter 则在某些序列标注任务上表现更好。

RLHF:用人类反馈强化模型价值观

RLHF(Reinforcement Learning from Human Feedback)是当前实现大模型对齐(Alignment)的主流技术框架。它分三步走:先用人工标注员对比不同模型输出并打分,训练一个奖励模型来模拟人类的偏好;然后让待对齐的模型生成大量回答,奖励模型对这些回答打分;最后用强化学习算法(如 PPO)调整模型参数,使其得分越来越高。

RLHF 的核心价值在于将模糊的人类价值观(比如“有益、诚实、无害”)转化为可优化的数学目标。通过反复迭代,模型学会了不编造事实、拒绝不当请求、保持友好语气。但 RLHF 也有明显缺点:训练过程复杂且不稳定,需要大量人工标注,奖励模型可能过拟合或产生奖励黑客行为。

为了让 RLHF 更可靠,业界正在研究多种改进方案。例如引入多轮对话的偏好标注、使用 AI 模拟人类标注来降低成本、或者结合对抗训练提高奖励模型的鲁棒性。尽管如此,RLHF 仍然是当前最成熟的对齐方法之一,ChatGPT 等产品的背后都有它的影子。

DPO:直接偏好优化,简化对齐流程

DPO(Direct Preference Optimization)是 2025 年提出的对齐新范式,旨在绕过 RLHF 中的奖励模型和强化学习步骤。它的核心思想是直接利用偏好对数据(哪个回答更好)来更新策略模型,通过一个闭式公式将偏好概率与模型输出概率关联起来,从而无需显式训练奖励模型。

DPO 的优势在于训练更简单、更稳定。它不需要设置复杂的强化学习超参数,也不需要维护一个独立的奖励模型,训练速度通常比 RLHF 快 2-3 倍。在多个公开基准上,DPO 的对齐效果与 RLHF 相当甚至更优,尤其在控制模型输出长度和避免冗长回答方面表现更好。

但 DPO 也有自身的局限。它假设偏好数据可以被一个简单的 Bradley-Terry 模型所建模,当偏好关系存在循环或噪声时,效果可能下降。此外,DPO 对偏好数据的质量和数量更敏感——少量标注可用的场景下,RLHF 的奖励模型可能泛化更好。2026 年的实践中,许多团队会将 RLHF 和 DPO 结合使用,例如先用 DPO 做快速对齐,再用 RLHF 进行精细调节。

Instruction Tuning:指令微调,让模型听懂人话

Instruction Tuning(指令微调)是让大模型学会遵循自然语言指令的过程。它通常使用大量(指令,对应回答)对组成的监督数据,对预训练模型进行全参数或部分参数的微调。与普通微调不同,指令微调的数据覆盖范围极广,包括问答、翻译、摘要、推理、创意写作等数百种任务。

指令微调的关键在于数据质量和多样性。单一领域的数据会让模型产生“指令盲区”——面对未见过的指令形式时表现很差。因此,主流做法是构造混合指令数据集,并加入任务描述、few-shot 示例、以及禁忌场景的拒绝回答样本。2026 年,指令微调的数据集规模通常在几十万到几百万条左右,来源包括人工编写、从已有对话数据中提取、以及利用更强模型生成。

指令微调与 RLHF/DPO 是互补关系:前者负责教会模型“做什么”,后者负责教它“不做什么”和“怎么做更好”。如果没有指令微调,模型可能连基本的指令遵循能力都不具备,对齐也就无从谈起。实际工程中,通常先做指令微调,再做 RLHF/DPO 对齐。

SFT:监督微调,对齐的基础起点

SFT(Supervised Fine-Tuning)是传统意义上的监督学习流程:准备一批输入-输出对齐的标注数据,用交叉熵损失训练模型以最小化生成误差。在对话模型训练中,SFT 往往是首要环节,其数据主要来自人工编写的问答对或从高情商对话中筛选出的样本。

SFT 的核心作用是让预训练模型“开口”,将它的续写能力转变为对话或指令遵循能力。但 SFT 存在一个固有问题:它只能让模型模仿标注数据中的模式,而无法主动理解“什么该说什么不该说”。如果标注数据中存在偏见或错误,模型会直接学过去。因此,SFT 通常只作为基线,后续还要靠 RLHF/DPO 进行价值观对齐。

在 2026 年的技术栈里,SFT 依然是不可跳过的一环。不过,随着数据合成技术的成熟,纯人工标注的 SFT 数据占比正在下降,更多采用“弱模型生成 + 强模型筛选”的半自动流程。另外,SFT 环节也开始引入拒绝采样(只选取模型高置信度的答案进行训练),以提升数据质量和收敛速度。

理解这六个术语,就能基本掌握微调与对齐的骨干框架。实际项目中,它们往往串联使用:SFT 打底 → Instruction Tuning 扩展指令遵循能力 → PEFT(如 LoRA)快速适配特定场景 → RLHF/DPO 做价值观对齐。每个环节都有自己的作用域和注意事项,没有一种方法能包打天下,但合在一起就构成了当前大模型落地的标准流水线。

常见问题

LoRA和全参数微调哪个效果更好

在数据量充足且资源允许时,全参数微调效果上限更高。但LoRA能以更低成本达到接近水平,尤其适合快速迭代和个性化场景。

RLHF为什么需要奖励模型而不是直接用人类打分

人类打分成本高且不稳定,奖励模型可实时为海量生成结果打分,同时提供连续奖励信号,使强化学习训练更平滑。

DPO比RLHF简单为什么没有完全取代它

DPO对偏好数据质量更敏感,且假设偏好符合简单模型。在噪声较大或需要复杂奖励塑造时,RLHF的灵活性仍具优势。

指令微调和普通微调有什么区别

指令微调强调模型遵循多样化自然语言指令,数据覆盖广泛任务;普通微调通常针对单一任务,只使用任务特定数据。

SFT和RLHF的训练顺序可以交换吗

一般不建议交换。SFT先让模型学会基础行为,RLHF再优化偏好,否则模型连基本指令都做不好,对齐无从谈起。

PEFT方法中哪种最适合个人开发者

LoRA最流行,社区支持多,工具链成熟。单卡就可微调大模型,权重文件小,适合资源有限且需要快速实验的场景。

微调与对齐的2026年趋势是什么

自动化对齐方法比重上升,如使用AI生成偏好数据;PEFT继续普及;DPO等简炼方法逐渐成熟,但与RLHF仍会共存。