Fine-tuning 模型微調:LoRA、QLoRA、PEFT 怎麼選? | Mason AI Lab

参数高效微调(Parameter-Efficient Fine-Tuning,PEFT )已成为全参数微调(Full-Parameter Fine-Tuning,FFT )的热门替代方案,在许多基准测试中实现了相近的性能,但计算和内存成本却低得多。然而,其在推理和指令执行等复杂任务上的有效性仍不明确。本文从表征能力和鲁棒性两个方面对PEFT和FFT进行了理论和实证比较。我们证明PEFT的解空间是FFT解空间的严格子集,并推导出了上界,揭示了其受限的参数化如何限制了表达能力并增加了对扰动的敏感性。在 20 个数据集和 11 个对抗性测试集上的实验支持了这些发现,表明虽然 PEFT 在标准任务上表现良好,但其在复杂和对抗性设置上的弱点需要超越当前 PEFT 范式的新方向。

论文:Look Within or Beyond? A Theoretical Comparison Between Parameter-Efficient and Full Fine-Tuning

单位:东北大学、上海交大、山大、LMU Munich

下载论文https://t.zsxq.com/ZxYMs

请索引第112篇论文

PEFT 真的是 FFT 的"平替"吗?

适合 AI+交叉学科(图学习、计算生物、社会计算、AI4Science)的本硕博和PI们慢读。

LoRA、Adapter、BitFit 这类 PEFT 方法,过去三年几乎成了大模型微调的"政治正确"——参数量小、显存友好、效果还能和 Full Fine-Tuning(FFT)掰手腕。但当任务变复杂(推理、指令跟随、对抗场景),PEFT 是不是悄悄掉队了?这篇 ACL 2026 主会长文,第一次把 PEFT vs FFT 的理论差距给证明白了,结论是冷的:

PEFT 的解空间是 FFT 的严格子集,且是 FFT 参数流形上测度为零的低维嵌入子流形。 在表达能力、对抗鲁棒性、数据边际收益三个维度上,FFT 系统性占优;PEFT 只在简单任务 / few-shot 场景下"看起来够用"。

下面拆给你看。

01 为什么 PEFT 会"不够用"

优化理论里有个老共识:过参数化模型往往表达能力更强、鲁棒性更好(Kohavi & Wolpert, Neal 等)。PEFT 的本质是用低维参数化去近似 FFT 的全维更新 


换句话说,PEFT 是把模型"摁"在一个低维子空间里调。作者用 sharpness-flatness 理论 先给了个直觉:PEFT 的增量权重分布比 FFT 更陡、更尖,意味着对扰动更敏感;而 FFT 的参数自由度更高,能学到更"平"的最小值,鲁棒性天然更好。

但这只是开胃菜,重头戏在后面五个定理。

02 五个定理串起来的"PEFT 上界论"


定理 1:PEFT ⊂ FFT(严格子集)


把 PEFT 映射 看成连续可微的满射缺失映射,根据 Sard 定理,当 时,在 中是 Lebesgue 测度为零的 维嵌入子流形。也就是说:

  • 任意 PEFT 解都能对应到一个 FFT 解

  • 反过来不成立,FFT 能到达的地方,PEFT 到不了


这不是"实现差别",是几何层面的不可能

定理 2:PEFT 表达能力上界


假设每层权重范数 ≤ 、激活 Lipschitz ≤ ,定义,则:

关键观察:靠近输出层的 PEFT 参数影响更大(指数 更小),而底层语义/跨域适配恰恰要靠前面层——这解释了为什么 PEFT 在"需要学新知识的复杂任务"上吃亏。交叉学科场景(比如分子性质预测从 QM9 迁到 MoleculeNet 新子集、图推理从引文网迁到生物网)往往要动底层表征,PEFT 的上界会先撞墙。

定理 3:PEFT 参数增量的边际递减临界点


理想权重更新,奇异值指数衰减。一旦 

对交叉学科很实用:LoRA 的 rank 不是越大越好,过了 反而伤泛化。但麻烦在于 和任务强相关——复杂交叉任务 rc可能比你想象的高得多

定理 4:PEFT 对扰动更敏感(对抗场景的关键)


把扰动 拆成 PEFT 子空间内分量 和正交分量 

  • FFT:

  • PEFT:


正交分量 PEFT 完全处理不了,只能裸吃梯度项。作者严格证出 

定理 5:数据边际收益,PEFT 只有 FFT 的 

Rademacher 复杂度给出:

  • FFT 泛化误差 ,PEFT 只有 

  • 每多一条样本,PEFT 风险下降量是 FFT 的 

数据越多,FFT 越香;few-shot 时 PEFT 占便宜,但数据过百后 FFT 反超——实验里 5→200 样本,FFT 涨 9.05%,LoRA 只涨 7.08%。

03 实验:理论没骗人

3.1 复杂任务,FFT 开始拉开


Table 1 是 LLaMA2 家族在 ViGGO(语义解析)、SQL Generation、GSM8k(数学推理)上的对比。FFT 相对 LoRA 的稳定优势:

  • LLaMA2-7B:ViGGO +2.81%、SQL +0.67%、GSM8k +7.31%

  • LLaMA2-13B / 70B:趋势一致,70B 上 FFT 仍领先 1.85%


平均下来 7B/13B/70B FFT 分别比 LoRA 高 3.54% / 4.26% / 1.85%。模型越大,FFT 仍不虚

Table 1:LLaMA2 家族不同微调方法性能对比(HiFT 是作者同期提出的分层全参方法,也归在 FFT 类)

指令跟随(mt-bench)也是类似故事。Table 2 里 TinyLLaMA/LLaMA2-7B/Mistral-7B 上 FFT 在 Reasoning、Math、STEM、Humanities 等"硬维度"普遍压 PEFT 一头,平均 FFT 比 LoRA 高 0.57 / 0.33 / —(Mistral 上 FFT 4.96 vs LoRA 4.74)。
Table 2:mt-bench 指令跟随对比(TinyLLaMA / Mistral-7B / LLaMA2-7B)

3.2 对抗鲁棒性:PEFT 露怯的地方


Table 3 AdvGLUE 上,RoBERTa-base/large 在原始 GLUE 上 LoRA 甚至略高于 FFT(base 95.10 vs 94.80),但一到 Adv 列就反过来了:

  • RoBbase FFT 原/对抗:94.80 / 34.62;LoRA:95.10 / 39.18 → 原始略赢,对抗被 FFT 反超

  • 更狠的是 RoBlarge:FFT 对抗平均 55.44,LoRA 只有 48.58 左右


Table 3(节选关键列):AdvGLUE 上 RoBERTa-base/large 原 vs 对抗

Adversarial SQuAD(Table 4)趋势一样:原始 SQuAD 上 LoRA 有时贴 FFT,但对抗子集 FFT 稳赢。OPT-13B 上(Table 5)LoRA 原始 F1 能压 FFT,但对抗 AA/AAC/ANA 全被 FFT 反超。

只看原始 benchmark 会误判"PEFT=FFT";对抗/分布外才是试金石——而交叉学科的真实场景(实验数据噪声、分布漂移、对抗样本攻击分子图)恰恰就是这种。

3.3 参数分布可视化:PEFT "动得少"不是优点


Figure 1(论文原图)对比了 FFT / LoRA / Prefix / BitFit 的增量参数分布:

PEFT 家族(LoRA/Prefix/BitFit)增量参数对称分布在零附近、标准差接近零——意思是PEFT 主要让模型"走个指令格式",没怎么往模型里塞新知识。FFT 的分布最宽,参数调整幅度最大。作者这句解读很毒:

"PEFT methods primarily adapt the model to follow instruction formats rather than incorporating substantial new knowledge."

对做 AI+生物/化学/材料的同学——如果你的微调目标是"让 LLM 学会新的领域知识(比如反应机理、蛋白折叠语境)",PEFT 可能真的只是在教格式。

3.4 数据边际收益:过了 few-shot,FFT 反超


Figure 2 是 k=5/10/20/50/100/200 每类样本下 RoBERTa + LLaMA2-7B 的表现:

规律很干净:

  • k < 20:LoRA 通常压 FFT

  • k = 20:打平

  • k ≥ 50:FFT 在 4/5 任务上反超,k=200 时 FFT 比 LoRA 高 9.05% vs 7.08% 的总涨幅

LoRA rank 从 8→16→32,性能/鲁棒性几乎不动(Table 4 里 RoBbase LoRA-r8/r16/r32 在 Adv SQuAD 上 EM 差不到 1 点);而 FFT 那边"冻多少层"影响巨大——Top1(只调最后 1 层)对抗 Avg 只有 36.87,全开 FPFT 直接 74.87(Table 10 RoBlarge)。

Table 10 :RoBlarge 调参数量对 Adv SQuAD 的影响

04 给 AI+交叉学科研究者的一点延伸


这篇论文对"非纯 NLP、做 AI+图/生物/化学/物理/社科"的组,有三个隐藏信号:

1. PEFT 的"省"是有代价的,代价在复杂任务上兑现

交叉学科任务往往满足:① 需要学新领域知识(不是走格式);② 标注贵但一旦标了就想榨干性能;③ 对抗/噪声常见(实验误差、图结构扰动)。三条全中 PEFT 的软肋。如果你的任务 GSM8k 级难度以上,先别默认 LoRA,至少跑一组 FFT 或 HiFT 当 baseline。

2. Few-shot 场景 PEFT 仍合理,但要清楚自己在"省"什么

k<20 时 PEFT 确实优于 FFT(过参导致小数据过拟合),这时候 LoRA/IA3 是合理的。但交叉学科常见"先标 200 条试试水"——一旦 k 过 50,FFT 的边际收益就开始甩 PEFT 了。

3. 鲁棒性这件事,PEFT 在"假装没事"

AdvGLUE / Adv SQuAD 上 PEFT 原始分贴 FFT、对抗分掉链子,这个模式在交叉场景会复现:比如分子属性预测里加一点 SMILES 扰动、图分类里加一点点边噪声,PEFT 模型的掉点可能比 FFT 狠得多。发药/发材料如果只报 clean test, reviewer 拿对抗集一砸就漏馅。

4. HiFT 这条折中路线值得盯

作者同期的 HiFT(分层全参微调)在 RoBERTa-large 上 GPU 显存 6.62GB,比 PEFT 的 LoRA(6.95)/IA3(7.13) 还低,同时性能贴 FFT。机制是先调顶层再逐步解冻——对显存紧但又想拿 FFT 性能的交叉组,是个可抄的作业。Table 7 显存对比:

Table 7:不同方法 GPU 显存(batch=8, seq=512)

05 结论


这篇 ACL 2026 的价值不在"锤 PEFT"——PEFT 在部署/多任务/显存受限场景的地位没人动摇——而在第一次把 PEFT vs FFT 的差距用定理钉死了:子集关系、容量上界、扰动敏感度、数据边际收益四个角度互相印证,实验 20 个数据集 + 11 个对抗集兜底。

对做 AI+交叉的你我来说,takeaway 很简单:

资源允许时,FFT / HiFT 仍是金标准;PEFT 是"够用就好"的工程选择,不是"等效替代"。 复杂任务、对抗场景、需要灌领域新知识的场景,先别急着 LoRA 一把梭。

代码作者开源在:https://github.com/misonsky/PEFTEval,想复现 Table 1–5 / Figure 1–4 的可以直接扒。

Graph Science Lab 公号往期也写过 LoRA 变种和图大模型微调的坑,这篇算是给"PEFT 万能论"泼了盆 ACL 级别的冷水。交叉学科的同学们,你们下一个任务的 baseline,还默认 LoRA 吗?


微信群

内容中包含的图片若涉及版权问题,请及时与我们联系删除