每天 0 点更新数据,热度根据全网互动数计算
最热 · 今天
最新
The Path Not Taken: RLVR Provably Learns Off the Principals
2025年11月11日
强化学习结合可验证奖励(RLVR)能够可靠地提升大语言模型的推理性能,但似乎仅修改了极少部分的参数。我们重新审视这一矛盾现象,发现这种稀疏性实际上是模型依赖型优化偏好的表象:对于一个固定的预训练模型而言,参数更新始终集中在某些特定区域,这种集中效应在不同训练过程中高度一致,且对数据集和强化学习方法的选择具有较强的鲁棒性。我们通过“三门控理论”从机制上解释了这一动态过程:门控I(KL锚定)施加了KL约束下的参数更新;门控II(模型几何)引导更新步长偏离主方向,进入低曲率、保持谱结构的子空间;门控III(精度限制)则将微小更新隐藏在非偏好区域中,使得偏离主方向的更新被误读为参数稀疏。随后,我们验证了该理论,并首次在参数层面刻画了RLVR的学习动态:RLVR在权重空间中沿非主方向进行学习,通过最小化的谱漂移、更小的主子空间旋转以及非主方向更新的协同对齐来实现性能提升。相比之下,监督微调(SFT)主要作用于主方向权重,导致谱结构扭曲,甚至在性能上落后于RLVR。 综上所述,这些结果首次从参数空间角度系统揭示了RLVR的训练动态,呈现出参数演化过程中的清晰规律。尤为重要的是,我们证明了强化学习处于与SFT截然不同的优化机制之中,因此直接套用SFT时代的参数高效微调(PEFT)方法可能存在根本缺陷,这一点已在我们对先进稀疏微调方法及LoRA变体的案例研究中得到证实。我们希望本研究能为深入理解RLVR提供一条白盒化路径,并推动面向其几何特性的、原生于RLVR的新型学习算法设计,而非继续依赖SFT时代的经验性方法。
911
热度
许愿开讲
PDF
解读
Hilbert Operator for Progressive Encoding (HOPE): A Mathematical Framework for Deconstructing Learned Representations in Deep Networks
2026年07月23日
深度神经网络能够编码复杂的表征,但如何解构其内部知识仍是一项挑战。鉴于学习与压缩之间存在内在联系,网络压缩为分析这类知识提供了一条颇具前景的研究路径。然而,现有的常规压缩启发式方法往往受限于尺度对称性问题和架构偏差。为解决这些问题,我们提出了“希尔伯特算子渐进编码框架”(HOPE),这是一种用于逐步解构已训练网络权重中表征的数学框架。 HOPE将网络压缩从离散域迁移至连续函数构成的希尔伯特空间中。该框架将单个神经元建模为秩-1 的希尔伯特–施密特算子,从而将剪枝(pruning)与神经元融合(neuron merging)统一为低秩子空间投影操作。在此基础上进一步拓展,HOPE引入了“宏模块剔除”(macro block eviction)机制,将多层结构(例如完整的残差路径)纳入同一统一度量体系之下。这一统一范式使得模型可在不同层间——无论其类型或规模如何——做出无偏倚的架构决策。HOPE是一种无需数据、亦无需人工设定超参数的框架。我们通过若干原理验证型实验(涵盖模型压缩与微调任务),展示了该理论在实际应用中的潜力。
580
热度
许愿开讲
PDF
解读
Stabilizing Reinforcement Learning with LLMs: Formulation and Practices
2025年12月01日
本文提出了一种针对大语言模型的强化学习(RL)新框架,解释了在何种条件下,策略梯度方法(如REINFORCE)可以通过代理的词元级别目标来优化真实的序列级别奖励。具体而言,通过一阶近似分析,我们发现只有当训练与推理之间的差异以及策略陈旧性均被最小化时,该代理目标才变得越来越有效。这一洞察为若干广泛采用的技术在稳定强化学习训练中的关键作用提供了理论依据,包括重要性采样校正、裁剪(clipping),尤其是针对混合专家(MoE)模型的路由回放(Routing Replay)。通过对一个300亿参数的MoE模型开展大规模实验,累计使用数十万GPU小时,我们发现,在on-policy训练中,采用重要性采样校正的基本策略梯度算法能够实现最高的训练稳定性。当引入off-policy更新以加速收敛时,结合裁剪和路由回放对于缓解因策略陈旧性引发的不稳定性至关重要。值得注意的是,一旦训练过程趋于稳定,无论是否采用冷启动初始化,持续优化最终都能达到相近的性能水平。我们希望所分享的这些见解以及所总结出的稳定强化学习训练方案,能够推动未来的研究进展。
341
热度
许愿开讲
PDF
解读
Certifiable Safe RLHF: Fixed-Penalty Constraint Optimization for Safer Language Models
2025年10月03日
确保安全性是大语言模型(LLM)的一项基本要求。在提升模型输出实用性的同时,有效降低其潜在危害,是一项复杂且长期存在的挑战。当前的方法通常将这一问题形式化为约束马尔可夫决策过程(Constrained Markov Decision Processes, CMDP)框架,并采用成熟的CMDP优化技术进行求解。然而,这些方法存在两个显著局限:首先,它们依赖于奖励和成本函数,导致性能高度依赖于底层评分机制;该机制必须能够捕捉语义含义,而非仅仅由表面关键词触发。其次,基于CMDP的训练需要调整对偶变量,这一过程计算开销大,且对于固定的对偶变量无法提供可证明的安全性保证,从而可能被对抗性越狱攻击所利用。为克服上述局限,我们提出了可验证安全的强化学习与人类反馈方法(Certifiable Safe-RLHF,简称CS-RLHF),该方法引入一个在大规模语料库上训练得到的成本模型,用于赋予具有语义基础的安全评分。与基于拉格朗日乘子的方法不同,CS-RLHF采用一种修正的基于惩罚项的建模范式。这一设计借鉴了约束优化中精确惩罚函数理论的思想,即通过恰当选择的惩罚项直接强制满足约束条件。当惩罚项经过适当缩放时,可在最优解处严格保证安全约束的可行性,从而无需更新对偶变量。实验结果表明,CS-RLHF在应对常规提示和越狱攻击提示时,性能优于当前最先进的大语言模型,响应效率至少提升五倍。
324
热度
许愿开讲
PDF
解读
When Does Recurrence Become an Algorithm? Convergence Selection in Weight-Tied Looped Transformers
2026年07月22日
权重绑定的循环式Transformer(即单个模块重复应用T次)在何种条件下能真正实现一个具体的算法?我们通过对群字问题(group word problems)的受控种群实验得出以下四项发现: (1)**预算定律(Budget Law)**:自由训练会自动建立一条线性计算前沿(linear computation frontier),即一种每轮循环可处理v个位置的机制;该机制的运行速度由训练合约(training contract)决定,具体表现为:v ∝ n_train / T_train(实测指数为0.98 ± 0.04,R² = 0.99),当训练轮数T等于输入长度n时,该比例恰好为1。随机梯度下降(SGD)会选择恰好满足训练合约所要求最低性能的前沿;若在测试阶段提供比训练时更多的循环轮次,则可在固定输入长度下“挽救”那些原本滞后的位置,从而导出一条具有理论依据的停机准则:T* = ⌈n / v̂⌉。 (2)**架构先验(architecture prior)而非表达能力(expressivity)决定了算法选择**:标准深度的Transformer在此类任务上自然习得并行扫描(parallel scan);而引入权重绑定则会将模型的选择倾向扭转至串行前沿(serial frontier),即便输入中已显式提供了支持对数深度扫描(log-depth scan)的位置编码(positional addressing),这一现象依然成立。在深度与参数量均匹配的前提下,未绑定权重的模型泛化能力最差,甚至完全无法学会A₅群上的任务。 (3)**计算瓶颈并非出现在电路复杂度理论所预言的位置**:NC¹-完全性本身并无代价(A₅群任务可完全泛化),而群阶(group order)才是真正的障碍(例如S₅群的120×120阶运算符会导致联合学习陷入死锁);但若采用“算子优先”(operator-first)的课程设计(curriculum),则所有随机种子下该瓶颈均可被彻底消除。 (4)**机制具有可迁移性,却不可强制植入**:跨不同预算合约进行热启动(warm-starting)可在所有随机种子下成功迁移所习得的算法,并仅需相应重估其运行速度;而若试图通过人为设计输入调度(input schedule)来强制施加串行性,则在自由训练能够成功的地方反而会失败。 上述结果无法被标准评估工具所观测——因为这些工具在理论上即注定饱和于训练循环所收敛到的不动点(fixed points)。为此,我们引入一种新型头部测量工具(head instrument):收敛时间标度函数 τ(n, i),并通过“损伤锥”(damage cones)对其因果有效性予以验证——其斜率精确复现了前述v值;进一步表明,在分布内(in-distribution)对头部行为的测量,可有效预测模型在分布外(out-of-distribution)的表现命运,而尾部指标(tail metrics)则完全失效。所有结果均在公开的“由易到难”(easy-to-hard)基准测试集上得到复现。
85
热度
许愿开讲
PDF
解读
Fast-SDE: Efficient Single-Microphone Sound Source Distance Estimation in Reverberant Environments
2026年06月10日
声源距离估计(SDE)是人机交互中一项关键能力。不恰当的交互距离不仅会降低语音采集与理解的可靠性,还会损害交互过程的自然性与舒适感。目前大多数SDE方法依赖于麦克风阵列,然而,多麦克风系统通常需要精密的硬件同步、几何标定,且额外占用空间与计算资源,因而难以适用于尺寸受限、算力有限的具身智能平台。为缓解上述问题,我们提出了Fast-SDE——一种轻量化的单麦克风SDE框架,专为计算资源有限、体积严格受限的机器人平台部署而设计。具体而言,Fast-SDE采用基于子带的主干网络结构,将频率轴划分为多个子带,而非使用宽频带主干网络对整个频谱进行处理;一个共享的子带编码器则将各子带映射为紧凑的潜在表征,并学习声学结构与时频模式之间的内在关联;最后,一个轻量化的回归头将融合后的子带表征转换为最终的距离估计结果。大量仿真与真实环境实验充分验证了所提方法的有效性与优越性。为惠及更广泛的研究社区,我们已将全部代码开源,地址为:https://github.com/JiangWAV/FAST-SDE。
54
热度
许愿开讲
PDF
解读
Kimi Linear: An Expressive, Efficient Attention Architecture
2025年10月30日
我们提出Kimi Linear,这是一种混合线性注意力架构,在包括短上下文、长上下文以及强化学习(RL)扩展在内的多种场景下,首次在公平比较中超越了全注意力机制。其核心是Kimi Delta Attention(KDA),一种表达能力强的线性注意力模块,它在Gated DeltaNet基础上引入了更精细的门控机制,从而更有效地利用有限状态RNN的内存。我们定制的分块算法通过采用一种特殊的“对角加低秩”(Diagonal-Plus-Low-Rank, DPLR)转移矩阵变体,实现了高硬件效率:相比通用DPLR公式大幅减少了计算量,同时更贴近经典的Delta学习规则。 我们基于KDA与多头潜在注意力(Multi-Head Latent Attention, MLA)的层间混合结构,预训练了一个拥有30亿激活参数、总计480亿参数的Kimi Linear模型。实验表明,在完全相同的训练配置下,Kimi Linear在所有评估任务上均显著优于全MLA模型,同时将KV缓存使用量最多减少75%,并在处理100万长度上下文时实现最高达6倍的解码吞吐量提升。这些结果表明,Kimi Linear可以作为全注意力架构的一种即插即用替代方案,在性能和效率方面均表现更优,尤其适用于输入和输出长度更长的任务。 为支持后续研究,我们开源了KDA内核及vLLM实现,并发布了预训练模型和经过指令微调的模型检查点。
54
热度
许愿开讲
PDF
解读