每天 0 点更新数据,热度根据全网互动数计算
最热 · 今天
最新
Nash Learning from Human Feedback
2023年12月01日
这篇文章讨论了如何通过人类反馈进行强化学习,以使大型语言模型(LLMs)更符合人类偏好。通常,RLHF的第一步是从人类反馈中学习奖励模型,通常是通过预训练的LLM生成的文本对之间的偏好来表达。随后,LLM的策略通过强化学习算法进行优化,以最大化奖励模型。然而,当前奖励模型的固有限制是它们无法完全表示人类偏好的丰富性以及它们对采样分布的依赖性。 在本研究中,我们介绍了一种使用成对人类反馈进行LLMs微调的替代流程。我们的方法涉及初始学习偏好模型,该模型在给定提示的情况下针对两个输入进行调整,然后通过追求一种策略,该策略始终生成优选于任何竞争策略生成的响应,从而定义了该偏好模型的纳什均衡。我们将这种方法称为从人类反馈中的纳什学习(NLHF)。 在表格策略表示的情况下,我们提出了一种基于镜像下降原理的新算法解决方案Nash-MD。该算法产生一系列策略,最后一次迭代收敛于正则化的纳什均衡。此外,我们探讨了策略的参数表示,并引入了用于深度学习架构的梯度下降算法。为了展示我们方法的有效性,我们提供了涉及文本摘要任务的LLM微调的实验结果。我们认为NLHF为偏好学习和策略优化提供了一个引人注目的途径,有可能推动将LLMs与人类偏好相一致的领域的发展。
3771
热度
许愿开讲
PDF
解读
Requential Coding: Pushing the Limits of Model Compression with Self-Generated Training Data
2026年07月13日
压缩是智能的根本特征。一个能够将其训练数据编码为短码的模型,必然已发现了支撑泛化能力的内在规律。大型神经网络所学习的函数,其真实复杂度可能远低于其参数量所暗示的水平;然而,要构造出能真正体现这种简洁性的编码方案却十分困难。基于参数的压缩方法(例如量化)所产生的码长与模型规模成正比,而与其参数实际承载的信息量无关。前序编码(prequential coding)则绕开了这一问题,转而对训练过程中的参数演化轨迹进行压缩;但它必须完整编码原始训练数据序列,无论模型实际学到了多少知识——因此,当数据本身具有高熵时,所得码长依然很大。我们提出“再序编码”(requential coding):由教师模型从学生模型自身当前分布中采样选取训练样本;学生模型的编码仅记录这些采样选择,而编码开销仅出现在教师与学生预测不一致之处。由此得到的码长既与模型参数量无关,也与数据熵无关,通常比前序编码小数个数量级,且其优势随模型规模增大而愈发显著。这种新型压缩方法揭示了以往压缩器无法触及的现象:在损失值恒定的前提下,更大规模的模型乃至模型集成反而能压缩到更小的码长,尽管其参数量更多;将该码长代入PAC-Bayes界后,可为十亿参数级大语言模型(LLM)提供目前最优的泛化性保证,即便对比那些依赖激进训后量化(且假设量化误差为零)所构建的界,其性能仍更优;在计算资源最优配置的训练范式下,该界随模型规模扩大而持续收紧,因为模型相对于数据集规模而言变得越来越可压缩;同一编码还自然预测出:当模型经历多轮次训练时,会逐步发生过拟合;此外,它还能将数据集中可学习的信息与其不可预测的随机成分明确分离——进而揭示出:低熵文本数据所蕴含的可学习结构,远比高熵图像数据丰富得多。
573
热度
许愿开讲
PDF
解读
Video Generation Models are General-Purpose Vision Learners
2026年07月10日
在“下一个词预测”这一目标的驱动下,自然语言处理(NLP)领域已从面向特定任务的模型范式,转向具备强大泛化能力的通用基础模型。那么,计算机视觉领域要实现通用型视觉模型,其对应的同等关键驱动力又是什么?本文提出,大规模文本到视频生成(text-to-video generation)可作为计算机视觉领域一种极具潜力的预训练范式,它能为通用视觉智能提供所必需的时空先验知识、视觉与语言的跨模态对齐能力,以及良好的可扩展性。为此,我们提出了GenCeption模型:该模型以一个预训练的视频生成扩散模型(video generative diffusion backbone)为基础,将其重构为一种前馈式感知模型(feed-forward perception model),能够根据文本指令灵活执行多种视觉任务。实验结果表明,GenCeption在一系列多样化任务上均达到当前最优性能,涵盖深度估计、表面法向量估计、相机位姿估计、表情指向性分割(expression-referring segmentation)以及3D关键点预测等任务;其表现常常媲美甚至超越各类专用模型(例如DepthAnything3、SAM3、D4RT、VGGT-Omega、Sapiens、David、Genmo及Lotus-2)。此外,在同等实验设置下,该基于视频生成的预训练主干网络,亦显著优于其他主流预训练范式(如V-JEPA和Video MAE)。尤为关键的是,GenCeption初步展现出良好的数据规模与模型规模扩展特性,并具备极高的数据利用效率——仅需使用领先模型(如D4RT和VGGT-Omega)七分之一至五百分之一的训练数据量,即可达到与其相当的性能水平。最后,GenCeption还展现出若干引人注目的涌现行为:一个仅在合成人类视频数据上训练的模型,竟能成功泛化至真实世界视频,并有效识别分布外(out-of-distribution)的物体类别(例如动物与机器人)。上述发现表明,视频生成绝非仅限于内容合成的工具,而是一条通向面向物理世界的通用视觉智能的奠基性路径。项目主页:https://genception.github.io
417
热度
许愿开讲
PDF
解读
DINOv3
2025年08月13日
自监督学习有望消除人工数据标注的需求,使模型能够轻松扩展到海量数据集和更大的架构。由于不针对特定任务或领域,这种训练范式具备从多种来源(从自然图像到航拍图像)学习视觉表示的潜力,且仅需使用一种算法。本技术报告介绍了 DINOv3,这是实现这一愿景的重要里程碑,它借助了简单而有效的策略。首先,我们通过精心的数据准备、设计与优化,充分利用了扩大数据集和模型规模带来的优势。其次,我们提出了一种名为“Gram 锚定”的新方法,有效解决了密集特征图在长时间训练过程中质量下降这一长期存在却未被解决的问题。最后,我们应用了事后策略,进一步增强了模型在分辨率、模型大小和与文本对齐方面的灵活性。最终,我们推出的这一通用视觉基础模型在广泛的设置下均优于当前最先进的专用模型,而且无需进行微调。DINOv3 能生成高质量的密集特征,在各种视觉任务中表现出色,显著超越了以往的自监督和弱监督基础模型。我们也公开了 DINOv3 系列视觉模型,旨在通过为不同的资源限制和部署场景提供可扩展的解决方案,推动各类任务和数据上的技术前沿不断进步。
385
热度
许愿开讲
PDF
解读
Ring-Zero: Scaling Zero RL to a Trillion Parameters for Emergent Reasoning
2026年07月14日
无需人类标注数据、仅依靠可验证奖励进行强化学习的方法(常被称为“零样本强化学习”或“Zero RL”),已成为激发模型链式思维(Chain-of-Thought, CoT)推理能力的一种强大范式。然而,受限于计算资源,现有研究大多仅在小型模型上开展,导致大规模模型下的训练动力学特征与涌现能力仍属未知领域。为切实探索这一前沿方向,我们致力于从模型中激发高质量的推理行为。但我们发现,简单粗暴地扩大模型规模往往会导致生成内容可读性差、存在大量冗余词元(token),且推理深度缺乏自适应调节能力。为应对上述挑战,我们提出了一套稳定而高效的训练流程,其中融合了多项算法与系统级优化技术,包括截断重要性采样(clipped importance sampling)、训练-推理比例校正(training-inference ratio correction)以及混合精度控制(mixed-precision control)。我们的实验揭示了三条关键结论,有力印证了关于“缩放之苦涩教训”(the “bitter lesson” of scaling)的核心观点:(1)将模型参数量扩展至1万亿(1T)级别,可显著提升样本利用效率与性能上限;(2)整个训练过程呈现出清晰的阶段性演进规律——先经历一个初步发现阶段(discovery phase),再进入一个精细化打磨阶段(sharpening phase);(3)模型在训练过程中自发涌现出一系列高级认知行为,包括拟人化倾向(anthropomorphism)、结构化输出格式(structured formatting)、自我验证能力(self-verification)、并行推理能力(parallel reasoning)以及上下文焦虑现象(context anxiety),从而使人工设计的启发式规则变得不再必要。在七个数学推理基准测试集上的评估结果表明,Ring-2.5-1T-Zero模型展现出具有竞争力的整体性能。此外,为超越单纯以最终答案是否正确作为评判标准的传统做法,我们进一步构建了一个涵盖三个维度的结构化链式思维质量评估框架——即**可理解性**(comprehensibility)、**可复现性**(reproducibility)与**推理效率**(efficiency);在此框架下,我们的模型在生成结构清晰、简洁凝练的推理路径方面展现出明显优势。通过公开分享我们在1万亿参数尺度上所观察到的各类涌现现象,我们期望为研究社区提供更深层次的洞见,助力深入理解超大规模模型的缩放行为及其内在规律。
345
热度
许愿开讲
PDF
解读
Single-Rollout Asynchronous Optimization for Agentic Reinforcement Learning
2026年07月08日
强化学习(RL)在大语言模型(LLM)的后训练阶段正变得日益重要。此前,面向LLM的强化学习流程大多采用同步式、批内交错(batch-interleaved)架构,这种设计在处理长程智能体任务(long-horizon agentic tasks)时效率低下。近期,异步强化学习作为一种更高效的替代方案崭露头角——它可在 rollout(轨迹采样)陆续到达时即时更新模型参数。然而,当前主流的异步RL系统往往过度侧重吞吐量(throughput),而对训练稳定性与任务有效性等关键问题却鲜有深入探索。例如,一个突出挑战在于:当前广泛应用的GRPO框架所依赖的“按组采样”(group-wise sampling)机制,天然难以适配异步智能体训练范式。 本文提出“单轨迹异步优化”(Single-rollout Asynchronous Optimization, SAO),以系统性应对异步强化学习中的稳定性与离策略(off-policy)难题。为削弱离策略偏差、提升泛化能力,我们摒弃按组采样,转而采用“单轨迹采样”(single-rollout sampling)策略,即每个提示(prompt)仅对应一条独立 rollout。在此基础上,我们进一步融合若干经过实践验证的价值模型(value model)训练设计,以增强该单轨迹策略的实际效果。为提升优化过程的稳定性,我们引入一种严格的双向词元级裁剪(strict double-side token-level clipping)机制。 SAO可实现长达一千步的稳定训练,并在智能体编程与推理基准测试(如SWE-Bench Verified、BeyondAIME及IMOAnswerBench)上持续超越GRPO及其各类变体。我们还证明,单轨迹强化学习在模拟的在线学习场景中尤为有效——在此类场景中,模型需持续适应动态演化的环境。正因如此,SAO已成功部署于开源大模型GLM-5.2(750B参数规模,运行于40块A100 GPU集群)的智能体强化学习训练流水线中。
258
热度
许愿开讲
PDF
解读
Lifelong LaCAM with Local Guidance for Lifelong MAPF
2026年05月16日
局部引导机制近期被证实是提升实时、次优多智能体路径规划(MAPF)实证性能的一项强大手段,其成功改进了可扩展的基于构型的求解器LaCAM。该机制通过在每个智能体周围注入具有信息量的时空线索,有效缓解了交通拥堵、减少了等待时间,且即便在严格的时间预算约束下仍能保持良好的可扩展性,从而在单次(one-shot)MAPF任务中实现了当前最优性能。本研究进一步探讨:此类优势能否迁移至“终身式”多智能体路径规划(LMAPF)场景?在该场景中,任务持续动态到达,而每一步规划质量的提升均可在长期运行中提高任务完成吞吐量。为此,我们提出LLLG——一种融合局部引导机制的终身式LaCAM算法。LLLG采用滚动时域的窗口化规划框架,并在每一时间步均以先前解作为初始值对引导信息进行热启动(warm-start)。实验表明,我们的方法具备优异的可扩展性,在紧凑、高密度环境中仍能维持高吞吐量,并全面超越现有各类规划器,从而推动了实时终身式多智能体路径规划领域的前沿发展。
257
热度
许愿开讲
PDF
解读
Group Representational Position Encoding
2025年12月08日
我们提出 GRAPE(群表示位置编码,Group RepresentAtional Position Encoding),这是一种基于群作用的统一位置编码框架。GRAPE 将两类机制整合在一起:(i) 在 $\mathrm{SO}(d)$ 中的乘法旋转(乘法型 GRAPE);以及 (ii) 来自一般线性群 $\mathrm{GL}$ 中幺模作用的加法 logits 偏置(加法型 GRAPE)。在乘法型 GRAPE 中,位置 $n \in \mathbb{Z}$(或 $t \in \mathbb{R}$)的作用形式为 $\mathbf{G}(n)=\exp(n\,ω\,\mathbf{L})$,其中 $\mathbf{L} \in \mathbb{R}^{d \times d}$ 是一个秩为 2 的反对称生成元,由此得到一种相对的、可组合的、保持范数不变的映射,并具有闭式矩阵指数表达。当 $d/2$ 个平面取标准坐标对且谱呈对数均匀分布时,该方法恰好还原了 RoPE。通过学习可交换子空间以及紧致非交换混合结构,这一几何框架得以严格扩展,分别以每注意力头 $O(d)$ 和 $O(r d)$ 的代价捕捉跨子空间的特征耦合。在加法型 GRAPE 中,加法 logits 源于秩为 1(或低秩)的幺模作用,恰好包含了 ALiBi 和遗忘变压器(Forgetting Transformer, FoX)作为特例,同时保持精确的相对位置律和流式缓存能力。总体而言,GRAPE 为长上下文模型中的位置几何提供了有理论依据的设计空间,将 RoPE 和 ALiBi 统一为其特例。项目主页:https://github.com/model-architectures/GRAPE。
216
热度
许愿开讲
PDF
解读