每天 0 点更新数据,热度根据全网互动数计算
最热 · 今天
最新
WHALE: A Simple Recipe for Joint Harness-Weight Optimization
2026年08月31日
智能体的性能同时取决于模型参数以及负责管理上下文和控制流的可执行“运行环境”(harness)代码。若仅单独优化其中任一组件,系统便可能被另一个保持不变的组件所制约:权重更新会改变哪种运行环境更为有效,而运行环境的更新又会改变模型哪些能力得以显现。当前主流的联合优化方法虽能同时调整模型权重与文本提示词(prompts),却仍将更广义的运行环境结构固定不变。为此,我们提出“权重—运行环境交替学习”(Weight-Harness Alternating LEarning,简称 WHALE)——一种简洁实用的学习范式,其核心在于交替执行两个阶段:首先在当前运行环境下更新模型权重,随后基于更新后的模型搜索更优的运行环境。我们分别采用在线拒绝采样微调(online rejection-sampling fine-tuning)和 Meta-Harness 方法来具体实现这两个阶段。何时切换阶段是关键的设计决策:为在区分真实性能提升与随机噪声的同时,避免因过度适配一个动态变化的搭档而导致过拟合,WHALE 采用两种策略之一——固定各阶段持续时长,或依据训练过程中的信号(如验证指标)设定自适应的“耐心等待”规则(patience rule)。我们在三大任务领域(网络搜索式问答、数学推理、国际象棋谜题)中,以 Qwen3.5-2B 和 Qwen3.5-4B 智能体为基线开展实验;结果表明,WHALE 在最优平均前8名准确率(best mean@8 accuracy)上,较仅优化权重、仅优化运行环境以及 Fast-Slow Training 等基线方法均显著提升,增益达 4.15 至 24.38 个百分点。值得注意的是,瓶颈既可能出现在权重端,也可能出现在运行环境端:例如,在搜索问答(SearchQA)任务中,仅通过运行环境搜索即可用远少得多的试运行次数(rollouts)达到仅优化权重所能获得的峰值准确率;而在数学推理任务中,运行环境的改进则必须依赖于权重更新之后才得以显现。此外,小步交替式的权重与运行环境联合更新,不仅在最终准确率上优于先集中优化权重、再集中优化运行环境的分阶段策略,而且在试运行开销(rollout cost)方面也更具效率。本工作的全部代码已开源,详见:https://github.com/krafton-ai/WHALE。
393
热度
许愿开讲
PDF
解读
Rethinking On-Policy Distillation of Large Language Models: Phenomenology, Mechanism, and Recipe
2026年04月14日
在线策略蒸馏(OPD)已成为大语言模型后训练阶段的一项核心技术,但其训练动力学机制至今仍缺乏深入理解。本文对OPD的动力学行为与内在机制开展了系统性研究。我们首先发现,OPD能否成功取决于两个关键条件:(i)学生模型与教师模型需具备相容的推理模式;(ii)即便二者推理模式一致且教师模型在评测指标上得分更高,该教师仍须为学生提供其在原始训练过程中未曾接触过的、真正新颖的能力。我们通过“由弱至强”的逆向蒸馏实验验证了上述结论:同一家族的1.5B与7B参数量教师模型,在学生模型视角下其输出分布几乎无法区分。进一步深入到词元(token)层面的机制分析,我们发现,成功的OPD过程呈现出一种渐进式对齐现象——即在学生模型曾访问过的状态上,双方对高概率词元的预测逐步趋于一致;而这一高度集中的共享词元集合仅占全部词元的一小部分,却承载了绝大部分的概率质量(97%–99%)。在此基础上,我们提出了两种实用策略以挽救失败的OPD过程:一是采用离线策略的“冷启动”训练方式;二是基于教师模型输出特征进行提示词(prompt)筛选,使所选提示更契合教师模型的响应偏好。最后,我们指出:OPD看似以“免费午餐”形式提供了细粒度、密集的词元级奖励信号,但这种便利实则伴随隐性代价——由此引出一个根本性问题:OPD是否能够扩展应用于长程(long-horizon)蒸馏任务?
260
热度
许愿开讲
PDF
解读
Tensor Logic: The Language of AI
2025年10月14日
人工智能的发展受到缺乏具备所有必要特性的编程语言的制约。PyTorch 和 TensorFlow 等库提供了自动微分和高效的 GPU 实现,但它们只是对 Python 的补充,而 Python 本身并非为人工智能设计。由于缺乏对自动化推理和知识获取的支持,人们不得不进行一系列漫长且代价高昂的修补式尝试来弥补这一缺陷。另一方面,LISP 和 Prolog 等人工智能语言则缺乏可扩展性和对学习的支持。本文提出了一种名为“张量逻辑”的新语言,它通过在基础层面统一神经网络与符号主义人工智能来解决上述问题。张量逻辑中唯一的构造是张量方程,其理论依据在于:逻辑规则与爱因斯坦求和本质上是同一类运算,其余一切均可归约为此。我展示了如何用张量逻辑优雅地实现神经网络、符号系统和统计方法中的关键形式,包括 Transformer 模型、形式化推理、核方法以及图模型。更重要的是,张量逻辑开辟了全新的研究方向,例如在嵌入空间中进行可靠的推理。这种方法结合了神经网络的可扩展性与可学习性,以及符号推理的可靠性与透明性,有望成为推动人工智能更广泛应用的基础。
258
热度
许愿开讲
PDF
解读
Last Translation Benchmark
2026年09月03日
为推动科学进步,我们需要能够检验当前最先进模型能力边界的基准测试,并需要能揭示模型失效案例的评估方法。随着模型能力不断增强,现有的机器翻译标准基准测试已日趋饱和。此外,自动翻译评价指标本身并不可靠,容易受到“奖励黑客”(reward-hacking)行为的干扰,且其评估结果往往缺乏可操作性。即便是被视为“金标准”的人工评测也并非毫无缺陷:它常常难以复现、缺乏客观性,且难以规模化开展。总体而言,上述问题严重阻碍了我们对本领域客观进展的追踪,也妨碍了我们识别切实可行的改进路径。为此,我们提出“终极翻译基准”(Last Translation Benchmark, LTB),这是一个由人类作者创作、经同行评审精选的多模态数据集,涵盖文本、图像、音频与视频等多种形式,其中所有样本均能可靠地使当前主流机器翻译模型失效。同时,我们还提出一种全新的评估范式:每个样本均附有手工编写的验证规则,明确描述该样本上模型的具体失效模式,从而确保后续评估具备可靠性与可操作性。该基准是一个持续演进的动态数据集,长期面向学界开放贡献。当前最新版本为LTBv1,收录了截至2026年9月1日之前经审核通过的所有贡献;未来将根据新数据的持续积累,定期发布更新版本。
244
热度
许愿开讲
PDF
解读
Large-Language Models as a Cognitive Virus
2026年09月03日
大语言模型(LLMs)正迅速融入人类文化,深刻重塑信息的生产、传播与使用方式。本文提出,可借助“病毒传播”这一类比来理解LLMs的扩散过程:其使用行为在人群中蔓延,并逐渐嵌入个体的认知实践与社会文化实践之中。我们构建了一个模型,刻画用户在“未耦合”“已耦合”与“持续依赖”三种状态之间的动态转换;结果表明,社会传播、认知“康复”(即恢复独立认知能力)以及集体强化效应三者之间的相互作用,可能引发临界转变(tipping points)和技术锁定(technological lock-in)。一个核心推论是“失控式动态”(runaway dynamics)的发生可能:一旦越过某一关键阈值,微小的采用率增长便可能触发整个群体向持续依赖状态的快速跃迁,并伴随认知能力的骤然退化。然而,同一理论框架亦揭示了实现“认知免疫”的可行条件——即通过抑制传播、增强可逆性(例如支持用户随时回归独立认知模式),从而防范此类风险。我们的研究结果凸显出:LLM的普及并非线性渐进过程,而可能涉及非线性的集体性转变,这对人类的认知自主性具有深远影响。
227
热度
许愿开讲
PDF
解读
Symbol-Equivariant Recurrent Reasoning Models
2026年03月02日
诸如数独(Sudoku)和ARC-AGI等推理任务,对神经网络而言仍具挑战性。以循环推理模型(RRM)为代表的结构化问题求解架构家族——包括分层推理模型(HRM)与微型递归模型(TRM)——为大型语言模型提供了一种参数更精简的替代方案;但目前这类模型仅能通过开销高昂的数据增强方式,隐式地处理符号对称性。为此,我们提出了符号等变循环推理模型(SE-RRM),其在架构层面引入符号等变层,显式地施加置换等变性约束,从而确保当输入符号或颜色发生任意置换时,模型输出的解保持完全一致。在9×9数独任务上,SE-RRM显著优于此前各类RRM;更值得注意的是,它仅需在9×9规模上进行训练,即可稳健泛化至更小的4×4以及更大的16×16和25×25规模实例——而现有RRM模型均无法实现此类外推能力。在ARC-AGI-1与ARC-AGI-2基准测试中,SE-RRM仅需极少的数据增强,且参数量仅为200万,即取得了具有竞争力的性能表现。这充分表明:显式建模对称性可有效提升神经网络推理能力的鲁棒性与可扩展性。代码已开源:https://github.com/ml-jku/SE-RRM。
220
热度
许愿开讲
PDF
解读
Environment Evolution for Terminal Agents
2026年09月03日
可扩展的交互式且可验证的环境,对于训练终端智能体至关重要。随着前沿大模型能力的不断提升,从零开始合成的环境逐渐失去挑战性,因而所能提供的学习信号也愈发有限。近期提出的协同演化方法,能够基于智能体在试运行(rollout)过程中暴露出的能力短板,迭代式地在其当前可学习能力边界附近合成新环境。然而,这类方法严重依赖于在线策略(on-policy)试运行,导致其泛化能力受限,且当模型能力持续增强时,难以持续提供有效的学习信号。本文提出“环境演化”(environment evolution)方法:该方法以离线策略(off-policy)方式逐步提升环境难度,并在训练过程中按代(generation-by-generation)动态调度已演化的环境,从而确保学习信号的持续供给。我们从多轮次学习目标出发,推导出影响环境难度的三大演化方向;进而通过一个经过循环工程设计的多智能体框架,在这些方向上具体实施环境演化。在 Hy4 preview、Claude Opus 5 和 GPT-5.6 Sol 上开展的定量试运行实验表明,环境演化方法始终能生成更具挑战性的环境。我们进一步在 Qwen3.6-27B 和 Qwen3.6-35B-A3B 模型上,仅通过简单的长视野强化学习训练即验证了该方法的有效性:二者在 Terminal-Bench 2.1 基准测试中的性能分别提升了 14.4 和 18.0 个百分点。
211
热度
许愿开讲
PDF
解读
Counterfactual Simulation Training for Chain-of-Thought Faithfulness
2026年02月24日
检验思维链(Chain-of-Thought, CoT)推理,是理解大语言模型(LLM)为何生成特定输出的最常用手段之一。然而,CoT可信性(faithfulness)方面广为人知的问题,严重制约了我们通过这一方法所能获得的洞见深度与可靠性。本文提出一种名为“反事实模拟训练”(Counterfactual Simulation Training, CST)的新训练方法,其核心目标是提升CoT的可信性:具体而言,即对那些能够帮助模拟器在反事实输入上准确预测模型输出的CoT给予奖励。我们将CST应用于两类场景:(1)基于线索的反事实CoT监控,用以识别模型是否依赖虚假相关特征、是否存在奖励黑客行为(reward hacking),或表现出迎合倾向(sycophancy);(2)面向通用模型驱动型反事实的反事实模拟训练,旨在促使模型在CoT中生成更具可信性、更可泛化的推理过程。我们在参数量高达2350亿的各类模型上开展实验,结果表明:CST可显著提升基于线索的反事实监控准确率(绝对准确率提升达35个百分点),同时亦能增强模型在通用反事实输入下的可模拟性(simulatability)(提升2个百分点)。此外,我们还发现:(1)CST的表现优于各类提示工程(prompting)基线方法;(2)利用大语言模型重写不具可信性的CoT,其效率是仅采用强化学习(RL)方法的5倍;(3)CoT可信性的提升无法自然迁移到“劝阻类线索”(dissuading cues)上(相较而言,“说服类线索”(persuading cues)则可有效受益);(4)更大规模的模型本身并不天然具备更高可信度的CoT,但它们确实能从CST中获得更显著的收益。上述结果表明,CST具有普适性地提升CoT可信性的潜力,尤其有望在CoT监控等关键应用场景中发挥重要作用。本文所有实验所用代码已开源,详见:https://github.com/peterbhase/counterfactual-simulation-training
211
热度
许愿开讲
PDF
解读