每天 0 点更新数据,热度根据全网互动数计算
最热 · 今天
最新
Rubric Dropout: A Simple Way to Mitigate Reward Hacking in Rubric-as-Reward RL
2026年08月12日
针对评分标准(即由大语言模型裁判评判的一系列评价维度清单)开展的强化学习,已成为在缺乏确定性答案的任务上对语言模型进行后训练的一种标准方法。然而,这类评分标准仅是对质量的一种固定代理指标,永远无法完整刻画质量本身;而若策略长期针对该标准进行训练,最终便会学会利用二者之间的差异进行“钻空子”。我们对此现象进行了直接测量:采用分组相对策略优化(GRPO)算法,在医学与科学领域的评分标准上对Qwen3-8B模型进行训练,并分别使用训练所用的裁判模型和更强的“黄金裁判”(gold judge)对分布外(OOD)基准测试集进行评估。结果发现,两类裁判给出的得分在训练过程中逐渐背离:训练裁判的得分持续上升,而黄金裁判的得分则先达峰值、随后下降——在HealthBench-Hard上下降3分,在ResearchQA上下降22分。倘若裁判存在固定偏差,则黄金裁判曲线应整体发生恒定偏移,而非在训练裁判得分持续上升的同时反向下滑;因此,这种背离确属奖励劫持(reward hacking),而非裁判噪声所致。为此,我们提出“评分标准随机丢弃”(Rubric Dropout)方法——这一仅需一行代码的改进方案借鉴自神经元丢弃(neuron dropout)思想:在每一轮训练中,我们随机丢弃评分标准中的一部分评价维度,再据此计算奖励信号,从而确保策略永远不会反复优化同一套完整评分标准。为保持GRPO算法中各 rollout 组内相对优势的可比性,同一组 rollout 共享相同的丢弃子集;而所有评估阶段均始终使用全部原始评分标准。我们在两组基准测试上,对比了不使用丢弃、30%丢弃率及50%丢弃率三种设置,结果表明:采用丢弃策略后,所有对应检查点上的分布外黄金裁判得分均得到提升(HealthBench-Hard提升1–2分,ResearchQA提升6–7分),我们所追踪的两项奖励劫持指标均有所下降,且在目标任务领域内未带来任何性能损失。进一步遍历不同丢弃比例发现,30%–50%区间构成一个宽泛而稳健的“最佳区间”;相比之下,另一种看似自然的替代方案——即依据各评价维度对训练的实际贡献度动态重加权——在我们的实验设定下,其效果甚至不如完全不干预。
522
热度
许愿开讲
PDF
解读
Training AI Scientists to Replicate Research
2026年08月13日
论文的可重复性是科学知识体系的基石,它既保障了既有研究成果的可靠性,也为后续实验提供了坚实基础。开展重复实验的过程通常会揭示此前未被充分明确的细节,因此其本身同样需要以假设驱动的方式进行探索,其开放性程度不亚于原创性研究。在本研究中,我们构建了“Replica”——一个面向论文复现任务的、具备良好扩展性的任务空间。为提供有效的奖励信号,我们设计了一种基于自动生成评分细则的评判器(rubric-based judge),该评判器噪声低,且其评估结果与人类专家对复现质量的判断高度一致。我们在该任务空间上对“Faraday”——一个参数量达270亿、将编程智能体作为工具调用的“人工智能科学家”智能体——进行了后训练,使其在预留的复现实验任务上性能超越了Claude Opus 4.8和GPT-5.5。针对单次推理轨迹(rollout)的定性分析表明,Faraday所采用的方法更具科学原则性。我们认为,本研究取得的成果为构建能够实现长周期科学创新、且无需依赖复杂工程框架的人工智能智能体迈出了关键一步。
433
热度
许愿开讲
PDF
解读
Dion3: Full-Stack Orthogonal Updates
2026年08月12日
缪子优化器(Muon)由于其立方时间复杂度的牛顿–舒尔茨正交化步骤,带来了显著的计算开销。当权重被分片存储时,通信开销进一步加剧了这一计算负担,致使缪子优化器在许多实际场景中优势尽失。为此,我们提出了 Dion3——一种针对该开销在系统全栈各层级进行深度优化的缪子优化器改进版本。我们设计的“格拉姆牛顿–舒尔茨”(Gram Newton-Schulz)算法降低了正交化过程的浮点运算量(FLOP);我们开发的 CuteDSL 内核通过充分利用矩阵对称性,大幅加速了正交化计算;我们的“超批处理”(megabatching)策略则有效减少了通信开销。此外,我们还对更新规则做出了一项简洁而有效的改进:每一步仅对动量矩阵的部分行进行正交化,而非全部行。这一新规则不仅比另一种“压缩版”缪子优化器 Dion 在训练速度上更快,而且在模型性能(如最终损失值)上也更优。总体而言,Dion3 在达到与缪子优化器相同甚至更低损失值的同时,将单步优化耗时最多降低至原来的六分之一。Dion3 已通过 dion 开源包(https://github.com/microsoft/dion)发布,可作为缪子优化器的即插即用(drop-in)替代方案。
320
热度
许愿开讲
PDF
解读
AQuA: Recursively Self-Improving Quantitative Trading Research Agents
2026年08月13日
我们从量化投资研究的层面探讨递归式自我改进:即一个自主系统能否利用前期实验所获得的证据,来优化后续迭代中提出的假设与候选方案。本文提出AQuA框架,该框架由两个独立的语言模型驱动型研究系统构成:其一专注于符号化因子发现,其二则致力于可训练模型的开发。这两个系统在智能体、记忆、候选空间及研究状态等方面完全相互隔离;它们各自独立地闭合自身的研究闭环——通过保留经验证有效的证据,并以此指导后续的提案生成。在此受限但明确的意义上,两个系统均在研究流程层面实现了递归式自我改进。此外,每个系统均运行于各自封闭的沙箱环境中:该环境固定了数据划分方式、特征与标签的定义,以及评估器,同时仅允许模型通过受约束的因子表达式或配置差异(configuration diffs)进行操作。其中,因子系统采用由管理者协调的多智能体流水线架构,能够发现并组合各类因子,最终在加密资产投资 Universe 中构建出综合信息系数(Information Coefficient, IC)约为 0.190 的信号;而模型系统则围绕一种混合时序架构,以配置驱动的方式循环迭代,其在美国股票市场上的单只个股信息系数达 +0.0843,并进一步转化为一种阈值型多空策略,在扣除双边交易成本后,样本外夏普比率(Sharpe Ratio)最高可达 +2.50;该策略自2021年至2025年每年均实现正向收益。
152
热度
许愿开讲
PDF
解读
Weaves, Wires, and Morphisms: Formalizing and Implementing the Algebra of Deep Learning
2026年04月08日
尽管深度学习模型运行的是定义明确的数学函数,但我们目前仍缺乏一个用于描述模型架构的严格数学框架。现有的临时性符号表示、示意图和伪代码难以妥善处理非线性广播(nonlinear broadcasting)机制,也无法清晰刻画单个组件与组合后整体模型之间的关系。本文提出了一种面向深度学习模型的范畴论框架,通过新引入的“轴-步长范畴”(axis-stride category)与“数组广播范畴”(array-broadcasted category),对广播机制进行了形式化建模。该框架使得模型架构所对应的底层数学函数得以被精确表达,并以可组合的方式进行推演与操作。这些数学定义进一步被转化为人类易于理解的示意图,以及机器可解析的数据结构。我们同步提供了 Python(pyncd)与 TypeScript(tsncd)两种语言的镜像实现,以体现本框架的普适性;其功能涵盖代数化构建、计算图转换、PyTorch 编译支持,以及示意图渲染等。该工作为深度学习模型的设计与分析奠定了系统化、形式化的理论基础。
121
热度
许愿开讲
PDF
解读
CAKE: Compiler-Agent Co-Design for Frontier Kernel Evolution
2026年08月12日
GPU内核智能体(kernel agents)与GPU编程语言长期以来各自独立发展,导致专家级内核难以复现。现有智能体通常将编译器视为一个不可更改的“黑盒”,仅能接收编译错误、正确性验证结果及执行耗时等有限反馈;而当前各类领域特定语言(DSL)则要么完全隐藏关键的调度决策,要么仅通过晦涩难懂的内存布局抽象来暴露这些决策。本文提出CAKE——一种编译器与智能体协同设计的新范式:智能体直接编写CAKE中间表示(CAKE IR),这是一种具备类型安全、显式刻画硬件特性的调度表达形式。CAKE完整暴露了线程束(warp)角色划分、数据搬移路径、同步机制以及流水线结构,同时原生支持形式化验证、性能代价建模和局部化诊断能力。更重要的是,整个运行环境(harness)本身具备自演化能力:反复出现的失败案例会自动转化为新的验证规则、IR原语、代价模型校准参数,以及可复用的优化策略。在B200 GPU上、实现细节完全隐藏的Flash-KMeans基准测试中(即“clean start”模式),CAKE在8000万token预算下生成的最优IR候选方案,其性能达到人工调优版FlashML基线的1.144倍,显著优于直接使用CUDA/PTX手写代码所得的0.928倍。超越该基准,由智能体生成的Kimi Delta Attention内核,在几何平均速度上相较官方FlashKDA提升2.05倍,并已通过端到端服务部署验证;基于调度器(dispatcher)实现的KNN与KMeans内核,在超过400种不同张量形状下,性能分别提升1.42倍至2.12倍;另有四项内核改进已作为补丁(PR)提交至上游开源仓库。CAKE全面支持从Ampere架构至Blackwell架构的NVIDIA GPU,且明确区分了面向单一形状的迭代优化与面向通用库的泛化设计及动态分发机制。
104
热度
许愿开讲
PDF
解读
Solipsistic Superintelligence is Unlikely to be Cooperative
2026年06月02日
人工智能面临的核心挑战,正从“能力提升”转向“共生共存”。当前人工智能研究的主流范式,聚焦于开发强大的智能体,将其所处世界视为外生且静态的反馈来源。我们认为,若沿袭这种唯我论式的人工智能设计思路,即便催生出一种在任务求解方面极为卓越的“超级智能”,它也极难具备合作性。人工智能系统的实际部署,会引发内生性的非平稳性,从而导致训练、测试与部署三个阶段之间出现显著脱节——即历史数据所反映的统计分布,与真实部署环境中的分布严重偏离。我们将这一现象称为“单边优化的自我瓦解特性”。要弥合这一鸿沟,就必须构建能够主动参与合作的人工智能系统:所谓合作,即多个行动者在相互依存关系中共同进行均衡选择的过程。因此,我们呼吁转向一种非唯我论的研究范式,将这种相互依存性本身确立为核心设计原则,而非将“合作”仅仅视作一项待解的任务。这一范式转变具体意味着:构建包含自适应对手(counterparties)的动态评估测试平台;将制度(institutions)作为基础性设计原语(design primitives)加以建模与整合;并将人类能动性(human agency)作为系统架构中一项结构性特征予以保留和保障。
104
热度
许愿开讲
PDF
解读