每天 0 点更新数据,热度根据全网互动数计算
最热 · 今天
最新
Temporal Self-Distillation: Learning Visual State Tracking in Videos Without Supervision
2026年09月03日
我们提出了S³T(时序自监督自蒸馏,Self-Supervised Self-Distillation over Time),据我们所知,这是首个完全自包含的连续视频状态跟踪框架。本方法将时间采样密度视为“特权信息”(privileged information),其理论依据在于:对同一视频片段采用更密集的时间采样,能够更准确地重建其动态运行状态。该密集采样视角作为“教师”,而具有相同参数权重的稀疏采样视角则作为“学生”,通过学习匹配教师模型的下一标记(next-token)分布来完成训练。整个模型自主生成训练目标,因此训练过程无需人工标注、无需额外的独立教师模型,也无需任何外部奖励信号,且在推理阶段不引入任何额外计算开销。在LLaVA-OneVision-2-8B模型上,仅使用S³T单模型即可将VSTAT基准的准确率提升+1.74;若进一步结合模型集成(souping),提升达+2.38;若再辅以视觉编码器的额外适配优化,则提升可达+2.70;相比之下,此前各类自演化(self-evolving)方法对状态跟踪能力的提升几乎可以忽略不计。此外,模型从无标注合成视频片段中习得的能力可有效迁移至真实视频场景,在VSTAT-YouTube状态跟踪问答任务上带来+7.95的性能提升,在MVBench动作计数(Action Count)任务上亦提升+4.50。
许愿开讲
PDF
解读
TokenMatch: 3D Mesh Correspondence Transformer with Curvature-Guided Tokenisation
2026年09月03日
尽管数据驱动的三维形状对应关系估计近年来取得了显著进展,但在部分观测和强烈非等距形变条件下的鲁棒匹配问题仍具挑战性。现有基于学习的方法往往依赖于人工设计的描述子或基于模板的表示;而近期基于函数映射(functional maps)的生成式模型则存在推理开销高、可解释性差、且难以泛化至部分形状等问题。针对上述局限,本文提出了TokenMatch——一种基于Transformer架构的全新统一模型,用于三维形状对应关系估计。我们的前馈式方法仅在BeCoS数据集(一个极具挑战性的非等距部分-部分形状匹配数据集)上进行训练,即可直接泛化至完整形状的匹配任务,无需任何重新训练或微调。TokenMatch通过自注意力与交叉注意力机制,高效地学习形状对之间的面片级与点级关系,并推断稠密对应关系。本文的核心洞见在于:可依据形状曲率信息对网格进行自适应分块(tokenisation),从而有效学习面向特定形状的几何描述子,以支撑对应关系估计。我们在多个标准基准数据集上对TokenMatch进行了评估,涵盖部分形状与完整形状匹配任务,包括CP2P、PSMAL、BeCoS、FAUST、SCAPE以及SHREC’19。实验结果表明,本方法在各项指标上均保持优异性能:在平均测地距离误差(mean geodesic error)与交并比(intersection-over-union)两项核心指标上,多数情况下均优于现有方法;同时,其推理速度亦达亚秒级,运行效率更高。
许愿开讲
PDF
解读
Scal3R: Learning Efficient Multi-Relative Pose Query for Scalable Online 3D Reconstruction
2026年09月03日
在线三维重建模型在处理长视频时性能较差。其根本原因在于:将相机位姿回归至一个固定的首帧参考坐标系,迫使模型进行远超训练分布范围的外推;由此产生的微小位姿漂移会不断累积并逐级放大,最终导致严重的几何结构坍塌。然而,我们观察到,尽管整体重建失败,但每一帧预测的深度图却始终保持稳定——即模型主干网络所学习的局部几何结构依然完好无损,仅全局位姿预测头(pose head)出现失效。受此“局部几何与全局位姿可解耦”现象的启发,我们提出了 Scal3R 方法。该方法将在线重建任务重新建模为一种面向多参考帧的相对位姿查询问题。具体而言,我们引入轻量级、可学习的嵌入标记(tokens),其参数量仅占整个模型约 1%;再通过非对称注意力机制,将这些标记注入一个完全冻结的主干网络中。由此构建的架构能够以多个历史关键帧为参考,动态查询当前帧的相对位姿。此外,我们还集成了一套支持闭环检测的在线位姿图优化系统,从而有效抑制长距离累积漂移。Scal3R 在单块 GPU 上仅需 8 小时即可完成训练收敛;在 KITTI 数据集上,其平均绝对位姿误差(ATE)相较现有在线基线方法降低超过 60%;同时,在 Virtual KITTI、Sintel、TUM-Dynamic、ScanNet 及 7-Scenes 等多个主流数据集上均达到当前最优(state-of-the-art)性能。项目主页:https://linjohnss.github.io/scal3r/
许愿开讲
PDF
解读
Principia: Relational Physics Tests for Video Models
2026年09月03日
在视频模型中评估物理推理能力十分困难,因为绝对运动的测量结果依赖于帧率、物体尺度以及相机标定参数——而这些信息在生成的视频中往往模糊不清,甚至完全不可获取。为此,我们提出一种不同的评估思路:当同一场景中的两个物体遵循相同的物理规律时,它们的运动之间必然存在可预测的关系;而这类关系的成立并不依赖于任何相机或场景的标定信息。我们由此构建了评测基准“Principia”,它通过成对物体之间的关系一致性来评估模型对牛顿力学原理的掌握程度。“Principia”覆盖八大物理现象——重力、恢复系数(碰撞反弹)、摩擦力、转动惯量、抛体运动、动量守恒、单摆运动以及质量-弹簧振荡系统——并涵盖平动、转动、碰撞及振荡等各类动力学过程,所有测试视频均采用受控实验协议采集的真实世界场景。此外,我们还设计了一种无需标定的“一致性得分”,该指标直接在图像空间内量化物理规律被违背的程度。在对六种当前最先进的视频生成模型所产出的数千段视频进行测试后,没有任何一个模型在 Principia 上得分超过 0.42,尽管它们在 VBench 基准上的平均得分均接近 0.8。我们还进一步评估了多模态视觉-语言模型识别此类关系性物理错误的能力:表现最优的模型准确率仅为 67%,而大多数模型的表现则接近随机猜测水平。
许愿开讲
PDF
解读
Compile by Training: Turning Natural-Language Specifications into Local Neural Functions
2026年09月03日
许多反复出现的文本处理功能虽然易于用自然语言描述,却难以通过规则实现;而对每个输入都调用一个大型远程模型,则会带来重复的成本开销、显著的延迟以及对服务提供商的依赖。为此,我们提出“训练式编译”(compile by training)方法:该方法将自然语言描述的任务规范直接转化为可复用的神经函数。在编译阶段,由教师模型(teacher models)生成面向特定任务的示例数据,用于训练一个轻量级适配器(small adapter),该适配器嵌入在一个紧凑型解释器(compact interpreter)中。最终生成的神经函数完全脱离教师模型独立运行,且可像普通软件一样被持久化存储、版本化管理,并支持组合调用。在FuzzyBench-Hard基准测试集(即Program-as-Weights快速编译器未能生成任何精确匹配结果的子集)上,“训练式编译”的语义准确率达到83.6%。不过,这一更高准确率是以更高的编译开销为代价的:其编译耗时约为一分钟,而快速编译器仅需数秒。我们已将该编译器部署至一个公开的交互式服务平台,并在多个实际应用场景中展示了所编译函数的能力,包括:跨多站点运行的网页辅助工具、语音/文本指令驱动的三维虚拟形象(3D avatar),以及英—克劳迪什语(English–Claudish)双向翻译器。
许愿开讲
PDF
解读
Clean Engineering, Unstable Measurement: A Preregistered Reliability Failure of Black-Box LLM Observers on Shared Endpoints
2026年09月03日
如今,语言模型裁判(language-model judges)已承担起筛选训练数据、评估生成结果质量以及驱动排行榜排序等关键职责。此时,该裁判本质上是一种测量工具,其有效性依赖于一个极少被明言的假设:同一请求发送至同一模型名称后,其行为在次日仍将保持一致。我们通过两项预先注册的审计活动对这一假设进行了检验,所有判定阈值均在实验启动前严格固定;然而,这两项活动均未能通过对其自身测量工具的有效性验证。 在总计52,988次经审计的请求尝试中,同窗口内重复排序结果与基准排序之间的斯皮尔曼相关系数仅为0.400,远低于预设的最低可接受标准0.90;而字节完全相同的请求在次日重放时,其排序结果的一致性亦仅达0.78,同样显著低于所要求的0.99——且每次测试中,执行过程记录均显示系统处于理论性能上限(即“天花板效应”)。造成上述差距的原因可归结为三方面机制:其一,标签到语义的映射关系本身存在严重偏差,其干扰强度甚至与待测信号本身相当;其二,候选结果间的实际差异幅度低至仪器自身噪声基底以下七个数量级,致使信号完全淹没于噪声之中;其三,即便输入内容字节完全相同,模型仍可能返回不同的排序结果——而采用精确排列(exact-permutation)方式读取输出的做法,反而会进一步放大此类随机噪声。 在本研究所覆盖的参数网格范围内,无论是替换评估指标,还是增加采样次数,均无法修复上述问题。后续一系列预先注册的对照实验进一步限定了该问题的边界:在所采样的数日内延长等待时间并无助益(相关系数分别为0.805与0.800,并在额外五天内得到重复验证);更换服务提供商亦无改善效果(四家主流供应商的表现均处于同一低水平区间,中位数介于0.74至0.88之间,且其公开提供的全部元数据字段均无法预测该表现差异);即使将模型部署于具备批处理不变性(batch-invariant)内核的自托管服务器上,也仅在服务器负载极低时才略有提升;而在人为构造、误差类型与量级均已知的测试案例中,该读出机制的判别能力所反映的实为错误类型,而非误差大小本身。 我们基于全部实证证据,提炼出一套三层级的“快照身份识别阶梯”(snapshot-identity ladder)、八条设计规范(design rules),以及一份标准化报告核查清单(reporting checklist);一项初步试点研究——其调用频次约为本研究总调用量的2%——便足以在早期即揭示出两个根本无法达成的评估门限(unreachable gates)。 需特别强调的是,所有研究结果均针对共享服务基础设施上可对外观测的行为表现,而非模型内部机制。在共享API端点场景下,“模型名称”并不等同于一个冻结不变的测量仪器;任何一项预先注册的评估流程,都必须首先完成对其所用测量仪器本身的校准与验证,方可在其基础上确立并固化任何评估门限。
许愿开讲
PDF
解读
ESPO: Error-Structured Prompt Optimization via Diagnose, Diversify, and Stabilize
2026年09月03日
诸如GEPA之类的进化式提示优化器存在“提示膨胀”问题:每轮迭代都会不断追加规则与限制条件,导致最终生成的提示长度增至原先的3倍,但准确率却并未提升。我们发现这一现象源于三大缺陷——错误观测不全面、搜索多样性不足,以及选择机制不可靠。为此,我们提出ESPO(结构化错误驱动的提示优化方法),将提示优化过程分解为三个阶段: **诊断阶段(Diagnose)**:仅需一轮处理,即可将全部训练错误聚类为若干结构性模式; **生成阶段(Propose)**:采用四种互补的候选提示生成策略,各策略具备独立的偏差倾向,从而保障生成多样性; **筛选阶段(Select)**:运用自助法(bootstrap)稳定性选择机制,确保所选提示在不同采样子集上表现稳健。 在七个公开NLP基准数据集(Tweet、MMLU、GSM8K、HotpotQA、ScoNe、HoVer 和 PUPA)上的实验表明,ESPO相较当前最优方法GEPA,平均准确率提升+3.76个百分点(74.67% vs. 70.91%),且在所有数据集上均达到或超越GEPA性能,同时所生成提示长度缩短47%(1,004字符 vs. 1,878字符),推理速度也更快。进一步开展跨模型验证,在另外四个学生模型(Gemma 3 12B、Mistral 14B、Qwen3 32B、Claude Haiku 4.5)上,ESPO在每一模型上均取得最高平均准确率;其中在Qwen3模型上的GSM8K任务中提升最为显著,准确率从15.00%跃升至91.40%。本文附录中给出的一般化误差界,从理论上为ESPO三阶段设计分别提供了测试阶段误差gap中对应项的严格支撑;消融实验亦证实了一个关键预测:若仅增加生成多样性而未引入自助稳定性选择机制,反而会损害整体性能(准确率下降1.20个百分点)。
许愿开讲
PDF
解读
Puffin-World: Scaling a Unified Multimodal Model with Native 3D World States
2026年09月03日
我们提出了“Puffin-World”——一种统一的多模态架构,无需依赖任何外部离线模块,即可融合物理理解、空间仿真以及三维世界生成与重建能力。为可靠地构建并交互式操作三维世界,本框架联合建模三种原生世界状态:物理状态(重力场与纬度)、几何状态(深度)和外观状态(图像),并引入一种统一的“全向相机”(Omni-Camera)表征,以支持多样化的任务需求与灵活的相机运动。除对上述状态进行建模外,我们还提出了一种跨未来帧传播物理动力学的策略:通过将相机的绝对物理属性(如位置、朝向、焦距等)锚定于真实世界坐标系中,Puffin-World 实现了物理上自洽且视觉上稳定的三维世界生成。进一步地,我们在单一生成过程中耦合外观与几何信息,同步合成每一帧未来视角图像,并同步反演其底层三维几何结构。这一统一范式支持需多任务协同的交织式闭环应用,例如动作模仿(mimic)与自校准的世界探索(self-calibrated world exploration)。为将 Puffin-World 扩展至更复杂的实际场景,我们构建了大规模数据集 Puffin-16M,包含 1500 万组视觉–语言–相机三元组样本,以及 100 万条涵盖多样化、高挑战性运动模式的轨迹数据。为推动该方向的后续研究,我们已开源全部代码、预训练模型及数据集。
许愿开讲
PDF
解读
Legibility is Not Interpretability: Comparing Judged and Actual Importance in Chain-Of-Thought Reasoning
2026年09月03日
思维链模型所生成的推理过程(reasoning traces)看似为我们提供了一扇清晰可读的窗口,用以窥探模型得出答案的具体路径。当前越来越多的研究正是基于这一假设展开:将这些推理过程视作可解读的中间表征,并利用大语言模型(LLM)作为“评判者”,诊断其中的错误、评估其忠实性(faithfulness),并借助过程奖励模型(process reward models)和生成式批评者(generative critics)对每一步推理进行细粒度监督。此类方法均依赖于一个关键前提——即推理步骤的文字内容本身携带着关于该步骤功能角色的信息。但事实果真如此吗?文字内容是否真的编码了哪些推理步骤更为关键这一信息?我们从操作化角度将某一步推理的重要性定义为“优势值”(advantage):即加入该步骤后,模型预期奖励(例如最终输出正确答案的概率)所产生的变化量;该值通过蒙特卡洛 rollout 方法进行估计。我们以这类估计结果作为衡量重要性的“真实标签”(ground truth),进而评估LLM评判者识别高优势值步骤的能力。结果发现,能力足够强的LLM虽能超越基于步骤出现频率的基线表现,但仍显著低于理论上的“噪声上限”(noise ceiling)。进一步地,若对模型进行微调,使其专门担任“步骤级批评者”(step-level critic),其在识别错误回答中关键步骤方面性能提升显著,但在正确回答中识别关键步骤的表现仍远未达到上限。这表明:仅凭推理过程的文字内容,只能部分还原出步骤的实际重要性。我们的研究结果丰富了当前关于思维链忠实性(chain-of-thought faithfulness)的文献体系,也向学界发出警示:切勿将推理过程表面的“可读性”(legibility)等同于真正意义上的“可解释性”(interpretability)——尤其当该假设被用于构建过程奖励模型时,其潜在风险更不容忽视。
许愿开讲
PDF
解读
Axonal delay dispersion decides whether a neuron detects an event or a sequence, and predicts cortical column diameter
2026年09月03日
大脑皮层神经元放电极为稀疏——在每个感觉时间窗内,其发放往往少于一个动作电位——因此仅依赖发放率的编码方式(率编码)已显不足,必须借助时间编码。长期以来人们已知:轴突传导延迟可将神经元的发放时序转化为同步性。然而,决定单个神经元究竟检测哪一类时间特征——是检测一次同步输入脉冲(即多个输入几乎同时到达),还是检测两组输入脉冲之间特定的先后顺序——这一机制迄今尚未得到系统研究。 我们提出一种“延迟特征”(delay-signature)理论框架:汇聚至同一树突分支上的各条轴突所具有的传导延迟,共同构成一把物理意义上的“密钥”。只有当输入序列中各动作电位的时间差恰好被这些延迟所补偿时,输入信号才能同步抵达该分支;随后,通过钙离子平台电位所设定的阈值进行的同步性检测,便将这种同步输入最终转化为全或无式的输出信号。 我们在积分型神经元模型的数值模拟中获得了三项主要结果: 第一,一个单一的、可量化的物理参数——即延迟集合的离散程度(dispersion)——即可调控整个神经元群体的功能表型:当该参数较小时,神经元主要执行事件检测;随其增大,群体则逐渐转向对输入顺序具有选择性的序列检测。这一功能转变是随机延迟与随机连接条件下涌现出的自然现象:当延迟离散程度很小时,根本不存在序列检测神经元;而当离散程度增大到某一临界值时,序列检测神经元的数量开始超过事件检测神经元,且该临界值与输入事件间的时间间隔呈近乎严格的线性关系——其斜率在统计上无法与1区分。这一发现将计算功能上的本质差异,映射到了解剖结构上髓鞘化与非髓鞘化投射通路之间的区别:髓鞘化不仅调节传导速度,更实质上充当了一种“计算模式开关”,直接决定了神经元执行何种计算任务。 第二,同一延迟离散程度也设定了该时间编码方案的能力边界:它既限定了所能编码的最长时间间隔,又确定了一个绝对的时间容差——约为1毫秒;在此容差范围内,输入延缓(slowing)比输入提前(speeding)更易被系统容忍。 第三,上述约1毫秒的时间窗口,结合皮层内水平方向的传导速度,可共同预测皮层柱(cortical column)的直径;而目前已有直接测量数据的两个脑区,其实际测得的柱直径恰好落在该理论关系所预测的位置上。由此可见,仅凭一个可在解剖学上直接测量的参数,即可同时决定神经元所检测的时间特征类型,以及其所能表征的时间信息的精度极限。
许愿开讲
PDF
解读