领域 ALL
特色 ALL
请选择
速览
今日热度
SlopShape: Identifying AI-Generated Commercial Web Content
LLM Other LLM NLP Other NLP AI Safety / AI Ethics DWAT
1460
热度
2026年09月14日
词级检测器几乎能完美识别未经修改的AI生成文本,但现有文献已指出,这类检测器在文本被改写后极易失效;此外,词级得分既无法刻画文本的整体特征,也无法确定其出自哪一种AI模型。因此,我们提出一个问题:能否在更深层次上识别AI生成文本——即从其结构特征入手,考察信息如何呈现、以何种顺序展开、依托哪些证据支撑,以及采用何种叙述口吻?我们复现了StoryScope(Russell等,2026)的研究方法——该研究曾揭示AI生成小说所具有的特定结构模式,并将这一方法拓展至商业内容领域:以268个企业网站发布的2,250篇ChatGPT问世前的人类撰写的博客文章为基准,与五种前沿AI模型生成的11,250篇对应“镜像”文本进行对比分析。我们构建了一套包含214个特征的结构化测量工具,由大语言模型(LLM)执行评估,并通过人工黄金标注环节完成验证(人工标注者之间的一致性kappa系数达0.928,人工标注与模型标注之间的一致性kappa系数达0.946)。仅凭其中187个结构特征,该工具即可在未参与训练的公司样本上实现98.0的宏平均F1值;即使对每一篇AI生成的博文均由其原始生成模型自行重写(即彻底改写),检测性能也几乎不受影响(宏平均F1值仍达98.1)。这一结构信号不仅具有表征能力,还具备归因能力:AI生成的博文普遍呈现出一种规整、自我指涉的结构形态;在源模型归因任务中,79.3%的AI博文被准确识别出其真实生成模型,远高于随机猜测的16.7%基线水平;而人类撰写的博文则多分布于极为罕见的结构配置之中。上述所有效应均成功复现了StoryScope的研究发现,且效应方向完全一致、强度更为显著。我们已开源全部流程、测量工具、提示词(prompts)、代码及聚合后的分析成果。
许愿开讲
PDF
解读
The Little Book of Generative AI Foundations: An Intuitive Mathematical Primer
GenAI Diffusion GANs Other GenAI ML Generative Models
789
热度
2026年05月28日
本书以推导为导向,精炼而系统地介绍了现代生成式人工智能的数学基础。它并非面面俱到地罗列各类最新模型架构或实现细节,而是构建了一条逻辑连贯的知识路径,串联起主要生成模型家族的核心思想——从主成分分析(PCA)、概率主成分分析(Probabilistic PCA)、变分自编码器(VAE)、扩散模型(Diffusion Models),到归一化流(Normalising Flows)、自回归分解(Autoregressive Factorisations)、生成对抗网络(GANs)、Wasserstein GAN(WGAN)以及基于能量的模型(Energy-Based Models)。其目标是在不削弱必要数学深度的前提下,使生成建模的整体结构更清晰易懂,从而帮助读者真正理解这些模型是如何被严格推导出来的,以及彼此之间存在怎样的理论关联。本书定位为一本夯实基础的入门读物,面向对数学原理怀有好奇心的研究人员、一线从业者及研究生。
许愿开讲
PDF
解读
Embodied-R1.5: Evolving Physical Intelligence via Embodied Foundation Models
AK's Picks Embodied AI and Robotics Task Decomposition MLMRD ML RL
379
热度
2026年06月09日
我们提出了Embodied-R1.5,这是一种统一的具身基础模型(Embodied Foundation Model, EFM),其单一架构集成了全面的具身推理能力,涵盖具身认知、任务规划、错误修正与指向定位等多个核心维度,旨在迈向通用物理智能。我们构建了三条自动化数据生成流水线,显著拓展了关键能力所需的数据覆盖范围,由此构建了一个规模超150亿词元(tokens)的大型数据系统;同时设计了一种多任务均衡的强化学习训练范式,以有效缓解异构任务之间存在的冲突问题。此外,我们引入了一种“规划器–定位器–修正器”(Planner-Grounder-Corrector, PGC)闭环框架,使单个模型能够自主执行并持续自我修正,从而可靠地完成长时程复杂任务。尽管参数量仅为80亿,Embodied-R1.5在24项具身视觉语言模型(VLM)基准测试中的16项上达到当前最优水平(SOTA),性能超越Gemini-Robotics-ER-1.5和GPT-5.4等前沿模型。得益于模型内部已深度内化的具身能力,Embodied-R1.5仅需少量数据微调,即可高效适配为具身语言动作模型(VLA),并在4个主流操作任务基准套件上全面超越领先VLA模型(如$π_{0.5}$)。我们进一步开展了大量零样本真实机器人实验,全面验证了该模型在指令跟随、功能可供性定位(affordance grounding)、关节式物体操控以及长时程复杂任务等方面的实际表现,充分展现出其面向物理世界的强大泛化能力。为推动具身基础模型领域的后续研究,我们开源了模型权重、全部训练数据集、训练代码,以及专为具身任务设计的评估框架——EmbodiedEvalKit。
许愿开讲
PDF
解读
LaST-R1: Reinforcing Robotic Manipulation via Adaptive Physical Latent Reasoning
Embodied AI and Robotics Robust MPC Imitation Learning ML RL PGPO
378
热度
2026年04月30日
机器人基础模型需要在复杂视觉场景中进行推理,才能在动态环境中执行自适应动作。尽管近期关于潜在推理型视觉-语言-动作(VLA)模型的研究已展现出对细粒度物理动力学的建模能力,但其应用仍主要集中于静态模仿学习范式,严重制约了模型的适应性与泛化能力。本文提出LaST-R1——一种全新的强化学习(RL)后训练框架,旨在高效利用“先潜在推理、再执行动作”的策略。具体而言,我们设计了核心强化学习算法“潜在到动作策略优化”(LAPO),该算法联合优化潜在推理过程与动作生成过程。通过将潜在的思维链(Chain-of-Thought, CoT)推理显式嵌入强化学习优化循环之中,LAPO激发了对物理世界的深层建模能力,从而支撑智能体在交互式环境中实现鲁棒的动作执行。此外,我们还引入了一种自适应潜在思维链机制,使策略能够根据环境状态的多样性,动态调节其推理步长(即推理的深度或广度)。实验表明,在仅需一次示例监督预热(one-shot supervised warm-up)的前提下,LaST-R1在LIBERO基准测试中取得了高达99.9%的平均任务成功率,显著加快了收敛速度,并大幅超越了此前最优(SOTA)方法的性能表现。在真实世界部署中,LaST-R1在涵盖单臂与双臂操作的四项复杂任务上,相较当前最优的监督微调方法,平均任务成功率提升了22.5%。最后,LaST-R1在仿真环境与真实世界环境之间展现出优异的跨域泛化能力。
许愿开讲
PDF
解读
Data-Driven Persona-Conditioned Agents for A/B Test Simulation
LLM Other LLM Agent Multi-agent Collaboration Agent Eval Benchmarks
342
热度
2026年09月01日
A/B测试是评估产品变更的黄金标准,但每次实验均需消耗真实的用户流量、投入工程资源,并耗费数周时间进行效果测量。我们提出了一种仿真框架,利用基于大语言模型(LLM)的智能体来预测A/B测试结果;这些智能体以数据驱动的用户画像为条件,而该画像则扎根于真实用户的实际行为信号。与以往依赖合成数据或基于规则构建用户画像的研究不同,我们的智能体直接从匿名化的行为数据中构建而成——包括用户活动模式、参与度信号以及推断得出的人口统计学特征——从而实现对目标用户群体更忠实、更精准的建模。我们将A/B测试仿真任务建模为一项结构化问答任务,并系统性地探究了以下四个关键问题:(i)问题设计的不同形式;(ii)用户画像数据来源及其与目标业务领域的匹配程度所带来的影响;(iii)单个画像所刻画的行为深度与整体用户群体多样性之间的权衡关系;(iv)面向大规模群体的高效子采样策略。在涵盖两类核心指标、共计40组真实A/B测试构成的基准测试集上,我们最优配置的仿真方法在不同测试指标下实现了75%–90%的方向性准确率,充分表明:基于真实数据构建的用户画像,是一条切实可行的技术路径,可支撑快速、低成本的实验预筛与可行性评估。
许愿开讲
PDF
解读
Colored Noise Diffusion Sampling
GenAI Diffusion ML DM
239
热度
2026年05月28日
扩散模型在图像合成任务中达到了当前最优性能,其生成轨迹本质上呈现出一种谱偏差(spectral bias):即早期优先重建低频的全局结构,后期才逐步恢复高频的精细细节。传统的随机微分方程(SDE)求解器未能考虑这一动态演化特性,而是在整个生成过程中简单粗暴地注入均匀的白噪声,从而错误地消耗了本就有限的能量预算。本文构建了一个全新的数学框架,将SDE推理过程重新诠释为一种目标明确、按频率解耦的能量传递机制。基于该框架,我们提出了“彩色噪声采样”(Colored Noise Sampling, CNS)——一种新颖的、无需额外训练的随机求解器。CNS不再注入均匀白噪声,而是采用一种动态的、随时间步长与频率变化而自适应调整的噪声调度策略,从而更高效地将注入的能量定向分配至当前尚未被结构化重建的频率成分上。通过主动利用扩散模型固有的谱偏差特性,CNS系统性地引导生成分布向真实数据流形收敛。大量实验表明,作为一种严格即插即用、仅在推理阶段替换采样器的方法,CNS在多种主流架构(SiT、JiT、FLUX)上均显著优于标准的常微分方程(ODE)和随机微分方程(SDE)基线方法。在ImageNet-256数据集上的无分类器引导(unguided)采样实验中,CNS实现了显著的FID指标下降:SiT-XL/2模型的FID从8.26降至6.27;JiT-B/16模型从32.39降至26.69;JiT-H/16模型则从11.88降至8.31。此外,在采用分类器自由引导(Classifier-Free Guidance)时,CNS亦能保持稳定且一致的相对FID提升。项目主页见:https://hadardavidson.github.io/CNS/。
许愿开讲
PDF
解读
Sparse Layers are Critical to Scaling Looped Language Models
LLM MQIA MoE
214
热度
2026年05月09日
循环式语言模型通过在深度方向上重复使用一组Transformer层,从而降低了内存开销,并在每次循环的边界处自然地提供了早期退出(early-exit)点。然而,与采用独立层的标准Transformer相比,循环式模型在扩展性方面表现欠佳。我们对比了标准Transformer与混合专家(Mixture-of-Experts, MoE)Transformer,分别考察其带循环与不带循环两种架构,得出两项主要发现。 第一,我们发现循环式MoE模型(Looped-MoE)的扩展性优于标准基线模型,而循环式稠密模型(dense looped model)则无法做到这一点。这一差异源于循环之间的路由发散(routing divergence):在循环式MoE模型中,同一组共享层在每次循环遍历时会激活不同的专家,从而在不增加参数量的前提下恢复了模型的表达能力。 第二,我们发现循环式模型配合早期退出机制,在计算开销与生成质量之间的权衡上优于标准模型。这是因为每一次循环结束时所经过的层,恰好就是最终输出所依赖的相同层,因此循环边界天然成为更优的退出点;实证结果也证实,在这些边界点上,模型输出更早趋于收敛。 综上所述,本研究为循环式模型的规模化发展指明了一条清晰路径:采用“循环式MoE + 早期退出”的架构,不仅能在大规模场景下超越标准Transformer,还能在几乎不损失生成质量的前提下,显著节省内存占用与推理计算开销。
许愿开讲
PDF
解读
Compression is all you need: Modeling Mathematics
ML PGM LOG KR / KRR MTPLD Other KRR
196
热度
2026年03月20日
人类数学(HM)——即人类所发现并重视的数学——仅仅是形式数学(FM)这一庞大体系中一个微乎其微的子集;而形式数学则囊括了所有有效的逻辑推导。我们认为,人类数学之所以独特,在于它可通过层级嵌套的定义、引理与定理实现高度压缩。我们采用幺半群(monoid)对这一特性建模:一条数学推导可表示为一串原始符号构成的字符串;而一个定义或定理则相当于一个被赋予名称的子串(或称“宏”),其引入可显著压缩该字符串的长度。在自由阿贝尔幺半群 $A_n$ 中,即便仅采用对数稀疏(logarithmically sparse)的宏集合,亦足以实现表达能力的指数级扩展;而在自由非阿贝尔幺半群 $F_n$ 中,即使宏集合的密度达到多项式级别,所能获得的表达能力提升也仅为线性;若要实现超线性扩展,则宏集合的密度必须接近最大可能值。我们以 MathLib(一个规模庞大的 Lean 4 数学形式化库)作为人类数学(HM)的实证代理,对上述模型展开检验。MathLib 中每个数学对象均具有三个关键度量:深度(即定义嵌套的层数)、包裹长度(其定义所含的词元 token 数量)以及展开长度(将其中所有引用完全递归展开后所得的原始符号总数)。我们发现:展开长度随深度与包裹长度均呈指数增长;而包裹长度则在各深度层级上大致保持恒定。这些经验结果与自由阿贝尔幺半群 $A_n$ 的理论预测高度吻合,却与自由非阿贝尔幺半群 $F_n$ 的预测明显相悖,从而支持如下核心论断:人类数学(HM)占据着形式数学(FM)这一指数级增长空间中一个仅呈多项式级增长的子区域。最后,我们进一步探讨:如何借助 MathLib 的依赖图(dependency graph)来量化“数学重要性”——具体而言,既可通过该图上的压缩率(compression ratio)加以衡量,也可通过类比 PageRank 的图分析方法进行评估;此类量化手段不仅能揭示哪些数学内容更富“兴趣”,还可引导自动化推理系统聚焦于那些具备强压缩性的区域——而这恰恰正是人类数学赖以生存与繁衍的土壤。
许愿开讲
PDF
解读
stable-worldmodel: A Platform for Reproducible World Modeling Research and Evaluation
Embodied AI and Robotics World Models Sim-Platform
186
热度
2026年05月20日
世界模型对于构建能够进行推理、规划,并在训练数据之外实现泛化的智能体至关重要。然而,当前世界模型相关研究较为零散:彼此割裂的代码库、数据处理流程与评估协议,严重阻碍了研究结果的可复现性与公平比较。此外,现有实践还面临三大关键瓶颈:一是代码库脆弱且多为一次性定制开发;二是视频数据加载速度缓慢;三是缺乏标准化的泛化能力评测基准。为此,我们推出 stable-worldmodel(简称 swm),一个面向世界建模研究与评估的开源平台,致力于推动该领域研究的标准化与可复现性。swm 具备以下三大核心能力:(1)基于 Lance 构建的高性能数据层,原生支持 MP4、HDF5 和 LeRobot 等主流数据格式,并提供便捷的格式转换工具;(2)干净、规范、经过充分测试的现代世界模型基线方法及规划求解器实现;(3)一套涵盖广泛环境与任务的评测套件,所有任务均额外引入可控的视觉、几何与物理变化因子,从而支持对动力学理解能力、控制性能、表征质量以及分布外泛化能力开展系统性的纯仿真(in-silico)评估。通过将整个研究流程——从数据加载、模型训练到评估分析——统一整合于一个可扩展的单一框架之下,\texttt{swm} 显著降低了研究门槛与工程开销,有力加速了通往可靠、可信世界模型的稳健发展进程。
许愿开讲
PDF
解读