活动
论文
知识树
专栏
风云榜
项目
社交
登录/注册
已选(0/)
重选
每天 0 点更新数据,热度根据全网互动数计算
最热 · 今天
今天
本周
本月
最新
LEANN: A Low-Storage Vector Index
Yichuan Wang
,
Zhifei Li
,
Shu Liu
,
...
2025年06月09日
基于嵌入的向量搜索支撑着许多重要应用,例如推荐系统和检索增强生成(RAG)。该技术依赖向量索引来实现高效搜索。然而,这些索引需要存储高维嵌入向量以及庞大的索引元数据,其总体规模可能达到原始数据(如文本片段)大小的数倍。如此高的存储开销使得在个人设备或大规模数据集上部署向量搜索变得困难甚至不切实际。为解决这一问题,我们提出了LEANN——一种面向向量搜索的高效存储索引方案,它通过即时重新计算嵌入向量而非预先存储,并对最先进的近似图索引进行压缩,同时保持搜索精度。LEANN能够在仅使用极小部分存储空间(例如仅为原始数据的5%)的情况下实现高质量的向量搜索,并支持存储高效的索引构建与更新。在真实场景的基准测试中,与传统索引相比,LEANN可将索引大小减少高达50倍,同时在RAG应用中保持最先进的搜索精度和相当的响应延迟。
1.41w
热度
许愿开讲
已成功许愿
社区会每周邀请许愿量TOP的论文作者,来社区直播开讲。为提升邀请成功率,你可分享给同行小伙伴,一起来许愿~
PDF
解读
PIXELRAG: Web Screenshots Beat Text for Retrieval-Augmented Generation
Yichuan Wang
,
Zhifei Li
,
Zirui Wang
,
...
2026年06月01日
将大型语言模型(LLMs)与检索到的网页文本相结合,已成为当前主流范式;然而,网页本身并非天然以纯文本形式存在:现有系统依赖复杂的解析流水线,将HTML线性化处理,并丢弃其原有的布局结构、视觉呈现及格式信息。为此,我们提出PixelRAG——一种全新的检索增强方法,它以网页原本的视觉形态(即像素图像)对其进行表征,并完全在像素空间内完成检索与阅读过程,从而构建端到端架构,彻底规避了文本抽象这一中间环节。据我们所知,PixelRAG是首个以这种原生视觉形式在完整维基百科语料库上运行的处理流程,其数据存储规模达3000万张网页截图,并配备高效的视觉检索索引。该方法基于现有的视觉嵌入模型(即Qwen3-VL-Embedding),并进一步利用精心筛选的对比学习训练数据,在网页截图数据集上对该模型进行微调。检索所得的截图直接作为像素输入送入视觉语言模型(VLM),全程无需任何中间文本转换步骤。实验表明,PixelRAG在各项基准测试中均持续优于“无检索”及“基于文本的RAG”两类基线方法;尤为令人意外的是,即便在NQ和SimpleQA等长期被广泛研究、高度依赖文本的问答任务上,其性能亦显著领先。此外,PixelRAG在多模态开放域问答(如MMSearch)、面向噪声新闻语料库的评测(如LiveVQA)以及智能体式评测(如MoNaCo)中同样表现优异,相较文本基线方法最高可将准确率提升18.1%。最后,像素表征还为RAG引入了一种全新的效率优化维度——图像压缩:在降低图像分辨率的前提下,最多可减少约三分之二的token开销,同时仍能保持原有精度。我们的结果对“网页检索必须依赖文本表征”这一固有认知提出了挑战,表明网页检索增强完全可以直接在其原生视觉形态下运行,并在提升性能的同时兼顾更高效率。
1.08w
热度
许愿开讲
已成功许愿
社区会每周邀请许愿量TOP的论文作者,来社区直播开讲。为提升邀请成功率,你可分享给同行小伙伴,一起来许愿~
PDF
解读
OmniGen: Unified Image Generation
Shitao Xiao
,
Yueze Wang
,
Junjie Zhou
,
...
2024年09月17日
在这项工作中,我们介绍了OmniGen,一种新的统一图像生成扩散模型。与流行的扩散模型(例如稳定扩散)不同,OmniGen不再需要额外的模块,如ControlNet或IP-Adapter来处理不同的控制条件。OmniGen具有以下特点:1)统一性:OmniGen不仅具有文本到图像生成能力,而且本质上支持其他下游任务,如图像编辑、主题驱动生成和视觉条件生成。此外,OmniGen可以通过将它们转化为图像生成任务来处理经典的计算机视觉任务,如边缘检测和人体姿态识别。2)简单性:OmniGen的架构非常简化,消除了额外的文本编码器的需要。此外,与现有的扩散模型相比,它更加用户友好,使得可以通过指令完成复杂任务而无需额外的预处理步骤(例如人体姿态估计),从而显著简化了图像生成的工作流程。3)知识转移:通过以统一格式进行学习,OmniGen有效地在不同任务之间转移知识,处理未见过的任务和领域,并展示新的能力。我们还探讨了模型的推理能力和链式思考机制的潜在应用。这项工作代表了通用图像生成模型的首次尝试,但仍存在一些未解决的问题。我们将在https://github.com/VectorSpaceLab/OmniGen开源相关资源,以促进这一领域的进步。
4703
热度
许愿开讲
已成功许愿
社区会每周邀请许愿量TOP的论文作者,来社区直播开讲。为提升邀请成功率,你可分享给同行小伙伴,一起来许愿~
PDF
解读
LimiX: Unleashing Structured-Data Modeling Capability for Generalist Intelligence
Xingxuan Zhang
,
Gang Ren
,
Han Yu
,
...
2025年09月03日
我们认为,要实现通用智能的进步,需要基于语言、物理世界和结构化数据的互补性基础模型。本报告介绍了LimiX,这是我们大型结构化数据模型(LDMs)系列中的首个成果。LimiX将结构化数据视为变量与缺失性(missingness)的联合分布,因此通过基于查询的条件预测,一个模型即可胜任广泛的表格任务。LimiX采用带掩码的联合分布建模进行预训练,其训练目标具有情景化和上下文依赖的特点:模型会根据特定数据集的上下文信息,预测用户指定的查询子集,从而在推理阶段实现快速、无需训练的适应能力。我们在10个大型结构化数据基准任务上对LimiX进行了全面评估,涵盖样本量、特征维度、类别数量、类别型与数值型特征比例、缺失值比例以及样本与特征比等多种复杂场景。实验表明,仅使用一个模型和统一的接口,LimiX在分类、回归、缺失值填补和数据生成等多种任务中始终优于包括梯度提升树、深度表格网络、近期的表格基础模型以及自动化集成方法在内的多种强大基线方法,且优势显著,同时无需针对不同任务设计专门的模型架构或进行单独训练。所有LimiX模型均已按照Apache 2.0协议公开发布,供公众使用。
4441
热度
许愿开讲
已成功许愿
社区会每周邀请许愿量TOP的论文作者,来社区直播开讲。为提升邀请成功率,你可分享给同行小伙伴,一起来许愿~
PDF
解读
OmniGen2: Exploration to Advanced Multimodal Generation
Chenyuan Wu
,
Pengfei Zheng
,
Ruiran Yan
,
...
2025年06月23日
在这项工作中,我们推出了OmniGen2,这是一种多功能且开源的生成模型,旨在为各种生成任务提供统一的解决方案,包括文本到图像生成、图像编辑以及上下文内生成。与OmniGen v1不同,OmniGen2为文本和图像模态分别设计了两个独立的解码路径,采用不共享的参数和解耦的图像编码器。这一设计使得OmniGen2可以在现有多模态理解模型的基础上进行构建,而无需重新适配VAE输入,从而保留原有的文本生成能力。为了支持OmniGen2的训练,我们开发了全面的数据构建流程,涵盖图像编辑和上下文内生成所需的数据。此外,我们还为图像生成任务引入了一种专门设计的反思机制,并基于OmniGen2构建了一个专用的反思数据集。尽管参数规模相对适中,OmniGen2在多个任务基准测试中仍取得了具有竞争力的结果,包括文本到图像生成和图像编辑。为了进一步评估上下文内生成(也称为主题驱动任务),我们引入了一个新的基准测试集OmniContext。在开源模型中,OmniGen2在一致性方面达到了最先进的性能水平。我们将发布模型、训练代码、数据集以及数据构建流程,以支持该领域的未来研究。项目页面:https://vectorspacelab.github.io/OmniGen2;GitHub链接:https://github.com/VectorSpaceLab/OmniGen2
4148
热度
许愿开讲
已成功许愿
社区会每周邀请许愿量TOP的论文作者,来社区直播开讲。为提升邀请成功率,你可分享给同行小伙伴,一起来许愿~
PDF
解读
Back to Basics: Let Denoising Generative Models Denoise
Tianhong Li
,
Kaiming He
2025年11月17日
如今的去噪扩散模型并不以传统意义上的“去噪”方式进行工作,也就是说,它们并不会直接预测干净的图像。相反,神经网络预测的是噪声或含噪的数据。本文指出,预测干净数据与预测含噪数据在本质上是不同的。根据流形假设,自然数据应当位于一个低维流形上,而含噪数据则不然。基于这一假设,我们主张采用直接预测干净数据的模型,这使得看似容量不足的网络也能在非常高维的空间中有效运行。我们证明了仅使用像素作为输入的简单大尺寸图像块Transformer即可成为强大的生成模型:无需使用分词器(tokenizer)、无需预训练、也无需额外的损失函数。我们的方法在概念上无非就是“**纯图像Transformer**”,即我们所称的 **JiT**(Just image Transformers)。我们在ImageNet上以256和512分辨率、使用16和32的大图像块尺寸进行实验,取得了具有竞争力的结果——而在这些设置下,预测高维含噪量的方法可能会彻底失败。通过让网络回归到流形的基本原理,我们的研究回归本质,致力于在原始自然数据上建立一种自成一体的、基于Transformer的扩散建模范式。
2774
热度
许愿开讲
已成功许愿
社区会每周邀请许愿量TOP的论文作者,来社区直播开讲。为提升邀请成功率,你可分享给同行小伙伴,一起来许愿~
PDF
解读
OxyGent: Making Multi-Agent Systems Modular, Observable, and Evolvable via Oxy Abstraction
Junxing Hu
,
Tianlong Li
,
Lei Yu
,
...
2026年04月28日
在复杂的工业环境中部署可投入生产使用的多智能体系统(MAS)仍面临诸多挑战,主要体现在可扩展性、可观测性以及自主演进能力等方面的固有局限。本文提出 OxyGent——一个开源框架,其核心创新在于两项关键技术:统一的“Oxy”抽象模型与“OxyBank”演进引擎。该统一抽象模型将智能体、工具、大语言模型(LLM)及推理流程统一封装为可插拔的原子化组件,从而支持类似乐高积木式的灵活系统构建,并实现对系统运行状态的非侵入式监控。为提升可观测性,OxyGent 引入了基于权限驱动的动态规划机制,以运行时动态生成的执行图替代僵化的预设工作流,进而提供自适应的可视化分析能力。此外,为支撑系统的持续演进,OxyBank 作为一个人工智能资产统一管理平台,可驱动自动化数据回传、智能标注以及模型与系统组件的协同演进。实证评估与多个真实工业场景案例表明,OxyGent 为多智能体系统提供了坚实、可靠且高度可扩展的基础架构。OxyGent 已依据 Apache License 2.0 协议完全开源,项目地址为:https://github.com/jd-opensource/OxyGent。
2472
热度
许愿开讲
已成功许愿
社区会每周邀请许愿量TOP的论文作者,来社区直播开讲。为提升邀请成功率,你可分享给同行小伙伴,一起来许愿~
PDF
解读
Actions Speak Louder than Words: Trillion-Parameter Sequential Transducers for Generative Recommendations
Jiaqi Zhai
,
Lucy Liao
,
Xing Liu
,
...
2024年02月27日
大规模推荐系统的特点是依赖于高基数、异构特征,并需要每天处理数十亿个用户操作。尽管在数千个特征上使用了大量的数据进行训练,但工业界中大多数深度学习推荐模型(DLRMs)在计算方面都无法扩展。 受到语言和视觉领域中Transformer的成功启发,我们重新审视了推荐系统的基本设计选择。我们在生成建模框架中将推荐问题重新定义为序列传导任务(“生成式推荐”),并提出了一种新的架构HSTU,专为高基数、非平稳流式推荐数据设计。 HSTU在合成和公共数据集上的NDCG性能比基准提高了高达65.8%,而在8192长度序列上比基于FlashAttention2的Transformer快5.3倍至15.2倍。基于HSTU的生成式推荐器,具有1.5万亿个参数,在在线A / B测试中提高了12.4%的指标,并已部署在拥有数十亿用户的大型互联网平台的多个表面上。更重要的是,生成式推荐器的模型质量在三个数量级的训练计算中经验性地呈现出幂律规模,达到了GPT-3/LLaMa-2规模,这减少了未来模型开发所需的碳足迹,进一步为推荐领域的第一批基础模型铺平了道路。
2397
热度
PDF
解读
Humanoid-Gym: Reinforcement Learning for Humanoid Robot with Zero-Shot Sim2Real Transfer
Xinyang Gu
,
Yen-Jen Wang
,
Jianyu Chen
2024年04月08日
Humanoid-Gym是一个易于使用的强化学习(RL)框架,基于Nvidia Isaac Gym,旨在训练人形机器人的运动技能,强调从模拟到真实环境的零-shot转移。Humanoid-Gym还集成了一个从Isaac Gym到Mujoco的sim-to-sim框架,使用户可以在不同的物理模拟中验证训练的策略,以确保策略的稳健性和泛化性。该框架在RobotEra的XBot-S(1.2米高的人形机器人)和XBot-L(1.65米高的人形机器人)中在真实环境中进行了验证,并实现了零-shot sim-to-real转移。该项目的网站和源代码可以在以下网址找到:https://sites.google.com/view/humanoid-gym/。
2335
热度
许愿开讲
已成功许愿
社区会每周邀请许愿量TOP的论文作者,来社区直播开讲。为提升邀请成功率,你可分享给同行小伙伴,一起来许愿~
PDF
解读
Autoregressive Image Generation without Vector Quantization
Tianhong Li
,
Yonglong Tian
,
He Li
,
...
2024年06月17日
传统观点认为,图像生成的自回归模型通常需要使用向量量化标记。我们发现,虽然离散值空间可以方便地表示分类分布,但它并不是自回归建模的必要条件。在这项工作中,我们提出使用扩散过程对每个标记的概率分布进行建模,这使我们能够在连续值空间中应用自回归模型。我们定义了扩散损失函数来建模每个标记的概率分布,而不是使用分类交叉熵损失。这种方法消除了需要使用离散值标记的必要性。我们在包括标准自回归模型和广义掩码自回归(MAR)变体在内的广泛案例中评估了其有效性。通过消除向量量化,我们的图像生成器在享受序列建模速度优势的同时取得了强大的结果。我们希望这项工作能激发在其他连续值领域和应用中使用自回归生成的动力。
2075
热度
PDF
解读