每天 0 点更新数据,热度根据全网互动数计算
最热 · 今天
最新
PIXELRAG: Web Screenshots Beat Text for Retrieval-Augmented Generation
2026年06月01日
将大型语言模型(LLMs)与检索到的网页文本相结合,已成为当前主流范式;然而,网页本身并非天然以纯文本形式存在:现有系统依赖复杂的解析流水线,将HTML线性化处理,并丢弃其原有的布局结构、视觉呈现及格式信息。为此,我们提出PixelRAG——一种全新的检索增强方法,它以网页原本的视觉形态(即像素图像)对其进行表征,并完全在像素空间内完成检索与阅读过程,从而构建端到端架构,彻底规避了文本抽象这一中间环节。据我们所知,PixelRAG是首个以这种原生视觉形式在完整维基百科语料库上运行的处理流程,其数据存储规模达3000万张网页截图,并配备高效的视觉检索索引。该方法基于现有的视觉嵌入模型(即Qwen3-VL-Embedding),并进一步利用精心筛选的对比学习训练数据,在网页截图数据集上对该模型进行微调。检索所得的截图直接作为像素输入送入视觉语言模型(VLM),全程无需任何中间文本转换步骤。实验表明,PixelRAG在各项基准测试中均持续优于“无检索”及“基于文本的RAG”两类基线方法;尤为令人意外的是,即便在NQ和SimpleQA等长期被广泛研究、高度依赖文本的问答任务上,其性能亦显著领先。此外,PixelRAG在多模态开放域问答(如MMSearch)、面向噪声新闻语料库的评测(如LiveVQA)以及智能体式评测(如MoNaCo)中同样表现优异,相较文本基线方法最高可将准确率提升18.1%。最后,像素表征还为RAG引入了一种全新的效率优化维度——图像压缩:在降低图像分辨率的前提下,最多可减少约三分之二的token开销,同时仍能保持原有精度。我们的结果对“网页检索必须依赖文本表征”这一固有认知提出了挑战,表明网页检索增强完全可以直接在其原生视觉形态下运行,并在提升性能的同时兼顾更高效率。
1.08w
热度
许愿开讲
PDF
解读
OmniGen: Unified Image Generation
2024年09月17日
在这项工作中,我们介绍了OmniGen,一种新的统一图像生成扩散模型。与流行的扩散模型(例如稳定扩散)不同,OmniGen不再需要额外的模块,如ControlNet或IP-Adapter来处理不同的控制条件。OmniGen具有以下特点:1)统一性:OmniGen不仅具有文本到图像生成能力,而且本质上支持其他下游任务,如图像编辑、主题驱动生成和视觉条件生成。此外,OmniGen可以通过将它们转化为图像生成任务来处理经典的计算机视觉任务,如边缘检测和人体姿态识别。2)简单性:OmniGen的架构非常简化,消除了额外的文本编码器的需要。此外,与现有的扩散模型相比,它更加用户友好,使得可以通过指令完成复杂任务而无需额外的预处理步骤(例如人体姿态估计),从而显著简化了图像生成的工作流程。3)知识转移:通过以统一格式进行学习,OmniGen有效地在不同任务之间转移知识,处理未见过的任务和领域,并展示新的能力。我们还探讨了模型的推理能力和链式思考机制的潜在应用。这项工作代表了通用图像生成模型的首次尝试,但仍存在一些未解决的问题。我们将在https://github.com/VectorSpaceLab/OmniGen开源相关资源,以促进这一领域的进步。
4703
热度
许愿开讲
PDF
解读
LimiX: Unleashing Structured-Data Modeling Capability for Generalist Intelligence
2025年09月03日
我们认为,要实现通用智能的进步,需要基于语言、物理世界和结构化数据的互补性基础模型。本报告介绍了LimiX,这是我们大型结构化数据模型(LDMs)系列中的首个成果。LimiX将结构化数据视为变量与缺失性(missingness)的联合分布,因此通过基于查询的条件预测,一个模型即可胜任广泛的表格任务。LimiX采用带掩码的联合分布建模进行预训练,其训练目标具有情景化和上下文依赖的特点:模型会根据特定数据集的上下文信息,预测用户指定的查询子集,从而在推理阶段实现快速、无需训练的适应能力。我们在10个大型结构化数据基准任务上对LimiX进行了全面评估,涵盖样本量、特征维度、类别数量、类别型与数值型特征比例、缺失值比例以及样本与特征比等多种复杂场景。实验表明,仅使用一个模型和统一的接口,LimiX在分类、回归、缺失值填补和数据生成等多种任务中始终优于包括梯度提升树、深度表格网络、近期的表格基础模型以及自动化集成方法在内的多种强大基线方法,且优势显著,同时无需针对不同任务设计专门的模型架构或进行单独训练。所有LimiX模型均已按照Apache 2.0协议公开发布,供公众使用。
4441
热度
许愿开讲
PDF
解读
OmniGen2: Exploration to Advanced Multimodal Generation
2025年06月23日
在这项工作中,我们推出了OmniGen2,这是一种多功能且开源的生成模型,旨在为各种生成任务提供统一的解决方案,包括文本到图像生成、图像编辑以及上下文内生成。与OmniGen v1不同,OmniGen2为文本和图像模态分别设计了两个独立的解码路径,采用不共享的参数和解耦的图像编码器。这一设计使得OmniGen2可以在现有多模态理解模型的基础上进行构建,而无需重新适配VAE输入,从而保留原有的文本生成能力。为了支持OmniGen2的训练,我们开发了全面的数据构建流程,涵盖图像编辑和上下文内生成所需的数据。此外,我们还为图像生成任务引入了一种专门设计的反思机制,并基于OmniGen2构建了一个专用的反思数据集。尽管参数规模相对适中,OmniGen2在多个任务基准测试中仍取得了具有竞争力的结果,包括文本到图像生成和图像编辑。为了进一步评估上下文内生成(也称为主题驱动任务),我们引入了一个新的基准测试集OmniContext。在开源模型中,OmniGen2在一致性方面达到了最先进的性能水平。我们将发布模型、训练代码、数据集以及数据构建流程,以支持该领域的未来研究。项目页面:https://vectorspacelab.github.io/OmniGen2;GitHub链接:https://github.com/VectorSpaceLab/OmniGen2
4148
热度
许愿开讲
PDF
解读
Back to Basics: Let Denoising Generative Models Denoise
2025年11月17日
如今的去噪扩散模型并不以传统意义上的“去噪”方式进行工作,也就是说,它们并不会直接预测干净的图像。相反,神经网络预测的是噪声或含噪的数据。本文指出,预测干净数据与预测含噪数据在本质上是不同的。根据流形假设,自然数据应当位于一个低维流形上,而含噪数据则不然。基于这一假设,我们主张采用直接预测干净数据的模型,这使得看似容量不足的网络也能在非常高维的空间中有效运行。我们证明了仅使用像素作为输入的简单大尺寸图像块Transformer即可成为强大的生成模型:无需使用分词器(tokenizer)、无需预训练、也无需额外的损失函数。我们的方法在概念上无非就是“**纯图像Transformer**”,即我们所称的 **JiT**(Just image Transformers)。我们在ImageNet上以256和512分辨率、使用16和32的大图像块尺寸进行实验,取得了具有竞争力的结果——而在这些设置下,预测高维含噪量的方法可能会彻底失败。通过让网络回归到流形的基本原理,我们的研究回归本质,致力于在原始自然数据上建立一种自成一体的、基于Transformer的扩散建模范式。
2774
热度
许愿开讲
PDF
解读
OxyGent: Making Multi-Agent Systems Modular, Observable, and Evolvable via Oxy Abstraction
2026年04月28日
在复杂的工业环境中部署可投入生产使用的多智能体系统(MAS)仍面临诸多挑战,主要体现在可扩展性、可观测性以及自主演进能力等方面的固有局限。本文提出 OxyGent——一个开源框架,其核心创新在于两项关键技术:统一的“Oxy”抽象模型与“OxyBank”演进引擎。该统一抽象模型将智能体、工具、大语言模型(LLM)及推理流程统一封装为可插拔的原子化组件,从而支持类似乐高积木式的灵活系统构建,并实现对系统运行状态的非侵入式监控。为提升可观测性,OxyGent 引入了基于权限驱动的动态规划机制,以运行时动态生成的执行图替代僵化的预设工作流,进而提供自适应的可视化分析能力。此外,为支撑系统的持续演进,OxyBank 作为一个人工智能资产统一管理平台,可驱动自动化数据回传、智能标注以及模型与系统组件的协同演进。实证评估与多个真实工业场景案例表明,OxyGent 为多智能体系统提供了坚实、可靠且高度可扩展的基础架构。OxyGent 已依据 Apache License 2.0 协议完全开源,项目地址为:https://github.com/jd-opensource/OxyGent。
2472
热度
许愿开讲
PDF
解读