MOON 围绕「商品多模态表征学习」完成了三代范式升级:1.0 任务统一,以 MLLM 统一建模商品图文,构建统一表征底座、支撑多类任务;2.0 模态协同,协调图文学习、缓解模态冲突;3.0 属性推理,先拆解属性、再生成表征,从「直接编码」走向「先推理、再表征」。目前 MOON 已规模化应用于超过 10 个下游场景,正成为服务阿里妈妈及淘天业务的多模态基础能力。
1. 背景与思考
在电商搜索中,决定用户点击与购买的,往往不是商品“像不像”,而是细节“对不对”。以一件红色针织衫为例,系统不仅要识别“针织衫”“红色”等整体语义,还要进一步理解蕾丝领、蝴蝶结、纽扣样式和局部装饰等细粒度属性。两件商品即使在品类、颜色和版型上高度相似,也可能因为几个关键细节的差异,面向完全不同的用户偏好与购买需求。这正是电商多模态理解的核心难点:粗粒度信息决定商品“看起来是否相似”,品牌、材质、型号、领型、图案与款式元素等细粒度属性,则决定商品“是否真正匹配”。
当大量商品在品类、颜色和轮廓上高度相似时,真正区分同款与相似款的,往往是 Logo、纽扣、领口、材质和图案等细节。如图 1 所示,Query、同款商品与相似商品在整体上十分接近,现有模型却容易被颜色、轮廓或背景等强信号主导,忽略弱而关键的局部属性。如何让表征不仅能识别“整体像不像”,还能判断“细节是否匹配”,是电商多模态理解需要解决的关键问题。

图 1. Query、同款商品与相似商品的细粒度属性对比
要准确理解并保留关键细节,模型需要逐步解决图像与文本如何对齐、如何融合,以及如何进一步解析细粒度语义等问题。沿着这条主线,多模态表征学习大致经历了三个技术阶段:
跨模态语义对齐:从独立编码到共享空间
早期双流架构采用相互独立的视觉编码器与文本编码器,将图像和文本投射至共享语义空间,建立跨模态的粗粒度关联。然而,这类方法的模态交互通常止步于表征空间的后期对齐,难以充分刻画同一商品中多张图片与多段文本相互补充的复杂语义结构。
深层多模态融合:从后期对齐到统一建模
以 MLLM 作为统一编码器,打破传统双流架构中图像与文本独立编码、后期对齐的建模范式,使纯图像、纯文本和图文组合等不同形态的输入,都能在同一模型框架下完成编码与深层跨模态交互,实现从“表征对齐”向“语义融合”的跃迁。
细粒度语义解构:从内容感知到推理表征
进一步释放 MLLM 的生成与推理能力,引导模型在表征提取前,对多模态输入中的实体、属性、关系、场景及意图等细粒度语义进行显式解析,并在此基础上构建统一表征,使表征从对图文内容的直接压缩,进一步拓展为对语义要素及其关联结构的显式建模。
从跨模态对齐、深层融合到细粒度推理,MOON 系列也沿着这一技术路径持续演进,并在电商场景中依次探索了以下三个核心问题:
能否用一套表征服务多类任务? 能否让不同模态的信息在统一框架下有效协同? 能否在紧凑向量中保留真正决定商品匹配的关键细节?
2. MOON 系列演进
围绕上述三个核心问题,MOON 1.0、2.0 与 3.0 分别从任务统一、模态协同和属性推理三个方向给出解决方案,逐步构建起面向电商场景的通用多模态表征体系。

图 2. MOON 系列三代演进路线
2.1 MOON 1.0:从任务专用走向统一底座
MOON 1.0 将生成式 MLLM 引入电商多模态表征学习,通过图搜、文搜和商品搜等多类检索任务的联合训练,构建跨任务共享的统一语义空间,验证了“一套表征服务多类任务”的可行性。但在实践中,MOON 1.0 也出现了明显的“跷跷板效应”:随着训练数据配比的调整,一类任务的增益往往以另一类任务的退化为代价。这表明,简单混训虽然实现了任务层面的统一,却难以协调不同模态和任务之间的学习节奏。如何在共享表征空间中减少能力竞争、实现图文模态的稳定协同,也成为 MOON 2.0 需要解决的核心问题。
WSDM'26:MOON: Generative MLLM-based Multimodal Representation Learning for E-commerce Product Understanding (https://arxiv.org/abs/2508.11999)
2.2 MOON 2.0:从模态不平衡走向模态协同
MOON 2.0 进一步聚焦图文模态的动态平衡,通过 Modality-driven MoE、Dual-level Alignment 和 Image-text Co-augmentation,分别从模型架构、训练目标与数据构造三个层面协调不同模态的学习过程,缓解单一模态主导及多任务间的“跷跷板效应”。然而,模态协同主要解决图文信息能否稳定融合的问题;当商品在品类、颜色和整体轮廓上高度相似时,模型仍然难以捕捉真正决定匹配的关键细节。
CVPR'26:MOON2.0: Dynamic Modality-balanced Multimodal Representation Learning for E-commerce Product Understanding (https://arxiv.org/abs/2511.12449)
2.3 MOON 3.0:从全局表征走向属性推理
现有 MLLM 表征方法大多仍将大模型视为特征提取器:输入图像与文本后,通过提取最后一个 Token 或对全部 Token 进行平均池化,直接生成全局向量。在这种“直接编码”范式下,品类、颜色和主体轮廓等显著语义往往占据主导,而材质、领口、纽扣、图案和局部装饰等弱而关键的细节,则容易在压缩过程中被稀释。换言之,模型直接回答了“如何将商品编码为一个向量”,却没有先理解:
商品由哪些关键属性构成? 哪些属性真正决定商品之间的差异? 哪些属性更有助于区分检索中的正负样本?
基于这一判断,MOON 3.0 将表征构建方式从“直接编码”推进为“先拆解属性,再生成表征”,推动 MOON 系列从“任务统一”“模态协同”进一步走向“属性推理”。
但明确方向并不意味着问题已经解决。要让属性推理真正服务于表征学习,还需要应对三个新的技术挑战:推理过程越长,原始图文信息越容易被稀释;对教师推理的模仿越充分,也未必越有利于区分检索中的正负商品;网络层数越深,细粒度局部信号越容易衰减。针对上述挑战,MOON 3.0 分别给出了对应的解决方案。
ACM MM'26:MOON 3.0: Reasoning-aware Multimodal Representation Learning for E-commerce Product Understanding (https://arxiv.org/abs/2604.00513)
3. MOON 3.0
3.1 方法
MOON 3.0 Pipeline 如图 3 所示。对于以图像、文本或图文组合形式呈现的 Query、正样本和负样本,模型不再直接生成全局向量,而是先通过自回归推理显式解析输入内容,将其拆解为结构化、多维度的属性序列;再结合原始内容与属性推理过程生成统一表征,实现从“直接编码”到“先推理、再表征”的范式转变。针对属性推理带来的原始信息稀释、教师推理与检索目标不一致,以及局部细节逐层衰减三个问题,MOON 3.0 分别设计了 Multi-head Modality Fusion、Joint Contrastive and Reinforcement Learning、Fine-grained Residual Enhancement 三个关键模块,具体如下:

图 3. MOON 3.0 整体框架
Multi-head Modality Fusion:如图 4 所示,MOON 3.0 以推理表征为基础,根据各模态信息与推理语义的一致性,动态融合原始视觉特征、文本特征及图文交互特征;同时,通过多头机制在不同语义子空间中学习差异化的融合权重。这相当于让模型在“想完之后,再有选择地回看原始图文信息”,补充推理过程中可能被稀释的细节,最终形成兼具高层推理语义与细粒度信息的统一表征。 
图 4. Multi-head Modality Fusion 模块
Joint Contrastive and Reinforcement Learning:SFT 能够帮助模型学习教师提供的属性结构与生成规范,但这类监督主要关注属性是否正确、完整,无法直接判断哪些属性更有助于区分检索中的正负样本。为此,MOON 3.0 联合使用对比学习与强化学习:对比学习直接约束表征空间,拉近 Query 与正样本的表征,拉远 Query 与负样本的表征;强化学习采用 GRPO(Group Relative Policy Optimization),从输出格式、推理长度、检索效果和属性质量四个维度构建奖励,将最终检索表现反馈至属性推理过程。通过二者协同,模型不仅能够学习“如何正确生成属性”,还能进一步探索“哪些属性更有利于区分正负样本”,从而生成更具检索判别力的属性推理结果,并提升最终表征质量。 Fine-grained Residual Enhancement:通过细粒度残差增强模块 FIRE,让关键局部信息贯穿视觉编码、跨模态融合与语言解码的完整前向过程。 Visual Encoding:针对电商图片背景复杂、不同图像 patch 所承载的信息价值不均的问题,FIRE 在视觉编码器中引入 patch 级门控残差。模型结合浅层局部特征与深层语义,自适应突出商品主体、纹理和设计元素等关键区域,降低背景噪声与无关 patch 的干扰; Cross-modal Fusion:将视觉编码器不同层级的特征分别投影,并注入 LLM 的若干早期层,使局部纹理、特定设计模式与整体商品语义以多粒度方式参与图文融合,为后续属性拆解提供更完整的视觉依据; Language Decoding:通过长程残差连接,将浅层多模态线索重新注入 LLM 深层表示,缓解关键图文细节在长序列推理和深层网络传播过程中的持续衰减。 移除 Reasoning:各项指标出现最明显的下降,其中"图搜文" R@10 从 42.95% 降至 17.12%(-25.83pt),商品分类与属性预测准确率分别从 86.40%、49.92% 降至 57.52%、34.21%(-28.88pt / -15.71pt)。这表明显式属性推理是 MOON 3.0 实现细粒度商品理解的核心基础; 移除 Multi-head Modality Fusion:五类检索任务均出现明显下降,其中"文搜图" R@10 从 38.93% 降至 31.95%(-6.98pt),说明对原始图文信号的自适应补充能够有效缓解长链推理中的信息稀释; 移除强化学习(GRPO):属性预测准确率从 49.92% 降至 41.54%(-8.38pt),多项跨模态检索指标同步下降,验证了强化学习对于突破 SFT 模仿瓶颈、探索更优属性推理策略的重要作用; 移除 FIRE:商品分类与属性预测准确率分别下降至 80.33% 和 42.22%(-6.07pt / -7.70pt),检索性能也出现一致退化,表明在完整前向过程中持续保留细粒度信息,是提升表征判别力的重要保障。 
MOON 1.0: 聚焦异构任务统一建模,提出基于生成式 MLLM 的电商多模态表征框架,通过多任务联合学习将图搜、文搜、商品搜、分类与属性预测纳入统一语义空间,验证了"一套表征服务多类任务"的技术可行性。(WSDM'26) MOON 2.0: 聚焦动态模态平衡,通过 Modality-driven MoE、Dual-level Alignment 与 Image-text Co-augmentation 三项关键设计,有效缓解多任务联训中的模态主导偏移与跷跷板效应,推动统一表征从"任务整合"迈向"模态协同"。(CVPR'26) MOON 3.0: 聚焦推理感知的多粒度语义表征,通过 Multi-head Modality Fusion、Joint Contrastive and Reinforcement Learning 与 FIRE,使模型在生成表征前先显式拆解商品属性,推动表征从"隐式全局编码"迈向"显式细粒度推理"。(ACM MM'26) 大模型驱动的自动化数据引擎: 以 MLLM 贯穿样本生产、质量判别与问题归因全过程:结合商品内容、结构化属性和业务知识,自动生成多模态 Query、正样本及属性冲突型困难负样本;从海量曝光、点击、成交和图搜行为中挖掘真实 Query—商品关系,并通过 MLLM-Judge、置信度校准与人工抽检过滤伪负样本和噪声标签。同时,将模型 Bad Case、训练损失与不确定性反馈至数据侧,定向补充长尾类目、细粒度属性和复杂意图样本,形成“数据生产—模型训练—效果评测—问题归因—数据反哺”的持续迭代闭环。 感知—推理—生成的深度一体化: 在属性推理的基础上,MOON 将进一步把商品理解与用户意图结合起来。模型不仅要识别商品是什么、具备哪些属性,还要理解用户真正关心哪些条件,并据此判断商品满足了哪些需求、哪些细节存在偏差,以及不同候选商品的关键差异。由此,MOON 将从回答“商品是什么、彼此像不像”,进一步走向理解“用户想要什么、商品为什么匹配、不同商品究竟差在哪里”,形成面向电商搜索的推理型表征基座。
3.2 实验结果
为系统评估推理感知多模态表征在电商场景下的综合能力,我们构建了 MBE 3.0 基准数据集(如图 5 所示)。MBE 3.0 来源于真实电商搜索行为日志,在 Query、正样本和负样本三元组的基础上,进一步为每件商品构建图像属性、文本属性与多模态属性三类标注,作为训练监督。整个数据集包含 769 万条训练样本和 91 万条高质量测试样本,支持图搜、文搜、商品搜、商品分类与属性预测等多类任务。

图 5. MBE 3.0 基准数据集构建流程
为全面验证 MOON 3.0 的方法有效性,在完成统一表征学习后,我们不针对各下游任务进行额外微调,直接在 MBE 3.0、M5Product 和 Fashion200K 三个数据集上进行了零样本(Zero-shot)评测。如图 6 的雷达图所示,MOON 3.0 在三个数据集涵盖的多模态检索、商品分类和属性预测任务上均取得领先表现,表明推理感知表征不仅能够提升细粒度商品理解能力,也具备良好的跨任务与跨数据集泛化能力。

图 6. 三个数据集上的 zero-shot 表现
如表 1 所示,在 MBE 3.0 基准测试集上,MOON 3.0 全面超越了 SigLIP2、Qwen3-VL-Embedding、GME-Qwen2VL、MM-Embed 等通用多模态表征,也优于 FashionCLIP、CASLIE-S、MOON 1.0 和 MOON 2.0 等电商领域专用表征。
以检索任务为例,MOON 3.0 在"图搜商品""文搜商品""商品搜商品""图搜文"和"文搜图"五类任务上的 R@10 分别达到 56.39%、48.10%、60.30%、42.95% 和 38.93%。相比 MOON 2.0,MOON 3.0 在所有检索任务上均实现同步提升,其中"文搜商品""图搜文"和"文搜图"分别提升 12.77、10.48 和 10.71 个百分点,体现了显式属性推理对跨模态细粒度匹配的显著作用。在商品分类与属性预测任务中,MOON 3.0 的准确率分别达到 86.40% 和 49.92%,相比 MOON 2.0 提升 19.13 和 13.56 个百分点。这进一步表明,"先拆解属性、再生成表征"的推理范式能够将款式元素等关键语义更充分地保留在表征中,从而稳定泛化至不同下游任务。

表 1. MOON 3.0 在 MBE 3.0 基准上的性能表现
在跨数据集评测中,MOON 3.0 在 M5Product 和 Fashion200K 两个公开基准上同样取得领先表现(表 2),验证了其在不同数据分布下的良好泛化性。

表 2. 跨数据集(M5Product、Fashion200K)泛化性能对比
为验证各核心模块的贡献,我们进行了详尽的消融实验,结果如表 3 所示:
表 3. 消融实验结果
3.3 可视化分析
为直观展示 MOON 3.0 的细粒度商品理解与推理能力,我们对多模态商品搜商品任务的检索结果进行了可视化,并将模型生成的中间属性与每个 Query、候选商品一同展示。
如图 7 所示,对于保温杯 Query,MOON 3.0 不仅能够识别"Insulated Tumbler"这一商品类别,还能进一步抽取"Beige、Brown"等颜色以及"Dog Motif"等设计元素。排名第 1 的商品与 Query 在类别、配色和图案等关键属性上高度一致;随着排名下降,候选商品在颜色和装饰图案等关键属性上的匹配度逐步降低,检索排名与属性匹配程度基本一致。
在手机壳与卫衣等案例中,模型同样能够识别手机型号、图案主题、拼接设计和衣领样式等决定商品匹配的局部属性。相比只输出一个不可解释的相似度分数,MOON 3.0 的中间推理结果能够进一步回答"为什么这个商品排在前面",使统一表征兼具判别性与可解释性。

图 7. 商品搜商品检索结果与中间属性推理可视化
4. 总结与展望
4.1 总结
MOON 系列围绕电商多模态表征的核心挑战持续演进,完成了从"任务统一"到"模态协同",再到"属性推理"的连续跨越,为构建下一代通用电商多模态表征基座奠定了技术基础。
值得一提的是,在发布 MOON 2.0 时,我们曾明确提出「多粒度语义表征」与「感知—推理—生成一体化」两条后续演进路径。MOON 3.0 延续这一技术构想,提出属性推理驱动的表征学习范式:一方面,通过显式解析商品的结构化属性,协同建模全局语义与细粒度属性;另一方面,将推理与生成机制融入表征构建过程,推动商品表征从直接编码向推理的增强范式演进。
4.2 展望
展望未来,MOON 系列将围绕数据与模型两条主线持续演进:
🏷️ 关于我们
阿里妈妈搜索广告多模态团队负责多模态技术的研发与应用,重点探索多模态大模型、智能创意、图像搜索和多场景建模等方向。近年来,团队在 CVPR、ACM MM、KDD、SIGIR、WSDM 等学术会议上发表多篇论文,真诚欢迎具备 CV、NLP 或推荐系统相关背景的同学加入!
📮 简历投递邮箱:wanxian.gwx@taobao.com

相关阅读
MOON 1.0:视觉感知与认知跃迁:电商多模态表征建模新范式 | 搜索广告AI大模型创新实践
MOON 2.0:CVPR'26 | 从任务统一到模态协同:电商通用多模态表征MOON 2.0也许你还想看
关注「阿里妈妈技术」,了解更多~
内容中包含的图片若涉及版权问题,请及时与我们联系删除



评论
沙发等你来抢