多模态表征已成为工业推荐系统的重要输入信息。在电商场景中,商品图片、标题等多模态内容蕴含着离散 ID 特征难以充分表达的商品语义。
通过建模这些内容信息,多模态表征能够增强模型的语义理解与泛化能力,从而为点击率(Click-Through Rate, CTR)预估带来稳定收益。工业推荐系统通常采用“预训练—应用”的两阶段范式引入多模态表征:预训练阶段基于业务场景的图文数据训练多模态编码器;应用阶段冻结编码器,离线推理生成商品表征,再将其作为特征接入 CTR 精排模型。然而,多模态预训练任务与下游点击预估在数据分布和优化目标上仍存在一定差异,预训练表征因而未必能够充分刻画与用户点击行为相关的细粒度偏好,这也为进一步优化留下了空间。
一种直接思路是联合训练多模态编码器与 CTR 精排模型,使预训练编码器能够利用点击标签进一步学习与 CTR 任务相关的知识。本文通过大规模工业实验发现,当基线编码器已具备较强的电商语义理解能力时,端到端多模态训练(End-to-End Multimodal Training,E2EM)在淘宝展示广告场景下并未产生额外收益。 进一步分析表明,原始 CTR 数据同时包含多模态语义因素与价格比较、位置偏差、误点击、兴趣疲劳等非多模态语义因素,因而可能向多模态编码器提供具有歧义的监督信号,且这类混合的监督信号较难仅从优化层面实现解耦。
基于上述观察,阿里妈妈展示广告 Rank 团队提出面向 CTR 预估任务的原生多模态表征学习范式 NMRL(Native Multimodal Representation Learning)。其采用 Mine-Then-Train 的两阶段流程:Mine 阶段通过训练多模态打标模型,从混合多种行为因素的 CTR 数据中挖掘能够归因于商品多模态内容、且与点击偏好对齐的高质量监督信号,从而在数据层面实现多模态监督与非语义行为因素的解耦;Train 阶段基于筛选得到的高质量三元组数据微调预训练编码器,学习面向 CTR 任务的原生多模态表征。NMRL 于 2026 年上线淘宝展示广告系统,取得 CTR +1.5%、RPM +0.5% 的线上收益。

论文标题:Native Multimodal Representation Learning for Click-Through Rate Prediction in E-Commerce Scenarios
录用会议:The 35th ACM International Conference on Information and Knowledge Management(CIKM 2026)
论文作者:Chao Yi、Feifan Yang、Jiawei Feng、Sishuo Chen、Zhangming Chan、Xiang-Rong Sheng、Han Zhu
论文链接:https://arxiv.org/abs/2608.24091
一、背景
工业 CTR 精排模型长期依赖离散 ID 特征建模用户与商品之间的交互关系。此类方法具有较强的记忆能力,但在冷启动和数据稀疏场景中泛化能力有限,也难以直接利用商品图片、标题等内容信息。近年来,多模态表征被广泛用于增强 ID-based CTR 精排模型,例如计算目标商品与用户历史行为之间的语义相似度、构建 Semantic ID,或作为连续特征与 ID Embedding 融合 [1-3]。
当前主流应用方式可概括为两阶段范式。预训练阶段使用特定业务场景中的多模态数据,通过对比学习等任务训练多模态编码器;应用阶段冻结编码器,离线抽取商品表征,并将其输入 CTR 精排模型。该方案将大规模多模态计算与 CTR 精排模型训练解耦,具有较好的工程稳定性。以淘宝展示广告系统为例,其采用基于语义感知对比学习(Semantic-aware Contrastive Learning,SCL)[1] 训练的多模态编码器提取表征,并应用于实际业务中取得显著增益。
尽管上述两阶段方案已取得显著增益,其预训练与下游应用仍相对独立:预训练任务主要建模商品内容之间的语义关系,未直接利用 CTR 数据及其优化目标。由于多模态语义相似性与用户点击偏好相关但并不等价,预训练表征与下游任务之间仍有进一步对齐的空间。为缩小这一差异,一种自然的思路是采用端到端多模态训练(End-to-End Multimodal Training,E2EM):将多模态编码器直接接入 CTR 精排模型,并通过 CTR Loss 联合优化二者,使编码器学习与点击偏好更加一致的表征。

图注:两阶段多模态应用范式与 E2EM 范式对比
本文首先研究如下问题:在已有高质量预训练多模态编码器的条件下,E2EM 能否进一步提升多模态表征在电商 CTR 预估任务中的效果?
二、发现
2.1 E2EM 未能进一步提升预训练多模态表征的效果
为检验 E2EM 能否在经过充分电商预训练的多模态编码器基础上进一步提升表征质量,本文首先在淘宝展示广告真实业务场景中开展大规模工业验证。实验采用已在线部署的 SCL 编码器作为 E2EM 的初始化编码器,并在保持 CTR 精排模型及多模态表征接入方式一致的条件下,对比冻结编码器与使用 CTR Loss 联合更新编码器时的模型效果。
实验数据覆盖一周内 8400 万用户、8800 万商品和 19 亿条样本。每条样本包含用户特征、目标商品特征、点击标签,以及目标商品和历史行为商品的图片与标题。多模态表征通过语义相似度建模和直接特征融合两种方式接入 CTR 精排模型。下图展示了使用 E2EM 编码器与冻结 SCL 编码器生成多模态表征时的 GAUC 差值曲线。结果表明,在我们的实验设置下,E2EM 未能在经过电商场景预训练的 SCL 编码器上带来进一步收益。

图注:使用 E2EM 编码器相比原 SCL 编码器的 GAUC 差值曲线
为进一步分析 E2EM 应用范围、优化器及学习率对实验结论的影响,本文开展了系统消融。由于在生产场景中反复进行 E2EM 训练的成本较高,相关实验转而在更轻量、同时包含“多模态 × 长序列”信息的开源数据集 Taobao-MM [2] 上完成。
对于 E2EM 的应用范围,我们采用三种设置:仅端到端更新目标商品侧编码器;在此基础上,通过 Memory Bank [4] 将 E2EM 表征同步应用于历史序列侧;同时端到端更新目标侧与历史序列侧编码器。下图展示了相应的实验结果。随着 E2EM 编码器的应用范围逐步扩大,模型效果持续下降。我们分析认为,E2EM 更新降低了原 SCL 编码器的表征质量;当这些质量退化的表征被应用于更大范围时,其对 CTR 预估的负面影响也会进一步放大。

表注:改变 E2EM 的应用范围的实验结果
对于 E2EM 的优化器及学习率,我们的实验覆盖 SGD、Adam、AdamW 三种优化器与三档学习率。实验结果如下图所示,在全部优化器与学习率组合中,最佳 E2EM 结果仍未超过基线。结果表明,上述现象并非仅出现在某一组训练范围或超参数设置下。

表注:不同优化器和学习率设置下的 E2EM 实验 GAUC 结果
在信息流电商场景,用户行为由多种因素共同决定。除商品图片与文本语义外,价格比较、误点击、展示位置偏差和兴趣疲劳等因素也会影响点击标签。例如,用户可能点击与历史兴趣语义差异较大的低价商品,也可能因兴趣疲劳而跳过高度相似的商品。下图展示了一些典型案例:

图注:用户的点击/未点击行为由多种因素共同决定,与用户历史兴趣语义相似度较低的商品可能被点击,而高度相似的商品也可能未被点击
为量化考察商品间多模态语义相似性在多大程度上能够解释用户点击行为,我们采用经过充分电商场景预训练的 SCL 表征 [1] 进行测量。该表征具备较强的电商语义理解与商品相似性判别能力,并已在淘宝展示广告的多类预估模型中取得显著收益。具体而言,我们计算目标商品与用户历史点击商品之间的语义相似度,分别以其均值和最大值作为预测分数,进而计算 GAUC(对应 MultiModal-Mean GAUC 和 MultiModal-Max GAUC)。具体计算方式如下图所示。

图注:MultiModal-Mean GAUC 与 MultiModal-Max GAUC 的计算方式
MultiModal-Mean GAUC 和 MultiModal-Max GAUC 分别为 0.541 和 0.536。这一结果从量化层面表明,用户的点击与未点击行为与商品间的多模态语义相似关系并非完全一致,仅依赖语义相似度不足以充分解释原始 CTR 数据。需要强调的是,这并不否定 CTR 数据中包含有价值的多模态信号,而是说明点击标签还混合了价格、展示位置等非语义因素,因而将其直接用于多模态编码器训练时,监督信号的纯净程度可能受到影响。
为避免上述 CTR 数据中的非语义因素干扰多模态表征学习,一个直接思路是进行端到端联合训练(即 E2EM):将多模态编码器(多模态分支)与基于 ID 特征的 CTR 精排模型(ID 分支)在 CTR 任务上共同优化,期望 ID 分支主要学习非语义因素,多模态分支则聚焦于多模态语义因素,从而在训练过程中自动形成分工。
然而,共享 CTR Loss 只根据最终点击预测误差进行反向传播,并不会判断当前样本应由哪个特征分支负责。即使 ID 特征能够拟合部分非语义行为,这些样本产生的梯度仍可能同步传播至多模态编码器,因此上述预期分工未必能够自然形成。
为检验 E2EM 是否形成了上述分工,我们从梯度层面衡量多模态编码器所接收监督信号的一致性。若 ID 分支能够有效吸收非语义因素,不同 CTR 样本对多模态编码器产生的梯度应较为一致;反之,若梯度方向高度不一致,则表明不同 CTR 样本对多模态编码器提出了不一致的优化要求,其中可能混合了非语义行为因素的影响。为此,我们固定多模态编码器参数并统计其最后一层 Transformer 在不同样本和 Batch 上的梯度方向,并与多模态语义监督占主导的 SCL 任务进行对比。其中,Avg Sim 1 表示同一批次内不同样本梯度的平均余弦相似度,Avg Sim 2 表示相邻批次平均梯度之间的余弦相似度;数值越低,说明不同样本或批次产生的梯度冲突越明显。

表注:SCL 与 E2EM 的样本间梯度一致性对比
上表展示了对应实验结果,SCL 的 Avg Sim 1 和 Avg Sim 2 分别为 0.144 和 0.849,而 E2EM 仅为 0.016 和 0.006。E2EM 的两项指标均接近 0,表明不同样本及相邻批次产生的编码器更新方向高度不一致。结合 2.1 中 E2EM 效果未达到基线的实验结果可以看出,在本文的联合训练设置下,引入 ID 分支后,多模态编码器仍然接收到了高度不一致的梯度信号,预期的分支间解耦效果尚未充分实现。
针对上述梯度不一致问题,一种可能的解决方案是在 CTR Loss 之外加入 SCL Loss,期望通过保留原有多模态语义学习目标,缓解 CTR 监督对编码器语义能力的破坏。然而,加入 SCL Loss 后,CTR GAUC 相较仅使用 CTR Loss 的 E2EM 进一步下降 0.17 个百分点,SCL Top-1 Accuracy 相较原始 SCL 编码器也下降 5 个百分点。两项指标均出现下降,表明简单增加语义正则既未改善 CTR 效果,也未能完整保留原有语义能力,反而会使编码器在点击偏好与多模态语义之间被动折中。一种可能的解释是,联合损失无法在样本层面识别哪些 CTR 行为能够由多模态语义解释,因而难以避免非语义监督信号影响共享编码器的更新。
综合上述分析,在本文研究的模型结构、数据场景与训练配置下,E2EM 在效果上存在局限性。导致这一局限性的原因为原始 CTR 标签并非完全多模态可归因,而端到端联合训练也尚未实现语义与非语义监督信号的有效解耦,因而难以为多模态编码器提供高质量监督。
三、方案
结合上述实验观察,我们选择从数据层面缓解这一信号耦合问题:先从 CTR 数据中识别并筛选可由多模态语义归因的用户偏好信息,再利用其构造数据并训练多模态编码器。原因是,与不同商品之间参数高度解耦的 ID Embedding 不同,多模态编码器以同一组共享参数为所有商品生成表征,因此对训练数据中的噪声更为敏感。无法由多模态语义解释的样本会产生梯度并更新共享的多模态编码器参数,进而影响其他商品的表征质量。因此,我们尝试在多模态编码器训练前对训练数据进行筛选。
我们提出面向 CTR 预估任务的原生多模态表征学习方法 NMRL(Native Multimodal Representation Learning)。NMRL 采用 Mine-Then-Train 两阶段流程。Mine 阶段首先训练多模态打标模型,用于从 CTR 数据中挖掘高质量监督信号;筛选得到的信号与点击偏好对齐、可归因于商品多模态内容,并包含现有 ID 特征与 SCL 表征尚未覆盖的增量信息,从而在数据层面减少非语义行为因素的干扰。Train 阶段利用筛选得到的高质量三元组微调预训练 SCL 多模态编码器,学习面向 CTR 任务的原生多模态表征。
3.1 Mine 阶段:高质量多模态监督信号挖掘
第一步:训练基于残差学习的多模态打标模型。
为了从原始 CTR 数据中识别与点击偏好相关、且能够由多模态内容解释的信号,我们首先训练一个多模态打标模型,用于估计商品之间的点击偏好相关性。我们基于 SCL 表征从用户历史行为序列中检索相关商品,并将目标商品分别与各检索商品组成商品对,再将双方的图片、标题等多模态内容输入打标模型。
打标模型需要学习 CTR 数据中的点击偏好,但直接更新 SCL 编码器可能使非语义因素破坏其已有的细粒度电商语义能力。为在学习点击偏好的同时保留原有语义能力,我们借鉴 TaskRes [5] 的残差学习思想来设计打标模型结构:冻结 SCL 编码器,仅通过新增的残差参数学习 CTR 数据中的点击偏好。下图展示了打标模型的具体结构,该模型包含 Residual Tuning 和 Click Relevance Scoring 两个模块:
Residual Tuning 模块: 在保持原有 SCL 语义表征的基础上,学习面向 CTR 任务的增量偏好信息。该模块首先使用冻结的 SCL 编码器提取商品表征,再通过 RK-Means [3] 为商品分配 Semantic ID,并从可学习的 SID Decode Codebook 中检索对应的 SID Embedding,作为 CTR 任务相关的残差与原始 SCL 表征融合。Codebook 采用零初始化,使融合表征在训练初始阶段与原始 SCL 表征保持一致,并在后续训练中逐步学习点击偏好。 Click Relevance Scoring 模块: 根据 Residual Tuning 模块输出的两件商品的融合表征计算点击相关性分数,可采用 MLP 或归一化内积实现。该分数随后通过语义相似度序列建模模块(如 SimTier [1]、SA-TA [2])接入 CTR 精排模型,CTR Loss 的梯度由此反向传播至打标模型参数,实现端到端训练。
这一设计具有三方面优势。首先,点击偏好由参数相对解耦的 SID Decode Codebook 承载,原始 CTR 数据的梯度不会更新共享的 SCL 编码器,从而较好地保留其细粒度电商语义理解能力。其次,Semantic ID 来源于多模态语义聚类,这一归纳偏置使 Codebook 学到的增量偏好信息具有较强的多模态可解释性。最后,Semantic ID 可预先离线计算并存储,后续训练仅需执行 Codebook 查表,无需重复进行大规模多模态编码,因而额外训练成本较低。

图注:打标模型结构示意图
将打标模型分数作为新增特征接入已有 CTR 精排模型后,GAUC 提升 0.13%,表明该分数捕获了现有 ID 特征与 SCL 表征尚未覆盖的增量偏好信息。我们进一步进行案例可视化以分析打标模型学习到的具体知识:在下图的第一个案例中,SCL 表征关注衣服版型与领口相似性,而打标模型更关注条纹图案;在第二个案例中,相较于材质纹理,打标模型更关注行李箱尺寸。这说明打标模型更加关注对用户点击偏好影响更大的商品属性。

图注:SCL 多模态相似度与打标模型点击相关性分数的案例比较
第二步:挖掘高质量三元组。
尽管打标模型能够捕获现有 ID 特征与 SCL 表征之外的增量信息,其仍存在两方面局限:一方面,打标模型直接基于原始 CTR 数据训练,部分商品对的点击相关性分数的准确性仍可能受到非多模态因素影响;另一方面,点击偏好仅通过 SID Embedding 学习,而 SID Embedding 本质上仍是 Embedding 参数,在训练过程中不直接感知商品的原始图片与文本,因此所学知识的泛化能力有限。为此,我们过滤掉打标模型输出的低置信结果,并根据打标模型的输出构造用于微调 SCL 编码器的多模态训练数据。
具体而言,我们首先使用 SCL 表征从用户历史行为中检索与目标商品最相似的 Top-K 商品,并过滤多模态相似度低于阈值 τₘ 的商品对,以保证候选样本具备基本的语义相关性。随后,将具有相同目标商品的候选对组合为三元组(Target Item, Item 1, Item 2),并保留满足以下约束的样本:

第一项约束保留现有表征难以区分二者的样本,以及在现有表征下 Item 2 与 Target Item 更相似的样本;第二项约束要求 Item 1 与 Target Item 的打标分数显著高于 Item 2,以打标模型的预测置信度过滤噪声数据。
第二项约束建立在“打标分数间隔越大,打标模型标签越可靠”的假设上。为验证这一假设,本文首先筛选SCL表征难以区分的样本(本实验中定义为Item 1和Item 2与Target Item的SCL表征相似度绝对差小于0.05的三元组)。在此基础上,将 Item 1 与 Target Item 的打标分数减去 Item 2 与 Target Item 的打标分数大于 0.15 的样本定义为高置信三元组,大于 0 而小于 0.05 的样本定义为低置信三元组,并分别抽取 1000 条。每个样本均由多名标注人员分别判断用户点击 Target Item 后更可能继续点击 Item 1 还是 Item 2,并以多数投票结果作为最终标签,以反映用户的普遍点击偏好。高置信组中 Item 1 的胜率达到 85%,而低置信组仅为 42%,验证了打标分数间隔作为筛选依据的有效性。最终我们得到千万规模的高质量三元组。
3.2 Train 阶段:原生多模态编码器训练
基于 Mine 阶段筛选得到的高质量三元组,在 Train 阶段我们使用三元组 Margin Loss 微调 SCL 编码器,引导 SCL 编码器学习与用户点击偏好更一致的相似度排序:

此外,我们在训练过程中额外引入 SCL 对比学习损失作为正则项,以防止编码器遗忘预训练阶段获得的细粒度电商语义能力:

最终训练目标为:

完成训练后,我们使用训练后的多模态编码器离线提取各商品的表征,由于该方法不修改 CTR 精排模型的其他模块,因此可以直接复用 SCL 编码器原有的多模态表征线上部署链路。
四、离在线实验效果
4.1 离线实验
我们基于淘宝展示广告系统一个月的数据开展离线实验,基线 CTR 精排模型已接入经过充分电商预训练的 SCL 表征。直接加入打标模型分数后,GAUC 和 AUC 分别提升 0.13% 和 0.08%,说明打标模型学习到了基线模型尚未充分建模的用户点击偏好信息;而进一步使用挖掘得到的高质量三元组微调 SCL 编码器后,GAUC 和 AUC 增益提升至 0.22% 和 0.11%,验证了 NMRL 方法的 Mine-Then-Train 流程的有效性。

表注:NMRL 离线实验结果
4.2 在线 A/B 实验
🏷️ 关于我们
阿里妈妈展示广告Rank团队负责核心商业化预估算法的迭代和创新研发,致力于利用人工智能前沿技术打造超大规模体量下的创新预估解决方案。
团队在模型参数Scaling (EST)、用户兴趣建模及终身序列建模 (DIN,DIEN,SIM,MUSE)、多场景建模 (STAR)、CVR 预估 (ESMM, DEFER, HDR, MAL)、多模态建模 (SimTier, TaobaoMM, NMRL) 等技术方向上持续深耕,用持续的技术突破和创新带动业务增长。近年在KDD、SIGIR、CIKM、WSDM等学术会议上发表多篇论文。欢迎感兴趣同学加入我们~
📎 点击下方阅读原文进入团队主页:https://displayrank.github.io/Homepage/
📮 投递简历邮箱:zhangming.czm@taobao.com
参考文献
[1] Xiang-Rong Sheng et al. Enhancing Taobao Display Advertising with Multimodal Representations: Challenges, Approaches and Insights. CIKM, 2024.
[2] Bin Wu et al. MUSE: A Simple Yet Effective Multimodal Search-Based Framework for Lifelong User Interest Modeling. CIKM, 2026.
[3] Xinchen Luo et al. QARM: Quantitative Alignment Multi-Modal Recommendation at Kuaishou. CIKM, 2025.
[4] Xintian Han et al. LEMUR: Large scale End-to-end MUltimodal Recommendation. CIKM, 2026.
[5] Tao Yu et al. Task Residual for Tuning Vision-Language Models. CVPR, 2023.

也许你还想看
关注「阿里妈妈技术」,了解更多~
内容中包含的图片若涉及版权问题,请及时与我们联系删除



评论
沙发等你来抢