EMNLP(Conference on Empirical Methods in Natural Language Processing)是自然语言处理领域顶级国际会议之一,其涉及领域包括但不限于机器翻译、文本生成、文本分类、信息抽取、问答系统、语言模型等研究方向。南京大学自然语言处理研究组共有六篇学术论文被EMNLP2026录用,其中,3篇主会,3篇findings。以下为本次六篇录用论文的介绍:
01
题目:Unlocking Fine-Grained Translation Quality Estimation in LRMs through Mutually Boosting Implicit and Explicit Reasoning
作者:Renfei Dang, Xinye Wang, Zhejian Lai, Weilu Xu, Shimin Tao, Daimeng Wei, Min Zhang, Shujian Huang
会议类型:Main
单位:南京大学,华为翻译中心
链接:https://arxiv.org/abs/2605.31378
论文简介:
大型推理模型(LRMs)在细粒度翻译质量评估(QE)上仍然表现不佳。我们认为,LRMs 已拥有强大的多语言能力,而当前的核心挑战源于细粒度 QE 任务本身的内在学习难度。
本文提出 RIEQE(Reasoning both Implicitly and Explicitly for QE),一个简单的两阶段训练框架,使隐式和显式推理能力实现互相促进。其中显式推理指的是使用推理链的推理过程,模型通过逐token生成进行推理;隐式推理指的是不使用推理链的推理过程,模型在逐层计算过程中进行推理。为使隐式推理可行,我们首先将复杂的 QE 任务分解为若干直接明了的子任务。在此基础上,我们的两阶段方法包括:(1) NonThinking-SFT,即不包含思维链的监督微调,以直接增强模型的隐式推理倾向和能力;(2) Thinking-RLVR,即采用可验证奖励的标准强化学习,随后加强显式推理。
在 WMT 测试集上,基于 Qwen3-4B-Thinking-2507 的 RIEQE 在显式推理性能上超越了所有基线模型,同时其隐式推理能力也与当前最优的QE模型相当。我们进一步通过实验分析,提供了隐式推理与显式推理相互促进的证据,展示了它们如何以双向方式彼此受益。
02
题目:GRRM: Group Relative Reward Modeling for Machine Translation
作者:Sen Yang, Shanbo Cheng, Lu Xu, Jianbing Zhang, Shujian Huang
会议类型:Main
单位:南京大学,新加坡科技设计大学
链接:https://arxiv.org/abs/2602.14028
论文简介:
在机器翻译中,利用强化学习提升大语言模型性能的关键,在于提供准确且具有区分度的奖励信号。现有方法通常采用 Pointwise Quality Metrics(PQM),独立地为每个候选译文给出奖励分数,这种方法难以捕捉同组候选之间的细粒度差异,在复杂样本上还容易出分数饱和现象,无法为 GRPO(Group Relative Policy Optimization)训练提供有效的反馈信号。
为此,我们提出 Group Quality Metric(GQM)范式,并根据这一范式设计了组相对奖励模型(GRRM)。GRRM 联合分析同一组候选译文,通过比较其语义、表达和语言现象,输出相对排序与分数,从而更准确地评估候选质量。实验表明,GQM 在多种模型、语言和数据集上对候选的区分能力均优于传统 PQM;在包含习语、俚语和专业术语的挑战集上,排序准确率最高提升 30% 至 40%,并展现出良好的跨语言泛化能力。
我们进一步将 GRRM 接入翻译模型的 GRPO 训练,优化后的翻译模型在复杂中英翻译任务上,性能达到与 DeepSeek-R1-0528 相当的水平。结果表明,GRRM 显著改进了翻译质量,同时促进了翻译模型的推理能力涌现,并缓解传统奖励模型中的 Reward Hacking 问题。


03
题目:MultiModal Code-Switching: Interleaving Visual Objects into Language for Explicit Object-Level Alignment
作者:Changhao Xiang, Shangyu Xing, Zhen Wu, Jianbing Zhang, Xinyu Dai
会议类型:Main
单位:南京大学
链接:https://arxiv.org/abs/2608.11167
论文简介:
现有多模态大语言模型(MLLM)主要依赖图像——文本对进行模态对齐预训练,将全局图像表征与较长的文本描述进行匹配。然而,这种图像级对齐方式存在指代歧义:模型难以从全局表征中推断多个视觉对象与文本实体之间的对应关系,因而导致数据利用效率低、语义对齐效果欠佳。
为解决这一问题,我们提出多模态语码转换(MultiModal Code-Switching,MMCS),一种提供显式对象级监督的新型预训练范式。受语言学中语码转换现象的启发,MMCS将文本实体替换为与之对应的视觉对象,使视觉与语言信息在同一序列中交错呈现,从而强化局部视觉——语言语义对齐。进一步地,我们构建了一套可扩展的数据合成流程,生成了包含77.3万条样本、具有准确对象——实体对应关系的预训练数据集。
实验结果表明,MMCS显著提高了数据效率:仅使用5万条样本,即可达到或超过使用60万条图像——文本对训练的性能。此外,在不同模型规模下,MMCS均能稳定提升模型的视觉定位与感知能力。

04
题目:PATS: Process-Level Adaptive Thinking Mode Switching
作者:Yi Wang, Junxiao Liu, Shimao Zhang, Jiajun Chen, Shujian Huang
会议类型:Findings
单位:南京大学
链接:https://arxiv.org/abs/2505.19250
论文简介:
当前的大语言模型(LLMs)通常无论问题难易程度如何,都对所有问题采用固定(简单或复杂)的推理策略。这种对任务与推理过程复杂度差异的忽视,导致了性能与效率之间的失衡。现有方法试图通过免训练的"快—慢"思考系统切换来处理不同难度的问题,但受限于粗粒度的解答级策略调整。为解决这一问题,我们提出了一种新的推理范式:过程级自适应思维模式切换(PATS),使 LLM 能够根据每一步的难度动态调整其推理策略,从而优化准确率与计算效率之间的平衡。我们的方法将过程奖励模型(PRMs)与束搜索(Beam Search)相结合,并基于数据驱动方法得出的阈值,引入了渐进式模式切换和坏步骤惩罚机制。我们在多种数学与非数学基准上,跨越不同的模型家族、模型规模以及不同质量的 PRM 进行了实验,结果表明:我们的方法在保持适度 token 用量的同时取得了较高的准确率。本研究强调了过程级、难度感知的推理策略自适应的重要性,为 LLM 的高效推理提供了有价值的见解。

05
题目:Rubric-as-Experts: Case-Specific MQM Rubrics for Translation Error Span Detection
作者:Weilu Xu, Yunzhi Shen, Xinye Wang, Ranfei Dang, Shujian Huang
会议类型:Findings
单位:南京大学
链接:https://arxiv.org/abs/2606.21559
论文简介:
当前基于大语言模型(LLMs)的片段级翻译质量估计(span-level QE)通常基于 MQM(Multidimensional Quality Metrics)进行评估,但不同翻译样本往往使用相同的 rubric。已有工作尝试根据具体样本动态生成 rubric,但自由生成容易产生模板化套话和冗余内容,也难以稳定控制评价范围。我们发现,在 MQM 体系内,提供给模型的错误类型和数量会直接影响错误识别的表现:增加错误类型数量能够提高错误覆盖,但也可能带来更多误报,而且不同样本适合的评价范围并不相同。基于这一观察,我们提出一种动态 rubric 框架,在保持 MQM 错误分类体系不变的前提下,针对每个源句—译文对选择相关的主类别,并确定所包含的子类型数量,从而构建更适合当前样本的评价空间。WMT span-level QE 基准上的实验表明,该方法在不同模型规模下均能提升 F1 和 MCC,说明在统一的 MQM 体系内根据具体样本调整 rubric,有助于提升 LLM 的片段级错误定位能力。

06
题目:AdaR: A Framework for Equipping LLMs with Adaptive Reasoning
作者:Zhejian Lai, Xiang Geng, Zhijun Wang, Bai Yang, Jiahuan Li, Rongxiang Weng, Jingang Wang, Xuezhi Cao, Xunliang Cai, Shujian Huang
会议类型:Findings
单位:南京大学,美团
链接:https://arxiv.org/abs/2510.04617
论文简介:
数学推理能力是衡量大语言模型(LLM)智能水平的重要指标。然而,现有大语言模型在鲁棒性和泛化能力方面仍存在明显不足。本文将这一问题归因于“虚假推理”:模型的推理过程往往受到表层相关性的驱动,因而容易盲目复现训练数据中记忆的模式。与之相对,我们认为,理想的大语言模型应具备自适应推理能力,即能够在问题模板与相应的推理过程之间建立正确关联。
为此,我们提出 AdaR 框架。该框架通过改变变量取值,自动合成与原始问题逻辑等价的新问题,并采用基于可验证奖励的强化学习(Reinforcement Learning with Verifiable Rewards,RLVR)对模型进行训练,以抑制虚假推理,促进自适应推理。为保证合成数据的质量,我们首先从原始问题中提取解题逻辑,随后通过代码执行生成对应答案,最后进行合法性检查。
实验结果表明,AdaR 能够以较高的数据合成效率显著提升模型的数学推理能力。此外,即使是 Qwen3-4B-Thinking-2507 等先进的大语言模型,在推理的鲁棒性和泛化能力方面仍存在不足,而 AdaR 能够有效缓解这些问题。


内容中包含的图片若涉及版权问题,请及时与我们联系删除



评论
沙发等你来抢