EMNLP 2026



EMNLP 2026, The 2026 Conference on Empirical Methods in Natural Language Processing, 计算机语言学和自然语言处理领域的顶级国际会议,是CCF推荐的B类国际学术会议,在相关领域享有较高的学术声誉。EMNLP 2026 计划于2026年10月24日至10月29日在匈牙利布达佩斯召开。

近日,EMNLP 2026 公布了论文录用结果。复旦大学数据智能与社会计算实验室共 13 篇论文被录用,其中 6 篇主会长文, 7 篇Findings。




01

CommunityBench: Benchmarking Community-Level Alignment across Diverse Groups and Tasks

作者:林嘉昱,魏忠钰

类别:主会长文

摘要:大语言模型(LLM)对齐旨在使模型行为符合人类价值观。现有对齐策略主要沿两条路径展开:一种假设存在普适的价值集合,以统一目标对齐所有用户(即"一刀切");另一种则将每个个体视为独特存在,为其定制专属模型(即"个体级"对齐)。然而,假设单一价值空间会边缘化少数群体的规范,而逐一定制个体模型则成本过高。鉴于人类社会天然地以社群为单位组织,且社群内部具有高度一致的价值取向,我们提出社群级对齐作为两者之间的"折中方案"。在实践层面,我们构建了 CommunityBench——首个面向社群级对齐评估的大规模基准,包含基于共同认同(Common Identity)与共同纽带(Common Bond)理论设计的四项任务。基于 CommunityBench,我们对多种基础模型进行了全面评估,结果表明当前 LLM 在建模社群特定偏好方面能力有限。此外,我们探索了社群级对齐在促进个体建模方面的潜力,为可扩展、多元化的对齐研究提供了有前景的方向。



02

LegalWorld: A Life-Cycle Interactive Environment for Legal Agents

作者:左松函*,岳圣斌*,蒋涛,李冠颖,宋鋆,黄萱菁,魏忠钰

类型:主会长文

合作单位 :上海创智学院、西南政法大学

摘要:大多数评测任务关注的是单一法律能力,而真实法律服务往往是一个连续推进的生命周期过程。在真实民事诉讼中,一个案件并不会停留在某个孤立环节。咨询阶段遗漏的事实可能导致诉讼请求设计不完整;文书阶段证据组织不足可能削弱庭审表达;一审中的争议焦点和裁判理由又会影响二审中的上诉策略。因此,真实诉讼不是一组互相独立的任务,而是一条具有因果依赖的程序链条。现有法律 benchmark 通常难以刻画这种跨阶段依赖:它们往往将咨询、文书生成、庭审推理或判决预测拆分为独立任务,无法观察智能体是否能在完整诉讼流程中保持案件记忆、角色边界、程序连续性和策略一致性。为了解决这一问题,我们提出 LEGALWORLD,一个面向法律智能体的民事诉讼全生命周期交互环境。LEGALWORLD 以真实中国民事一审、二审裁判文书为基础,将民事诉讼建模为从法律咨询到二审裁判的连续状态链,使法律智能体能够在同一案件中经历完整诉讼流程,并在多角色、多阶段、多工具的动态环境中接受评估。本文的核心贡献总结如下:

(A) 本文提出了首个面向中国民事诉讼全生命周期的法律智能体交互环境 LEGALWORLD。 该环境将民事诉讼建模为五个阶段、七个子场景的连续状态链,覆盖法律咨询、文书起草、一审庭审、上诉文书和二审庭审等关键流程。

(B) 本文构建了支持长程法律智能体运行的可复用基础设施。 LEGALWORLD 设计了局部记忆、全局案件记忆和模块化 Skill/Tool 库,用于维持跨阶段事实、证据、诉讼请求、抗辩意见和程序状态的一致性。

(C) 本文提出 LongJud-Bench,用于评估法律智能体在完整诉讼生命周期中的能力。 LongJud-Bench 从法律咨询、文书起草和庭审攻防等维度拆解法律智能体能力,能够揭示单一总分难以发现的模型能力差异。



03

CURP: Codebook-based Continuous User Representation for Personalized Generation with LLMs

作者:王亮*,牟馨忆*,刘潇优,黄萱菁,魏忠钰

类别:主会长文

摘要:用户建模通过个体的偏好和行为模式来刻画其特征,从而在大语言模型(LLMs)的当代方法中实现个性化仿真。然而,现有方法无论是个性化提示基方法还是参数基方法在平衡个性化质量与计算效率及数据效率方面均面临挑战。我们提出了一种新颖框架CURP,该框架采用双向用户编码器、离散原型码本和双重聚合器,以提取多维用户特质和查询感知的用户特征。这种设计使得仅需少量可训练参数(约2800万参数,约占模型总规模的0.36%)即可实现即插即用的个性化。通过大量实验,我们表明,在语言模型个性化(LaMP)基准测试中,CURP相较于强基线方法取得了优越的性能和泛化能力,同时具有更好的可解释性和鲁棒性。



04

PersonaDual: Balancing Personalization and Objectivity via Adaptive Reasoning

作者:刘潇优*,牟馨忆*,岳圣斌,王亮,王宇青,王锲翔,秦天睿,魏忠钰

类别:主会长文

合作单位:OPPO

摘要:随着人们对大语言模型的期望越来越高,希望其回答能够符合自身偏好,个性信息也显得愈发有价值。然而,个性化信息存在双面效应:它虽能提升交互体验,却可能损害模型的客观性与事实准确性,尤其是在个性信息与问题主题不一致时。为解决这一问题,我们提出PersonaDual框架,该框架可在单一模型中同时支持客观推理与个性化推理两种模式,并根据上下文动态切换推理模式。PersonaDual首先通过监督微调学习两种推理模式,随后使用我们提出的DualGRPO强化学习算法进一步优化,以改进模式选择。在客观性和个性化基准测试中的实验表明,PersonaDual在保留个性化优势的同时实现了近乎无干扰的性能,并能更有效地利用有益的个性化信号来提升客观问题求解能力。



05

HyLaT: Efficient Multi-Agent Communication via Hybrid Latent-Text Protocol

作者:牟馨忆*,王思远*,李泽君,何瑜岚,魏忠钰

类别:主会长文

合作单位:香港中文大学、伦敦国王学院

摘要:通信协议设计是基于大语言模型的多智能体系统中的核心挑战。现有的单通道方法面临固有的通信三难困境:基于文本的方法具有可解释性但过于冗长,而基于隐空间的方法虽然高效却不透明,且局限于单向工作流。受多通道通信理论启发,我们提出了 HyLaT,一种混合隐空间-文本通信协议,通过隐空间通道传输详尽的认知信号以提升效率,同时以自然语言表达简洁的关键信号以保持可解释性和精确性。我们引入了一个两阶段训练框架,结合单智能体混合生成学习与多智能体交互式联合训练,使智能体能够在多轮交互中理解和生成混合消息。实验表明,HyLaT 在显著降低通信开销的同时保持了有竞争力的任务性能,并在多种设置下展现出良好的泛化性和鲁棒性。



06

ObGynLongBench: Revealing the Evidence-to-EHR Gap in Longitudinal EHR Decision-Making

作者:项钧*,保智杰*,胡蓉,覃开舟,陈伟,魏忠钰

类别:主会长文

合作单位:复旦大学附属妇产科医院、华中科技大学

摘要:大型语言模型(LLM)在个性化医疗助手中的应用日益受到关注。然而,现有的医疗基准大多依赖于静态问答,并预先提供筛选好的证据,因此尚不清楚 LLM 能否基于真实的纵向电子健康记录(EHR)做出可靠的临床决策。为弥补这一空白,我们提出了 ObGynLongBench:一个基于规则、面向长上下文 EHR 的妇产科临床决策基准。ObGynLongBench 基于 976 份真实的妊娠期 EHR 病史构建,包含 1,500 个临床决策点案例,其判断依据来自可追溯的教材和临床指南规则。每个案例均对应一名真实患者、妊娠时间线中的一个具体时点,以及决策作出前的信息边界,从而支持在三种输入范围下进行评估:仅证据(Evidence-only)、就诊级 EHR(Visit-level EHR) 和 病史级 EHR(History-level EHR)。

对 17 个 LLM 的评估结果揭示了显著的 “证据到 EHR 差距”(Evidence-to-EHR Gap):当相关证据被直接提供时,模型表现良好;但当模型需要从当日就诊记录或完整的决策前 EHR 病史中自行提取证据时,准确率明显下降。进一步分析表明,证据定位是一个关键瓶颈:随着 EHR 上下文长度增加、证据要求变得更加复杂,模型性能会进一步下降;此外,在同一患者的病史中,较早阶段发生的错误往往能够预测后续阶段的错误。最后,在不同的 EHR 访问策略中,主动搜索智能体的表现最佳,这进一步表明,如何准确定位与特定患者相关的证据,是构建可靠个性化医疗助手所面临的核心挑战。



07

InterviewBench: Benchmarking Large Language Models as Interviewers

作者:戴尚哲,段飞宇,魏忠钰

类型:Findings

摘要:访谈往往需要通过对话收集信息,这意味着访谈者需要掌握提出恰当的问题、适应受访者的行为、并从对话中提取并还原结构化信息的能力。然而,现有研究对 AI 系统作为访谈者的能力评估仍不够充分。因此,我们提出了InterviewBench,一个面向大语言模型 AI 访谈者的评测基准,从静态局部访谈与动态多轮访谈两个层面评估模型的能力。静态评估将真实访谈抽象为可控的局部决策任务,动态评估则将模型置于多轮访谈模拟中,考察其端到端访谈能力。InterviewBench基于真实的访谈记录构建,包含5500道分类选择问题、3000个生成性问题和184个动态场景。通过评测 23 个开源与闭源大语言模型,我们发现,当前模型已经能够生成较为流畅的访谈话语,但在访谈策略选择、显式证据引出、长程互动管理以及应对非理想受访者行为等方面仍存在明显不足。



08

Revising Context, Shifting Simulated Stance: Auditing LLM-Based Stance Simulation in Online Discussions

作者:张辛农*,单琬婷*,闾涵加,魏忠钰,罗杰波

类型:Findings

合作单位新加坡管理大学、罗切斯特大学

摘要:大语言模型正被越来越多地用于模拟社交媒体用户,并推断个体可能如何回应网络讨论。然而,这类模拟究竟反映了精确的、特定于用户的信念,还是对上下文中语义无关的变化高度敏感,目前仍不清楚。本文提出以反事实上下文修订(counterfactual context revision)作为审计大语言模型立场模拟的框架。给定一段原始的网络对话,我们首先推断目标用户对特定话题的立场;随后对对话上下文施加受控的修订策略,并在修订后的上下文下重新模拟该用户的立场。我们将纯文本修订策略与融入梗图(meme)上下文的多模态修订策略进行对比,并评估两项主要有效性指标,即平均方向性立场偏移(average directional stance shift)与立场转变率(stance transition rate)。结果表明,在不同的极化偏好机制下,纯文本与多模态策略均能引发有效且稳健的立场转变。本研究提供了一个用于理解大语言模型立场模拟之上下文敏感性的评估框架;更广泛地看,它同时揭示了利用大语言模型模拟网络观点动力学的潜力与风险。



09

Can Agents Read the Room? Benchmarking Visual Social Intelligence in Multimodal Simulation

作者:万石君*,吴学海*,张霁雯,王思远,魏忠钰

类别:Findings

合作单位:香港中文大学

摘要:社交互动既依赖于语言,也依赖于可见的社交信号(如面部表情、姿态、注视和情绪变化)。然而,现有的社交智能体基准测试大多基于文本,鲜少考察多模态智能体能否利用视觉线索来引导互动。我们推出了 AGENTVISS,这是一个旨在评估多模态社交模拟中视觉社交智能的基准测试。该基准包含 240 个场景、585 个角色实例以及 2,340 个“角色-任务”实例,整合了对齐的图文信息、结构化角色档案以及四类角色级任务:表情任务、特征任务、互动调节任务和互动结果任务。在“视觉语言化”(verbalized-vision)和“直接视觉”(direct-vision)两种模式下对七种近期多模态大语言模型(MLLM)进行的评估显示,局部角色演绎与整体互动管理之间存在显著差距:模型在特定角色的表情呈现和冲突处理方面表现已接近饱和,但在互动调节和基于视觉信息的任务结果达成方面,仍面临巨大挑战。



10

OViP: Online Vision-Language Preference Learning with Hallucination-Targeted Negatives

作者:刘书隽、王思远、李泽君、王建祥、曾成、黄萱菁、魏忠钰

类别:Findings

合作单位:字节跳动、香港中文大学

摘要:现有视觉语言大模型普遍存在幻觉问题,现有面向视觉的直接偏好优化方法大多采用启发式或者离线方式构造负样本图像,这类样本多为简单负例,模型对正确回答本身概率已经极低,带来的优化梯度有效信息少甚至会产生误导。针对该问题,本文提出 OViP 在线视觉‑语言偏好学习框架,借助扩散先验,依据模型训练过程中自身产生的幻觉响应动态合成目标幻觉负样本图像,得到语义错位但模型依然会分配较高置信度的困难负样本。具体来说,OViP 在线采样并筛选模型输出得到对比文本对,借助大模型识别正负响应间语义差异,据此生成提示词,通过文生图或者图像编辑方式构造对应的负图像,联合完成语言与视觉双向偏好优化。本文还完善评测协议,兼顾幻觉抑制效果与模型通用能力,区分显式与隐式幻觉,提出幻觉降低综合指标 HRI。在五个幻觉评测基准与四个通用能力基准上开展实验,基于 LLaVA‑1.5 系列、Qwen2.5‑VL‑3B 的实验结果表明,OViP 能够有效缓解模型幻觉,相比 SIMA 计算效率提升约 2 倍,并且不会造成通用能力退化,同时消融实验验证了在线负样本构造、图像损失设计的必要性,为多模态偏好优化缓解幻觉提供了高效可行的实现思路。



11

Beyond Isolated Behaviors: Hierarchical User Modeling for LLM Personalization

作者:王亮*,牟馨忆*,刘潇优,王天楠,王宇青,魏忠钰

类别:Findings

合作单位:OPPO

摘要:大语言模型(LLMs)已在多个领域展现出卓越的能力,但如何使其输出针对个体用户进行个性化定制仍然是一个开放挑战。 现有方法主要采用扁平化的行为范式,即聚合用户行为,却未明确考虑这些行为是如何组织成更深层的行为结构的。在本工作中,我们借鉴皮埃尔·布迪厄的实践理论,提出了PHF(实践—惯习—场域) 框架,一个基于社会学理论的重构框架,通过三个层次来实现LLM个性化:将个体行为视为实践,将其在时间上的累积所形成的稳定倾向视为惯习,将相似用户之间共享的规律性视为场域。我们通过一个基于冻结LLM的轻量级、模型无关的实现方案来实例化PHF。在语言模型个性化(LaMP)基准上的实验表明,该方法在多种任务上均取得了一致的性能提升,进一步的分析也验证了所学行为结构的可解释性和可扩展性。



12

MedReaMM: Evaluating Large Multimodal Models on Expert-Level Clinical Diagnostic Synthesis

作者: 魏莱,陈昱潮,曹振彪,张晓今,魏忠钰,王帮亭,陈伟,白翔

类别: Findings

合作单位: 华中科技大学、南京医科大学第一附属医院(江苏省人民医院)

摘要: 大语言模型与大多模态模型在医疗诊断中的应用受到广泛关注,但现有医学评测通常聚焦文本问答或单一医学图像理解,难以衡量模型综合患者病史、检查结果与多张医学影像进行临床诊断的能力。为弥补这一不足,本文提出 MedReaMM,面向专家级多模态临床诊断综合能力构建评测基准。该基准收集来自高水平医学期刊及临床病例数据库的复杂病例,经标签泄漏筛查、ICD-11 标准化编码及临床专家审核后,最终包含 625 个病例、平均每例 2.79 张医学图像以及 1,042 个标准化诊断,并要求模型以开放式方式生成排序后的鉴别诊断列表。实验系统评测了 23 个主流大多模态模型,结果显示即使采用较宽松的 Top-10 诊断标准,多数模型准确率仍低于 50%,表明当前模型距离可靠的专家级多模态临床诊断仍存在明显差距。进一步分析发现,医学知识、医学图像理解与跨模态证据整合能力均与最终诊断表现高度相关,并共同构成制约模型临床诊断能力的关键因素。



13

RIDGE: Region-Informed Derivative-Guided Evidence Selection for Long Video Understanding

作者:徐山青、罗盟、钱萌宸、高豫辉、彭思月、钟枭晗、张晓今、魏忠钰、陈伟、白翔

类别:Findings

合作单位:华中科技大学、新加坡国立大学

摘要:长视频包含的视觉内容远超大视觉语言模型(Large Vision-Language Model, LVLM)在固定视觉 Token 预算下的可处理范围,因而关键帧选择直接决定模型能否看到回答问题所需的证据。现有查询感知方法通常依据帧—问题相似度进行排序或采样,容易忽略峰值前后相似度较低却承载事件原因、过程、结果与转折的证据帧。本文提出 RIDGE,一个面向长视频理解的区域感知与导数引导的证据选择框架,将帧—问题相似度序列视为具有时序结构的信号,利用导数与曲率将其划分为峰值、上升、下降、边界和背景五类区域,并根据问题需求分配帧预算,从而兼顾事件核心、铺垫、后续、转折与上下文。RIDGE 只需分析已有的帧—问题相关性得分即可完成关键帧选择,无需额外训练或反复调用下游 LVLM,计算开销小,并能灵活适配不同骨干模型。在四个长视频基准和三种 LVLM 骨干模型构成的评测组合中,RIDGE 相较于现有先进方法整体表现优异;以 Qwen2.5-VL-7B 为例,其在 Video-MME、LongVideoBench、MLVU 和 LVBench 上较均匀采样基线分别提升 2.5、6.5、9.9 和 12.4 个百分点。





END



复旦大学数据智能与社会计算实验室


Fudan DISC


联系方式:disclab@fudan.edu.cn

地址:复旦大学袁天凡、慧敏校园C栋

内容中包含的图片若涉及版权问题,请及时与我们联系删除