Last Translation Benchmark

2026年09月03日
  • 简介
    为推动科学进步,我们需要能够检验当前最先进模型能力边界的基准测试,并需要能揭示模型失效案例的评估方法。随着模型能力不断增强,现有的机器翻译标准基准测试已日趋饱和。此外,自动翻译评价指标本身并不可靠,容易受到“奖励黑客”(reward-hacking)行为的干扰,且其评估结果往往缺乏可操作性。即便是被视为“金标准”的人工评测也并非毫无缺陷:它常常难以复现、缺乏客观性,且难以规模化开展。总体而言,上述问题严重阻碍了我们对本领域客观进展的追踪,也妨碍了我们识别切实可行的改进路径。为此,我们提出“终极翻译基准”(Last Translation Benchmark, LTB),这是一个由人类作者创作、经同行评审精选的多模态数据集,涵盖文本、图像、音频与视频等多种形式,其中所有样本均能可靠地使当前主流机器翻译模型失效。同时,我们还提出一种全新的评估范式:每个样本均附有手工编写的验证规则,明确描述该样本上模型的具体失效模式,从而确保后续评估具备可靠性与可操作性。该基准是一个持续演进的动态数据集,长期面向学界开放贡献。当前最新版本为LTBv1,收录了截至2026年9月1日之前经审核通过的所有贡献;未来将根据新数据的持续积累,定期发布更新版本。
  • 作者讲解
  • 图表
  • 解决问题
    现有机器翻译基准(如WMT、BLEU-based benchmarks)已接近饱和,无法有效区分SOTA模型能力边界;自动评估指标(如BLEU、COMET)不可靠、易被奖励黑客攻击,且缺乏可解释性;人工评估虽为金标准,但难以复现、主观性强、成本高、不可扩展。因此,领域缺乏能客观、可重复、可归因、可持续演进的评估范式来追踪真实进展。
  • 关键思路
    提出‘最后翻译基准’(Last Translation Benchmark, LTB)——一个以‘模型失效’为构造原则的活体(living)基准:所有样本均为人类专家撰写并同行评审的真实多模态(文本/图像/音频/视频)难例,明确设计用于击穿当前最强翻译系统;每个样本附带手工编写的可执行验证规则(verification rules),将抽象失败(如‘语义失真’)转化为具体、可判定、可归因的逻辑断言(例如‘源句含反讽,译文必须保留否定词+时态错位标记’),从而实现可靠、细粒度、行动导向(actionable)的评估。
  • 其它亮点
    LTB是首个以‘对抗性失效’为核心构建原则、支持多模态输入、并强制绑定形式化验证规则的翻译评估基准;v1版本(截至2026年9月1日)已开源,含完整样本、验证规则引擎(Python DSL)、自动化评估流水线及贡献指南;所有数据经双盲同行评审,确保难度与真实性;规则驱动设计使失败可定位、可修复(如提示工程/解码策略/架构修改),直接支撑迭代改进;未来计划集成模型自诊断反馈与规则生成辅助工具。
  • 相关研究
    ‘BIG-Bench Hard’ (Srivastava et al., 2022); ‘ToMi’ (Liu et al., 2023, 语义一致性测试集); ‘TransRater’ (Wang et al., 2024, 基于LLM的细粒度评分框架); ‘Multilingual MMLU’ (Huang et al., 2024, 跨语言推理评估); ‘Nope’ (Zhang & Chen, 2025, 面向NLU的对抗性反例基准)
许愿开讲
PDF
原文
点赞 收藏
向作者提问
NEW
分享到Link

提问交流

提交问题,平台邀请作者,轻松获得权威解答~

向作者提问