今天,我们正式推出 jina-reranker-v3.5

作为 v3 系列的进阶版,它依旧保持了 0.6B 的参数规模以及标志性的 LBNL( Last but not late,一次前向传播处理整批文档)的列表式架构。在保持轻量化推理优势的同时,v3.5 专门解决了生产环境中最棘手的三个工程痛点垂直领域适配、结构化记录的逻辑识别,以及长列表下的显存爆炸。

HF 🤗 https://huggingface.co/collections/jinaai/jina-reranker-v3.5

魔搭 🧙 https://modelscope.cn/models/jinaai/jina-reranker-v3.5

技术报告 📖 https://arxiv.org/abs/2607.18152

API 💻 https://jina.ai/reranker/

性能预览

维度
nDCG@10 表现
相比 v3 提升
核心亮点
BEIR (通用)63.20
+1.10
超越 4B 规模的 Qwen3-Reranker
MIRACL (多语言)74.11
+2.6%
0.6B 档位的性能标杆
RTEB (行业领域)70.95
+4.3%
覆盖法律/金融/医疗/代码
Struct-IR (结构化)48.3+24.8%
对 JSON 格式,表格,和字段背后的逻辑和规则的理解更清楚
推理速度
——
1.22×–1.56×
列表越长,加速越明显

为什么推出 v3.5?

Jina Reranker v3 的表现已经超出了我们的预期,它证明了 0.6B 参数配合 Listwise 架构,完全有能力在通用基准测试上和大模型掰掰手腕。但当我们将 v3 投入真实的业务时,却发现了一些榜单无法体现的坑。

  1. 垂直领域: 法律条文、临床诊断或金融研报,其语言模式与通用网页截然不同。BEIR 上的冠军模型,在复杂的法律判例面前也可能失效。

  2. 结构化数据: 面对 JSON 或表格数据,Reranker 如果不懂字段间的逻辑约束,比如“价格必须在 100~200 之间”、“必须是 L 码”等,就很容易给出离谱的评分。

  3. 长列表延迟: 处理长文档列表时,全自注意力机制带来的显存开销是平方级增长的,延迟根本不可控。

v3.5 的出现,就是为了在保持轻量的同时,把这些工程盲区扫平。

三大核心演进

1. 3L2G 混合注意力架构

为了从根本上降低长列表下的计算开销,我们放弃了传统的全自注意力模式,转而采用 3L2G 混合注意力架构。

模型的大部分层运行 滑动窗口注意力(Sliding Window Attention),窗口大小设为 1024,这直接将计算复杂度从平方级拉到了线性级别。为了不丢失全局信息,我们周期性地 穿插了全局注意力层进行同步,并强制 末层必须全局可见,确保最终打分能吃透整组候选文档的特征。

2. 覆盖失效场景的数据策略

在训练阶段,我们将重点放在补齐 v3 的弱势场景上。

在法律和行业合规领域,我们补充了 EUR-Lex 和 AILA 等权威判例库,涵盖多国法律法规;医疗方面则补充了临床对话与生物医学论文。同时,利用大模型生成了大量极具干扰性的难负样本,逼模型学会区分细微的司法辖区和专业差别。

面对电商或企业系统中的 JSON 记录或者表格数据,传统模型往往只看字面词汇,不懂数字逻辑,比如搜 150 元以下,可能把 160 元的也匹配出来。我们采用 Struct-IR 策略故意对 JSON 数据的关键字段,如价格、规格做微调或扰动,,逼模型去理解字段背后的约束与逻辑关系。

此外,多语言语料库 也扩展到了 50 多种语言,整体通用性与泛化能力进一步增强。

3. 三阶段自蒸馏流程

直接训练稀疏模型往往性能抖动,我们摸索出了一套迂回战术:

先练一个性能触顶的全注意力教师模型;再让 3L2G 学生模型去适应注意力路径的变化;最后通过 KL 散度和隐状态 MSE 等多维度蒸馏,让学生模型在大幅提速的同时,完美承接教师模型的排序质量。

性能实测

我们对比了 v3.5 与前代版本 v3,以及目前市面上主流的大参数重排模型。数据覆盖了通用搜索、多语言、垂直行业以及结构化数据四个维度。

1. 通用搜索:0.6B 规模超越 4B 模型

Jina Reranker v3.5 BEIR 基准测试结果与 Qwen3 和 Mixedbread rerankers 的比较

在通用的 BEIR 搜索基准测试中,v3.5 的平均分达到 63.20 (nDCG@10)。性能超过了参数量是其 7 倍的 Qwen3-Reranker-4B(62.28)。

2. 垂直行业:法律与金融场景的专项补强

Jina Reranker v3.5 RTEB 特定领域基准测试结果(法律、医疗和金融检索)

针对 法律、金融、医疗和代码 等行业语境(RTEB 基准),v3.5 的综合表现提升了 4.3%。在法律任务 AILA 上,v3.5 的 nDCG 指标相比 v3 猛增了 11 - 14 个点。

3. 结构化数据理解

Jina Reranker v3.5 在 Struct-IR 和 STaRK 上的结构化数据基准测试结果

这是 v3.5 进步最大的地方。在 Struct-IR 测试中,得分从 38.7 提升至 48.3,提升 24.8%。尤其在简历筛选等强约束场景中,Recall@5 指标已经能够与 Qwen-4B 持平。

4. 推理速度

数据集
平均文档长度
jina-reranker-v3
jina-reranker-v3.5
加速
BEIR
 短文档场景
~145 Tokens
371.1 ms
305.3 ms
22%
RTEB
 长文档场景
~1,900 Tokens
16,064.9 ms
10,290.9 ms
56%

混合注意力架构在长文档列表上展现了巨大的优势。以法律判例检索为例,处理速度提升了 56%,这直接解决了长上下文重排时最头疼的显存爆炸和延迟抖动的问题。

如何快速上手?

1. Jina AI API 

已在 Jina AI 官网同步上线,直接把模型名改成 jina_reranker_v3.5即可,代码逻辑不用改动

curl https://api.jina.ai/v1/rerank \
  -H "Authorization: Bearer $JINA_API_KEY" \
  -d '{
    "model": "jina-reranker-v3.5",
    "query": "有机化学反应机制",
    "documents": ["SN2 亲核取代反应...", "如何烤制酸面包...", "钯催化偶联反应..."]
  }'

2. Elasticsearch 集成

通过 Elastic Inference Service (EIS) 调用,可作为 text_similarity_reranker retriever 接入混合搜索的流水线。

3. 私有化部署

https://github.com/jina-ai/jina-on-prem 支持 Docker 一键部署,适用于内网隔离或受监管的数据环境。

4. 模型已开源

模型权重已发布至 Hugging Face,支持通过 transformers 库直接加载。

model = AutoModel.from_pretrained("jinaai/jina-reranker-v3.5", trust_remote_code=True)

jina-reranker-v3.5 适用 CC BY-NC 4.0 许可协议,如有商业用途需求,请随时联系我们:sales@jina.ai

总结

在 0.6B 这个不挑卡的体量下,我们借由 3L2G 混合注意力架构,降低了长列表的推理门槛,并把对结构化数据的理解能力补齐到了生产可用的水平。

如果你现在的系统正面临长列表响应慢,或者垂直领域的检索,结构化数据的理解差点意思,Jina Reranker v3.5 提供了一个极具性价比的技术选型。

所有的技术细节与实验数据都已同步在技术报告 https://arxiv.org/abs/2607.18152 中公开。




本文由 Hugging Face 中文社区内容共建项目提供,稿件由社区成员投稿,经授权发布于 Hugging Face 公众号。文章内容不代表官方立场,文中介绍的产品和服务等均不构成投资建议。了解更多请关注公众号

如果你有与开源 AI、Hugging Face 相关的技术和实践分享内容,以及最新的开源 AI 项目发布,希望通过我们分享给更多 AI 从业者和开发者们,请通过下面的链接投稿与我们取得联系: https://hf.link/tougao 

内容中包含的图片若涉及版权问题,请及时与我们联系删除