BaseRT: Best-in-Class LLM Inference on Apple Silicon via Native Metal

2026年07月01日
  • 简介
    我们推出了 BaseRT——一款专为 Apple Silicon 平台设计、原生基于 Metal 构建的大语言模型(LLM)推理运行时,创下了该硬件平台迄今最高的推理吞吐量纪录。当前主流的运行时系统(包括 llama.cpp 和基于 MLX 的各类框架)均因采用面向通用计算抽象而未适配 Metal 的执行模型及 Apple Silicon 统一内存架构,从而引入了额外开销。BaseRT 通过直接构建于 Metal 之上,深度融合芯片特性:实现算子内核融合(kernel fusion)、针对统一内存架构进行精细化优化,并采用定制化的调度逻辑,从而充分释放了被现有框架所忽视的性能潜力。BaseRT 全面支持所有 Apple M 系列设备,兼容八种量化格式(从 Q2 到 FP16),覆盖多种主流模型家族。本文在 M3 和 M4 Pro 设备上,对 Qwen3、Llama 3.2 和 Gemma 4 三大模型系列分别在 Q4 和 Q8 两种量化精度下进行了系统性评测。实验结果表明,BaseRT 的解码(decode)吞吐量最高可达 llama.cpp 的 1.56 倍、MLX 的 1.35 倍;而对于混合专家(MoE)类模型,其预填充(prefill)阶段的性能优势更为显著。从参数量低于 10 亿的小型模型到高达 300 亿参数的大型模型,BaseRT 均展现出稳定且业界领先的端到端吞吐性能。这些成果重新定义了 Apple Silicon 作为推理平台的能力上限,其意义远超此前报道:随着隐私保护要求日益严格、端到端延迟约束愈发严苛,以及云端推理成本压力持续攀升,AI 推理正加速向终端设备迁移;在此背景下,经过深度性能调优的本地化推理运行时,已成为支撑这一范式转型不可或缺的关键基础设施层。BaseRT 已开源,代码地址为 https://github.com/basecompute/baseRT
  • 作者讲解
  • 图表
  • 解决问题
    在Apple Silicon(M系列芯片)上高效运行大型语言模型(LLM)推理面临显著性能瓶颈:现有开源运行时(如llama.cpp、MLX)因依赖跨平台抽象层、未适配Metal执行模型及忽略统一内存架构特性,导致计算与内存带宽利用率低下,尤其在prefill阶段和MoE模型中尤为严重。该问题并非全新,但此前缺乏针对Apple硬件原生、系统级深度优化的推理运行时。
  • 关键思路
    BaseRT提出一种完全原生的Metal推理运行时设计范式:摒弃通用抽象层,直接构建于Metal API之上;通过芯片感知的kernel fusion(如融合RoPE、QKV投影、Softmax等)、统一内存拓扑感知的张量布局与缓存策略、以及细粒度定制dispatch逻辑(避免CPU-GPU同步开销),实现端到端硬件协同优化。其核心新意在于将‘硬件特性驱动’而非‘框架兼容性驱动’作为首要设计原则,是首个全面释放Apple Silicon Metal并行能力与统一内存带宽潜力的LLM推理引擎。
  • 其它亮点
    实验覆盖Qwen3、Llama 3.2、Gemma 4三大主流模型族,在M3/M4 Pro设备上评估Q4/Q8量化配置;首次报告Apple Silicon上最高decode throughput(较llama.cpp提升1.56x,MLX提升1.35x),MoE模型prefill加速更显著;支持8种量化格式(Q2–FP16)及全M系列设备;代码完全开源(GitHub: basecompute/baseRT),含可复现benchmark脚本与详细profiling工具;值得深入的方向包括:动态MoE路由在Metal上的低延迟调度、Metal Ray Tracing单元辅助稀疏计算探索、以及与Core ML Pipeline的协同编译优化。
  • 相关研究
    MLX: A Unified Framework for Machine Learning on Apple Silicon (2023); llama.cpp: Lightweight LLM Inference (2023); Core ML Tools 6: Quantization and Compilation for On-Device LLMs (Apple, WWDC2024); Metal Performance Shaders Graph: Accelerating Neural Networks on GPU (Apple, 2022); MLC-LLM: High-Performance LLM Inference System with Learnable Compilation (2023)
许愿开讲
PDF
原文
点赞 收藏
向作者提问
NEW
分享到Link

提问交流

提交问题,平台邀请作者,轻松获得权威解答~

向作者提问