我们提出了SANA-WM——一种高效、参数量为26亿的开源世界模型,原生支持长达一分钟的视频生成,可合成高保真、720p分辨率、时长以分钟计的视频,并实现精准的相机运动控制。SANA-WM在视觉质量上可媲美LingBot-World和HY-WorldPlay等大规模工业级基线模型,同时显著提升了整体运行效率。本架构由四大核心设计驱动:(1)混合线性注意力机制(Hybrid Linear Attention),将帧级门控Delta网络(GDN)与Softmax注意力相结合,从而在保障长时序建模能力的同时大幅降低显存开销;(2)双分支相机控制模块(Dual-Branch Camera Control),确保模型严格遵循用户指定的六自由度(6-DoF)相机运动轨迹;(3)两阶段生成流程(Two-Stage Generation Pipeline),在第一阶段生成结果基础上,引入专用于长视频的精细化重构器(long-video refiner),显著提升生成视频的整体质量与帧间一致性;(4)鲁棒的标注流水线(Robust Annotation Pipeline),从公开视频中自动提取具备真实尺度信息的六自由度相机位姿,进而生成高质量、时空一致的动作标签。依托上述设计,SANA-WM在数据使用、训练算力及推理硬件三方面均展现出卓越的效率优势:仅需约21.3万段带真实尺度位姿监督的公开视频片段即可完成训练;在64块H100 GPU上仅需15天即可完成全部训练;单卡GPU即可生成一段60秒的完整视频;其蒸馏轻量化版本经NVFP4量化后,可在单块RTX 5090显卡上于34秒内完成一段60秒、720p分辨率视频的去噪生成。在我们构建的一分钟世界模型评测基准上,SANA-WM的动作跟随准确率明显优于此前所有开源基线模型,且在视觉质量相当的前提下,吞吐量达到现有方案的36倍,为可扩展的世界建模提供了切实可行的高效路径。

