英文原标题:Accelerating vision-language models with LFM2.5-VL-DSpark
本文为英文原文的机器翻译摘要,原文见:Hugging Face Blog ↗
- LiquidAI 发布实验性 DSpark 草稿模型,为视觉语言模型 LFM2.5-VL-3B 增加推测解码路径,在不改变输出质量的前提下提升推理速度。
- 速度提升:设备端解码最高加速 3.13 倍,H100 上最高 2.66 倍;端到端增益分别最高 2.62 倍和 2.27 倍。
- 内存开销小:草稿模型增加约 2.8 亿参数,仅占 3B 目标模型的 8.9%。
- 草稿模型采用 4 层注意力结构,块大小为 9,训练 10 个 epoch;推理时建议块大小为 8 或 9。
- 首日支持 llama.cpp、MLX-VLM 和 SGLang,模型以 Safetensors 和 GGUF 格式在 Hugging Face 发布。
关键数据
- 设备端解码加速 2.30x 至 3.13x,端到端延迟改善 1.56x 至 2.62x(MLX on M5 Max)
- llama.cpp on M3 Ultra 解码加速 1.57x 至 2.14x,端到端改善 1.30x 至 1.77x
- H100 上解码加速 20.4x 至 2.66x,端到端改善 1.64x 至 2.27x
- 草稿模型总参数约 279.5M,其中解码器堆栈 193.0M、隐藏状态投影 21.0M、马尔可夫头 65.5M、归一化与置信头 6.4k
- 草稿模型增加 280M 参数,占 3B 目标模型的 8.9%
引语
- 推测解码是精确的:目标模型验证每个提议的 token,因此贪婪输出与单独目标模型相同
为什么值得看:该工作将推测解码从文本模型扩展到视觉语言模型,在几乎不损失质量的前提下显著提升推理速度,并首日支持主流推理框架,有助于推动 VLM 在边缘设备上的实际部署。