2026年9月24日 23:08
Liquid AI、VLM高速化のDSpark公開
Accelerating vision-language models with LFM2.5-VL-DSpark
3行まとめ
- •Liquid AIがVLM用DSparkを公開
- •デコード速度が端末で最大3.13倍
- •モデル増は8.9%、重みは公開
詳細
概要
Liquid AIは2026年9月24日、視覚言語モデル(VLM)「LFM2.5-VL-3B」向けの実験的なドラフトモデル「LFM2.5-VL-DSpark」を公開した。ドラフトモデルは、小さなモデルが先に候補トークンを生成し、本体モデルが検証する投機的デコーディングに使われる。テキスト版のLFM2.5-DSparkドラフタと同じ構成で、本体モデルの特定層の隠れ状態を取り込み、k個の候補トークンをまとめて生成する。
性能
Apple M5 Max上のMLXではデコード速度が2.30〜3.13倍、エンドツーエンドの遅延が1.56〜2.62倍に改善した。M3 Ultra上のllama.cppではデコードが1.57〜2.14倍、H100ではデコードが最大2.66倍、エンドツーエンドが1.64〜2.27倍となった。評価はMMSpecベンチマークに沿った6種類の視覚タスクで行った。
提供と制約
ドラフトモデルは約280Mパラメータで、本体の3Bモデルに対する増加は8.9%にとどまる。llama.cpp、MLX-VLM、SGLangに初日から対応する。ただし高速化されるのはデコードのみで、プリフィルと画像エンコードは対象外のため、これらが遅延の大半を占める環境では改善幅が限られる。
なぜ重要か
VLMの生成速度を端末上で最大3.13倍にでき、追加メモリは8.9%で済む。エッジでの実行を検討する開発者の判断材料になる。
元記事を読む — Hugging Face Blog