NAW / COMPUTE 06
IMAGE: AI生成ビジュアル
COMPUTE / Infrastructure
vLLM v0.28.0公開 — Kimi-K3最適化とDeepSeek V4対応、Model Runner V2とKVキャッシュ階層化を強化
高性能LLMサービングエンジンvLLMがv0.28.0をリリース。584コミット・270名が参加し、Kimi-K3の推論最適化、DeepSeek V4のsparse MLA対応、投機的デコーディング強化、Model Runner V2の成熟、ディスク対応の階層KVキャッシュなど大規模アップデートを実施。
vLLMプロジェクトは2026年8月26日、LLM推論サービングエンジン「vLLM」の最新安定版 v0.28.0 を公開した。GitHub Releasesで発表され、584コミット・270名のコントリビューター(うち76名が新規参加)による2週間サイクルのメジャーマイナーアップデートとして位置づけられる。Kimi-K3とDeepSeek V4への集中的な最適化に加え、Model Runner V2の成熟やKVキャッシュの階層化など、推論基盤全体にわたる強化が含まれる。
ハイライト:Kimi-K3とDeepSeek V4を中心とした性能最適化
vLLM v0.28.0の最大の焦点は、MoEモデル Kimi-K3 と DeepSeek V4 への最適化だ。
- Kimi-K3性能向上: Decode Context Parallel(DCP)対応、 fused FlashKDA の decode/prefillカーネル、SiTU活性化によるMegaMoE対応、GEMM-RSによる系列並列化、all-gather統合によるカーネルレベル1.5〜3倍高速化、適応的な投機的トークン予算によるDSpark TTFTの約60%改善、共有エキスパート分割によるGPUあたり約17 GiBのメモリ削減を実装。V2モデルランナー経由でROCmでも動作する。
- DeepSeek V4: sparse MLAを通常decode、MTP、DSpark投機的デコーディングでエンドツーエンド対応。AMD Quark NVFP4、reasoning-effortプロンプト、疎top-kメタデータカーネル最適化、eager CUDAグラフ領域の絞り込み、gfx11/gfx950でのROCm有効化を追加。
- 投機的デコーディング: ローカル畳み込みと候補セレクターを備えたDFlash2、信頼度スケジュール検証を用いるDSpark、ドラフトモデル向けの非同期スケジューリング自動有効化を導入。
- 新デフォルト:
max_num_batched_tokensを8192から16384へ引き上げ、Mambaモデルではprefix cachingをデフォルト有効、BlackwellのCUDAグラフ取得デフォルトを1024へ引き上げ。
いずれもプロジェクト側の公称値・実装報告であり、特定のモデル・ハードウェア・バッチ条件での独立した再現評価が推奨される。
基盤強化:Model Runner V2、階層KVキャッシュ、Rust/gRPC
推論基盤のアーキテクチャ面でも大幅な更新が行われた。
- Model Runner V2の成熟: E/P/D分離(encode/prefill/decode disaggregation)、重みオフロード、複数レイヤーのMTP KVキャッシュ対応、エンコーダーCUDAグラフ、デコーダーのトークン単位プーリング、attention-freeモデル対応、
thinking_token_budget対応など。 - 階層KVキャッシュのオフロード: ディスクへのオフロード対応、外部セカンダリ階層マネージャを
module_pathで利用可能に、部分的なセカンダリ階層ロード、階層化メトリクス、並列度に依存しないCPUレイアウトの正規化。 - RustフロントエンドとgRPC: スタンドアロンレンダラー、gRPC経由のマルチモーダル画像推論、データ並列ランクの明示的ルーティング、RLライフサイクル制御を追加。protobufスキーマはBufで公開された。
- 新モデル対応: Muse Glimmer、Ling 3.0 Flash(BF16/MTP/パーサーやFP8派生・MXFP4)、Dots3 NOTEのネイティブマルチモーダル、Interns2mobiusなどを新たにサポート。Qwen3.8のROCm対応やQwen3.5 GDN向け融合カーネルも含む。
破壊的変更と提供形態
- 破壊的変更: bitsandbytesサポートはout-of-treeプラグインへ移行、Transformersは5.15.0へ更新、非推奨の
calculate_kv_scalesとoverride_attention_dtypeは削除された。 - 提供形態: PyPI(CUDA 13.0がデフォルト、
pip install vllm)、ROCm向けwheel(--extra-index-url https://wheels.vllm.ai/rocm/0.28.0/rocm722)、Dockerイメージ(vllm/vllm-openai:v0.28.0、CUDA 12.9/ROCm/CPU/XPUバリアント)、ソースtarballなど。GitHub ReleasesのAssetsセクションで配布される。 - 移行時の注意: Transformersやbitsandbytes依存を更新している環境では、依存解決とプラグイン導入の再確認が必要。
max_num_batched_tokensのデフォルト変更はスループット向上が期待される一方、メモリ使用量の増加に注意が必要だ。