半導体チップとデータセンターをつなぐ青い抽象ビジュアル
NAW / COMPUTE 06

IMAGE: AI生成ビジュアル

COMPUTE / Infrastructure

vLLM v0.28.0公開 — Kimi-K3最適化とDeepSeek V4対応、Model Runner V2とKVキャッシュ階層化を強化

高性能LLMサービングエンジンvLLMがv0.28.0をリリース。584コミット・270名が参加し、Kimi-K3の推論最適化、DeepSeek V4のsparse MLA対応、投機的デコーディング強化、Model Runner V2の成熟、ディスク対応の階層KVキャッシュなど大規模アップデートを実施。

vLLMプロジェクトは2026年8月26日、LLM推論サービングエンジン「vLLM」の最新安定版 v0.28.0 を公開した。GitHub Releasesで発表され、584コミット・270名のコントリビューター(うち76名が新規参加)による2週間サイクルのメジャーマイナーアップデートとして位置づけられる。Kimi-K3とDeepSeek V4への集中的な最適化に加え、Model Runner V2の成熟やKVキャッシュの階層化など、推論基盤全体にわたる強化が含まれる。

ハイライト:Kimi-K3とDeepSeek V4を中心とした性能最適化

vLLM v0.28.0の最大の焦点は、MoEモデル Kimi-K3 と DeepSeek V4 への最適化だ。

  • Kimi-K3性能向上: Decode Context Parallel(DCP)対応、 fused FlashKDA の decode/prefillカーネル、SiTU活性化によるMegaMoE対応、GEMM-RSによる系列並列化、all-gather統合によるカーネルレベル1.5〜3倍高速化、適応的な投機的トークン予算によるDSpark TTFTの約60%改善、共有エキスパート分割によるGPUあたり約17 GiBのメモリ削減を実装。V2モデルランナー経由でROCmでも動作する。
  • DeepSeek V4: sparse MLAを通常decode、MTP、DSpark投機的デコーディングでエンドツーエンド対応。AMD Quark NVFP4、reasoning-effortプロンプト、疎top-kメタデータカーネル最適化、eager CUDAグラフ領域の絞り込み、gfx11/gfx950でのROCm有効化を追加。
  • 投機的デコーディング: ローカル畳み込みと候補セレクターを備えたDFlash2、信頼度スケジュール検証を用いるDSpark、ドラフトモデル向けの非同期スケジューリング自動有効化を導入。
  • 新デフォルト: max_num_batched_tokens を8192から16384へ引き上げ、Mambaモデルではprefix cachingをデフォルト有効、BlackwellのCUDAグラフ取得デフォルトを1024へ引き上げ。

いずれもプロジェクト側の公称値・実装報告であり、特定のモデル・ハードウェア・バッチ条件での独立した再現評価が推奨される。

基盤強化:Model Runner V2、階層KVキャッシュ、Rust/gRPC

推論基盤のアーキテクチャ面でも大幅な更新が行われた。

  • Model Runner V2の成熟: E/P/D分離(encode/prefill/decode disaggregation)、重みオフロード、複数レイヤーのMTP KVキャッシュ対応、エンコーダーCUDAグラフ、デコーダーのトークン単位プーリング、attention-freeモデル対応、thinking_token_budget 対応など。
  • 階層KVキャッシュのオフロード: ディスクへのオフロード対応、外部セカンダリ階層マネージャを module_path で利用可能に、部分的なセカンダリ階層ロード、階層化メトリクス、並列度に依存しないCPUレイアウトの正規化。
  • RustフロントエンドとgRPC: スタンドアロンレンダラー、gRPC経由のマルチモーダル画像推論、データ並列ランクの明示的ルーティング、RLライフサイクル制御を追加。protobufスキーマはBufで公開された。
  • 新モデル対応: Muse Glimmer、Ling 3.0 Flash(BF16/MTP/パーサーやFP8派生・MXFP4)、Dots3 NOTEのネイティブマルチモーダル、Interns2mobiusなどを新たにサポート。Qwen3.8のROCm対応やQwen3.5 GDN向け融合カーネルも含む。

破壊的変更と提供形態

  • 破壊的変更: bitsandbytesサポートはout-of-treeプラグインへ移行、Transformersは5.15.0へ更新、非推奨の calculate_kv_scalesoverride_attention_dtype は削除された。
  • 提供形態: PyPI(CUDA 13.0がデフォルト、pip install vllm)、ROCm向けwheel(--extra-index-url https://wheels.vllm.ai/rocm/0.28.0/rocm722)、Dockerイメージ(vllm/vllm-openai:v0.28.0、CUDA 12.9/ROCm/CPU/XPUバリアント)、ソースtarballなど。GitHub ReleasesのAssetsセクションで配布される。
  • 移行時の注意: Transformersやbitsandbytes依存を更新している環境では、依存解決とプラグイン導入の再確認が必要。max_num_batched_tokens のデフォルト変更はスループット向上が期待される一方、メモリ使用量の増加に注意が必要だ。

出典

掲載内容は公開時点の情報に基づきます。重要な判断では、一次情報と最新の提供条件をあわせてご確認ください。