開発ツールのワークフローが立体的につながる抽象ビジュアル
NAW / PRODUCTS 03

IMAGE: AI生成ビジュアル

PRODUCTS / Developer Tools

Transformers v5.16.0公開 — Qwen4-Exp/Step-3.7-Flash/Granite Speech 5対応とNVFP4量子化、DTensor並列化を強化

Hugging Face Transformers v5.16.0が4つの新モデルアーキテクチャと破壊的変更を含むマイナー更新。Qwen4-Expのハイブリッド注意、Cohere Compass、Step-3.7-Flash、Granite Speech 5を統合。

Hugging Faceは2026年8月26日、Transformers v5.16.0を公開した。GitHub Releasesで発表された安定版(stable)のマイナーアップデートで、Qwenによる次世代ハイブリッドアーキテクチャ「Qwen4-Exp」、軽量CTC音声認識「Granite Speech 5 Turbo」、198B MoE視覚言語モデル「Step-3.7-Flash」、Cohereの小規模特化モデル「CohereCompass」の4アーキテクチャを新たに統合した。推論効率と長文脈対応を狙った量子化・キャッシュ・並列化の基盤強化も含む大規模更新だ。

新規モデル:ハイブリッド注意とMoE、軽量ASRを統合

  • Qwen4-Exp: Qwen3.5のハイブリッド text/multimodal を拡張し、3要素で構成される。
    • GatedResidual(GR): Hyper-ConnectionとGatedNormを組み合わせ、Attention/MoEブロック前後で複数residual streamを要素単位ゲーティングで混合・注入量を制御。
    • Qwen Sparse Attention(QSA): 複数query headで圧縮されたkeyブロックをスコアリングし、関連度の高い連続トークンブロックのみを選択。末尾の不完全ブロックは非圧縮で保持し、インデックス負荷とメモリ局所性を改善。
    • Gated DeltaNetとの併用で線形注意と疎注意を統合した初のハイブリッド構成を実現し、長文脈推論の効率を大幅に高めると説明される。
    • Per-Layer Embedding(PLE): 選択したdecoder層に、ハッシュ化n-gramとdilated depthwise畳み込み由来の語彙特徴を付与。
  • Granite Speech 5.0 Turbo CTC: 約470Mパラメータのconformerエンコーダによる軽量ASR。BPEターゲットのCTC学習、1回のforward pass+greedy CTCデコードで転写が完了し非自己回帰。フレームスタッキング+block-wise時間サブサンプリングで合計8倍の時間圧縮、ブロックattention(Shaw相対位置埋め込み)、中間層CTC事後確率を隠れ状態へフィードバックするself-conditioned CTCを備える。
  • Step-3.7-Flash: StepFunの198B疎MoE視覚言語モデル(言語196B+視覚1.8B)。先頭3層を除く全decoder層で288 routed experts(top-8)+共有expert 1つをsigmoid+学習バイアスでルーティング。Gated Attention、multi-token prediction(use_mtp=Trueで投機的デコード)、SigLIP系ViT(2次元RoPE)と動的画像タイリングを備える。
  • CohereCompass: Cohereの小規模特化(vision-)languageモデル向けベースアーキテクチャ。

いずれもTransformers側の統合実装であり、モデル本体の性能値は各モデルの公式カード・技術レポートに依存する。本リリース自体にベンダー公称のベンチマーク比較チャートは含まれていない。

基盤強化:量子化・キャッシュ・並列化

  • 量子化: HF kernels経由のNVFP4量子化を新規サポート。BF16重みをオンザフライで量子化し約50%のメモリ削減を謳う。圧縮形式チェックやCLIP初期化、KVキャッシュ専用量子化の不具合修正も実施。
  • キャッシュ: sliding windowキャッシュのoff-by-one、Whisper投機的デコードのキャッシュ破損、Qwen2.5-Omni/Qwen3-Omni-MoEのcompilable cache生成など複数バグを修正。負値によるcache cropの文書化、レイヤーごとの異なるsliding_window/attention_chunk_size設定を可能にするper-layer cache設定を追加。
  • 生成(Generation): Emu3の画像生成、OLMo/GPTNeoXの不正出力、候補生成器のlogit分布整合など生成まわりの修正。サンプリング時のlogit processor適用後のlogits返却で分布を揃える改善も含む。
  • 並列化: DTensorネイティブバックエンドへ移行(破壊的変更)。tp_planは非推奨サイクルを経て移行が必要。加えて、重み共有/非共有embeddingに対応した素朴なパイプライン並列推論エンジンを追加しgenerate()と統合。BLTのmodel parallelバグも修正。
  • カーネル/Attention: Flash Attention 2 hub kernelのデフォルトをv3へ更新、SigLIP2文書修正、GPT-2 cross-attentionマスク破棄の修正、TimmWrapperのSDPA宣言などを実施。

破壊的変更と移行注意

  • DTensor移行: 従来のテンソル並列実装はDTensorベースに置換された。旧TP APIで推論・学習している環境は新インターフェースへの移行が必須。
  • SDPA dispatch挙動変更: attn_implementation=\"sdpa\" がwav2vec2_conformer、wav2vec2-bert、SeamlessM4T/v2で正式サポートされ、回避策を入れていた環境では初期化挙動が変わる可能性がある。
  • Processor変更: FuyuProcessorimage_patch_indicesを返さなくなり、該当フィールド依存コードの修正が必要。
  • その他: パイプラインのmodel.generation_config優先順位保持、Qwen3-VLビデオプロセッサの per-frame pixel cap オプションなど運用改善も含む。

開発者はpip install -U transformersなどで更新可能。Transformers 5.15系からの更新時は、DTensor移行とFuyu/量子化関連の破壊的変更点を確認のうえ依存関係を再検証することが推奨される。

出典