AIプロダクトの操作画面とモジュールを表す抽象ビジュアル
NAW / PRODUCTS 03

IMAGE: AI生成ビジュアル

PRODUCTS / Developer Tools

Transformers v5.17.0公開 — HYV4・VibeVoice・KimiLinearなど6モデル統合、Vision RoPEを標準化

Hugging Face Transformers v5.17.0が6つの新アーキテクチャ統合を含む安定版マイナー更新。780B級MoEのHYV4、長尺多話者音声合成VibeVoice、MoonshotのKimiLinearなどを追加し、Vision系の回転位置埋め込みを統一モジュールへ移行する破壊的変更も含む。

Hugging Faceは2026年9月9日(UTC)、Transformers v5.17.0 を公開した。GitHub Releasesで発表された安定版(stable、prerelease・draftではない)のマイナーアップデートで、言語・音声・マルチモーダル検索にまたがる6つの新モデルアーキテクチャ統合が中心。Vision系モデルの回転位置埋め込み(RoPE)を統一モジュールへ標準化する破壊的変更や、生成ループの高速化も含む。

新規統合:6アーキテクチャの概要

  • HYV4(Hy4-Preview): リリースノートによれば780BパラメータのMixture-of-Experts言語モデルで、トークンあたり49Bパラメータが活性化、コンテキスト幅は100万トークン。Multi-head Latent Attention(MLA)、DeepSeek Sparse Attention(DSA)、学習可能なattention sink付きGated MLA、Independent Hyper-Connections(iHC)の組み合わせと記載されている。多トークン予測(MTP)層は実行されず、チェックポイント内の重みは読み込み時に無視される。
  • VibeVoice: LLM構造内でnext-token diffusionを用い、複数話者の長尺音声(ポッドキャストや複数人オーディオブック向け)を合成する枠組み。量子化キャッシュ関連の修正も同リリースに含まれる。
  • NeoMME: 多言語テキストトークンと画像生パッチを単一の双方向Transformerエンコーダで処理する、260M・800Mパラメータのマルチモーダル多言語基盤エンコーダ群。文書検索向けにファインチューニングされたNeoMME-Retriever(late-interactionとdenseの joint 目的)も同時統合。
  • Fun-ASR-Nano: Alibaba DAMO AcademyのFunAudioLLMチームによる800Mパラメータのエンドツーエンド音声認識モデル。中国語・英語・日本語(7方言・26地域アクセントを含む)対応、ホットワードカスタマイズ、句読点の直接出力を特徴と記載。
  • KimiLinear: Moonshot AIのハイブリッド線形注意アーキテクチャ。チャンネルごとの忘却ゲートを持つKimi Delta Attention(KDA)を大半の層に使い、4層ごとにDeepSeek-V3流のMLAによるfull-attentionブロック、フィードフォワードは共有エキスパート付きMoEという構成。
  • Canary-1B-v2: 高速・頑健な多言語ASR/音声翻訳(AST)モデル。Parakeet由来のFast Conformerエンコーダと、デコーダプロンプト接頭辞でタスク(転写/翻訳)を切り替えるTransformerデコーダの組み合わせ。

破壊的変更と基盤改善

  • Vision RoPEの標準化(破壊的変更): Vision系の2D/3D回転位置埋め込みが統一的なRoPE周波数計算モジュールに標準化された。注意層レベルやモデル固有のRoPEグリッド処理に依存するカスタムVisionモデルは、新しい中央実装(modeling_rope_utils.py)への移行が必要。
  • 生成(Generation): デコードの各ステップでアクセラレータ同期を行わない最適化によりステップ毎のオーバーヘッドを削減。生成時にリモートのHubファイルを無条件ダウンロードしない修正、encoder-decoderモデルの自動コンパイルキャッシュ検査の強制など正確性修正も含む。
  • キャッシュ・カーネル: VibeVoiceの量子化キャッシュ不具合、paged attentionのキャッシュなし呼び出し時の静かな失敗などの修正。カーネル側はHubカーネル関数が低速な純PyTorch参照実装へ黙ってフォールバックする際の警告追加などが含まれる。

前回のv5.16.0(Qwen4-Expなど4モデル統合)に続く大型のモデル統合リリースであり、音声系(VibeVoice、Fun-ASR-Nano、Canary)と効率的注意アーキテクチャ(KimiLinear、HYV4)の二軸が目立つ。Vision RoPEの移行が必要な利用者は、リリースノートのBreaking changesと各モデル文書の確認が必要だ。

出典