NAW / PRODUCTS 03
IMAGE: AI生成ビジュアル
PRODUCTS / Products
TwelveLabsの動画埋め込みモデル「Marengo 3.0」がAmazon BedrockのKnowledge Basesで利用可能に
TwelveLabsのMarengo Embed 3.0がAmazon BedrockのマネージドKnowledge Basesで埋め込みモデルとして一般提供に。フレーム抽出・音声書き起こし・セグメントごとの埋め込み生成をマネージドに任せ、自然言語で動画・画像・音声を意味検索できる。クエリはRetrieve APIまたはAgentCore経由。
TwelveLabsの動画埋め込みモデル「Marengo Embed 3.0」が、Amazon BedrockのマネージドKnowledge Bases(MKB)で埋め込みモデルとして一般提供になった。AWSの公式ブログが使い方のウォークスルーとともに伝えたもので、TwelveLabs側もMarengoとしてBedrockのマネージドKnowledge Baseに入った初の動画モデルだとしている。映像ライブラリを接続すれば、テキストを検索するように意味内容で動画・画像・音声を探せる。
マネージドKnowledge Baseでの動き
- 取り込み: Amazon S3上のマルチモーダルコンテンツを取り込み、マネージドMKBがフレーム抽出・音声書き起こし・セグメントごとのMarengo Embed 3.0埋め込み生成・インデックスへのベクター書き込みを自動実行する。
- 検索: アプリケーションはBoto SDKのRetrieve API、またはAmazon Bedrock AgentCoreのGatewayターゲットとしてナレッジベースにクエリする構成が示されている。
- 料金: マネージドKnowledge Basesは保存・取得の従量課金で、Marengo Embed 3.0による埋め込み生成は標準のAmazon Bedrock料金で請求されるとしている。
Marengo 3.0の位置づけ(TwelveLabs公称)
- 概要: 動画・音声・テキスト・画像とそれらの組み合わせを扱う実世界向けマルチモーダル埋め込みモデル。多言語の動画アーカイブ、作曲検索、音声理解、スポーツ分析、OCRなどを狙うとしている。
- 効率: 512次元の埋め込みで、Amazon Nova(3072次元)比で6倍、Google Vertex(1408次元)比で3倍の保存効率だとしている(TwelveLabsの公称値)。
- 性能と速度: 合成性能73%で最高、レイテンシは動画1秒あたり0.05秒(正規化値)で最速とし、Novaは1秒あたり1.5秒超で30倍遅いとしている(いずれもTwelveLabsの公称値で、独立した第三者評価は示されていない)。
- ベンダー公称値と独立評価は区別が必要で、実際の精度・速度・コストはデータと言語・利用条件に依存する点に留意が必要だ。