要点
Cloudflareは10月9日、音声、動画、画像、テキストを一つのリクエストで扱う判定モデルClef-omniを公開しました。複数のメディアを順に文字起こし・要約する代わりに、定義した選択肢や項目を返す処理を一回へまとめられるため、画像付きの検品や音声付きの設備記録のような入力で、経路を設計し直す選択肢になります。
何が変わったのか
Cloudflare Blogの発表(Cloudflare、2026年10月9日)は、オープンウェイトの判定モデル群にClef-omniを加えたと案内しています。wav/mp3の音声、mp4/webmの動画、画像、テキストを受け付け、質問ごとに定義したスキーマへ判定を返す設計です。公式の例は、設備写真、運転音、ファン動画から、ラベルが読めるか、異音があるか、ファンが動いているかを同時に判断します。
料金と制約にも変更があります。Clef-omniは入力100万トークンあたり0.15ドルで開始、Clef-flashは0.09ドルから0.038ドルへ値下げされました。一方、ホスト版Clef-flashのコンテキスト長は64kから24kへ短縮されています。Clef本体は64kのまま、ホスト版の中央値は入力約800トークンで262msから152ms、約3,400トークンで616msから305msになったと同社は説明します。
どこで効くのか
音声、静止画、動画を別々に前処理してからテキストモデルへ渡している処理では、媒介ファイルの保存、同期、失敗の扱いが増えます。Clef-omniは、最終的に必要なものが自由文の要約ではなく、合否、分類、転記候補のような定型判断である場面に向きます。たとえば保守受付では、利用者が送った写真・短い録音・動画を一つの検査項目へ結び付けられます。
ここからは編集部の見立てです。単一APIにすると入力経路は短くなりますが、誤判定時の根拠確認まで不要になるわけではありません。まずは人が再確認できる低リスクの項目に限定し、元のメディア、判定結果、再確認結果を分けて記録すると、前処理を減らした効果と精度の差を比較できます。
導入するか
採用判断
様子見 — 複数形式の入力から定型の判定を返す既存フローには評価価値があります。ただし、Clef-flashの24kへの短縮は長い入力を前提にした利用者に影響するため、値下げだけで置き換えないでください。モデルの適合性、料金、入力サイズ、再確認手順を同じテストデータで確認してから選びます。
15分ミニ課題
- リポジトリ内のアップロード処理、問い合わせフォーム、または保守記録の設計メモから、画像・音声・動画のうち二つ以上を別々に扱う経路を一つ選びます。なければ、扱う予定のメディアを二つ挙げます。
- その経路で最終的に必要な定型判定を三つまで書き出します。自由文の要約ではなく、
はい/いいえ、分類、必須項目の有無に限定します。 - 入力のサイズ上限、元ファイルの保持先、人による再確認の担当を一行ずつ記録します。
- 24kを超える可能性がある入力があればClef-flashへの切替候補から外し、なければ小さな検証用データセットを作るところまでを完了条件にします。
前提知識
判定モデルは長い回答を生成するモデルではなく、あらかじめ決めた選択肢や項目を返す用途に向きます。入力トークン換算と対応形式は料金へ影響するため、実装前にCloudflareの開発者ドキュメントで最新条件を確認してください。
参照元
- Introducing Clef-omni with full multimodality, plus a faster Clef and a cheaper Clef-flash — Cloudflare Blog、2026年10月9日。対応メディア、料金、コンテキスト長、速度、利用例を掲載。