海外の見慣れないドメインからアクセスが来た。よくある通販サイトなのか、個人情報を盗むフィッシングサイトなのか。こうした「選ぶだけ」の判定をAIにやらせたいとき、ふつうの対話型AIは答えの文章を書き終えるまで待たされ、出力の形も毎回少し崩れる。
Cloudflareは2026年10月1日、この判定だけを高速にこなす自社開発のAIモデル「Clef」を公式ブログで発表した。文章を生成せず選択肢の確率をそのまま返すこの種のモデルを、本サイトはJevと、その無料版「Laya」として2回取り上げてきた。Clefはこの系譜に加わった3つ目のモデルで、画像・動画も判定対象にできる点と、Cloudflare自身が実務で速さを確かめている点が新しい。
Clefは何が新しいのか
Jev・Layaはどちらもテキストだけを判定対象にしていた。Clefはここにビジョンエンコーダを備え、画像や動画も入力にできる。公式ブログは「Jevは今のところテキスト分類しかできない」とこの違いを明記している(Cloudflare公式ブログ)。レシートの画像を渡して「金額が読み取れるか」を判定させる、といった使い方がそのまま想定されている。
対応できる文脈の長さも伸びた。CloudflareはJevの3万2千トークンに対し、Clefは6万5,536トークン(64k)まで扱えるとしている(同ブログ)。判定材料に長い会話履歴や複数のドキュメントを渡したいとき、途中で切り詰めずに済む範囲が広がった。
もっとも、Clefは後発の模倣ではない。Cloudflareは、Jevが登場したのと同じ週に、自前の決定モデルの実験を既に公開していたと明かしている。もとにしたのは、研究者Matt Mastracciの独立研究だ。画像生成系のモデル「DiffusionGemma」を改造し、確率を直接出力させる手法を試していたという(同ブログ)。後のベンチマーク表に並ぶ「DiffusionGemma Jev」は、この時点の試作にあたる。Clefは、この実験をQwenベースの土台に乗り換えて仕上げた後継になる。
では、この新しい仕様は実務でどれだけ使えるのか。
自社の脅威分析で起きた2倍の差
仕様が伸びても、実務で使えるほど速くなければ意味がない。Cloudflareはこの点を、自社の脅威インテリジェンス業務で検証している。アクセス元のドメインをブラウザで表示・解析させる。それをClefに渡し、「ファッションサイトらしさ95%、ECサイトらしさ85%、フィッシングの可能性1%未満」のように、業種とリスクを確率付きで分類させる使い方だ(同ブログ)。
この処理にかかった時間は2.2秒。同じ作業を汎用の大型LLM「gpt-oss-120b」にやらせたところ4.7秒かかり、しかも返ってきた分類は2種類にとどまったという(同ブログ)。時間で2倍以上、判定できた項目数でもClefのほうが多かった。
Cloudflareが運営するベンチマーク「Jev Decision Index」でも、同様の傾向が出ている。
中央値のレイテンシで見ると、Clefは209.3ミリ秒、より軽量なClef-flashは38.8ミリ秒で、Jevの524.1ミリ秒を大きく下回る(同ブログ)。精度でも、いずれもClefが上回った(同ブログ)。問い合わせ内容の分類(BANKING77)はClefが94.20、Jevが79.74。意図の判定(CLINC150+OOS)はClefが97.43、Jevが89.27だった。
ただし、Clefが常に上回るわけではない。Typesafe社自身の業務別評価では、請求書処理・カスタマーサポート・セキュリティインシデントの3業務で、Clef系がJevを上回った。一方、AIエージェントの行動記録を監視する業務だけは違う。Jevの71.6が、Clef・Clef-flashの68.5・69.8を上回った(同ブログ)。エージェントの振る舞いを監視する用途で乗り換えを検討するなら、この1点は手元のデータで確かめたほうがよい。
では、なぜここまで速くできるのか。
文章を書かない仕組み
ふつうの対話型AIは、答えの文章を1語ずつ書き進める。次の単語を選ぶたびにモデル全体を計算し直すので、答えが長くなるほど待ち時間も伸びる。
Clefはこの工程そのものを持たない。入力をQwenベースの土台に1回だけ読み込ませ、答えの文章は一切書かずに済ませる。文章を1語ずつ生成する工程がないという意味で、この設計を非自己回帰と呼ぶ(Cloudflare公式ブログ)。
読み込んだあとの採点には、専用の部品が働く。土台の最終的な内部状態から、あらかじめ決めた質問それぞれの選択肢へ証拠を振り分け、全質問・全選択肢の点数を1回の計算でまとめて出す部品だ。Cloudflareはこれを「joint schema head」と呼んでいる(Hugging Faceのモデルカード)。
土台のQwenモデル自体は凍結したまま、ランク256の低ランクアダプタ(LoRA)とこの専用ヘッドだけを追加で学習させている(同ブログ)。
学習済みの巨大なモデルにはほとんど手を加えず、後ろに付け足した小さな部品だけを鍛える。土台を1から作り直すより、短い期間で済む学習方法だ。Cloudflareはこれに加え、確率の精度(較正)を高めるための強化学習も独自に開発したと説明している(同ブログ)。
1語ずつ書く工程自体がないから、質問がいくつ増えても計算は1回で済む。2.2秒という数字が出た理由はここにある。
とはいえ、速さだけが利点ではない。実際に自分のサービスへ組み込むには、何が要るのか。
組み込むには何が要るか
ClefのAPIは、JevやSystemOneと完全に互換性がある。渡せる質問の型は3種類あり、これはJev・Layaと同じ形になる(Hugging Faceのモデルカード)。
noul: 「至急の対応が要るか」のような「はい/いいえ」の判定choice: 「どの担当チームが扱うか」のように、決めた選択肢から1つを選ばせるscore: 「影響の深刻度」のように、順序のある段階で評価させる
JevやLayaを呼び出していたコードは、送信先をClefに変えるだけでほぼそのまま動く。
利用はCloudflareのWorkers AI上で@cf/cloudflare/clefとして呼び出す形になる。料金は入力100万トークンあたり0.24ドルだ(Cloudflare Developers)。価格表を見て最初は出力側の料金を探したが、見当たらない。考えてみれば当然だ。Clefは文章を一切生成しないので、出力トークンという課金の対象そのものが存在しない。
Hugging Faceでは重みがApache-2.0ライセンスで完全に公開されている。Workers AIを使わず、自分のサーバーに置いて動かすこともできる(Hugging Face)。特定の業務に合わせて追加学習したい場合、まずはCloudflareのエンジニアチームが伴走する形で調整を請け負う。将来的には、利用者自身がデータの収集から再学習・配備までをCloudflare上で完結できるセルフサービス型の仕組みに広げる計画だという(同ブログ)。こちらの提供開始時期はまだ決まっていない。
まとめ
Clefが加わったことで、文章を生成せず判定だけを即答するAIは、テキストに限らず画像や動画も対象にできるようになった。Cloudflare自身がドメイン分類という自社業務に組み込み、大手LLMの2倍近い速さで処理できることも確かめている。速さの理由は、1語ずつ文章を書く工程を持たず、入力を1回読むだけで全質問の確率をまとめて返す非自己回帰の設計にある。JevやLayaのAPIをそのまま使えるうえ、オープンウェイトで自分のサーバーでも試せる。判定業務の振り分けに時間がかかっていると感じているなら、既存のコードを大きく書き換えずに試せる選択肢が1つ増えたことになる。
コメント
気づきや感想をどうぞ記事への補足や、読んで考えたことをお寄せください。個人情報や、他の人を傷つける内容の投稿はお控えください。
投稿にはGoogleログインが必要です。
Googleでログイン投稿にはGoogleアカウントの表示名が公開されます。メールアドレスは取得・公開しません。
コメントを読み込んでいます…