問い合わせメールを「至急対応」と「あとで確認」に振り分けたい。レビューの文章から満足度を数値で拾いたい。こうした単純な判定にAIを使いたいが、クラウドのAPIに文章を送るたびに料金が発生し、社外にデータが出るのも避けたい——。本サイトは2026年9月に、この手の判定だけを高速にこなすAIモデル「Jev」を2回取り上げた。Jevは文章を生成せず、選択肢や点数を一瞬で返す設計で速かったが、TypeSafe AIが提供するクローズドなAPIとしてしか使えなかった。
2026年9月18日、Jevと同じ通信規格に対応しながら、無料で自分のパソコンにも置ける互換モデル「Laya」が公開された。Apache 2.0ライセンスのオープンウェイトで、Jevを呼び出していたコードをほぼそのまま使い回せる。無料で肩代わりできるとなると、次に気になるのは、本当にJevの代わりになるほど速く正確なのかという点だ。
Layaは何を肩代わりするのか
Jevは、文章を一文字ずつ書きながら答えを組み立てる通常のAIとは違い、渡された文章を一度読んだだけで、あらかじめ決めた選択肢や0〜1の点数を直接返す。文章を書く工程そのものを持たないぶん速く、出力の形も崩れない。この設計をTypeSafe AI自身は、公式ブログで「System 1」(考えずに直感で即答する思考)と呼んでいる。
Laya(GitHub)は、開発元Convai InnovationsがApache 2.0で公開した、この System 1 型の判定モデルだ。Jevが使うPOST /v1/systemoneという通信規格にそのまま対応しており、公式READMEは「既存のJevクライアントをそのまま使える」と明記している。導入もpip install layaだけで、コマンド1つ(laya "text" --predict)から試せる。
モデルは421M(英語専用)・322M(多言語版、45以上の言語をベンチマーク済み)・421M(業務判定に特化したtyped-decisions版)の3種類が公開されている。
Layaが返せる答えの形はJevと同じく3種類ある。冒頭で挙げた「振り分けたい」「点数を拾いたい」という場面は、そのままこの3つに対応する。
choice: 「至急対応・通常・低優先度」のように、決めた選択肢から1つを選ばせるscore: 満足度などを0〜1の点数で出させるnoul: 「エスカレーションが要るか」に「はい/いいえ」で答えさせる
ここまでで分かるのは、Jevが持っていた「速い判定」という特徴が、無料で・自分の環境に置ける形でも手に入るようになった、という点だ。開発元のConvai Innovations自身は、この互換モデルの速さと正確さをどう主張しているのだろうか。
公式ベンチマークが主張する数字
Laya公式サイトと先の GitHub README は、Tesla T4 GPU 1枚での計測として次の数字を並べている。多言語版の単一質問あたりのレイテンシは32.8ミリ秒。業務判定を模したtyped-decisionsベンチマーク(4つの業務シナリオ・計2,000件の判定)での正答率は0.766で、Jev自身の0.727を上回るとしている。較正誤差(モデルが申告する確信度と実際の正答率のずれ、小さいほど良い)も、温度調整後の値でLayaが0.081、Jevが0.246と主張している。
この0.766という数字は4つの業務シナリオの平均で、Hugging Faceのモデルカードはシナリオごとの内訳も公開している。
| 業務シナリオ | 正答率 |
|---|---|
| 請求書処理 | 0.804 |
| セキュリティインシデントの判定 | 0.766 |
| カスタマーサポート | 0.764 |
| AIエージェントの動作記録の監視 | 0.730 |
数値の差が大きいわけではない。それでも内訳を見ると、請求書処理のような形式が決まった文章より、カスタマーサポートやエージェントの監視記録のような文脈依存の判定のほうが、Layaにとってやや分が悪いと分かる。
これらはあくまでConvai Innovations自身が計測した数字だ。無料で速いという触れ込みが本当かどうかは、実際に動かした人の結果と突き合わせて初めて確かめられる。
実機ではどれくらい速いのか
GMOインターネットグループ グループ研究開発本部の技術者は、Apple Silicon向けに最適化された版(Laya-MLX)をMac上で実際に動かし、ブログで報告している。試したのは次の2つの業務例だ。
- 問い合わせのエスカレーション判定(「はい/いいえ」で回す
noul) - ECサイトレビューの感情分析(点数で回す
score)
初回を除く体感レイテンシはLayaが35〜50ミリ秒だった。比較のために動かしたJevは210〜240ミリ秒で、同じ人が同じ環境で両方を動かした数字なので、公式発表より実感に近い。
同じマシン、同じ2つの業務例で比べても、Layaの応答はJevよりはっきり短い時間で返ってきた(GMOブログ)。無料のオープンウェイト版のほうが遅いだろう、という予想を自分は持っていたので、この差は意外だった。
なぜここまで速くできるのか
種明かしは単純で、Layaも Jev と同じく文章を生成しない。双方向エンコーダと呼ばれる仕組みで入力全体を一度に読み込み、生成の工程を経ずに、選択肢ごとの確率や点数を1回の計算(単一フォワードパス)で直接出力する。ふつうのAIが答えを1語ずつ書き足しながら組み立てるのに対し、Layaは「読み終えた時点で答えも決まっている」状態を作る設計になる。
生成という重い工程をまるごと省いているので、クラウドの大きなGPUを使わなくても、手元のノートパソコンでJevと張り合える速さが出る。これがGMOの検証で見えた速度差の理由になる。
確認すべき条件
一方で、この設計には注意点もある。先のGMOの検証では、速さと同時に判定の誤りも見つかっている。
- レビュー分析: 複数件のうち2件で主な不満点を誤って検出し、確信度が0〜6%か100%近くのどちらかに偏った
- エスカレーション判定: Layaの正答は5件中3件にとどまり、同じ条件で動かしたJevの5件中5件を下回った
Zennに投稿された検証記事(genelab_999氏)は、GitHub README・公式サイト・Hugging Faceのモデルカードという3つの公式資料の数字を突き合わせている。同じ「正答率」でも、資料ごとに定義が違うと指摘した内容だ。
もっとも実務に関わるのは、確信度についての発見だ。Hugging Faceのモデルカード自身が「多言語版は系統的に自信過剰」と明記している。Zennの検証はその具体例として、クメール語では正答率が0%なのに平均確信度は95.2%と出るケースを示した。GMOが実機で見た「確信度が極端に振れる」挙動と、Zennが資料上で見つけた「確信度が実態と合わない」という指摘は、別々の検証でありながら同じ弱点を指している。
つまり、確信度が高い答えだけを自動で採用し、低いものは人が見直す、という運用を組む場合、対象がラテン文字の言語であることが前提になる。非ラテン文字言語を扱うなら、確信度の数値をそのまま足切りの基準に使わないほうがよい。
まとめ
Jevと同じ「文章を生成せず判定だけを即答する」AIモデルが、Apache 2.0の無料モデル「Laya」として使えるようになった。実際にMac上で動かした検証では、同じ業務例でJevより大幅に短いレイテンシが確認されている。仕組みは、生成の工程を持たず入力を一度読むだけで答えを出す双方向エンコーダで、これがそのまま速さの理由になっている。確信度の較正は非ラテン文字言語で崩れる場合があると公式のモデルカード自身が認めているので、対象言語を確認したうえで自動判定の閾値に使えば、Jevの有料APIに頼らずとも同じ種類の判定を手元でこなせる。
コメント
気づきや感想をどうぞ記事への補足や、読んで考えたことをお寄せください。個人情報や、他の人を傷つける内容の投稿はお控えください。
投稿にはGoogleログインが必要です。
Googleでログイン投稿にはGoogleアカウントの表示名が公開されます。メールアドレスは取得・公開しません。
コメントを読み込んでいます…