Litmus — 話題のニュースを、深く読み解く。 RSS
AI

1ビット量子化で、20億パラメータのAIがメガネに収まった

PrismMLの新モデル「1-bit Bonsai」は、重みを1ビットで持つことでメモリを4分の1近くに圧縮し、Qualcomm製メガネ向けチップ単体で20億パラメータの視覚言語モデルを動かす。仕組みを確認する。

黒縁の眼鏡をかけた人物が、レンズ越しに視線を向けている接写

イメージ写真 記事の内容を撮影したものではありません。Photo by Kindel Media on Pexels

この記事には Amazon アソシエイトのリンクを含みます。

メガネをかけているだけで、視界に映っているものについてAIが答えてくれる。そんなスマートグラスの宣伝文句を見るたびに、自分はどこか半信半疑だった。あの細いフレームの中に、AIモデルを動かすだけの余力があるとは思えなかったからだ。

答えは、AIモデルの中身である「重み」の持ち方にあった。AI開発企業PrismMLが2026年9月23日(米国時間)に発表した新版「1-bit Bonsai」は、重みを1ビットまで切り詰めて保存する(PrismML公式プレスリリース)。この工夫だけで、20億パラメータの視覚言語モデルがメモリ0.43GBに収まり、Qualcomm製のメガネ向けチップだけで動かせるようになった。

重みを1ビットにするとは、具体的に何をしていることなのか。精度を削った分だけ、受け答えの質も落ちてはいないのか。数字を追いながら確かめていく。

AIがメガネで動く理由

なぜメガネのような小さな端末で、AIモデルが動くようになったのか。出発点は、PrismMLとQualcommがSnapdragon Summit 2026で明らかにした組み合わせにある(TechCrunch)。

発表された「1-bit Bonsai」のスマートグラス版は、言語を扱う部分(1.7B、1ビット)と、画像を理解する部分(0.3B、4ビット)を組み合わせたモデルだ。合計のパラメータ数は20億になる。文章だけでなく画像も理解できるこの種のモデルは、視覚言語モデル(VLM)と呼ばれる。ふだん使うチャットボットが文字だけを読み書きするのに対し、VLMはカメラが捉えた映像も入力として受け取れる点が違う。

一度に読める文章の長さは1,024トークンだ。動作環境はQualcomm Snapdragon AR1 Gen 1というチップで、その中のHexagon NPU(AI処理専用の回路)の上で動く(PrismML公式プレスリリース)。

装着者が見ているものを理解し、その場の状況に応じて答える。それが想定されている使い方だ(TechCrunch)。PrismML自身は想定する用途として、視覚の理解・文脈をふまえた推論・その場での応答の3つを挙げている(PrismML公式プレスリリース)。この仕組みを支えているのが、「重みを1ビットで持つ」という圧縮の仕方になる。では、その1ビットとは何をどう減らしているのか。

重みを1ビットにする仕組み

重みを1ビットにするとは、何をしていることなのか。スマートグラス版の言語モデル部分だけを取り出して比べると、答えが数字で見えてくる。ふだん使われる4ビット精度の版はメモリを1.66GB占める。それを1ビットにした版は0.43GB、約4分の1の大きさに縮む(PrismML公式プレスリリース)。

AIモデルの中身は、パラメータと呼ばれる数値の集まりだ。この数値1つ1つを「重み」と呼ぶ。ふだんの4ビット版は、1つの重みを16段階の細かさで保存している。写真の濃淡を256段階のグレースケールで持つか16段階で持つかの違いに近い。1ビット版は、この段階を実質2つ、-1か+1かだけに減らす。

値の種類を減らすほど、1つの重みを書き表すのに必要な情報量は減る。情報量が減れば、同じメモリの中により多くの重みを詰め込める。これが、メモリを4分の1に縮める理由になる。1-bit Bonsaiでは、この2値の重みだけでは表現が粗くなりすぎるため、重みのグループごとにおおまかな大きさを表す倍率を1つ添えている(orcarouter.aiのブログ記事)。この倍率が、2値だけでは失われる情報の粗さを補っている。

精度を削ったのは重みの表現方法であって、モデルが扱える語彙や仕組みそのものではない。

0.00.20.40.60.81.01.21.41.64ビット版: 1.661ビット版: 0.431.660.434ビット版1ビット版GB

0.43GBと1.66GBの差が、そのままメガネに載るかどうかの分かれ目になる。サイズを4分の1近くまで削って、受け答えの質は本当に保たれているのか。

性能は落ちていないのか

サイズを削った分だけ性能も落ちていそうなものだが、PrismMLが公表した評価はそうなっていない。同社は1ビット版を、大きさの近いQwen 3 1.7B(4ビット版)と、次の8種類のベンチマークで比較した(PrismML公式プレスリリース)。

  • BFCL v3
  • HumanEval+
  • MMLU Redux
  • IFEval
  • IFBench
  • MuSR
  • GSM8K
  • GPQA Diamond

比較対象のQwen 3 1.7Bは、PrismML以外の企業が開発した、大きさの近い軽量モデルだ。自社の旧版ではなく他社製のモデルを比較対象に選んでいる点は、自分には妥当な比べ方に見える。

結果についてPrismMLは「comparative benchmark results(同等の結果)」と説明している(PrismML公式プレスリリース、orcarouter.aiのブログ記事)。ただし、個別の点数までは公表していない。この比較はPrismML自身が実施・公表したもので、第三者による独立した再現は今のところ確認できていない。効果を判断するときは、この点を踏まえておきたい。

自社評価とはいえ、サイズを4分の1にしてなお同等の結果を掲げられるのは、量子化の効果としては大きい。サイズだけでなく、動く速さも2倍以上になったという。メモリの削減は、速さとどうつながっているのか。

速さが2倍を超えた理由

動く速さも2倍以上になった理由は、メモリの削減と同じ仕組みから来ている。1ビット版は1秒あたり15.36トークンを生成し、4ビット版の7.44トークンの2.06倍にあたる(PrismML公式プレスリリース)。この速さで計算すると、100トークン程度の短い返答は、1ビット版が7秒足らず、4ビット版が13秒強かかる差になる。

024681012144ビット版: 7.441ビット版: 15.367.4415.364ビット版1ビット版トークン/秒

重みが軽くなれば、1つの答えを作るたびにメモリから読み出すデータの量が減る。加えてPrismMLは、この1ビット版をQualcomm Hexagon NPU向けの専用ソフトウェア開発キットでコンパイルした(orcarouter.aiのブログ記事)。これにより、1ビットの重みに対応した専用の計算回路を使えるようになっている。値が-1か+1のどちらかしかないなら、重みとの掛け算は符号を反転させるかどうかの足し算・引き算に近い処理で済む。読み出すデータ量の削減に加えて、この単純な計算が処理をさらに軽くしている。

ここまでの数字は、いずれも技術の発表段階のものでもある。実際にいつ、どんなメガネで使えるようになるのか。

まとめ

PrismMLの1-bit Bonsaiは、AIモデルの重みを16段階から実質2値へ削る量子化を使っている。この工夫によって、20億パラメータの視覚言語モデルがメモリ0.43GBに収まった。動く速さもQualcomm Snapdragon AR1 Gen 1の上で、4ビット版の2倍超になっている。自社ベンチマークでは4ビット版と同等の結果を掲げているが、これはPrismML自身の評価で、第三者による検証はまだ確認できていない(PrismML公式プレスリリース)。

TechCrunchが報じた2026年9月24日の時点では、この2B版に対応する具体的なスマートグラス製品はまだ発表されていない(TechCrunch)。重みをどう保存するかを工夫するだけで、AIモデルは電池の小さな端末にも収まるようになってきている。1-bit Bonsaiは、その工夫がメガネというサイズでも通用することを、具体的な数字で示した。

この記事の先を読む本を探す

特定の本を勧めるものではありません。検索結果から、いまの版と目次を確かめて選んでください。

コメント

気づきや感想をどうぞ

記事への補足や、読んで考えたことをお寄せください。個人情報や、他の人を傷つける内容の投稿はお控えください。

コメントを読み込んでいます…

    ほかの記事

    最新の記事 →