米ハワイ州マウイ島で開催された「Snapdragon Summit 2026」で、Qualcommは最新のAI技術とそれを実現する半導体やソフトウェア技術についてさまざまな話題を提供した。特に注目を集めたのが、スマートグラスを使った物体認識のデモだ。
デモでは、グラスをかけた状態で目の前に「リンゴ」を掲げると、グラスが音声で「リンゴ(正確にはApple)」と応答し、内蔵カメラで実際に物体が何であるかを認識している様子が示された。このグラスにはQualcommの最新SoC「Snapdragon AR1+ Gen 1」と「Snapdragon AR1 Gen 1」が搭載されており、PrismMLを組み合わせることで、いわゆる「1bit AIモデル」での画像認識を実現しているという。
1bit AIモデルの仕組みと性能
現在のTransformerベースのAIモデルは、大量の行列演算を繰り返すことで推論を実現しており、この演算に用いる「値」の精度をFP8(浮動小数点数)やINT8(整数)のようなビット数で表している。最近ではINT4やINT2といった「値」での計算処理が用いられることもあるが、これはビット数がそれぞれ4bitまたは2bitという単位で減少していることを意味する。
ビット数が減少することで得られるメリットは、推論で用いるモデルのデータが、ビット数の減少幅に合わせてサイズが小さくなっていくことにある。例えば、INT8がINT4になるとサイズは半分になり、INT2であればINT8に比べて4分の1となる。演算処理もそれだけ軽くなるため、もしINT4やINT2に対応した演算装置がNPUやGPUといった「処理ブロック」に組み込まれていれば、処理の高速化が可能になる。
一方でデメリットとしては、本来であれば得られる計算結果がビット数の減少によって失われ(丸め込まれ)、精度の低下として現れる。そのため、用途によってモデルや演算精度の使い分けが重要になるというのがAI推論での基本だ。
1bit AIモデルの実力と限界
今回の1bit AIモデルは、PrismMLの20億パラメータ(2B)を持つBonsai 2Bを使い、史上初のスマートグラス端末内でのローカル処理のみでマルチモーダル(視覚と言語処理)の1bit AIモデルを動作させることに成功したと説明された。
ポイントとしては、PrismMLのBonsai 2Bでは4bit AIモデル相当の推論が可能ながら、メモリ使用量が4分の1、トークン生成速度で2倍というパフォーマンスを実現している。つまり、前述の画像認識デモ(+音声ガイド)は1bit AIモデルで実行されたということを意味する。
ただし前述のAI推論の基本に立ち返ったとき、1bit AIモデルでは何らかのトレードオフがあるわけで、実際この1bit AIモデルではどこまでのことが可能なのだろうか。
Qualcomm TechnologiesでパーソナルAI担当SVP兼GMを務めるジアード・アスガー氏は、次のように語っている。「(1bit推論は)非常に重要であり、特にメモリ容量が非常に限られている小型デバイスでは、8bit AIモデルと比較してサイズだけで8分の1になり、(推論の実行に)1GBのDRAMが必要だったとしても、1bit AIモデルでは125MBで収まる。これにより、さまざまなデバイスでAI処理の実行が可能になる。他方で、1bit AIモデルでは精度が多少失われることになるものの、PrismMLではビット数を減少させても精度をかなり維持できるような独自のソリューションを持っている。必要なのは、これで何ができるかであり、AIによって視覚的な手がかりを得られることにある」
例えば、実際に今この部屋で(スマートグラスに)質問をしたとして、ここにはたくさんの人がいて、その場所は自宅ではなくオフィスや会議室のような場所であると答えるだろう。これが外であれば、昼間で晴れているといった情報を教えてくれる。これがAIエージェントによる体験の向上で、もし実際に古いレストランでメニューを撮影したり、OCRを実行したりというのであれば、より高精度なAI処理やカメラが必要になる。今、われわれがテーマにしているのは、いかに視覚情報をデバイスに取り込むかということにある」(アスガー氏)
スマートグラスとAIの役割分担
つまり、スマートグラスに内蔵するタイプのAIモデルで求められるのは、スマートフォンなどに内蔵されているようなある程度の汎用性を持ったAIモデルによるローカル処理ではなく、視覚情報などを取り込んでいかにユーザー体験を補助していくのかであり、そこにはスマートフォンなどとの役割の違いがあるという考えだ。
同様に、同社でAI担当バイスプレジデントのヴァイネシュ・スクマー氏も1bit AIモデルの限界と、適した用途で使うことの重要性を説明する。「例えば、スマートグラスを使ってどのような機能が実現できるかを考えるべきであり、スマートグラス内に1GBのメモリしか搭載できないのであれば、そこでAI推論を動作させるには1bit AIモデルを使うしかないというのが実際だ。スマートグラスでも、『エアコンをつけて』『電気を消して』といったコマンドによる制御は可能であり、特にAIモデルを作成するための特別なトレーニングは必要ない。こういったシンプルなオン/オフはそれだけで十分役に立つが、仮に『2+2は?』『Strawberryという文字にrは何個含まれている?』といった質問に答えるのは非常に難しい。それはAI推論の世界であり、そもそもStrawberryという単語の意味を理解する必要がある。つまり、どれだけ訓練してもこうした問題の解決は1bit AIモデルには非常に困難であり、数年後には実現するかもしれないとしても、現状ではまだ最先端とはいえない。画像認識においても、写真を取り込んで処理はできても、その内容を分析して情報を返してくれるような仕組みは1bit AIモデルには難しく、ハイブリッドAIのような形でクラウドを組み合わせる必要がある。どのようなアクションを実行したいかによって、その目的に合わせてモデルを呼び出すことが重要だ」(スクマー氏)