3人以上のオンライン会議を録音して、あとから文字起こしを読み返す。発言がひとつなぎのテキストになっていて、どこからどこまでが誰の発言か分からなくなっていた経験がある人は少なくないはずだ。既存の文字起こしツールが自動で話者を分けてくれても、結局は聞き直しながら「これは田中さんだ」「ここは鈴木さんだ」とラベルを振り直す羽目になることもある。
NVIDIAは2026年9月23日、音声AIモデル「Nemotron 3 Diarization」を公開した。話し手の声を一切事前に登録しなくても、最大8人までの発言をリアルタイムで自動的に仕分けられる。Hugging Faceから無料でダウンロードでき、商用利用もできるオープンモデルだ。声を登録せずにどうやって同じ人の発言をつなげているのか、精度と速さはどこまで実用に耐えるのか、実際に使うには何が要るのかを順に見ていく。
声を登録しなくても仕分けられる仕組み
「誰が何を言ったか」を自動で仕分ける処理は、音声AIの分野で「話者分離(diarization)」と呼ばれる。多くの人がまずイメージするのは、使う前に自分や同僚の声を録音して登録しておき、そのサンプルと照合して「この声は田中さんだ」と当てる方式ではないだろうか。自分もそう予想していた。
ところがNemotron 3 Diarizationは、話者の声を1つも事前登録しない。かわりに、会話の中で声が最初に聞こえた順に「speaker_0」「speaker_1」……と番号を振っていくだけだ。次の仮の会議で見てみる。
実際の会議を模した仮の例では、speaker_0とspeaker_1の発言が0:01〜0:02の間で重なったあと、0:05になって初めてspeaker_2の声が現れる。Nemotron 3 Diarizationはこのspeaker_2に、名前も声紋も知らないまま「3番目に登場した声」という理由だけで新しいラベルを割り当てる(公式ブログ)。
speaker_0とspeaker_1が重なる0:01〜0:02のような場面も、そのまま扱える設計になっている。モデルの出力は「時間フレーム×最大8話者」の確率の並びで、公式ブログは「二人が同時に話せば、同じフレームで2つのチャンネルが同時にアクティブになる」と説明している。1つの時刻に1人しか割り当てられない仕組みだと、重なった発言のどちらかが欠け落ちてしまうが、話者ごとに独立したチャンネルを持つことでその欠落を避けている。
この処理を支えるのが、公式ブログが「到着順話者キャッシュ(Arrival-Order Speaker Cache、AOSC)」と呼ぶ仕組みだ。登場順にラベルを割り当て、同じ人には同じラベルを振り続ける役割を持つ。AOSCは、それまでの会話に出てきた話者の情報をキャッシュとして保持する。そこに直近の音声フレームの履歴を持つFIFOキューを組み合わせ、新しい発言区間が来るたびに、それが既に聞いた声か初めての声かを判定してラベルを安定させている。
名前も声紋も要らず、この会話の中で何番目に声が現れたかという順番だけを手がかりに、話者のラベルが決まる。
リアルタイムでも精度は保てるのか
会議中にその場で文字起こしを流す用途では、録音を最後まで聞いてから処理する「オフライン」のような余裕はない。遅延を削るほど、精度は犠牲になっていないのだろうか。
NVIDIAは話者分離のベンチマーク「Voice Arena Diarization-Bench v1」でNemotron 3 Diarizationを検証した。12システム17構成の中で1位になっている。話者分離の誤り率を示すDER(Diarization Error Rate、数値が低いほど誤りが少ない)は14.72%で、2位の19.3%より相対で24%低い(公式ブログ)。
レイテンシ設定を変えたときの挙動は、別のデータセットDIHARD IIIで確認できる。録音全体を待ってから処理する「オフライン」設定(入力バッファ30.4秒)ではDER12.73%で、実時間の15,113倍の速さで処理できた。これを1.04秒待つだけで結果を出す「低レイテンシ」設定に切り替えると、DERは13.18%とわずかに上がる。代わりに処理速度は実時間の865倍まで落ちる。どちらも実時間よりはるかに速いが、待つ秒数を削るほど精度と処理速度の両方が下がるトレードオフがあり、用途に応じてどちらを取るかを選べる形になっている。
これはNVIDIA RTX PRO 5000・バッチサイズ32という検証環境での測定値だ。ネットワークやアプリ側の処理を含めた体感の遅延と同じに読むべきではないと、公式ブログ自身が注記している。この記事が当てはまるのは、この検証条件下の数値までになる。
この1.04秒設定は、従来モデルのSortformer v2.1と比べてもDERが平均41.0%改善している。低遅延でも精度を落とさない方向に更新されたことになる。
何人まで区別できるのか
最大8人まで、と最初に書いた。この上限は今回の更新で広がったものだ。従来のSortformerは4人までしか区別できなかったが、Nemotron 3 Diarizationはこれを2倍の8人に広げている。
DIHARD IIIの8つの評価条件のうち、複数話者が入り混じる会議形式のNOTSOFAR1 MHMという条件で改善が最も大きい。従来モデル比でDERが相対65.2%下がった。一方、2人の通話が中心のCALLHOMEという条件では9.0%にとどまる。2人の通話より、人数が多く発言が入り組む会議のほうが、この更新の恩恵が大きい。
8人まで、無料で、リアルタイムに区別できるとなると、次に気になるのは自分の手元でどう使えるかだろう。
自分の用途で使うには
Nemotron 3 DiarizationはHugging Faceで公開されており、ライセンスは「OpenMDW License Agreement v1.1」。Linux Foundationの発表によれば、このライセンスは利用分野を限定せず、商用利用に別途契約も要らない。モデルカードにも「商用・非商用どちらの利用にも対応できる」と明記されている。
ただし、今日から誰でもすぐ試せる完成品ではない。動作には次の環境が要る。
- NVIDIAのGPU(Ampere・Hopper・Blackwell世代)
- Linux環境
- Python 3.12以上
- 音声処理ライブラリ
nemo-toolkit
入力できる音声は16kHzの単一チャンネルで、.wavや.mp3などの形式に対応する。会議アプリや議事録サービスの裏側に組み込んで、マイクの音声から話者ラベル付きの文字起こしを作る部品として使う想定だ。一般利用者がそのまま画面で触れるアプリではない点は、試す前に踏まえておきたい。
まとめ
NVIDIAが2026年9月23日に公開したNemotron 3 Diarizationは、話者の声を1つも事前登録せず、会話に登場した順で自動的にラベルを振っていく方式を採る。この方式で、最大8人までの発言をリアルタイムに仕分けられる。オフライン設定で実時間の15,113倍、1.04秒の低レイテンシ設定でも865倍の速さで処理でき、精度は従来モデル比で平均41.0%改善した。
ライセンスはOpenMDW License Agreement v1.1で、商用・非商用を問わず無料で使える。使うにはNVIDIA GPUとLinux環境、Python 3.12以上が要るため、会議アプリや議事録サービスに組み込む開発者にとってまず意味のある選択肢になる。
コメント
気づきや感想をどうぞ記事への補足や、読んで考えたことをお寄せください。個人情報や、他の人を傷つける内容の投稿はお控えください。
投稿にはGoogleログインが必要です。
Googleでログイン投稿にはGoogleアカウントの表示名が公開されます。メールアドレスは取得・公開しません。
コメントを読み込んでいます…