有料プラン(3カ月分)を無料プレゼント中!詳しく見る
App IconMemolith
2026年10月03日 07:10

NVIDIA Nemotron 3 Diarization、話者分離ベンチで1位に

執筆: Takumi(Memolith開発者)
メモリスメモリスによる要約
  • 話者分離モデルNemotron 3 Diarizationが評価ベンチで1位を獲得
  • 1億パラメータのオープンウェイトで、最大8人の話者に対応する
  • 初期結果で英語会話が対象。雑音や遠距離収音では性能が落ちうる

NVIDIAは、会話の「誰がいつ話したか」を判定する話者分離(ダイアライゼーション)モデル「Nemotron 3 Diarization」をHugging Faceのブログで紹介しました。 オープンウェイト(モデルの重みが公開されていて、自分の環境で動かせる形式)で、規模は1億パラメータです。 VoiceArenaの評価ベンチ「Diarization-Bench」では1位とされています。

評価の中身も確認しておきます。 指標はDER(話者分離の誤り率)で、見逃した発話、誤って検出した発話、話者の取り違えの3種類の誤りを合算し、基準となる話者時間の合計で割った値です。 重複発話を採点する条件で、Nemotron 3 DiarizationのDERは14.72%、次点のシステムは19.3%でした。相対では約24%低い計算です。 最大8人の話者に対応し、ライブの会話と録音済みの会話の両方を扱えます。

話者分離のDER比較。Nemotron 3 Diarization: 14.72%、次点のシステム: 19.3%。英語の139会話を対象にした初期結果で、日本語の会議での順位は不明

話者分離は、単体では「speaker_2」のような匿名のラベルが、何秒から何秒まで話したかという時刻の記録にすぎません。 音声認識(ASR)と組み合わせて初めて、話者付きの文字起こしになります。 つまり、会議の録音から「誰が何を言ったか」が読める文章を作る工程の一部が、公開モデルで底上げされたことになります。

では、これで会議録音の話者分離は解決したと受け止めてよいのでしょうか。 1位という結果だけを見れば、そう読みたくなります。

ただ、この数字をそのまま自分の録音に当てはめるのは早計です。 ブログによれば、1位は英語の139会話(合計約22時間)を対象にした初期結果です。VoiceArenaが対応のある統計分析まで終えた時点で変わる可能性があると、原典が留保しています。 日本語の会議で同じ順位になるとは、この資料からは言えません。 さらに同じ資料は、非常に長い録音や、強い雑音・残響・遠距離収音のある音声では性能が落ちうるとも書いています。会議室の中央に置いたスマホの録音は、まさにこの条件に近づきます。

そこで提案は二つです。 一つは、モデルの順位よりも自分の録音条件を先に整えることです。話者の近くで録り、雑音を避ければ、資料が挙げる性能低下の条件を避けられます。 もう一つは、話者ラベルの扱いです。出力されるのは「speaker_2」のような匿名のラベルで、実在の個人を特定するものではないと原典が明記しています。誰の発言かを紐づける最終確認は人が担うと決めておけば、取り違えが議事録に残る事故を防げます。

メモリス(AIボイスメモ)は、録音を渡すと、録音終了後にAIが文字起こしと要約を作る仕組みです。 話者分離の精度が上がる流れの中でも、元の録音が残っていれば、AIの出力で怪しい箇所を聞き直して確かめられます。 音声認識側の動向は、MicrosoftのMAI-Transcribe-2-Streamingの記事でも扱っています。

メモリス ブログの記事を、Googleで便利に検索できます

Googleで優先ソースとして追加
有料プラン(2,490円相当)を
無料プレゼント中!
詳しく見る