
- 話している最中に文字起こしが逐次届く低遅延モデルが登場
- 現在はパブリックプレビューでSLAなし、本番利用は非推奨
- 逐次認識と録音後処理は目的が違い、用途で使い分ける
Microsoftが、音声をテキストに変える新しいモデル「MAI-Transcribe-2-Streaming」のドキュメントを公開しています。 公式ドキュメントによると、このモデルはライブ音声向けの低遅延な音声テキスト変換モデルです。 音声を途切れさせずに送り続けると、話者が話している間に、文字起こしの結果が少しずつ返ってきます。
返ってくる結果には2種類あります。 中間結果は、いま認識中の文字起こしを更新していくもので、最終結果は各区間の文字起こしを確定させます。 話している途中の文は、後続の言葉を聞いてから書き換わることがある、ということです。 利用方法としては、OpenAI Realtime互換のWebSocket接続(Realtime API)と、Azure Speech SDKの2種類が案内されています。
想定用途には、コールセンター、音声アシスタント、会議や講義の字幕表示、音声操作の画面、ライブのメモ取りが挙げられています。 注意点は提供段階です。現在はパブリックプレビューで、SLA(サービス品質の保証)なしで提供されており、本番の運用には推奨されないとされています。
読者にとっての意味は、「話している最中に画面へ文字が出る」仕組みが、開発者向けに使いやすくなっていくという点です。 いずれ字幕付きの会議ツールや音声操作の機能に組み込まれる可能性はありますが、現時点で一般向けの製品に載ると決まったわけではありません。
まず、逐次認識の強みは「いま」に使える点にあると考えます。 字幕表示や音声操作のように、発言の直後に文字が必要な場面では、確定を待たずに中間結果を出せる設計が合っています。 一方で、中間結果は後から書き換わる前提のため、そのまま議事録や記録として保存すると、確定前の誤りが残る恐れがあります。 即時性が要る用途では逐次認識を使い、残す記録には確定した最終結果を使う、という分け方が筋でしょう。
これとは別に、録音を後から処理する方式の価値も見直されてよいと思います。 逐次方式は話し終わる前に結果を返す必要があるので、全体を踏まえた処理は組み込みにくいと考えられます。 録音がすべて揃ってから処理するなら、全体の文脈を踏まえた文字起こしや要約を作りやすくなります。 会議の後に見返す記録が目的なら、字幕のような即時性より、読み返しやすい文章が届くことのほうが価値を持ちます。 メモリスは、録音を終えてからAIが文字起こしと要約を行うAIボイスメモです。会議や思いつきを録音して渡し、数分後に届く文章を確認する使い方になります。 目的が「その場で見る」なのか「後で使える記録を残す」なのかを先に決めると、選ぶ道具も決まります。




