Ep.1537 Microsoft、AI音声対話の遅延を打破──ストリーミング文字起こしモデル「MAI-Transcribe-2-Streaming」発表(2026年10月4日配信)
カートのアイテムが多すぎます
カートに追加できませんでした。
ウィッシュリストに追加できませんでした。
ほしい物リストの削除に失敗しました。
ポッドキャストのフォローに失敗しました
ポッドキャストのフォロー解除に失敗しました
-
ナレーター:
-
著者:
タイトル
Microsoft、AI音声対話の遅延を打破──ストリーミング文字起こしモデル「MAI-Transcribe-2-Streaming」発表
このエピソードで登場するキーワードを説明します。
Microsoft: 業界を牽引する巨大テック企業。近年はAI部門「Microsoft AI」を中心に、独自のAIモデル群「MAI」シリーズを強力に推し進めている。
MAI-Transcribe-2-Streaming: Microsoftが開発した初のストリーミング文字起こしモデル。ユーザーが話し終わるのを待たず、発話中にリアルタイムでテキスト化を行う。
MAI-Voice-2.1: 今回同時に発表された多言語対応の音声合成モデル。一つの声質を保ったまま、23の言語をネイティブのアクセントで切り替えて話すことができる。
Artificial Analysis: AIモデルの性能を独自に評価・格付けするベンチマーク機関。今回の音声認識ランキングにおいてMicrosoftの同モデルが首位を獲得した。
それでは解説に入ります。
2026年10月1日、Microsoft AIは同社初となるストリーミング文字起こしモデル「MAI-Transcribe-2-Streaming」を発表し、同時に音声合成モデルの「MAI-Voice-2.1」および高速版の「MAI-Voice-2.1-Flash」を公開しました。現在、生成AI市場ではOpenAIの「GPT Realtime」やGoogleの「Gemini 3.5 Transcribe Live」など、音声エージェントの実用化に向けたモデル開発競争が激化しています。AIと人間が違和感なく会話するためには、音声の聞き取りから応答までの遅延をいかに短縮するかが最大の課題とされていました。
今回発表された「MAI-Transcribe-2-Streaming」は、発話の終了を待たずに音声入力からわずか100ミリ秒強で初期のテキスト候補を出力し始めるという仕組みを採用しています。これにより、音声アシスタントはユーザーが話し終える前に文脈を汲み取り、ツールの呼び出しや回答の準備を自律的に始めることが可能になります。独立系評価機関であるArtificial Analysisの最新ベンチマークにおいて、同モデルは他社の競合製品を抑え、文字起こしの精度と速度の両面で首位を獲得しました。
また、文字起こしだけでなく、AI側が返答する際の音声を担う「MAI-Voice-2.1」シリーズも大きな技術的進歩を遂げています。最大の特徴は、たった一つの声のアイデンティティを保ったまま23言語を操る点です。英語から日本語、さらにドイツ語へと会話が切り替わっても、アシスタントの声質が変わることなく、それぞれの言語のネイティブなアクセントで応答します。特に高負荷・低遅延なワークロード向けに用意された「MAI-Voice-2.1-Flash」は、150ミリ秒という極めて短い遅延で音声を生成でき、既存の同等モデルと比較して推論速度が55%向上し、コストも約60%削減されています。
Microsoftの狙いは、音声の「認識」と「発話」の双方で業界最高水準の速度を提供し、AIエージェントの会話ループ全体の遅延を人間の会話ペースに適応させることです。これら3つのモデルはすでにMicrosoft Foundry等を通じて開発者向けに提供が開始されており、企業のカスタマーサービスやリアルタイム翻訳、インタラクティブな学習メディアなど、ビジネス現場におけるAIの音声活用が一段と加速すると期待されています。
今回のエピソードは以上で終了です。また次回お会いしましょう。