米マイクロソフト、文字起こしAI「MAI-Transcribe-2-Streaming」 60言語を即時変換(ビジネス+IT)
51 分前

米マイクロソフトのAI部門は2026年10月1日、リアルタイム文字起こしモデル「MAI-Transcribe-2-Streaming」を発表した。60言語に対応し、約100ミリ秒で最初の暫定結果を返す。音声合成モデル「MAI-Voice-2.1」と高速版も公開し、企業の音声エージェント開発を後押しするという。
米マイクロソフトのAI部門マイクロソフトAI(Microsoft AI)は2026年10月1日、公式ブログで、リアルタイム文字起こしに対応した音声認識モデル「MAI-Transcribe-2-Streaming」を発表した。同社初のストリーミング型モデルで、60言語に対応し、話している言語を自動で判別し続ける。あわせて音声合成モデル「MAI-Voice-2.1」と高速版「MAI-Voice-2.1-Flash」も公開した。
同社によると、新モデルは評価機関アーティフィシャル・アナリシスのランキングで、最終結果と途中結果の両方の精度で1位になった。話し終わるのを待たず、音声を受け取ってから100ミリ秒余りで暫定的な結果を出し、文脈に応じて修正しながら確定させる。社内評価では、口述筆記や字幕付けで文字が表示されるまでの速さが最も近い競合の2倍だったという。
価格は音声1時間あたり0.54ドル(約85円)で、年末までの導入価格としている。Azureの技術文書によれば現在はパブリックプレビューの段階で、サービス品質保証(SLA)はなく、本番環境での利用は推奨していない。
MAI-Voice-2.1は23言語・26ロケールに対応する。1つの声のまま複数の言語を母語話者のようなアクセントで話せるのが特徴で、企業はブランドの声をどの言語でも統一できるという。価格は100万文字あたり22ドル(約3,454円)。Flash版は45秒分の音声を150ミリ秒の遅延で生成でき、同等のモデルより約60%安い100万文字あたり15ドル(約2,355円)とした。
3モデルはMicrosoft FoundryやMAI Playgroundなどで利用できる。マイクロソフトは6月の開発者会議で7つの自社開発モデルを発表しており、自社モデルの拡充を進めている。
本文の著作権はYahoo!ニュースにあります。