最新ツール・サービス
Meta、初のリアルタイム音声認識モデル「Muse Voice Transcribe」 20人超の話者識別と多言語混在に対応
ITmedia AI+公開: 2026年9月2日
出典:ITmedia AI+
この記事のポイント
- 1話者分離と音声認識を単一モデルで処理し、20人以上の同時識別が可能
- 20.16秒の超低遅延と、単語誤り率3.1%の高い精度を両立
- 31時間あたり0.18ドルの低価格でAPI提供、Macアプリにも搭載済み
要約
Metaは、世界最速水準のリアルタイム音声認識モデル「Muse Voice Transcribe」を発表しました。このモデルは、音声認識(ASR)、20人以上の話者分離(ダイアライゼーション)、発話終了検知を一つのモデルで同時に処理する「自己回帰型マルチモーダルモデル」です。日本語を含む25言語に対応し、1時間あたり0.18ドルという低コストで提供されます。最大の特徴はその低遅延性で、発話終了からわずか0.16秒で文字起こしを完了。ベンチマークではElevenLabsなどの競合を上回る精度(単語誤り率3.1%)を記録しています。すでにMac版の「Meta AI」アプリやコーディング支援ツール「Muse Code」に組み込まれており、Fnキーを押しながらアプリを問わず音声入力が可能です。
出典:ITmedia AI+ の情報をもとにAIが要約
当サイトの考察
“
ヒナキラです!文字起こしAIの世界に、Metaが「破壊的」な性能を持って殴り込んできましたね。先週、議事録ツールのCirclebackが無料プランを発表したというニュースをお伝えしましたが、MetaはAPIレベルで「高精度・超低遅延・激安」という最強の武器を投入してきました。特に、1時間わずか約27円という価格設定は、他社のサービスを圧倒しています。注目すべきは、MacアプリでFnキーを押すだけで「どのアプリに対しても」リアルタイムで高精度な音声入力ができる点です。これはライターやブロガーにとって、執筆スピードを数倍に加速させる究極のツールになります。先週お伝えした「AIエージェントが自律的に仕事をする」未来において、人間がAIに指示を出す「声のインターフェース」が、これで完全に完成したと言えるでしょう。日本語対応もバッチリなので、日本のユーザーにとっても今すぐ恩恵がある大ニュースです!
よくある質問
Q日本語での精度はどうですか?
A
公式に初期リリース時点での検証済み言語に含まれており、高い精度が期待できます。特にコードスイッチング(多言語混在)にも強いです。
Q個人でこのAPIを使うにはどうすればいいですか?
A
Meta Model APIから利用可能です。プログラミングができなくても、Mac版Meta AIを使えばその恩恵を受けられます。
QZoomなどの会議で議事録として使えますか?
A
20人以上の話者分離に対応しているため、会議のリアルタイム議事録作成には最適なモデルと言えます。
用語解説
話者分離(ダイアライゼーション)
音声データの中で、誰がどのタイミングで話しているかを識別し、話者ごとに区別する技術。
WER(単語誤り率)
Word Error Rate。音声認識の結果がどれだけ正確かを示す指標。数値が低いほど正確。
自己回帰型モデル
過去のデータを元に、次に続くデータ(文字や音声)を順番に予測して生成するAIの仕組み。
※ この記事の要約・考察・FAQ・用語解説はAIによって生成されています。正確な情報は元記事をご確認ください。

ヒナキラ
Hinakira AI News 編集長
AIツール・LLM・プロンプト活用術を中心に、個人クリエイター・副業者向けのAI最新情報を毎日お届けしています。AI歴3年以上、いろんな用途に実際に使って試してきた知見をもとに、読者が「自分ごと」として活用できる考察を心がけています。
関連する記事
- 最新ツール・サービスGoogleがCanvaに対抗するAIツール「Google Pics」を公開。デザイン不要、プロンプトのみで作成可能
- 画像・動画・音声AIGoogle、AI画像生成・編集ツール「Google Pics」提供開始 特定オブジェクトの編集や文字翻訳も可能
- 最新LLM・モデル「Claude」利用制限を“一括リセット” 「Fable 5.1」のリリースに伴い
- 最新LLM・モデル「Claude Fable 5.1」と「Claude Mythos 5.1」が登場、Fable 5より最大45%安くて高性能
- 最新LLM・モデルAnthropic、「Claude Fable 5.1」と「Claude Mythos 5.1」発表 「監視の難しさ」への懸念も開示
