Hinakira AI News

HinakiraAI News

最新ツール・サービス

Meta、初のリアルタイム音声認識モデル「Muse Voice Transcribe」 20人超の話者識別と多言語混在に対応

ITmedia AI+公開: 2026年9月2日
出典:ITmedia AI+

この記事のポイント

  • 1話者分離と音声認識を単一モデルで処理し、20人以上の同時識別が可能
  • 20.16秒の超低遅延と、単語誤り率3.1%の高い精度を両立
  • 31時間あたり0.18ドルの低価格でAPI提供、Macアプリにも搭載済み

要約

Metaは、世界最速水準のリアルタイム音声認識モデル「Muse Voice Transcribe」を発表しました。このモデルは、音声認識(ASR)、20人以上の話者分離(ダイアライゼーション)、発話終了検知を一つのモデルで同時に処理する「自己回帰型マルチモーダルモデル」です。日本語を含む25言語に対応し、1時間あたり0.18ドルという低コストで提供されます。最大の特徴はその低遅延性で、発話終了からわずか0.16秒で文字起こしを完了。ベンチマークではElevenLabsなどの競合を上回る精度(単語誤り率3.1%)を記録しています。すでにMac版の「Meta AI」アプリやコーディング支援ツール「Muse Code」に組み込まれており、Fnキーを押しながらアプリを問わず音声入力が可能です。

出典:ITmedia AI+ の情報をもとにAIが要約

当サイトの考察

ヒナキラです!文字起こしAIの世界に、Metaが「破壊的」な性能を持って殴り込んできましたね。先週、議事録ツールのCirclebackが無料プランを発表したというニュースをお伝えしましたが、MetaはAPIレベルで「高精度・超低遅延・激安」という最強の武器を投入してきました。特に、1時間わずか約27円という価格設定は、他社のサービスを圧倒しています。注目すべきは、MacアプリでFnキーを押すだけで「どのアプリに対しても」リアルタイムで高精度な音声入力ができる点です。これはライターやブロガーにとって、執筆スピードを数倍に加速させる究極のツールになります。先週お伝えした「AIエージェントが自律的に仕事をする」未来において、人間がAIに指示を出す「声のインターフェース」が、これで完全に完成したと言えるでしょう。日本語対応もバッチリなので、日本のユーザーにとっても今すぐ恩恵がある大ニュースです!

よくある質問

Q日本語での精度はどうですか?
A

公式に初期リリース時点での検証済み言語に含まれており、高い精度が期待できます。特にコードスイッチング(多言語混在)にも強いです。

Q個人でこのAPIを使うにはどうすればいいですか?
A

Meta Model APIから利用可能です。プログラミングができなくても、Mac版Meta AIを使えばその恩恵を受けられます。

QZoomなどの会議で議事録として使えますか?
A

20人以上の話者分離に対応しているため、会議のリアルタイム議事録作成には最適なモデルと言えます。

用語解説

話者分離(ダイアライゼーション)

音声データの中で、誰がどのタイミングで話しているかを識別し、話者ごとに区別する技術。

WER(単語誤り率)

Word Error Rate。音声認識の結果がどれだけ正確かを示す指標。数値が低いほど正確。

自己回帰型モデル

過去のデータを元に、次に続くデータ(文字や音声)を順番に予測して生成するAIの仕組み。

※ この記事の要約・考察・FAQ・用語解説はAIによって生成されています。正確な情報は元記事をご確認ください。

この記事をシェアする

ヒナキラ

ヒナキラ

Hinakira AI News 編集長

AIツール・LLM・プロンプト活用術を中心に、個人クリエイター・副業者向けのAI最新情報を毎日お届けしています。AI歴3年以上、いろんな用途に実際に使って試してきた知見をもとに、読者が「自分ごと」として活用できる考察を心がけています。