2026-08-26 · ← ニュース
Gemini 3.5 Transcribe、生音声を直接フォーマットされたテキストに変換
生の文字起こしの終わり
Googleは、文字起こしの典型的な問題を解決するために設計された新しい音声テキスト変換モデル、Gemini 3.5 Transcribeをリリースしました。単に言葉を大量に生み出すだけでなく、「えー」や「あー」を直接排除し、文の途中の修正(「火曜日に会いましょう、いや、水曜日に」)を処理し、テキストをすぐにフォーマットすることができます。
文字起こしから理解への移行
古いChirp 3モデルとの違いは、精度だけではありません(ストリーミングの単語誤り率は4.0%に低下しました)。重要なのはエコシステムへの接続です。Transcribeは最大3人の話者を認識してタイムスタンプを返すことができます。そして主にmacOSのGeminiアプリでは、音声から直接関数呼び出し(function calling)を行い、他のモデルにタスクを割り当てることができます。
AIの終わりとUIの始まり
Googleはこのモデルを自社の製品(Gboard、Antigravity、Chrome)に押し込んでおり、音声入力がもはや単なるディクテーションツールではなく、システムを制御するための本格的な方法になることを示しています。開発者向けに、このモデルはGemini APIを介して、ライブストリーミングと録音処理の両方のバリアントで利用できます。
Google外での導入速度
本当のテストは、このモデルが現在WhisperやDeepgramで構築している開発者を納得させられるかどうかです。エッジケースでの価格、レイテンシ、信頼性が決定要因になります。
Lilithの判定
音声の文字起こしはコモディティ化しているため、Googleは意図の理解とマシン制御を直接販売しようとしています。問題は、開発者がGoogleのスマートなパッケージを求めているのか、それともWhisperの純粋なテキストの上に独自のロジックを構築したいのかということです。
外部リンクは最後に置いています。まずここで簡潔に解説 — 他人のサイトを探し回る必要はありません。
元の記事 ↗ ↗