リアルタイム STT

Inworld の音声テキスト変換がライブ会話に適合する仕組み

Inworld の音声テキスト変換は、ライブ音声を、利用可能な単語のストリーム、タイミング、コンテキストへと変換します。会話が続いている間も聞き取り続ける必要があるボイスエージェント、ゲーム、学習プロダクト、サポート体験向けに設計されています。

リアルタイム音声文字起こしのワークフロー
01 / 入力の準備

クリーンなリアルタイム文字起こしの前提条件

音声を送信する前に、インタラクションで何を保持する必要があるかを決めます。安定したストリーム、既知の言語、そして聞き取りから応答への明確な引き継ぎにより、文字起こしレイヤーはペースを維持するのに十分な信号を得られます。本番環境の音声アプリでは、同意の処理と、名前、製品名、またはドメイン固有の用語の語彙リストも追加してください。

  1. 信号を準備する

    モノラル、または適切にミックスされた音声を、クリッピング、エコー、他の話し声をできる限り抑え、一貫したサンプリングでキャプチャします。

  2. ストリームを開く

    ライブ音声にはリアルタイム WebSocket 接続を使用するか、録音後に文字起こしを生成できる場合はファイルを送信します。

  3. コンテキストを読み取る

    部分テキスト、確定テキスト、タイムスタンプ、利用可能な音声シグナルを取り込み、ターンが終わる前にアプリケーションが反応できるようにします。

02 / 一連の流れ

マイクから応答までの一連の流れ

典型的なフローは、人が話し始め、ストリーミング文字起こしを経て、アプリケーションが次に何をするかを決めて終了します。同じ文字起こし結果を、モデル、検索インデックス、キャプションレイヤー、音声応答に活用できます。これを リアルタイム TTS-2 と組み合わせるチームは、1つの連続したやり取りの中で、聞き取りと発話を続けられます。

ボイスアプリビルダー

コンパニオンがユーザーの話を聞き、届いた部分的な単語を受け取り、完了したターンを使って役立つ返信を選択します。

Inworld ai voice generator

ゲームチーム

文字起こしがリクエストを素早く特定することで、プレイヤーはシーンのタイミングを保ちながら、キャラクターに自然に話しかけられます。

Inworld realtime tts 2

学習プロダクト

学習者は声に出して練習し、リアルタイムの文字起こしを受け取り、発した言葉とその伝え方の両方に基づくフィードバックを受け取ります。

Inworld voice cloning

サポートチーム

サポートアシスタントは会話を追跡し、話者の交替を明確に保ちながら、適切なコンテキストをワークフローやナレッジ検索に引き渡します。

Inworld AI voice generator
03 / オプション表

音声テキスト変換ワークフローのオプション表

すべてのプロダクトを同じパイプラインに無理に通すのではなく、その時々に合った方法を選択しましょう。以下の関連ページでは、チームが文字起こしと組み合わせて利用することの多い、周辺の音声機能を紹介しています。

ルート 最適な用途 役立つ出力
リアルタイムストリーム ライブ会話 部分および最終文字起こしイベント
同期ファイル 録音音声 ソースに合わせた文字起こし
音声プロファイリング より豊かなインタラクションロジック 感情、年齢、アクセント、ピッチ、スタイル
VADとタイムスタンプ ターンテイキングと字幕 音声境界と単語のタイミング
04 / 制限と限界

入力の準備が整っていない場合に起こること

最も期待外れな文字起こしは、モデルを取り巻く条件が原因で起こります。クリッピングは子音を隠し、話者の重なりはターンの境界を曖昧にし、遠くにあるマイクは正確な単語や音声シグナルに必要な細部を減らします。処理前後を比較すると、その違いは明確です。よりクリーンなストリームによって、アプリケーションは推論に利用できる、より信頼性の高い情報を得られます。

リアルタイム音声文字起こし前のノイズの多い音声ワークフロー
処理前:ノイズが多く、途切れた入力
音声クリーンアップ後の構造化されたリアルタイム文字起こしワークフロー
処理後:より明瞭で利用しやすいコンテキスト

ユーザーが実際に使用するマイク、アクセント、話す速度、バックグラウンド環境でテストしてください。固有名詞にはカスタム語彙を追加し、重要な場面では話者の境界を維持し、ターンが完了するまでは部分テキストを暫定的なものとして扱いましょう。

5 リアルタイムチャンクごとの音声シグナル
2 ストリーミングと同期されたパス
1 両方のワークフローに対応する統合API
継続的に音声を聞き続けるプロダクト向けのコンテキスト
05 / ご質問

リアルタイム音声認識に関するよくある質問

Inworldの音声認識レイヤーは何をしますか?

ライブまたは録音済みの音声をテキストに変換しながら、アプリケーションがタイミング、話者の振る舞い、言葉を取り巻く状況を理解するのに役立つコンテキストを提供します。

会話を進行中に文字起こしできますか?

はい。双方向WebSocketストリームは、ライブ音声、部分的な結果、最終文字起こしイベントに対応しているため、録音全体が終わるのを待たずにアプリケーションが応答できます。

音声を接続する前に何を準備すべきですか?

まず、安定したキャプチャパス、既知の言語、適切なマイクの配置、そして特に注意が必要なドメイン語彙を用意してください。リリース前に、ノイズの多い音声や重なった発話でテストしましょう。

文字起こしは音声アプリケーションにどのように組み込めますか?

文字起こし結果は、推論、ツール呼び出し、字幕、検索、または音声による応答をトリガーできます。これをリアルタイム音声合成と組み合わせることで、聞くことから行動し、話すことまでの完全なループを構築できます。