ホーム / 文字起こしAPI

Gladia の文字起こしAPI

音声を編集可能なテキストへ変換する Speech-to-Text(STT)機能の仕組みを解説します。

高精度な音声認識モデル

Gladia は独自の音声認識モデル(Solaria-3 など)を採用しており、英語の実音声で低い WER(語誤り率)を達成しています。英語だけでなく、フランス語・ドイツ語・スペイン語・イタリア語などでも精度向上が図られています。ノイズの多い音声や専門用語を多く含む会話でも、安定した文字起こしを目指しています。

主な特長

100以上の言語

非同期・リアルタイムの両方で100以上の言語に対応し、アクセントに敏感な自動言語検出を備えます。

話者分離

会話の中で誰が話したかを区別する話者分離(ダイアリゼーション)に対応。複数人の会話も読みやすくなります。

編集可能な出力

タイムスタンプ付きのクリーンな文字起こしを返し、編集・共有・下流処理に使いやすくします。

文字起こしの品質は下流のすべての処理に影響するため、Gladia は認識精度そのものに注力しています。詳細な機能は 開発者向け ページをご覧ください。