高精度な音声認識モデル
Gladia は独自の音声認識モデル(Solaria-3 など)を採用しており、英語の実音声で低い WER(語誤り率)を達成しています。英語だけでなく、フランス語・ドイツ語・スペイン語・イタリア語などでも精度向上が図られています。ノイズの多い音声や専門用語を多く含む会話でも、安定した文字起こしを目指しています。
主な特長
100以上の言語
非同期・リアルタイムの両方で100以上の言語に対応し、アクセントに敏感な自動言語検出を備えます。
話者分離
会話の中で誰が話したかを区別する話者分離(ダイアリゼーション)に対応。複数人の会話も読みやすくなります。
編集可能な出力
タイムスタンプ付きのクリーンな文字起こしを返し、編集・共有・下流処理に使いやすくします。
文字起こしの品質は下流のすべての処理に影響するため、Gladia は認識精度そのものに注力しています。詳細な機能は 開発者向け ページをご覧ください。