メインコンテンツへスキップ
Ink 2 は、Cartesia が提供する最速かつ最も精度の高いストリーミング音声認識モデルです。あらゆるストリーミング STT の中で最も低い単語誤り率と最良のターン検出を備え、本番環境のボイスエージェント向けに構築されています。電話番号、日付、メールアドレスなどの構造化データを最初から正しく書き起こし、話者が話し始めるタイミングと話し終えるタイミングを認識するため、別途 VAD(音声区間検出)を用意する必要がありません。 ターン検出は組み込みです。Ink 2 は turn.startturn.updateturn.eager_endturn.resumeturn.end というターンイベントの完全なライフサイクルを発行するため、エージェントはいつ聞き、考え、応答すべきかを正確に把握できます。ステートマシンについては ターンイベント を、ターン検出のありなしで Ink 2 を実行する方法については STT エンドポイントの比較 を参照してください。 ink-whisper の情報については、旧 STT モデル のページを参照してください。

次のステップ

オンラインで試す

サインアップやコード不要

構築を始める

ガイドとベストプラクティス