Text to Speech
Sonic 3.5 により、90ms 未満のレイテンシで非常にリアルな音声をストリーミングします。
Speech to Text
ターン検出を標準搭載した Ink 2 でリアルタイムに文字起こしします。
Voice Agents
低レイテンシの音声エージェントを数分で構築・デプロイします。
Voice Cloning
10 秒のクリップから音声を複製し、40 以上の言語とアクセントで利用できます。
構築を始める
クイックスタート
数行の Python または JavaScript で最初の音声をストリーミングします。
Playground
ブラウザですべてのモデルを試し、API キーを取得できます。
API リファレンス
API の規約、エラー、およびすべての REST・WebSocket エンドポイントのリファレンス。
モデル
Sonic 3.5 は、世界最速で最も感情豊かな、非常にリアルな text-to-speech モデルです。最初の音声バイトを約 90ms でストリーミングするため、ナレーションや吹き替えと同じように、リアルタイムの会話にも対応できます。バリエーションと機能については text-to-speech モデル を参照してください。 Ink 2 は、ネイティブのターン検出を備えた、世界最速で最も正確なストリーミング speech-to-text モデルです。話者がいつ話し始め、いつ話し終えたかを把握するため、エージェントはいつ聞き、いつ応答すべきかを判断できます。詳細は speech-to-text モデル を参照してください。 Managed Agents は、音声エージェントを構築・デプロイするための Cartesia のプラットフォームです。文字起こしの Ink、任意に選択できる LLM、音声合成の Sonic を組み合わせ、ターンテイキング、ツール、テレフォニーを代わりに処理します。まずは Managed Agents を参照してください。サポート
メールサポート
連携、アカウント、請求に関するサポートは support@cartesia.ai までご連絡ください。