Skip to main content
Cartesia のモデルは、音声の自然さと文字起こしの精度で第 1 位にランクされており、精度、レイテンシ、自動的な音声・ターン検出がミッションクリティカルとなる、エンタープライズグレードの会話型音声 AI のために設計されています。

Text to Speech

Sonic 3.5 により、90ms 未満のレイテンシで非常にリアルな音声をストリーミングします。

Speech to Text

ターン検出を標準搭載した Ink 2 でリアルタイムに文字起こしします。

Voice Agents

低レイテンシの音声エージェントを数分で構築・デプロイします。

Voice Cloning

10 秒のクリップから音声を複製し、40 以上の言語とアクセントで利用できます。

構築を始める

クイックスタート

数行の Python または JavaScript で最初の音声をストリーミングします。

Playground

ブラウザですべてのモデルを試し、API キーを取得できます。

API リファレンス

API の規約、エラー、およびすべての REST・WebSocket エンドポイントのリファレンス。

モデル

Sonic 3.5 は、世界最速で最も感情豊かな、非常にリアルな text-to-speech モデルです。最初の音声バイトを約 90ms でストリーミングするため、ナレーションや吹き替えと同じように、リアルタイムの会話にも対応できます。バリエーションと機能については text-to-speech モデル を参照してください。 Ink 2 は、ネイティブのターン検出を備えた、世界最速で最も正確なストリーミング speech-to-text モデルです。話者がいつ話し始め、いつ話し終えたかを把握するため、エージェントはいつ聞き、いつ応答すべきかを判断できます。詳細は speech-to-text モデル を参照してください。 Managed Agents は、音声エージェントを構築・デプロイするための Cartesia のプラットフォームです。文字起こしの Ink、任意に選択できる LLM、音声合成の Sonic を組み合わせ、ターンテイキング、ツール、テレフォニーを代わりに処理します。まずは Managed Agents を参照してください。

サポート

メールサポート

連携、アカウント、請求に関するサポートは support@cartesia.ai までご連絡ください。