概要
エージェント
Cartesiaのホスト型 Line ボイスエージェントは、米ドルで分単位で課金されます。これはクレジット残高に影響しません。Text-to-Speech
標準的なTTSは1文字あたり約1クレジットかかります。正確なクレジット数は、トランスクリプトの前処理によりわずかに変動する可能性があります。 これは、すべてのTTSエンドポイントに適用されます:/tts/bytes、/tts/sse、/tts/websocket。
Pro Voice Clone を使用したTTS
Pro Voice Clone で音声を生成すると、1文字あたり約1.5クレジット(標準TTSの50%増し)かかります。これは、お客様のデータでファインチューニングされた専用モデルで実行されるためです。 これは Instant Voice Clones には適用されず、標準レートで課金されます。Speech-to-Text
STTの料金は、モデルとバッチエンドポイント/リアルタイムエンドポイントのどちらを使用するかによって異なります。トランスクリプトが生成されなくても、無音区間も含まれます。Pro Voice Clone ファインチューニング
Pro Voice Clone の作成は、/fine-tunes/create を介してお客様のデータでモデルをファインチューニングするもので、1,000,000クレジットかかります。
トレーニングが成功した場合にのみ課金されます。Pro Voice Cloneはトレーニングされたベースモデルにピン留めされるため、新しいベースモデルや新しいデータでの再トレーニングには、さらに1,000,000クレジットかかります。
Infill
Infill は、既存の2つのクリップをつなぐ音声を生成します。各リクエストには固定の300クレジットに加えて、Infillトランスクリプトに適用される標準TTSレートがかかります。Voice Changer
Voice Changerは入力音声をターゲットボイスに変換します。/voice-changer/bytes および /voice-changer/sse の両方で、入力音声1秒あたり15クレジットかかります。