PVC を作成する
PVC は、学習に使用した音声に極めて忠実な結果を生成します。単一話者のクリーンな録音を、目的とする音量、テンポ、音質で用意してください。データが多いほど品質は向上します:最低30分です。学習には最大3時間かかります。サポート対象モデル
新しい PVC は、以下のすべてのサポート対象モデルスナップショットで自動的に学習されます:sonic-3.5-2026-05-04sonic-3.6-2026-08-27
model_id フィールドは非推奨であり、無視されます。
録音のヒント
使える 30 分の音声を録音するには計画が必要です。それだけの量の音声があると、モデルは声そのもの、つまりアクセント、声質、その声を特徴づける細かな癖を学習します。クローンが 1 つの調子に固定されないよう、データセット全体で感情に変化を付けてください。 PVC は一度に 1 つの言語で学習されるため、必要な言語ごとに別々のデータセットを録音してください。- 現実的な感情の幅をカバーする:ニュートラル、温かい、明るい、心配そう、安心させる
- データセット全体を録音する前に、テスト読みを承認する
- 休憩を取る。疲れた声はぶれが生じ、そのぶれがクローンに反映されます
- 話者は 1 人、背景ノイズなし。 静かな部屋で、音楽なし、壁の反響がない環境で録音します。
- クローンに話させたい話し方で話す。 トーン、アクセント、ペース、エネルギーはすべて引き継がれます。
- アナウンサーのようにではなく、自然に話す。 過剰な発音や芝居がかった話し方は、クローンの会話らしさを損ないます。
- 長いポーズを避ける。 クローンは、文と文の間の無音を含めてペースを模倣します。
- 話者が実際に話せる言語で録音する。 各クローンは 1 つの言語から作成されます。
| 推奨 | 非推奨 |
|---|---|
| マイクの正面から約 45° 横にずらして話す | 正面に向かって話す - 破裂音(p や b の破裂ノイズ)の原因になります |
| 終始一定の距離と音量を保つ | 体を近づけたり離したり、音量を上下させたりする - クローンの音量が不安定になる原因になります |
| エフェクトやフィルターをすべてオフにして、加工なしで録音する | ノイズリダクション、エコー、EQ 調整を加える - クローンに不自然なアーティファクトが生じる原因になります |
| 水分補給を心がける | 口が乾いた状態で録音する - マイクがかすかな口中音を拾う原因になります |
話し方の指示書の例
話し方の指示書の例
録音前にクローンをどのように聞かせたいかを決め、書き出しておきます。以下を自社ブランドに合わせて調整してください。声質
中程度のピッチ有能プロフェッショナルフレンドリー親しみやすい
話し方温かい明瞭会話調明るい生き生きとした
目標: 台本どおりのエージェントではなく、誠実で共感のこもった声に聞こえること。話し方の指示Pro Voice Clone のデータセットがカバーすべき内容
Pro Voice Clone のデータセットがカバーすべき内容
エージェントが実際に行う会話を洗い出し、それぞれのトランスクリプトを書きます。台本どおりのセリフと半分即興の応答を混ぜることで、実際の言い回し、息づかい、話題の切り替えをデータセットに取り込めます。たとえば、カスタマーサービスのデータセットには次を含めます:
- 冒頭のあいさつ(複数のバリエーション)
- 日程調整と確認
- 綴りの読み上げ、メールアドレス、英数字
- エラー対応と共感
- 聞き違いと聞き直し
- 時刻、日付、期間
- 自然な話し方のパターンとつなぎ言葉
- 締めのあいさつ
ダッシュボードから
Pro Voice Clone ページを開きます。ここから PVC を作成し、既存のクローンのステータスを追跡できます。画面上の手順に従って音声データを提供し、学習を開始し、生成されたボイスを試聴します。API から
以下のエンドポイントを使用して、プログラムから PVC を作成できます:- データを保持するデータセットを作成
- データセットにファイルをアップロード
- データセットからファインチューンを作成
- ファインチューンが生成したボイスの一覧を取得
前提条件
- Cartesia API キーを保有していること(
CARTESIA_API_KEYとしてエクスポート)。- 1つ以上の
.wavファイルを含むsamples/フォルダーがあること。
Text-to-Speech で PVC を使用する
テキスト読み上げ API リクエストで、model_id にそのボイスのサポート対象モデルのいずれかを指定してください。サポート対象モデルは、Get Voice レスポンスの fine_tunes.public_model_id フィールドで返されます。
PVC は sonic-preview では使用できません。sonic-preview は予告なく変更されるベータ版モデルであるため、あるスナップショットで学習したボイスは次のスナップショットと互換性がありません。
sonic-preview またはサポートされていない model_id を指定すると、HTTP 400 と voice_model_mismatch エラーが返されます:
FAQ
IVC と PVC のどちらを使うべきですか?
IVC と PVC のどちらを使うべきですか?
多くのユースケースでは、まず IVC から始めてください:高速かつ高品質で、必要な音声はわずか10秒です。キャラクターボイスの複製、珍しいアクセントの保持、特定のトーンやテンポの再現が必要な場合は、PVC を選択してください。
作成した PVC はどこで確認できますか?
作成した PVC はどこで確認できますか?
作成した PVC は Cartesia ダッシュボードまたは API から確認できます。ダッシュボードでは、Voice Library の My Voices に移動し、PRO バッジを目印にしてください。API では、List Voices を
is_owner=true で呼び出し、is_pro=true のボイスでフィルタリングしてください。PVC ファインチューンはいくつ作成できますか?
PVC ファインチューンはいくつ作成できますか?
作成できる PVC ファインチューンの数はサブスクリプションプランによって異なります:
現在の PVC ファインチューン数を確認するには、ダッシュボードの Pro Voice Clone ページを開いてください。Limit の行に、プランの上限に対して作成済みのファインチューン数が表示されます。
プランのスロット上限に達した場合は?
プランのスロット上限に達した場合は?
既存の PVC は引き続き動作します。新しい PVC を学習するには、不要になったファインチューンを Pro Voice Clone ページまたは Delete Fine Tune エンドポイントから削除するか、プランをアップグレードしてスロットを増やしてください。
プランをアップグレードせずにスロットを追加購入できますか?
プランをアップグレードせずにスロットを追加購入できますか?
スロットの個別販売はありません。新しい PVC のためにスロットを空けるには、不要になったファインチューンを削除するか、プランをアップグレードしてスロットを増やしてください。
プランをダウングレードまたはキャンセルした場合、PVC はどうなりますか?
プランをダウングレードまたはキャンセルした場合、PVC はどうなりますか?
既存の PVC は、新しいプランの上限を超えていても引き続き動作します。上限内に戻るまで、新しい PVC の学習はできません。
Cartesia が新しいモデルをリリースした場合、PVC の移行は必要ですか?
Cartesia が新しいモデルをリリースした場合、PVC の移行は必要ですか?
不要です。新しい TTS モデルがリリースされると、PVC は自動的に対応するため、
model_id を切り替えても動作し続けます。これらの対応バージョンはプランのスロットにカウントされません。