Skip to main content
Professional Voice Clone(PVC)は、Cartesia のテキスト読み上げ(TTS)モデルをあなたの音声でファインチューニングし、アクセント、話し方、音質を含めた、ほぼ完全な音声のレプリカを生成します。 多くのユースケースでは高速かつ高品質な Instant Voice Clone から始めることをおすすめします。IVC では十分な近似が得られず、単一話者のスタジオ品質の音声を30分以上用意できる場合には、PVC を使用してください。

PVC を作成する

PVC は、学習に使用した音声に極めて忠実な結果を生成します。単一話者のクリーンな録音を、目的とする音量、テンポ、音質で用意してください。データが多いほど品質は向上します:最低30分です。学習には最大3時間かかります。
スピードと音量は固定されます。 PVC はデータセットからテンポと音量を学習するため、スピードと音量のコントロールはリクエスト時に効果がありません。学習前に、ソース音声の段階で目的のスピードと音量に設定してください。

サポート対象モデル

新しい PVC は、以下のすべてのサポート対象モデルスナップショットで自動的に学習されます:
  • sonic-3.5-2026-05-04
  • sonic-3.6-2026-08-27
Create Fine-tune の model_id フィールドは非推奨であり、無視されます。

録音のヒント

使える 30 分の音声を録音するには計画が必要です。それだけの量の音声があると、モデルは声そのもの、つまりアクセント、声質、その声を特徴づける細かな癖を学習します。クローンが 1 つの調子に固定されないよう、データセット全体で感情に変化を付けてください。 PVC は一度に 1 つの言語で学習されるため、必要な言語ごとに別々のデータセットを録音してください。
  • 現実的な感情の幅をカバーする:ニュートラル、温かい、明るい、心配そう、安心させる
  • データセット全体を録音する前に、テスト読みを承認する
  • 休憩を取る。疲れた声はぶれが生じ、そのぶれがクローンに反映されます
すべてのテイクに共通する基本:
  • 話者は 1 人、背景ノイズなし。 静かな部屋で、音楽なし、壁の反響がない環境で録音します。
  • クローンに話させたい話し方で話す。 トーン、アクセント、ペース、エネルギーはすべて引き継がれます。
  • アナウンサーのようにではなく、自然に話す。 過剰な発音や芝居がかった話し方は、クローンの会話らしさを損ないます。
  • 長いポーズを避ける。 クローンは、文と文の間の無音を含めてペースを模倣します。
  • 話者が実際に話せる言語で録音する。 各クローンは 1 つの言語から作成されます。
マイクの使い方:
推奨非推奨
マイクの正面から約 45° 横にずらして話す正面に向かって話す - 破裂音(p や b の破裂ノイズ)の原因になります
終始一定の距離と音量を保つ体を近づけたり離したり、音量を上下させたりする - クローンの音量が不安定になる原因になります
エフェクトやフィルターをすべてオフにして、加工なしで録音するノイズリダクション、エコー、EQ 調整を加える - クローンに不自然なアーティファクトが生じる原因になります
水分補給を心がける口が乾いた状態で録音する - マイクがかすかな口中音を拾う原因になります
話し方を仕上げてください。 納得のいく話し方になるまでテイクを録り直してください。編集で無音を整えることはできますが、平板なテイクは修正できません。
録音前にクローンをどのように聞かせたいかを決め、書き出しておきます。以下を自社ブランドに合わせて調整してください。声質
中程度のピッチ有能プロフェッショナルフレンドリー親しみやすい
話し方
温かい明瞭会話調明るい生き生きとした
目標: 台本どおりのエージェントではなく、誠実で共感のこもった声に聞こえること。話し方の指示
エージェントが実際に行う会話を洗い出し、それぞれのトランスクリプトを書きます。台本どおりのセリフと半分即興の応答を混ぜることで、実際の言い回し、息づかい、話題の切り替えをデータセットに取り込めます。たとえば、カスタマーサービスのデータセットには次を含めます:
  • 冒頭のあいさつ(複数のバリエーション)
  • 日程調整と確認
  • 綴りの読み上げ、メールアドレス、英数字
  • エラー対応と共感
  • 聞き違いと聞き直し
  • 時刻、日付、期間
  • 自然な話し方のパターンとつなぎ言葉
  • 締めのあいさつ

ダッシュボードから

Pro Voice Clone ページを開きます。ここから PVC を作成し、既存のクローンのステータスを追跡できます。画面上の手順に従って音声データを提供し、学習を開始し、生成されたボイスを試聴します。

API から

以下のエンドポイントを使用して、プログラムから PVC を作成できます:
  1. データを保持するデータセットを作成
  2. データセットにファイルをアップロード
  3. データセットからファインチューンを作成
  4. ファインチューンが生成したボイスの一覧を取得
前提条件
  1. Cartesia API キーを保有していること(CARTESIA_API_KEY としてエクスポート)。
  2. 1つ以上の .wav ファイルを含む samples/ フォルダーがあること。

Text-to-Speech で PVC を使用する

Pro Voice Clone は、すべてのサポート対象モデルで学習されます。Cartesia が新しいモデルをリリースすると、あなたのボイスを新しいモデルでも自動的に利用できるようにするため、モデルをアップグレードしても継続して動作します。
テキスト読み上げ API リクエストで、model_id にそのボイスのサポート対象モデルのいずれかを指定してください。サポート対象モデルは、Get Voice レスポンスの fine_tunes.public_model_id フィールドで返されます。 PVC は sonic-preview では使用できません。sonic-preview は予告なく変更されるベータ版モデルであるため、あるスナップショットで学習したボイスは次のスナップショットと互換性がありません。 sonic-preview またはサポートされていない model_id を指定すると、HTTP 400 と voice_model_mismatch エラーが返されます:

FAQ

多くのユースケースでは、まず IVC から始めてください:高速かつ高品質で、必要な音声はわずか10秒です。キャラクターボイスの複製、珍しいアクセントの保持、特定のトーンやテンポの再現が必要な場合は、PVC を選択してください。
作成した PVC は Cartesia ダッシュボードまたは API から確認できます。ダッシュボードでは、Voice Library の My Voices に移動し、PRO バッジを目印にしてください。API では、List Voices を is_owner=true で呼び出し、is_pro=true のボイスでフィルタリングしてください。
作成できる PVC ファインチューンの数はサブスクリプションプランによって異なります:現在の PVC ファインチューン数を確認するには、ダッシュボードの Pro Voice Clone ページを開いてください。Limit の行に、プランの上限に対して作成済みのファインチューン数が表示されます。
既存の PVC は引き続き動作します。新しい PVC を学習するには、不要になったファインチューンを Pro Voice Clone ページまたは Delete Fine Tune エンドポイントから削除するか、プランをアップグレードしてスロットを増やしてください。
スロットの個別販売はありません。新しい PVC のためにスロットを空けるには、不要になったファインチューンを削除するか、プランをアップグレードしてスロットを増やしてください。
既存の PVC は、新しいプランの上限を超えていても引き続き動作します。上限内に戻るまで、新しい PVC の学習はできません。
不要です。新しい TTS モデルがリリースされると、PVC は自動的に対応するため、model_id を切り替えても動作し続けます。これらの対応バージョンはプランのスロットにカウントされません。