Skip to main content
cartesia-mcp パッケージは、Model Context Protocol (MCP) を介してCartesiaを公開します。これにより、Cursor、Claude Code、Codex などのMCP対応クライアントから、カスタムスクリプトなしでボイスのリスト、TTS と STT の実行、発音辞書の管理、ボイスのクローンなどを行えます。

要件

  • uv — グローバルインストールなしで uvx 経由でサーバーを実行します
  • Python 3.13以上(uvx によって自動でインストールされます)
  • Cartesia APIキー(形式: sk_car_…)

セットアップ

APIキー を取得し、cartesia-mcp をエージェントに接続します。

試してみる

エージェントに次のようなことを尋ねてみてください:
  • 利用可能なすべてのCartesiaボイスをリストする
  • 選択したボイスでテキストを音声に変換する(速度、音量、感情)
  • 音声ファイルをテキストに文字起こしする
  • 発音辞書を作成し、TTSで使用する
  • アカウントのクレジット使用量を確認する
  • 既存のボイスを別の言語にローカライズする

ツール

パラメータと戻り値の型については、cartesia-mcp のソース を参照してください。

出力ディレクトリ

デフォルトでは、生成された音声はサーバーの作業ディレクトリに書き込まれます。固定のフォルダを指定するには、env に OUTPUT_DIRECTORY を追加します:

音声ファイル

speech_to_text と clone_voice は、手元にある音声ファイルを受け取ります。以下のいずれかを渡してください:
  • file_path — MCP を実行しているマシン上の絶対パス。ローカルの uvx で使用します。
  • file_id — Cartesia のクラウドファイル。text_to_speech の生成結果やプレイグラウンドの履歴のファイルも含みます。ホスト型 MCP(mcp.cartesia.ai)ではこちらを使用してください。お使いのコンピュータ上のパスは、そのサーバー上には存在しません。
download_url は 24 時間有効なブラウザ用リンクです。これらのツールへの入力には使えません。speech_to_text では、一般的なファイルの文字起こし(mp3、flac、wav などの一般的なコンテナ)にはデフォルトの batch モードを使用してください。モノラル PCM WAV(TTS 出力など)や、encoding と sample_rate を指定した生 PCM には mode="stream" を使用してください。

TTS のダウンロード

text_to_speech はデフォルト(save=true)で音声を組織のクラウドストレージに保存し、以下を返します:
  • file_id — download_file に渡すと新しいリンクを取得できます。再利用したい音声がこの生成結果である場合は、speech_to_text や clone_voice にも渡せます
  • download_url — リンクの作成に成功した場合の、ブラウザで開ける時間制限付き URL(24 時間)。省略された場合は、file_id を指定して download_file を呼び出してください。
  • file_path — MCP を実行しているマシン上のコピー。ローカルの uvx では、同じマシン上の後続のツールにこのパスを渡せます。
クラウドフィールドなしのローカルのみの生成にするには、save=false を設定してください。

Admin APIキー

一部のツールは、admin APIキー(sk_car_admin_...)のみを受け付ける 管理エンドポイント を呼び出します。get_credit_usage を使用するには、CARTESIA_API_KEY に加えて env に CARTESIA_ADMIN_API_KEY を設定してください。Admin キーは管理ルートでのみ機能します; play.cartesia.ai/keys のAPIキーはそれらのルートでは機能せず、Admin キーは生成ルートでは機能しません。組織管理者のみが、プレイグラウンドの Keys → Admin で Admin キーを発行できます。

APIバージョン

Cartesia MCPは Cartesia-Version: 2026-08-14 を使用して構築されています。

cartesia-mcp

公式のCartesia MCPサーバー