cartesia-mcp パッケージは、Model Context Protocol (MCP) を介してCartesiaを公開します。これにより、Cursor、Claude Code、Codex などのMCP対応クライアントから、カスタムスクリプトなしでボイスのリスト、TTS と STT の実行、発音辞書の管理、ボイスのクローンなどを行えます。
要件
- uv — グローバルインストールなしで
uvx経由でサーバーを実行します - Python 3.13以上(
uvxによって自動でインストールされます) - Cartesia APIキー(形式:
sk_car_…)
セットアップ
APIキー を取得し、cartesia-mcp をエージェントに接続します。- CLI (推奨)
- Cursor
- Claude Code
試してみる
エージェントに次のようなことを尋ねてみてください:- 利用可能なすべてのCartesiaボイスをリストする
- 選択したボイスでテキストを音声に変換する(速度、音量、感情)
- 音声ファイルをテキストに文字起こしする
- 発音辞書を作成し、TTSで使用する
- アカウントのクレジット使用量を確認する
- 既存のボイスを別の言語にローカライズする
ツール
パラメータと戻り値の型については、cartesia-mcp のソース を参照してください。
高度な設定
高度な設定
出力ディレクトリ
デフォルトでは、生成された音声はサーバーの作業ディレクトリに書き込まれます。固定のフォルダを指定するには、env に OUTPUT_DIRECTORY を追加します:音声ファイル
speech_to_text と clone_voice は、手元にある音声ファイルを受け取ります。以下のいずれかを渡してください:file_path— MCP を実行しているマシン上の絶対パス。ローカルのuvxで使用します。file_id— Cartesia のクラウドファイル。text_to_speechの生成結果やプレイグラウンドの履歴のファイルも含みます。ホスト型 MCP(mcp.cartesia.ai)ではこちらを使用してください。お使いのコンピュータ上のパスは、そのサーバー上には存在しません。
download_url は 24 時間有効なブラウザ用リンクです。これらのツールへの入力には使えません。speech_to_text では、一般的なファイルの文字起こし(mp3、flac、wav などの一般的なコンテナ)にはデフォルトの batch モードを使用してください。モノラル PCM WAV(TTS 出力など)や、encoding と sample_rate を指定した生 PCM には mode="stream" を使用してください。TTS のダウンロード
text_to_speech はデフォルト(save=true)で音声を組織のクラウドストレージに保存し、以下を返します:file_id—download_fileに渡すと新しいリンクを取得できます。再利用したい音声がこの生成結果である場合は、speech_to_textやclone_voiceにも渡せますdownload_url— リンクの作成に成功した場合の、ブラウザで開ける時間制限付き URL(24 時間)。省略された場合は、file_idを指定してdownload_fileを呼び出してください。file_path— MCP を実行しているマシン上のコピー。ローカルのuvxでは、同じマシン上の後続のツールにこのパスを渡せます。
save=false を設定してください。Admin APIキー
一部のツールは、admin APIキー(sk_car_admin_...)のみを受け付ける 管理エンドポイント を呼び出します。get_credit_usage を使用するには、CARTESIA_API_KEY に加えて env に CARTESIA_ADMIN_API_KEY を設定してください。Admin キーは管理ルートでのみ機能します; play.cartesia.ai/keys のAPIキーはそれらのルートでは機能せず、Admin キーは生成ルートでは機能しません。組織管理者のみが、プレイグラウンドの Keys → Admin で Admin キーを発行できます。APIバージョン
Cartesia MCPはCartesia-Version: 2026-08-14 を使用して構築されています。cartesia-mcp
公式のCartesia MCPサーバー