メインコンテンツへスキップ
Amazon SageMaker Jumpstart は、マネージドインフラ、オートスケーリング、統合モニタリングを備えた Cartesia セルフホストソリューションを最短でデプロイする手段です。このデプロイ方法は、セルフホスト AI を初めて利用するチームや、マネージドインフラを利用したいチームに最適です。 開始するには、AWS Marketplace の Sonic 3 on AWS Marketplace からサブスクライブしてください。

概要

SageMaker Jumpstart によるデプロイメントの特長:
  • マネージドインフラ: AWS がサーバーのプロビジョニングとメンテナンスを担当
  • オートスケーリング: 需要に応じた組み込みのオートスケーリング
  • 統合モニタリング: CloudWatch によるメトリクスとログの統合
  • 従量課金: オンデマンドリソース割り当てによるコスト最適化
  • クイックセットアップ: 事前構成済みノートブックを使って数分でデプロイ

前提条件

AWS アカウントの要件

  • SageMaker アクセス可能な AWS アカウント
  • GPU インスタンス(ml.g6e.xlarge)の十分なサービスクォータ
  • SageMaker Full Access および Marketplace サブスクリプションアクセス(ViewSubscriptions、Unsubscribe、Subscribe)を持つ IAM ロール
  • VPC 構成(プライベートデプロイ用、オプション)

はじめに

SageMaker 上で Sonic 3 の推論エンドポイントをデプロイするには、こちらのノートブックの手順を参照してください。

推論のセットアップ

Sonic 3 は SageMaker 上でリアルタイム推論のみをサポートしています。推論エンドポイントのインスタンスタイプとして ml.g6e.xlarge を選択してください。各インスタンスは 8 件の同時リクエストを処理できます。最良のパフォーマンスを得るために、SageMaker ではクライアントから SageMaker への接続を再利用することを推奨しています。これにより、接続を再確立する時間を節約できます。boto3 では max_pool_connections を設定できます。複数のリクエストが接続を再利用するため、リクエストごとに新しい TCP/TLS 接続を確立するコストを回避できます。

入出力

入力の概要

レスポンスストリーミングエンドポイントは、生成のトランスクリプト、ボイス、言語、出力フォーマットを指定する JSON オブジェクトを入力として受け取ります。

入力パラメータ

データサンプル

出力の詳細

出力イベント

SageMaker は Response Stream でレスポンスイベントを返します。ペイロードは base64 エンコードされた blob としてクライアントに送信されます。SageMaker の制約により、1 つのイベントが複数のセグメントに分割されることがあります。当 API は各完全なイベントの末尾に改行を必ず付与するため、クライアント側で再構築できます。返される各イベントは、生成された音声チャンクと一部のメタデータを含む JSON オブジェクトです。イベントは event.type で識別される次のいずれかの型になります:
Chunk Event
chunk イベントには、指定された出力フォーマットとサンプルレートで、最大 20 ms 分の音声チャンクが含まれます。
Done Event
done イベントは生成の完了を示します。done イベントは event.type == "done" および event.done == True で識別されます。
Timestamp Event
timestamp イベントは、認識された単語またはトークンのタイミング情報を提供します。
Phoneme Timestamp Event
phoneme timestamp イベントは、通常、詳細な音声分析のために音素レベルでタイミング情報を提供します。

エラーハンドリング

生成中にエラーが発生した場合、SageMaker は Model Error としてエラーを返します。エラーを処理するには、エラーオブジェクトの OriginalStatusCode フィールドを参照してください(Python でのエラーハンドリング例を参照)。

422 エラー

422 エラーは、入力の形式が正しくないことを示します。詳細は Message フィールドで確認できます。

429 エラー

429 エラーは、リクエストしているモデルコンテナが、その時点でリクエストを処理する容量がないことを示します。Cartesia のモデルは、一度に最大 4 件の同時生成リクエストを処理します。複数の推論コンテナレプリカを実行している場合、SageMaker の ProductionVariants 設定内の RoutingConfig パラメータを LEAST_OUTSTANDING_REQUESTS に設定して、ロードアウェアなルーティングを使用することを推奨します。これにより、最適な負荷分散が可能になります。

コンテナログ

CloudWatch でコンテナログを参照できます。ほとんどのログはリクエスト ID とともに発行されます。サーバー側のリクエスト ID の形式は {uuid}-{client supplied context id} です。