shiichan

SageMaker AI 推論、G7 インスタンスで最大 4.6 倍速に!

やっほー、しぃちゃんだよ!今日は SageMaker AI 推論で新しいインスタンスが使えるようになったニュースを紹介するね!

AWS What's New aws.amazon.com

なにが発表されたの?

AWS の発表(AWS What's New)によると、Amazon SageMaker AI の推論エンドポイントが、NVIDIA RTX PRO 4500 Blackwell Server Edition GPU を搭載した G7 インスタンスに対応したよ。前世代の G6 インスタンスと比べて、最大 4.6 倍の AI 推論性能を発揮できるとのこと。

今までどうだったの?

プロダクション環境で生成 AI モデルを推論に使う場合、高い GPU スループットとメモリ容量が求められるんだけど、これまでの世代のインスタンスだと、以下みたいな悩みがあったの。

  • 中〜大規模モデルをコスト効率よくサービングしたくても、高価なコンピュートを過剰にプロビジョニングする必要があった
  • メモリの制約に収めるために、モデルを量子化しないといけないケースもあった

つまり「モデルはちゃんと動かしたいけど、そのために無駄にお金がかかる/精度を犠牲にする」というジレンマがあったんだよね。

これで何が変わるの?

G7 インスタンスは、そのジレンマを解消するために作られたインスタンスだよ。GPU メモリ容量とメモリ帯域幅・スループットが強化されたことで、次のようなワークロードに向いているの。

  • 7B〜30B パラメータ級のモデルのサービング
  • 画像・動画生成ワークロード
  • 複数モデルを同時に扱うマルチモデル推論エンドポイント

過剰プロビジョニングや量子化なしで、これまでより大きいモデルを効率よく本番運用できるようになったのが嬉しいポイントだね。

深く潜ってみよう

G7 インスタンスのスペックを、前世代の G6 と比べながら見てみるよ。

  • GPU: NVIDIA RTX PRO 4500 Blackwell Server Edition(第 5 世代 Tensor コア搭載)
  • GPU メモリ: GPU 1 基あたり 32 GB
  • ネットワーク: 最大 700 Gbps の EFA 対応ネットワーキング(G6 比で 7 倍)
  • ローカルストレージ: 最大 7.6 TB の NVMe SSD(大きなモデルをコンピュートの近くに置ける)

インスタンスサイズは ml.g7.xlarge から ml.g7.48xlarge まで用意されていて、SageMaker AI Inference のコンソール・API・SDK からエンドポイント設定でインスタンスタイプを指定するだけでデプロイできるよ。

現時点での対応リージョンはこちら。

  • 米国東部(バージニア北部、オハイオ)
  • 米国西部(オレゴン)

まだリージョンは限定的だから、使いたい場合はまず対応リージョンかどうかをチェックしてね。

まとめ

  • Amazon SageMaker AI 推論が NVIDIA RTX PRO 4500 Blackwell Server Edition GPU 搭載の G7 インスタンスに対応
  • G6 比で最大 4.6 倍の推論性能、GPU メモリ 32 GB、EFA ネットワーク最大 700 Gbps(7 倍)、NVMe SSD 最大 7.6 TB
  • 7B〜30B パラメータ級モデルや画像・動画生成、マルチモデル推論エンドポイント向き
  • ml.g7.xlargeml.g7.48xlarge をコンソール・API・SDK から指定するだけでデプロイ可能
  • 対応リージョンは米国東部(バージニア北部、オハイオ)・米国西部(オレゴン)の現時点 3 リージョン
  • 中〜大規模の生成 AI モデルを本番運用しているエンジニアに刺さるニュースだよ!