Kinesis Data Streams に「ストリーミングテーブル」が登場、Iceberg への自動配信でコスト最大 50%削減できちゃうよ!
やっほー、しぃちゃんだよ! 今日はストリーミングデータの世界がちょっと便利になるニュースを見つけて、朝からわくわくが止まらなかったの! さっそく紹介するね!
AWS What's Newなにが発表されたの?
AWS の What's New によると、Amazon Kinesis Data Streams に「ストリーミングテーブル(streaming tables)」という新機能が登場したよ。これは完全サーバーレスの機能で、Kinesis ストリームのデータを継続的に Amazon S3 Tables 上の Apache Iceberg 形式のテーブルへ配信してくれるものなの。
原文ではこう説明されているよ。
Amazon Kinesis Data Streams introduces streaming tables, a new fully serverless capability that continuously delivers data from Kinesis streams to Amazon S3 Tables in Apache Iceberg format.
ストリーミングテーブルを使えば、自前で Iceberg 配信パイプラインを構築・運用する必要がなくなって、データ配信コストを最大 50% 削減できるんだって。しかも「インテリジェント インライン圧縮」機能によって小さいファイルが大量にできてしまう問題(いわゆる small file problem)も解消されて、ダウンストリームのクエリコストも最大 30% 削減できるみたい! すごいよね!
今までどうだったの?
これまで、ストリーミングデータを Apache Iceberg テーブルに配信して近リアルタイム分析や AI/ML の特徴量パイプラインに活かしたい場合、利用者は自分でカスタムパイプラインを構築して運用する必要があったの。フォーマット変換の処理も自分で書かなきゃいけないし、そのためのコンピュートインフラも管理しなきゃいけなかった。それに、大量のストリーミングインジェストが続くと小さな Parquet ファイルがどんどん溜まっていって、あとでクエリするときのパフォーマンスが下がったり、ストレージコストが増えたりする課題もあったんだよ。
これで何が変わるの?
ストリーミングテーブルを使うと、利用者はストリーミングテーブルを作成するだけで、Kinesis ストリームから Amazon S3 Tables への継続的なデータ配信が完全サーバーレスで実現できるようになるの。スケーリング、リトライ、圧縮、配信の信頼性確保といった面倒な部分はぜんぶ Kinesis Data Streams 側が自動で面倒を見てくれるんだって。
これによって、近リアルタイム分析や AI/ML の特徴量パイプラインを、Iceberg 配信基盤を自作することなく、最新のデータを使って構築できるようになるよ。カスタムパイプラインの開発・運用コストがまるごと不要になるのは、データエンジニアリングチームにとってかなり嬉しいポイントだと思うな!
深く潜ってみよう
コンソールから数クリックでストリーミングテーブルを構成できて、カスタムアプリケーションやセルフマネージドのコンピュートリソースは不要とのことだよ。データ配信自体も数分で始められるみたい。
料金面では、On Demand Advantage(ODA)と On Demand Standard(ODS)の両方の容量モードに対応した従量課金制で、セットアップ料金や最低利用料金のコミットメントはなく、成功したデータ配信に対してのみ課金される仕組みだよ。無駄なく使えるのはうれしいポイントだね。
提供リージョンについては、Kinesis Data Streams が利用可能なすべての AWS リージョンで使えるとのことで、AWS GovCloud や中国リージョンも含まれているよ。
まとめ
- Kinesis Data Streams に「ストリーミングテーブル」が登場、Kinesis ストリームから Amazon S3 Tables(Apache Iceberg 形式)へ完全サーバーレスで継続配信できる
- 自前の Iceberg 配信パイプライン構築・運用が不要になり、データ配信コストを最大 50% 削減
- インテリジェント インライン圧縮で小ファイル問題を解消し、クエリコストを最大 30% 削減
- On Demand Advantage / On Demand Standard の容量モードで従量課金、セットアップ料金や最低利用料金なし
ストリーミングデータを Iceberg で分析基盤に取り込みたいと思っていたデータエンジニアさんや、Kinesis をすでに使っているチームには特に刺さる発表だと思うよ!