View a markdown version of this page

Amazon ECS での SQL ベースのデータ処理 - Amazon ECS での SQL ベースのデータ処理

翻訳は機械翻訳により提供されています。提供された翻訳内容と英語版の間で齟齬、不一致または矛盾がある場合、英語版が優先します。

Amazon ECS での SQL ベースのデータ処理

公開日: 2021 年 3 月 8 日 (図の履歴)

このアーキテクチャは、 でデータ処理を簡素化および高速化するコンテナ化された ETL フレームワーク (ARC) を使用して、設定駆動型のコードレスextract-transform-load (ETL) 代替を構築する方法を示していますApache Spark。AWS Fargate を使用して Amazon Elastic Container Service でフレームワークを実行します。

Amazon ECS での SQL ベースのデータ処理

Amazon Elastic Container Service、AWS Fargate、Amazon Simple Storage Service AWS Lambda、Amazon CloudWatch を使用した SQL ベースのデータ処理を示すアーキテクチャ図。

次の手順では、アーキテクチャについて説明します。

  1. ユーザーは、インタラクティブな ARC Jupyter Notebook の ARC フレームワークと SQL スクリプトに基づいて ETL データパイプラインを作成します。ノートブックは AWS Fargate を使用して Amazon ECS で実行されます。

  2. ノートブックジョブと ETL ジョブは、AWS PrivateLink を介してバッチデータとストリームデータを処理します。ETL プロセスとデータストア間のトラフィックは、Amazon ネットワークを離れません。

  3. ARC Jupyter ノートブックは、ジョブフロー設定 JSON ファイルを生成します。ユーザーは、CI/CD 自動デプロイプロセスを通じて、または手動で、ファイルと SQL スクリプトを Amazon Simple Storage Service にアップロードします。

  4. Amazon S3 ファイル到着イベントは、 AWS Lambda関数をトリガーします。

  5. Lambda 関数は、Amazon ECS タスクをスピンアップしてバッチデータを一時的な方法で処理するか、長時間実行されるコンテナでストリームデータを継続的に処理します。各ジョブは分離されたコンピューティングリソースを使用します。

  6. Amazon CloudWatch Events は、AWS Fargate または Amazon EC2 起動タイプを使用して、通常の ARC ETL ジョブと Amazon ECS タスクをスケジュールおよびオーケストレーションします。

  7. ARC ETL ジョブは、詳細なレベルで各データ処理ステージのアプリケーションログを生成します。CloudWatch はモニタリングとアラート機能を提供します。

詳細情報

詳細については、次のリソースを参照してください。

図の履歴

このリファレンスアーキテクチャ図の更新について通知を受け取るには、RSS フィードにサブスクライブします。

変更説明日付

初版発行

リファレンスアーキテクチャ図が最初に公開されました。

2021 年 3 月 8 日

注記

RSS 更新をサブスクライブするには、使用しているブラウザで RSS プラグインが有効になっている必要があります。