記事

AIデータパイプライン:段階とアーキテクチャのガイド

AIデータパイプラインは、AIモデルの学習・運用のためのデータの取り込み、準備、提供を自動化します。

AIデータパイプラインは、人工知能や機械学習モデルの訓練、接続、運用のためにデータを取り込み、準備し、提供する自動化システムです。従来のデータパイプラインを拡張し、モデルの本番環境をサポートするために必要な追加の段階、ガバナンス、監視を導入します。

ほとんどのAIデータパイプラインは、取り込み、準備、トレーニングまたはRAGインデックス作成、デプロイ、監視の5段階を経てデータを処理します。インジェスションはソースシステムから生データを収集します。準備はそれをクリーンアップし、変換します。トレーニングやインデックス作成はモデル構築や検索インデックスの入力に使います。デプロイはモデルを本番環境に投入します。モニタリングはパイプラインとモデルの健康状態の両方を追跡し、次のサイクルに信号をフィードバックします。

従来のデータパイプラインは、ダッシュボード、レポート、分析ツールに構造化データを届けるよう最適化されています。AIデータパイプラインは、多くの場合、非構造化またはマルチモーダルなデータを機械学習や生成AIモデルに届けるよう最適化されています。より厳密な系譜を強制し、継続的な再学習をサポートし、データとモデルの健全性の両方を監視します。ほとんどの企業は両方を運用しており、AIパイプラインは従来のパイプラインが提供するガバナンスとストレージを拡張するものであり、置き換えるものではありません。

AIデータパイプラインは複数のツールカテゴリを利用しています。インジェスションやオーケストレーションツールはデータをソースから目的地へ移動します。データ準備やフィーチャーエンジニアリングツールはモデルのデータをクリーンアップし、シェイプします。フィーチャーストアやベクターストアは、トレーニング、推論、検索拡張生成に使用される入力を管理します。オブザーバビリティツールはパイプラインの健全性、データドリフト、モデルドリフトを追跡します。ほとんどの本番パイプラインは、単一のエンドツーエンドプラットフォームに依存するのではなく、これらのカテゴリを組み合わせています。

典型的なAIデータパイプラインアーキテクチャ図は、5段階の水平フロー(取り込み、準備、トレーニングまたはインデックス化、展開、監視)を示し、監視からフィードバック矢印がトレーニングへと戻ります。ソースシステムは左側でインジェストに入力され、アプリケーションとユーザーは右側で出力を消費します。ガバナンス、系譜、アクセス制御は5段階すべての下に水平レイヤーとして動作します。

機械学習におけるパイプラインとは、生の訓練データを展開モデルに変換する一連の自動化ステップのことです。典型的なステップには、特徴設計、トレーニング、検証、デプロイ、モニタリングが含まれます。より広範なAIデータパイプラインにおいて、機械学習パイプラインは、取り込みから本番監視まで続く長いチェーンの中の一段階、すなわちトレーニングまたはインデックス化ステップに過ぎません。

最新情報をお受け取りください

メールアドレスをご登録ください。ブログの最新情報をお届けします。



テラデータはソリューションやセミナーに関する最新情報をメールにてご案内する場合があります。 なお、お送りするメールにあるリンクからいつでも配信停止できます。 以上をご理解・ご同意いただける場合には「はい」を選択ください。

テラデータはお客様の個人情報を、Teradata Global Privacy Statementに従って適切に管理します。