AI フェッチャーは、人工知能アプリケーションで使用するために、特定のコンテンツを取得する自動化システムです。Web の大部分を体系的にスキャンする AI クローラーとは異なり、AI フェッチャーは通常、直接のリクエストに応じて個々の URL または少数のリソースにアクセスします。
簡単に言うと、クローラーは Web を広範囲に探索し、フェッチャーは AI が必要とするものを必要なときに正確に取得します。
AI フェッチャーの目的は何ですか?
AIフェッチャーは、AIシステム(モデル)に新しく対象を絞った情報を提供するために使用されます。この情報が必要となるのは、次のアクティビティに起因します:
ユーザーが参照したウェブページ、ドキュメント、または API レスポンスを取得すること(人が何かを Google で検索し、AI フェッチャーがその問い合わせに対する AI の概要を提供するのを支援するイメージです)
トレーニングデータに存在しない可能性がある最新のコンテンツを提供すること
リンクプレビュー、引用、AI 要約、ファクトチェックなどをサポートする機能
AI ツールが外部システムやサービスとやり取りできるようにすること
AI fetcher は AI crawler とどう違うのでしょうか?
クローラーとフェッチャーの主な違いは、その活動の範囲と目的にあります。
AIクローラーは、多くの場合、トレーニングやインデックス作成のために、大規模にコンテンツを事前にスキャンして収集します。
AI フェッチャーは、通常、ユーザーのアクションまたはアプリケーションのリクエストをきっかけとして、特定のコンテンツを事後対応的に取得します
フェッチャーは、従来の Web クローラーというよりも、ページを読み込むブラウザや API を呼び出すバックエンドサービスに近いものです。
AIフェッチャーはどのような種類のコンテンツを取得しますか?
AIフェッチャーは通常、次のものを取得します:
個々の Web ページまたは記事
PDF や HTML ファイルなどのドキュメント
APIレスポンスと構造化データ
特定のタスクに必要なメディアファイルまたはメタデータ
通常、コンテンツにはサイト全体をスキャンするのではなく、一度に1つのリクエストでアクセスします。
AIフェッチャーがWebサイトにアクセスするきっかけは何ですか?
AIによるフェッチの一般的なトリガーは次のとおりです:
AI ツールに URL を貼り付ける、または参照するユーザー
特定のソースを検証または要約する必要があるAIシステム
リアルタイムデータ(例:料金プラン、ドキュメント、ステータスページ)を取得するためのリクエスト
外部情報を必要とするアプリケーションのワークフロー
多くの場合、明示的なユーザーまたはシステムの意図がなければ、フェッチは発生しません。
Webサイトの所有者はどのように AI フェッチャーのトラフィックを識別できますか?
Webサイトの所有者は、いくつかの方法でAIフェッチャーを識別できます:
固有のUser-Agent文字列(基本的には識別名)によって
自動化されたアクセスを示すリクエストヘッダーによって
閲覧ではなく API コールに似たトラフィックパターンを評価することで
フェッチャーのトラフィックは通常、クローラーのトラフィックよりも量が少なく、より散発的です。
AI フェッチャーは robots.txt とアクセス・コントロールの対象ですか?
はい。AI フェッチャーは通常:
認証要件、ペイウォール、アクセス制限を遵守する
robots.txt を確認する場合があります。実装によって異なります
Webサイトの利用規約および法的要件を遵守する必要があります
フェッチャーは特定のコンテンツを取得するため、ログインゲートのようなアクセスコントロールは非常に効果的であることがよくあります。
AI フェッチャーはプライバシー上のリスクですか?
AI フェッチャーは、一般に広範なクローラーよりもリスクが低いです。理由は次のとおりです:
アクセスが制限された、ターゲットを絞ったコンテンツ
多くの場合、明示的なユーザーの操作に関連付けられています
大規模に無差別にデータを収集しないでください
ただし、機密性の高い URL が意図せず取得されたり、アクセスコントロールの設定が誤っていたりすると、リスクが生じる可能性があります。
AI Fetchersのセキュリティリスクとは何ですか?
AIフェッチャーは、ウェブページ、ドキュメント、またはAPIレスポンスなどの特定の外部リソースをオンデマンドで取得します。AI クローラーよりも標的が絞られている一方で、慎重に設計およびコントロールされていない場合は、依然として重要なセキュリティ上の考慮事項が生じます。
AI フェッチャーのリスク
サーバーサイド・リクエスト・フォージェリ(SSRF)。 任意のURLを受け入れるフェッチャーは、内部サービス、クラウドメタデータエンドポイント、またはプライベートネットワークへのアクセスに悪用される可能性があります。
機密リソースへの不正アクセス。 厳格なネットワークおよびドメインのコントロールがなければ、フェッチャーが意図せず内部または制限されたコンテンツを取得する可能性があります。認証情報とトークンの露出。認証が設定されたフェッチャーでは、ログ、キャッシュ、またはレスポンスを通じて、Cookie、APIキー、または特権認証情報が漏えいするリスクがあります。
データ流出。 攻撃者は、fetcherをプロキシとして使用して、保護されたシステムから機密データを抽出し、それを外部に返すことができます。
悪意のある、または敵対的なコンテンツ。 取得したコンテンツには、エクスプロイトのペイロードや、下流の AI の動作を操作するように設計されたテキスト(プロンプト・インジェクションと呼ばれます)が含まれている場合があります。
悪用とトラフィック増幅。 無制限のフェッチは悪用されると、過剰なトラフィックを生成し、サービスを圧倒し、またはリクエストの発信元を隠すために利用される可能性があります。
リソースの枯渇。 無制限のフェッチは、帯域幅、コンピューティング、または有料APIクォータを消費し、可用性とコストに影響を与える可能性があります。
ポリシーとアクセスコントロールのバイパス。robots.txt、認証、またはサイトポリシーの適用に一貫性がないと、法的およびセキュリティ上のリスクが生じる可能性があります。
AI フェッチャーのリスクをどのように防止できますか?
セキュリティチームは、AI フェッチャーに関連するリスクの防止に役立つベストプラクティスをいくつか実装できます。
URL 許可リストと拒否リスト
ネットワークの分離と外向きトラフィックのフィルタリング
フェッチコンテキストからの認証情報の削除
コンテンツのサニタイズと検証
レート制限とリクエストクォータ
取得したデータとモデルの指示を明確に分離
Bot Management and WAF controls
Fastly のソリューションが役立つ理由
Fastly の Next-Gen WAF には、正当なボットを許可しつつ、アプリケーションを悪意のあるボットから保護できる Bot Management 機能が組み込まれています。収益やユーザーエクスペリエンスに悪影響を及ぼす前に、悪質なボットによるWebサイトや API への攻撃を特定して軽減し、悪意のある行為をブロックします。
Next-Gen WAF とそのBot Management機能の詳細をご覧ください。