簡単なスケーリングや組み込みのセキュリティ、プログラマブルなコントロール、完全な可視性まで、Fastly は最先端の CDN に求められるあらゆる機能を提供します。
高速な AI はセマンティックキャッシュから始まる
Fastly AI Accelerator
データを理解するインテリジェントなキャッシングにより、AI のパフォーマンスが向上します。Fastly の AI Accelerator は、OpenAI や Google Gemini などの人気の LLM のパフォーマンスを9倍向上させます。再構築は不要、たった1行のコードで実現できます。
AI ワークロードにキャッシュ層が必要な理由
AI ワークロードは、従来の非 LLM 処理と比較してスピードが1桁以上遅くなる場合があります。このような遅延は、ユーザーにとっては数十ミリ秒から数秒の違いとして体感される上、AI ワークロードは何千ものリクエストを処理するサーバーにも大きな負荷を与えます。
セマンティックキャッシュは、クエリをベクトル形式で概念にマッピングすることで、質問の形式を問わず、その答えをキャッシュする仕組みです。この新しいテクノロジーは、主要な LLM プロバイダーが推奨するベストプラクティスであり、AI Accelerator によってセマンティックキャッシュを簡単に実装できます。
メリット
LLM を使用するストレスからの解放と、より効率の高いアプリケーションの構築を実現
Fastly AI Accelerator のスマートなセマンティックャッシュにより、API コールとコストを削減できます。
パフォーマンスの改善
セマンティックキャッシュにより、情報元に送信されるリクエストの数とレスポンス時間を削減し、AI API のスピードと信頼性を向上できます。
コストの削減
アップストリーム API の使用を減らし、コンテンツを Fastly のキャッシュ から直接配信することでコストを大幅に削減できます。
開発者の生産性を向上
AI レスポンスをキャッシュし、Fastly プラットフォームのパワーを活用することで、開発者の貴重な時間を節約し、車輪の再発明を回避できます。
よくある質問
Fastly の AI Accelerator とは何ですか ? どのように AI のパフォーマンスを向上させますか ?
AI Accelerator は、生成 AI アプリケーションで使用される大規模言語モデル (LLM) API 向けのセマンティック・キャッシュ・ソリューションです。Fastly プラットフォームでは、AI リクエストをネットワークのエッジで処理し、インテリジェントなセマンティックキャッシュと最適化された配信を活用することで、より高速な AI レスポンスが可能になります。また、LLM API へのリクエストが減ることで、トークンコストの削減にもつながります。
Fastly はエッジで AI アクセラレーションをどのように実現しますか?
Fastly を利用して AI リクエストの処理、最適化、レスポンス配信をエンドユーザーの近くに移すことで、AI アクセラレーションが可能になります。個々のクエリをすべて、レイテンシの高い中央集約型データセンターや LLM プロバイダーにルーティングする代わりに、Fastly のグローバルエッジネットワークはトラフィックフローを最適化し、スループットを大幅に向上させ、ラウンドトリップタイムを短縮します。このアプローチは、わずか数ミリ秒の遅延でもユーザーエクスペリエンスを低下させる可能性がある、大量の推論処理を伴うワークロードにおいて特に効果的です。
セマンティックキャッシュとは何ですか?Fastly によって、どのように LLM コストを最適化できますか?
セマンティックキャッシュは、完全に一致するレスポンスのみをキャッシュするのではなく、類似または同等の AI レスポンスを識別して再利用します。クエリを、より小さな意味のある概念に分解し、後続のクエリとの一致を理解するために利用します。つまり、同一ではなくても、意味的に類似していれば一致を把握できます。Fastly は、エッジでセマンティックキャッシュを適用することで、LLM への重複した推論リクエストを削減し、トークンコストを抑え、一貫してより高速な AI レスポンスを実現します。これは、チャットボットや仮想アシスタント、コードジェネレーター、コンテンツ作成ツール、ナレッジベースにおいて、特に大きな価値を発揮します。
Fastly によって LLM のパフォーマンス最適化をどのように改善できますか?
AI アプリケーションにとって最も重要なパフォーマンスメトリクスは、どれだけ速くユーザーにレスポンスを表示できるかです。従来の LLM は、計算コストが高く、低速です。Fastly はセマンティックキャッシュを使用して、新しいクエリが本質的に以前のクエリと同じかどうかを識別します。一致する場合、Fastly はエッジから直接回答を提供します。これにより、レイテンシが数秒 (LLM がレスポンスを生成するのを待つ時間) から数ミリ秒 (キャッシュ済みレスポンスを配信する時間) に短縮され、エンドユーザーに対するパフォーマンスが大幅に改善されます。
Fastly によって AI アプリケーションのインフラストラクチャコストを削減できますか?
はい。Fastly はセマンティックキャッシュを活用し、バックエンドの LLM プロバイダーへの呼び出しを削減します。これにより、推論コストが低下し、オリジンの負荷が軽減され、レスポンス速度やユーザーエクスペリエンスを損なうことなく、AI の利用拡大に伴う支出をコントロールしやすくなります。
Fastly AI は既存の AI スタックやプロバイダーとどのように連携しますか?
Fastly は、組織の既存の AI インフラストラクチャや LLM プロバイダーの前段にシームレスに配置され、高パフォーマンスのデリバリーと最適化を行うレイヤーを提供します。これは特定のモデルを置き換えるものではなく、パフォーマンスを向上させるプロキシとして機能するため、エンジニアリングチームは基盤にあるフレームワーク、デプロイパイプライン、特定のモデル選択を変更することなく、AI ワークロードを加速できます。
Fastly AI は、エンタープライズおよび本番環境レベルの AI ワークロードに適していますか?
はい。Fastly AI は、信頼性と安全性に加え、安定したパフォーマンスが求められるエンタープライズ規模の AI アプリケーション向けに構築されています。CTO やプラットフォーム部門の責任者が、本番環境で AI ワークロードを実行するために必要とするコントロール、オブザーバビリティ、スケーラビリティを提供すると同時に、世界中のエンドユーザーに、より高速な AI 体験を届けます。
Fastly AI は、どのような AI のユースケースで最もメリットがありますか?
Fastly AI は、対話型 AI やカスタマーサポート、AI 主導の検索やナレッジベース、リアルタイムのパーソナライゼーションやコンテンツ生成、エージェント型ワークフローなどに適しています。Fastly のエッジベースのセマンティックキャッシュ機能は、LLM のパフォーマンス最適化と低レイテンシのレスポンスが重要なあらゆるアプリケーションにメリットをもたらします。




