Plateforme Edge Cloud de Fastly

Solutions numériques innovantes

Une IA plus rapide commence par la mise en cache sémantique

Fastly AI Accelerator

Obtenez de meilleures performances d’IA grâce à une mise en cache intelligente qui comprend vos données. Fastly AI Accelerator multiplie par 9 les performances des LLM les plus populaires comme OpenAI et Google Gemini. Aucune reconstruction nécessaire, rien qu’une ligne de code.

Hero IA

Pourquoi vos charges de travail d’IA ont-elles besoin d’une couche de mise en cache ?

Les charges de travail d’IA peuvent être considérablement plus lentes que les traitements non-LLM. Vos utilisateurs voient la différence entre quelques dizaines de millisecondes et plusieurs secondes et, dans le cas de plusieurs milliers de requêtes, vos serveurs la voient aussi.

La mise en cache sémantique cartographie les requêtes en concepts. Les réponses aux questions sont mises en cache, quelle que soit la façon dont les questions sont posées. Il s’agit d’une bonne pratique recommandée par les principaux fournisseurs de LLM et AI Accelerator facilite la mise en cache sémantique.

Avantages

Utilisez les LLM avec facilité pour créer des applications plus efficaces

Fastly AI Accelerator réduit les appels API et les coûts grâce à une mise en cache sémantique intelligente.
  • Améliorer les performances

    Fastly aide à rendre les API d’IA rapides et fiables en réduisant le nombre de demandes et les délais des demandes grâce à la mise en cache sémantique.

  • Réduire les coûts

    Réduisez les coûts en diminuant l’utilisation de l’API en amont, en servant le contenu directement à partir de Cache Fastly.

  • Augmenter la productivité des développeurs

    Permettez aux développeurs de gagner un temps précieux en tirant parti de la puissance de la plateforme Fastly pour mettre en cache les réponses d’IA sans avoir à réinventer la roue.

Questions fréquemment posées

Qu'est-ce que l'AI Accelerator de Fastly et comment améliore-t-il les performances de l'IA ?

AI Accelerator est une solution de mise en cache sémantique facile à mettre en œuvre pour les API de grands modèles de langage (LLM) utilisées dans les applications d'IA générative. La gestion des requêtes d'IA est positionnée en périphérie du réseau, la plateforme utilisant une mise en cache sémantique intelligente et une distribution optimisée pour permettre aux entreprises de fournir des réponses d'IA plus rapides aux utilisateurs. La diminution des allers-retours vers l'API LLM permet également de réaliser des économies sur le coût des jetons.

Comment Fastly favorise-t-il l'accélération de l'IA en périphérie ?

Fastly favorise l'accélération de l'IA en rapprochant la gestion des requêtes d'IA, l'optimisation et la distribution des réponses des utilisateurs finaux. Au lieu d'acheminer chaque requête individuelle vers un data center ou un fournisseur de LLM centralisé et à forte latence, l'edge network mondial de Fastly optimise le flux de trafic pour améliorer considérablement le débit et réduire les temps aller-retour. Cette approche est particulièrement efficace pour les charges de travail d'inférence à fort volume, où des retards de l'ordre de la milliseconde peuvent dégrader l'expérience utilisateur.

Qu'est-ce que la mise en cache sémantique et comment Fastly optimise-t-il les coûts des LLM ?

La mise en cache sémantique est une technique qui identifie et réutilise des réponses d'IA similaires ou équivalentes, plutôt que de mettre en cache uniquement les correspondances exactes. Elle décompose la requête en concepts plus petits et significatifs, qui peuvent être utilisés pour comprendre les correspondances avec de futures requêtes, même si elles ne sont pas identiques, mais simplement sémantiquement similaires. Fastly applique la mise en cache sémantique en périphérie pour réduire les appels d'inférence LLM redondants, abaisser les coûts de jetons et livrer des réponses d'IA constamment plus rapides. Cela s'avère particulièrement utile pour les chatbots et les assistants virtuels, les générateurs de code, les outils de création de contenu et les bases de connaissances.

Comment Fastly améliore-t-il l'optimisation des performances des LLM ?

La métrique de performance la plus critique pour les applications d'IA est la rapidité avec laquelle un utilisateur voit une réponse. Les grands modèles de langage (LLM) traditionnels exigent une puissance de calcul importante et sont lents. Grâce à la mise en cache sémantique, Fastly peut déterminer si une nouvelle requête est essentiellement similaire à une précédente. Dans ces cas, Fastly transmet la réponse directement depuis la périphérie. Cela permet de réduire la latence, qui passe de plusieurs secondes (en attendant que le grand modèle de langage génère la réponse) à quelques millisecondes (lors de la diffusion d'une réponse préalablement mise en cache), ce qui représente une amélioration massive des performances pour l'utilisateur final.

Fastly peut-il réduire les coûts d'infrastructure pour les applications d'IA ?

Oui. En utilisant la mise en cache sémantique, Fastly réduit le nombre d'appels devant atteindre les fournisseurs de LLM en back-end. Cela réduit les coûts d'inférence, diminue la charge sur le serveur d'origine et aide les équipes à contrôler leurs dépenses à mesure que l'utilisation de l'IA augmente, sans sacrifier la vitesse de réponse ni l'expérience utilisateur.

Comment Fastly AI s'intègre-t-il aux piles et fournisseurs d'IA existants ?

Fastly fournit une couche de distribution et d'optimisation hautement performante qui se positionne de manière transparente en amont de l'infrastructure d'IA et des fournisseurs de LLM existants d'une entreprise. Puisqu'il fonctionne comme un proxy améliorant les performances plutôt que comme un remplacement pour des modèles spécifiques, les équipes d'ingénierie peuvent accélérer les charges de travail d'IA sans modifier leurs frameworks sous-jacents, leurs pipelines de déploiement ou leurs choix de modèles spécifiques.

Fastly AI est-elle adaptée aux charges de travail d'IA de niveau entreprise et de production ?

Oui. Fastly AI est conçue pour les applications d'IA à l'échelle de l'entreprise qui exigent fiabilité, sécurité et performances prévisibles. Elle offre les contrôles, l'observabilité et la scalabilité exigés par les CTO et les leaders de plateformes exécutant des charges de travail d'IA en production, tout en favorisant des expériences d'IA plus rapides pour les utilisateurs finaux dans le monde entier.

Quels types de cas d'utilisation de l'IA tirent le plus grand avantage de Fastly AI ?

Fastly IA est particulièrement adaptée à l'IA conversationnelle, à l'assistance client, à la recherche et aux bases de connaissances alimentées par l'IA, à la personnalisation et à la génération de contenu en temps réel, ainsi qu'aux flux de travail agentiques. Toute application pour laquelle l'optimisation des performances des LLM et les réponses à faible latence sont essentielles peut bénéficier des fonctionnalités de mise en cache sémantique en périphérie de Fastly.

Fastly aide à propulser les plateformes LLM à l’échelle du web.

Laissez Fastly vous aider à optimiser votre plateforme LLM dès aujourd’hui.