¿Qué son los fetchers de IA?

Los fetchers de IA son sistemas automatizados que recuperan fragmentos específicos de contenido para el uso de aplicaciones de inteligencia artificial. A diferencia de los rastreadores de IA, que escanean sistemáticamente grandes partes de la web, los fetchers de IA suelen acceder a URL individuales o a pequeños conjuntos de recursos en respuesta a una solicitud directa.

En términos simples, los crawlers exploran la web de forma amplia, mientras que los fetchers obtienen exactamente lo que una IA necesita, cuando lo necesita.

¿Cuál es el propósito de los fetchers de IA?

Los fetchers de IA se usan para proporcionar a los sistemas de IA (modelos) información reciente y específica. La necesidad de esta información surge de las siguientes actividades: 

  • Recuperar una página web, un documento o una respuesta de API a la que hace referencia un usuario (piensa en una persona que busca algo en Google y el recuperador de IA ayuda a proporcionar un resumen de IA sobre la consulta)

  • Suministro de contenido actualizado que puede no existir en los datos de entrenamiento

  • Funciones compatibles como vistas previas de enlaces, citas, resúmenes de IA o verificación de datos

  • Permitir que las herramientas de IA interactúen con sistemas o servicio externos

¿En qué se diferencian los fetchers de IA de los crawlers de IA?

La principal diferencia entre los crawlers y los fetchers está en el alcance y la intención de sus actividades. 

  • Los rastreadores de IA escanean y recopilan contenido de forma proactiva a escala, a menudo para entrenamiento o indexación

  • Los fetchers de IA recuperan de forma reactiva contenido específico, por lo general activados por una acción del usuario o una solicitud de la aplicación

Los fetchers son más similares a un navegador que carga una página o a un servicio de backend que llama a una API que a un rastreador web tradicional.

¿Qué tipo de contenido recuperan los fetchers de IA?

Los recuperadores de IA suelen obtener:

  • Páginas web o artículos individuales

  • Documentos como PDF o archivos HTML

  • Respuesta de API y datos estructurados

  • Archivos multimedia o metadatos necesarios para una tarea específica

Por lo general, acceden al contenido una solicitud a la vez, en lugar de escanear sitios completos.

¿Qué hace que un recuperador de IA acceda a un sitio web?

Los desencadenantes comunes de la recopilación por parte de la IA incluyen: 

  • Un usuario que pega o hace referencia a una URL en una herramienta de IA

  • Un sistema de IA que necesita verificar o resumir una fuente específica

  • Una solicitud para recuperar datos en tiempo real (p. ej., precios, documentación, página de estado)

  • Un flujo de trabajo de la aplicación que requiere información externa

En muchos casos, la recuperación no ocurriría sin la intención explícita del usuario o del sistema.

¿Cómo pueden los propietarios de sitios web identificar el tráfico de los fetchers de IA?

Los propietarios de sitios web pueden identificar a los rastreadores de IA de varias maneras: 

  • Por sus distintas cadenas de Usuario-Agente (básicamente, un nombre identificador)

  • Por los encabezados de sus solicitudes que indican acceso automatizado

  • Al evaluar patrones de tráfico que se asemejan más a llamadas API que a la navegación

El tráfico de fetcher suele ser de menor volumen y más esporádico que el tráfico de crawler

¿Los fetchers de IA están sujetos a robots.txt y controles de acceso?

Sí. Los fetchers de IA suelen: 

  • Respeta los requisitos de autenticación, los paywall y las restricciones de acceso

  • Puede verificar robots.txt, según la implementación

  • Debe cumplir con los términos de servicio del sitio web y los requisitos legales

Como los fetchers recuperan contenido específico, los controles de acceso, como las barreras de inicio de sesión, suelen ser muy eficaces.

¿Los fetchers de IA representan un riesgo para la privacidad?

Los fetchers de IA suelen representar un riesgo menor que los crawlers amplios porque:

  • Accede a contenido limitado y dirigido

  • Suelen estar vinculadas a acciones explícitas del usuario

  • No recopiles datos indiscriminadamente a escala

Sin embargo, pueden surgir riesgos si se obtienen URL sensibles de forma no intencional o si los controles de acceso están mal configurados.

¿Cuáles son los riesgos de seguridad de los fetchers de IA?

Los recuperadores de IA obtienen recursos externos específicos, como páginas web, documentos o Respuesta de API, bajo demanda. Aunque están más dirigidos que los rastreadores de IA, siguen planteando consideraciones importantes de seguridad si no se diseñan y controlan cuidadosamente.

Riesgos de los fetchers de IA

Falsificación de solicitudes del lado del servidor (SSRF). Los fetchers que aceptan URL arbitrarias pueden usarse de forma indebida para acceder a servicios internos, endpoints de metadatos en la nube o redes privadas.

Acceso no autorizado a recursos confidenciales. Sin controles estrictos de red y dominio, los fetchers pueden recuperar contenido interno o restringido de forma no intencional.

Exposición de credenciales y token. Los fetchers configurados con autenticación corren el riesgo de filtrar cookies, claves de API o credenciales privilegiadas a través de logs, caché o respuestas.

Exfiltración de datos. Los atacantes pueden usar fetchers como proxy para extraer datos sensibles de sistemas protegidos y devolverlos al exterior.

Contenido malicioso o adversarial. El contenido recuperado puede contener cargas útiles de exploit o texto diseñado para manipular el comportamiento de la IA en procesos posteriores (lo que se conoce como prompt injection).

Abuso y amplificación de tráfico. La obtención abierta de recursos puede explotarse para generar tráfico excesivo, saturar servicios o enmascarar el origen de las solicitudes.

Agotamiento de recursos. Las recuperaciones sin límites pueden consumir ancho de banda, capacidad de cómputo o cuotas de API pagadas, lo que afecta la disponibilidad y el costo.

Elusión de políticas y control de acceso. La aplicación inconsistente de robots.txt, la autenticación o las políticas del sitio puede generar riesgos legales y de seguridad.

¿Cómo puedes prevenir los riesgos de los fetchers de IA?

Existen varias prácticas recomendadas que los equipos de seguridad pueden implementar para ayudar a prevenir los riesgos asociados con los fetchers de IA. 

  • Listas de permitidos y listas de denegación de URL

  • Aislamiento de red y filtrado de salida

  • Eliminación de credenciales de los contextos de recuperación

  • Saneamiento y validación de contenido

  • Limitación de velocidad y cuotas de solicitudes

  • Separación clara entre los datos obtenidos y las instrucciones del modelo

  • Gestión de bots y controles de WAF  

Cómo Fastly puede ayudar

Fastly Next-Gen WAF ofrece capacidades integradas de gestión de bots para proteger tus aplicaciones de bots maliciosos y, al mismo tiempo, permitir los legítimos. Evita que los bots maliciosos realicen acciones perjudiciales contra tus sitios web y API identificándolos y mitigándolos antes de que afecten negativamente tu resultado final o la experiencia del usuario.

 Obtén más información sobre Next-Gen WAF y sus capacidades de gestión de bots.

¿Estás listo para empezar?

Ponte en contacto con nosotros