Infrastructure and SEO20 de agosto de 20267 min de lectura

Cloudflare AI Gateway: qué hace y cuándo conviene pasar por él

Un endpoint delante de 24 proveedores de IA, con caché, topes de gasto en dólares y registro de coste por modelo. Qué cubre Cloudflare AI Gateway y qué no.

gray and multicolored analog gauges

Cloudflare AI Gateway es un proxy que se coloca entre tu aplicación y los proveedores de IA a los que llama: añade caché, analítica, límites de tráfico, topes de gasto en dólares y el registro de cada petición, sin cambiar los modelos que usas.

Está pensado para equipos cuyas funciones de IA ya han pasado la fase de prototipo. Dos o tres proveedores, unos miles de llamadas al día y una factura mensual que nadie sabe atribuir a una función concreta. La calidad del modelo se queda como estaba. Lo que cambia es que sabes cuánto cuesta, por usuario y por ruta, antes de que llegue la factura.

La versión de treinta segundos

Cambia una sola cosa: la URL base a la que apunta el SDK. Las peticiones llegan a tu gateway en Cloudflare, que las reenvía al proveedor y devuelve la respuesta. El resto del código se queda donde está. A cambio tienes registros de peticiones, análisis de coste por modelo, una caché, límites de tráfico, topes de gasto en dólares y un filtro de contenido opcional. Las funciones básicas del gateway son gratuitas y Cloudflare traslada el coste de inferencia de los proveedores sin recargo.

¿Qué problema resuelve de verdad un AI gateway?

Dos problemas, y ninguno tiene que ver con la calidad del modelo.

El primero es la visibilidad del gasto. En el State of FinOps 2026, el 98% de los encuestados dice gestionar ya el gasto en IA, frente al 31% de dos años antes, y el control de costes de IA sale como la competencia que más falta hace desarrollar. La dificultad tiene una raíz estructural: el gasto en IA no sigue al número de usuarios. Una función agéntica convierte un solo clic en una cadena de llamadas al modelo, y un paso de recuperación multiplica varias veces los tokens de un prompt. Un presupuesto calculado sobre el volumen de peticiones del trimestre pasado se queda muy corto.

El segundo es la atribución. Los paneles de los proveedores informan del gasto por clave de API y por modelo. No te dicen que el endpoint de resumen cuesta nueve céntimos al día por usuario activo mientras el buscador cuesta una fracción de céntimo. Sin un proxy en el camino, ese número hay que reconstruirlo desde registros de aplicación que probablemente aún no escribes.

Cómo funciona

Un gateway es una URL por proyecto. Las peticiones que llegan se reenvían al proveedor indicado, y la respuesta vuelve con la forma en que la mandó el proveedor. Hay tres maneras de llamarlo. Los endpoints nativos mantienen el formato exacto de OpenAI, Anthropic, Google y los demás, así que el código de SDK ya escrito funciona tras cambiar la URL base. Un endpoint unificado compatible con OpenAI te deja cambiar de modelo cambiando una cadena. El enrutamiento dinámico ejecuta un flujo que defines tú antes de elegir el modelo.

AI Gateway admite 24 proveedores de forma nativa, entre ellos OpenAI, Anthropic, Google Vertex AI, Amazon Bedrock, Groq, Mistral, DeepSeek, xAI y el propio Workers AI de Cloudflare. Cualquier otro servicio con una API HTTPS se conecta como proveedor personalizado y conserva registros, caché y límites de tráfico. Con la facturación unificada llamas a los proveedores con credenciales gestionadas por Cloudflare, sin guardar claves dentro de la aplicación, y lo liquidas todo en una factura.

Los cinco controles que importan

La caché

Las peticiones idénticas se sirven desde la caché de Cloudflare en lugar del proveedor. El TTL se fija petición a petición con la cabecera cf-aig-cache-ttl, con un mínimo de 60 segundos y un máximo de un mes. El matiz es real: solo aciertan las repeticiones exactas. En un producto de chat, donde cada prompt es texto libre, la tasa de acierto roza el cero. En una tubería de clasificación o extracción que ejecuta una plantilla fija sobre un conjunto acotado de entradas, es el mayor recorte disponible en la factura.

Los límites de tráfico

Peticiones por ventana de tiempo, por gateway. Pasado el límite, el gateway responde 429 y la petición no llega nunca al proveedor. Tómalo como protección frente a abusos y contención de daños, no como control de gasto: cien peticiones baratas y cien caras cuentan igual.

Los topes de gasto

Presupuestos en dólares en vez de en peticiones. El gateway calcula el gasto acumulado a partir del consumo de tokens y del precio del modelo, y bloquea las peticiones cuando se alcanza el tope. Cloudflare los publicó en beta abierta el 5 de junio de 2026 para todos los planes, con ejemplos como 200 dólares al día por cada usuario o un techo de 10.000 dólares al día para todo el gateway. Es el control que convierte una función de IA en una partida con máximo y no en un riesgo abierto.

Los guardrails

El gateway puede inspeccionar prompts y respuestas al vuelo frente a categorías de seguridad. La evaluación corre sobre @cf/meta/llama-guard-3-8b en Workers AI y se factura como inferencia por tokens, así que el coste crece con la cantidad de texto que filtras. Además añade una llamada al modelo en el camino, y eso se nota en la latencia. Filtra las superficies donde el texto escrito por el usuario llega a un modelo, no todas las llamadas.

El enrutamiento dinámico

El enrutamiento dinámico sustituye el modelo escrito en el código por un flujo pequeño, montado con interfaz visual o en JSON. Las condiciones eligen el modelo, las cuotas se aplican dentro del flujo y los fallbacks cubren una caída del proveedor. Mandar a los usuarios de pago al modelo grande y a los gratuitos al barato pasa a ser un flujo de dos nodos en vez de una rama en el código.

Qué te dan los registros

La analítica cubre peticiones, tokens, coste, errores y latencia, desglosados por proveedor y por modelo: la vista que los paneles de los proveedores no dan en cuanto usas más de uno. Desde agosto de 2026 el gateway también lee la identidad del usuario autenticado desde Cloudflare Access y la asocia a registros, analítica y reglas de gasto. Así «la factura de IA subió un 40% este mes» se convierte en una cuenta con nombre y una ruta concreta, que es la diferencia entre una pregunta de administración y un ticket de ingeniería.

Cuánto cuesta

El gateway en sí es gratuito, y la inferencia de los proveedores se traslada a precio de proveedor. El único recurso medido es el almacenamiento de registros: 100.000 registros guardados entre todos los gateways en el plan Workers Free, 200.000 en Workers Paid, y luego 8 dólares por cada 100.000 registros guardados al mes. Logpush, que envía los registros a tu propio almacenamiento, necesita plan de pago. Los guardrails se facturan como inferencia. Presupuesta registros y guardrails: al lado del gasto en modelos, lo demás redondea a cero.

Cuándo pasar por él y cuándo no

Pasa por él si llamas a más de un proveedor, si una sola acción del usuario se abre en varias llamadas al modelo, si necesitas un presupuesto por cliente o por equipo que la plataforma aplique por ti, o si el stack ya vive en Cloudflare y un binding más no cuesta nada.

Piénsatelo dos veces si llamas a un único proveedor unos cientos de veces al día y ya tienes trazas que responden a la pregunta del coste. Piénsatelo dos veces si los contratos o las reglas de residencia de datos convierten un procesador extra en el camino en una conversación legal y no en un cambio de configuración. Y verifica el streaming en staging antes de mover el tráfico de producción: está soportado, y las tres cosas que conviene comprobar con tu cliente son las respuestas token a token, los tiempos de espera y el paso de errores.

El trato es el de cualquier proxy gestionado. Aceptas un salto de latencia y una dependencia, y obtienes controles que si no tendrías que escribir y mantener. Si los quieres dentro de tu infraestructura, LiteLLM es la opción autoalojada y corre en una máquina modesta con una base de datos Postgres. Si buscas sobre todo gobernanza y guardrails profundos, Portkey nació para eso. Las primitivas se parecen ya en toda la categoría, así que la decisión va sobre todo de quién las opera.

Conceptos vecinos

Un gateway mide el gasto y lo limita. No decide cuánto debería costar una función de IA, que es una cuestión de pricing tratada en cómo gestionar el coste de tokens antes de perder margen. Tampoco sustituye la caché ni el diseño del streaming en la aplicación: ese trabajo vive en el cliente, y el lado de Next.js lo vimos en la API de Anthropic en Next.js. Si el almacenamiento ya está en Cloudflare, la comparativa de R2 cubre la otra mitad de esa factura.

Foto de Jay Heike en Unsplash

Preguntas frecuentes

¿Un AI gateway añade latencia a cada petición?

Sí, un proxy añade un salto, y la única forma seria de medirlo es compararlo con tu propia línea base en vez de fiarte de una cifra leída por ahí. En la práctica el tiempo añadido es pequeño al lado de la generación del modelo, que suele medirse en segundos. Dos funciones mueven la aguja en direcciones opuestas: un acierto de caché elimina del todo la llamada al proveedor y vuelve mucho antes que el modelo, mientras que los guardrails añaden una segunda llamada y ralentizan la petición. Prueba ambas configuraciones sobre tu p95 antes de decidir.

¿Cloudflare AI Gateway es gratis?

El gateway en sí es gratuito, y la inferencia de los proveedores se paga a precio de proveedor, sin recargo. Hay dos partidas medidas. El almacenamiento de registros es gratis hasta 100.000 registros en el plan Workers Free y 200.000 en Workers Paid, y a partir de ahí cuesta 8 dólares por cada 100.000 registros guardados al mes. Los guardrails se facturan como inferencia por tokens en Workers AI, así que crecen con el volumen de texto que filtras. Logpush, que envía los registros a tu almacenamiento, exige plan de pago.

¿Puedo seguir usando el SDK de Anthropic o de OpenAI?

Sí. Los endpoints nativos mantienen idéntico el formato de petición y respuesta de cada proveedor, así que cambia la URL base del cliente y nada más en el punto de llamada. Si prefieres uniformar a todos los proveedores tras una sola forma, el endpoint unificado compatible con OpenAI te deja cambiar de modelo editando una cadena. Ambos estilos reciben los mismos registros, la misma caché y los mismos límites de tráfico y de gasto. Elige los endpoints nativos si dependes de parámetros propios de un proveedor, y el unificado si te importa más cambiar de modelo sin trabajo.

¿Qué pasa cuando se alcanza el tope de gasto a mitad de mes?

Las peticiones se bloquean cuando el gasto acumulado supera el tope: se para la función en vez de crecer la factura. Diseña ese escenario antes de activarlo: decide qué enseña el producto cuando el modelo no está disponible y si caer a un modelo más barato es mejor que dar un error. El enrutamiento dinámico es el sitio donde escribir esa decisión, porque un flujo puede mandar el tráfico a un modelo más pequeño en lugar de fallar. El patrón habitual es un techo para todo el gateway más un presupuesto por usuario más bajo, para acotar por separado el riesgo de la empresa y el de una sola cuenta.

Artículos relacionados

Studio

Empieza un proyecto.

Un partner único para todo el proyecto. Producción más rápida, tecnología moderna, costes reducidos.