Adamarant
Iniciar
Volver a Apuntes

Cloudflare Workers AI o la API de OpenAI: cuándo usar cada una

Infrastructure and SEO13 sept 20268 min de lectura

Workers AI cuesta 0,011 dólares por cada 1.000 Neurons y corre en GPU de más de 180 ciudades. Dónde le gana a una API alojada y dónde no.

Fiber optic cables connected to a network switch in a server rack

Cloudflare Workers AI es una plataforma de inferencia serverless que ejecuta modelos en GPU dentro de la propia red de Cloudflare, con cobro por unidad de cómputo en vez de por hora de GPU. La llamas desde un Worker mediante un binding, o por HTTP desde donde sea. La decisión que un equipo afronta de verdad es más estrecha que el debate edge contra nube: para esta función concreta, ¿la llamada va a Workers AI o a una API alojada como la de OpenAI?

Se elige por la forma de la petición. Llamadas cortas, frecuentes y sensibles a la latencia, pegadas a código que ya corre en Cloudflare: Workers AI. Razonamiento con contexto largo, tool calling de varios pasos y todo aquello donde el techo de calidad del modelo decide si la función aguanta: API frontier alojada. Casi todos los sistemas en producción que montamos usan las dos, y la regla de enrutado se escribe una sola vez.

Qué es Workers AI en 2026

La plataforma nació como catálogo de modelos open-weight pequeños y una promesa sobre la latencia. Desde entonces se ha movido. Hoy Cloudflare lista más de 50 modelos open source junto a modelos frontier de terceros servidos por la misma vía de facturación: Kimi K2.6 y K2.7-code de Moonshot, GLM 5.2 y 5.3 de Z.ai, DeepSeek V4 Pro. Varios de ellos piden un método de pago activo o créditos prepagados de AI Gateway antes de contestar.

La facturación va por Neurons, la unidad con la que Cloudflare mide el cómputo en GPU, a 0,011 dólares por cada 1.000 Neurons. Tanto el plan Workers gratuito como el de pago incluyen 10.000 Neurons al día sin coste, y la asignación se reinicia a las 00:00 UTC. Desde la actualización de precios de agosto de 2026, la documentación publica además las tarifas por modelo en tokens, así que comparar con una API alojada consiste en leer dos números y no en hacer conversiones.

La horquilla de precio dentro del catálogo es más ancha que la distancia entre plataformas. IBM Granite 4.0 H Micro cuesta 0,017 dólares por millón de tokens de entrada. GLM 5.3 cuesta 1,400. Son 82 veces más, en la misma cuenta y detrás del mismo token de API. Equivocarse de modelo en Workers AI sale más caro que equivocarse de proveedor.

Cloudflare Workers AI o la API de OpenAI: los cinco ejes que deciden

  • Techo de calidad del modelo. Ganan las API frontier alojadas. Epoch AI midió que desde enero de 2026 los mejores modelos open-weight van cuatro meses por detrás de los cerrados de frontera, con una diferencia de 8 puntos en su Capabilities Index.
  • Coste unitario en tareas pequeñas. Gana Workers AI, por casi un orden de magnitud. Llama 3.1 8B en la build fp8-fast sale a 0,045 dólares por millón de tokens de entrada y 0,384 de salida.
  • Posición en la red. Gana Workers AI cuando quien llama ya es un Worker. La petición se queda dentro de la red donde corre el código. Ninguna clave de terceros que acotar, rotar o perder.
  • Límites de frecuencia. Ganan las API alojadas en margen de carga. La generación de texto en Workers AI parte de 300 peticiones por minuto y cuenta, y los modelos frontier de la plataforma se quedan en 20 por minuto, o 50 con créditos prepagados de AI Gateway.
  • Coste de cambio. Empate, y más bajo de lo que se supone. Workers AI sirve endpoints compatibles con OpenAI en /v1/chat/completions y /v1/embeddings: mover una llamada es cambiar una base URL y una cadena de modelo.

Cuándo conviene hacer inferencia en Workers AI

La llamada es corta, frecuente y aburrida

Clasificación, moderación, etiquetado, detección de idioma, embeddings, un primer resumen. Son las llamadas que entran a miles cada hora y nunca necesitan razonamiento de frontera. En un modelo insignia alojado se convierten en la partida que se come el margen de una función de IA sin hacer ruido. En Workers AI un modelo instruct pequeño las despacha por céntimos.

El criterio no es la longitud del prompt. Es si una persona que revisa la salida notaría la diferencia entre un modelo de 3B y uno de frontera. Para marcar spam o poner una etiqueta de tema, casi nunca. Para un resumen legal, al instante.

Quien llama ya es un Worker

Cuando la llamada sale de código que corre en Cloudflare, el binding de IA mantiene la petición dentro de la misma red. Desaparece un viaje por internet público, desaparece un segundo proveedor del camino de los datos y desaparece una credencial del calendario de rotaciones. Cuando alguien de cumplimiento pregunta dónde acaba el texto de los clientes, la respuesta es una empresa más corta.

Quieres un suelo gratis bajo el prototipo

10.000 Neurons al día bastan para construir y enseñar una función sin tarjeta registrada, en el plan gratuito. Importa poco en un equipo con financiación e importa bastante en un prototipo que tiene que sobrevivir una semana de pruebas internas antes de que alguien apruebe presupuesto.

Cuándo quedarse con la API alojada

El techo del modelo es la función

Si la promesa del producto es un agente que planifica en varios pasos, lee un contrato de 200 páginas o escribe código que compila, el nivel open-weight es un recorte que el usuario nota. Los cuatro meses de retraso que mide Epoch son una media entre benchmarks y se acortan cada trimestre, pero una media no ayuda cuando una tarea concreta de razonamiento falla en un umbral concreto de calidad. Pruébalo con el prompt real antes de dar por hecha la paridad.

El tráfico va a picos y tiene forma frontier

20 peticiones por minuto es un techo real. Un asistente de código con 40 usuarios a la vez choca contra él. Los créditos prepagados de AI Gateway lo suben a 50, que ayuda, y los límites existen porque las peticiones agénticas tardan más en cerrarse. Si tu perfil de carga es irregular y depende de la frontera, presupuesta un proveedor alojado con más cuota y deja Workers AI para el nivel barato de debajo.

Necesitas las herramientas de alrededor

Salidas estructuradas, function calling, endpoints por lotes, pipelines de fine-tuning, herramientas de evaluación y un contrato de soporte con un nombre encima. El ecosistema open-weight cubre casi todo, de forma desigual. Los proveedores alojados lo cubren con documentación y un interlocutor comercial. A unos equipos eso les vale dinero y a otros nada.

Cuánto cuesta de verdad la diferencia

Pongamos una función sobre el buzón de soporte: 500.000 llamadas al mes, unos 1.200 tokens de entrada y 200 de salida en cada una. Salen 600 millones de tokens de entrada y 100 millones de salida. Con las tarifas publicadas de Workers AI:

  • Llama 3.1 8B fp8-fast: 27,00 dólares de entrada más 38,40 de salida, o sea unos 65 dólares al mes.
  • gpt-oss-120b: 210,00 dólares más 75,00, unos 285 dólares al mes.
  • GLM 5.3: 840,00 dólares más 440,00, unos 1.280 dólares al mes.

Misma plataforma, mismo token de API, mismo camino de código. Un rango de 20 veces que decide una cadena en el campo del modelo. La carga media aquí es de 11,6 peticiones por minuto: cómoda frente al límite de 300 por minuto en generación de texto, imposible frente al de 20 por minuto de los frontier si el tráfico llega a oleadas.

Esta cuenta se hace antes de publicar la función, no después de la primera factura. La versión larga del argumento está en cómo gestionar el coste de tokens antes de perder margen.

Cómo lo montamos nosotros

Dos niveles, un router. El nivel barato (embeddings, clasificación, moderación, resúmenes cortos) va a un modelo pequeño de Workers AI. El nivel caro (razonamiento, agentes, todo lo que el usuario lee entero) va a un modelo frontier alojado. Los dos pasan por AI Gateway para caché, topes de gasto y fallback, con lo que la decisión de enrutado se observa en vez de suponerse.

Lo que hace segura esta estructura es el endpoint compatible con OpenAI. Como las dos partes hablan la misma forma de petición, asignar un nivel es configuración y no arquitectura. Si un modelo pequeño resulta bastante bueno para una tarea que dábamos por frontier, el cambio es una línea y un despliegue. Si resulta peor, igual.

Los límites que conviene saber antes de decidir

La inferencia no corre en todas partes. Cloudflare declaró GPU en más de 180 ciudades tras doblar capacidad en un año, frente a una red que cubre 330 ciudades. La petición que sale de un Worker viaja igualmente hasta una sede con GPU. Es un salto corto y privado en lugar de una llamada por internet público a otro proveedor, y la ganancia real de latencia existe, pero no es inferencia en el mismo rack que el usuario.

Los Neurons meten un paso intermedio. La documentación ya pone los precios en tokens al lado de los precios en Neurons, así que el modelo mental es más fácil que antes, aunque la factura siga llegando en unidades de cómputo. Se presupuesta en tokens y se concilia en Neurons.

Y los modelos frontier de Workers AI no son modelos de Cloudflare. Son pesos de terceros servidos sobre infraestructura de Cloudflare, con la calidad del proveedor y los límites de frecuencia de la plataforma. Muchas veces esa es la combinación correcta. Conviene decirlo porque este año «correrlo en Cloudflare» y «correr un modelo abierto» dejaron de significar lo mismo. El mismo razonamiento vuelve un piso más abajo cuando eliges entre edge runtime y Node runtime para el código que hace la llamada.

Foto de Kirill Sh en Unsplash

Preguntas frecuentes

¿Cloudflare Workers AI cuesta menos que la API de OpenAI?+

En modelos open-weight pequeños sí, con mucha diferencia. Llama 3.1 8B fp8-fast sale a 0,045 dólares por millón de tokens de entrada y 0,384 de salida en Workers AI, un orden de magnitud por debajo de cualquier modelo insignia alojado. La comparación se da la vuelta en cuanto eliges un modelo frontier en la misma plataforma: GLM 5.3 cuesta 1,400 dólares por millón de tokens de entrada y 4,400 de salida, a la par de los proveedores alojados y no por debajo. El ahorro viene de bajar el trabajo un nivel de modelo, no de la plataforma en sí.

¿Puedo usar el SDK de OpenAI con Workers AI?+

Sí. Workers AI sirve endpoints compatibles con OpenAI para generación de texto en /v1/chat/completions y para embeddings en /v1/embeddings. Con el SDK oficial openai-node cambias la base URL al endpoint de tu cuenta de Cloudflare y pones el modelo con una cadena del catálogo, por ejemplo @cf/meta/llama-3.1-8b-instruct. El código de los prompts, el manejo del streaming y los reintentos siguen funcionando, y por eso montar un enrutado de dos niveles sale barato y deshacerlo también.

¿La inferencia de Workers AI corre en la ciudad más cercana al usuario?+

No siempre. Cloudflare declaró GPU en más de 180 ciudades tras doblar capacidad en un año, mientras que la red cubre 330 ciudades. Una petición que sale de un Worker en una ciudad sin GPU viaja hasta la sede más cercana que sí las tiene. Ese salto se queda dentro de Cloudflare en vez de cruzar internet público hacia otro proveedor, así que sigue siendo más corto que una llamada a una API alojada, pero llamarlo inferencia en el edge promete más de lo que ocurre.

¿Qué pasa cuando agoto los 10.000 Neurons gratuitos del día?+

En el plan Workers gratuito, las peticiones siguientes fallan con un error hasta que la asignación se reinicia a las 00:00 UTC. En el plan de pago, el consumo por encima de la asignación diaria se cobra a 0,011 dólares por cada 1.000 Neurons sin corte, así que la forma de romperse pasa a ser una factura y no una caída. Algunos modelos frontier de la plataforma exigen además un método de pago activo o créditos prepagados de AI Gateway para responder. Decide cuál de los dos fallos prefieres antes de lanzar y pon un tope de gasto acorde.

Servicios relacionados

Studio

Empieza un proyecto.

Escribimos sobre lo que construimos. Cuéntanos qué quieres construir tú.