Cloudflare Workers AI o API OpenAI: quando conviene ciascuna
Workers AI costa 0,011 dollari ogni 1.000 Neuron e gira su GPU in oltre 180 città. Dove batte una API ospitata e dove invece no.
In questo pezzo
Cloudflare Workers AI è una piattaforma di inferenza serverless che esegue i modelli su GPU dentro la rete di Cloudflare, con addebito a unità di calcolo invece che a ora di GPU. La chiami da un Worker tramite binding, oppure via HTTP da qualunque posto. La decisione che i team affrontano davvero è più stretta della contrapposizione edge-cloud: per questa singola funzione, la chiamata va a Workers AI o a una API ospitata come quella di OpenAI?
Si sceglie in base alla forma della richiesta. Chiamate corte, frequenti, sensibili alla latenza, che stanno accanto a codice già in esecuzione su Cloudflare: Workers AI. Ragionamento su contesto lungo, tool calling a più passaggi, e tutto ciò in cui il tetto qualitativo del modello decide se la funzione regge: API frontier ospitata. Quasi tutti i sistemi in produzione che costruiamo usano entrambe, e la regola di routing si scrive una volta sola.
Cosa è Workers AI nel 2026
La piattaforma è nata come catalogo di modelli open-weight piccoli, più una promessa sulla latenza. Poi si è spostata. Oggi Cloudflare elenca oltre 50 modelli open source accanto a modelli frontier di terze parti serviti sullo stesso binario di fatturazione: Kimi K2.6 e K2.7-code di Moonshot, GLM 5.2 e 5.3 di Z.ai, DeepSeek V4 Pro. Diversi di questi richiedono un metodo di pagamento attivo o crediti prepagati di AI Gateway prima di rispondere.
La fatturazione passa dai Neuron, l’unità con cui Cloudflare misura il calcolo su GPU, a 0,011 dollari ogni 1.000 Neuron. Sia il piano Workers gratuito sia quello a pagamento includono 10.000 Neuron al giorno senza costo, e l’allocazione si azzera alle 00:00 UTC. Dall’aggiornamento dei prezzi di agosto 2026 la documentazione pubblica anche le tariffe per modello in token, quindi il confronto con una API ospitata è leggere due numeri invece di fare conversioni.
Lo scarto di prezzo dentro il catalogo è più ampio della distanza fra le piattaforme. IBM Granite 4.0 H Micro costa 0,017 dollari per milione di token in ingresso. GLM 5.3 ne costa 1,400. Sono 82 volte tanto, sullo stesso account, dietro lo stesso token API. Sbagliare modello su Workers AI costa più che sbagliare fornitore.
Cloudflare Workers AI o API OpenAI: i cinque assi che decidono
- Tetto qualitativo del modello. Vincono le API frontier ospitate. Epoch AI ha misurato che da gennaio 2026 i modelli open-weight migliori restano indietro di quattro mesi in media rispetto ai modelli chiusi di frontiera, con uno scarto di 8 punti sul suo Capabilities Index.
- Costo unitario sui compiti piccoli. Vince Workers AI, di circa un ordine di grandezza. Llama 3.1 8B nella build fp8-fast sta a 0,045 dollari per milione di token in ingresso e 0,384 in uscita.
- Posizione sulla rete. Vince Workers AI quando chi chiama è già un Worker. La richiesta resta dentro la rete in cui gira il codice. Nessuna chiave di terze parti da limitare, ruotare o perdere.
- Limiti di frequenza. Vincono le API ospitate sul margine di carico. La generazione di testo su Workers AI parte da 300 richieste al minuto per account, e i modelli frontier della piattaforma stanno a 20 al minuto, o 50 con crediti AI Gateway prepagati.
- Costo di cambio. Pari, e più basso di quanto si creda. Workers AI espone endpoint compatibili con OpenAI su
/v1/chat/completionse/v1/embeddings: spostare una chiamata significa cambiare una base URL e una stringa di modello.
Quando conviene fare inferenza su Workers AI
La chiamata è corta, frequente e noiosa
Classificazione, moderazione, tag, riconoscimento della lingua, embedding, primo giro di sintesi. Sono le chiamate che arrivano a migliaia ogni ora e non hanno mai bisogno di ragionamento di frontiera. Su un modello di punta ospitato diventano la voce di costo che si mangia in silenzio il margine di una funzione AI. Su Workers AI un piccolo modello instruct le smaltisce per pochi centesimi.
Il criterio non è la lunghezza del prompt. È se una persona che rilegge l’output noterebbe la differenza fra un modello da 3B e uno di frontiera. Per un flag di spam o un tag di argomento, di solito no. Per una sintesi legale, subito.
Chi chiama è già un Worker
Quando la chiamata parte da codice in esecuzione su Cloudflare, il binding AI tiene la richiesta dentro la stessa rete. Sparisce un giro su internet pubblico, sparisce un secondo fornitore dal percorso dei dati, sparisce una credenziale dal calendario delle rotazioni. Quando qualcuno in compliance chiede dove finisce il testo dei clienti, la risposta è più corta di un’azienda.
Vuoi un pavimento gratuito sotto il prototipo
10.000 Neuron al giorno bastano per costruire e mostrare una funzione senza carta registrata, sul piano gratuito. Conta poco per un team finanziato e parecchio per un prototipo che deve sopravvivere a una settimana di test interni prima che qualcuno approvi un budget.
Quando tenere la API ospitata
Il tetto del modello è la funzione stessa
Se la promessa del prodotto è un agente che pianifica su più passaggi, legge un contratto di 200 pagine o scrive codice che compila, il livello open-weight è un peggioramento che l’utente sente. I quattro mesi di ritardo misurati da Epoch sono una media fra benchmark, e si accorciano ogni trimestre, ma una media non serve quando un compito specifico di ragionamento fallisce a una soglia di qualità specifica. Provalo sul prompt vero prima di dare per scontata la parità.
Il traffico è a picchi e ha forma frontier
20 richieste al minuto sono un tetto reale. Un assistente di scrittura codice con 40 utenti in contemporanea ci sbatte contro. I crediti AI Gateway prepagati lo alzano a 50, il che aiuta, e i limiti esistono perché le richieste agentiche impiegano più tempo a chiudersi. Se il profilo di carico è irregolare e dipende dalla frontiera, metti a budget un fornitore ospitato con quota più alta e lascia Workers AI al livello economico sotto.
Ti serve il contorno di strumenti
Output strutturati, function calling, endpoint batch, pipeline di fine-tuning, strumenti di valutazione e un contratto di supporto con un nome sopra. L’ecosistema open-weight copre quasi tutto, in modo disomogeneo. I fornitori ospitati lo coprono con documentazione e un referente commerciale. Per certi team vale soldi veri, per altri niente.
Quanto costa davvero la differenza
Prendiamo una funzione sulla casella di assistenza: 500.000 chiamate al mese, circa 1.200 token in ingresso e 200 in uscita ciascuna. Fanno 600 milioni di token in ingresso e 100 milioni in uscita. Con le tariffe pubblicate di Workers AI:
- Llama 3.1 8B fp8-fast: 27,00 dollari di ingresso più 38,40 di uscita, cioè circa 65 dollari al mese.
- gpt-oss-120b: 210,00 dollari più 75,00, circa 285 dollari al mese.
- GLM 5.3: 840,00 dollari più 440,00, circa 1.280 dollari al mese.
Stessa piattaforma, stesso token API, stesso percorso di codice. Un intervallo di 20 volte deciso da una stringa nel campo del modello. Il carico medio qui è di 11,6 richieste al minuto: comodo contro il limite di 300 al minuto sulla generazione di testo, impossibile contro quello di 20 al minuto dei frontier se il traffico arriva a ondate.
Questo conto si fa prima di rilasciare la funzione, non dopo la prima fattura. La versione lunga dell’argomento sta in come gestire il costo dei token prima di perdere il margine.
Come lo impostiamo noi
Due livelli, un router. Il livello economico (embedding, classificazione, moderazione, sintesi brevi) va su un modello piccolo di Workers AI. Il livello costoso (ragionamento, agenti, tutto ciò che l’utente legge per intero) va su un modello frontier ospitato. Entrambi passano da AI Gateway per cache, tetti di spesa e fallback, così la scelta di routing diventa osservabile invece che teorica.
È l’endpoint compatibile con OpenAI a rendere sicura tutta la struttura. Dato che le due parti parlano la stessa forma di richiesta, assegnare un livello è configurazione, non architettura. Se un modello piccolo si rivela abbastanza buono per un compito che davamo per frontier, la modifica è una riga e un rilascio. Se si rivela peggiore, uguale.
I limiti da conoscere prima di decidere
L’inferenza non gira ovunque. Cloudflare ha dichiarato GPU in oltre 180 città dopo aver raddoppiato la capacità in un anno, a fronte di una rete che copre 330 città. La richiesta partita da un Worker viaggia comunque fino a una sede con GPU. È un salto corto e privato invece di una chiamata su internet pubblico verso un altro fornitore, e il guadagno pratico di latenza c’è, ma non è inferenza nello stesso rack dell’utente.
I Neuron aggiungono un passaggio di mezzo. La documentazione ora affianca i prezzi in token a quelli in Neuron, quindi il modello mentale è più semplice di prima, per quanto la fattura arrivi ancora in unità di calcolo. Si mette a budget in token e si riconcilia in Neuron.
E i modelli frontier su Workers AI non sono modelli di Cloudflare. Sono pesi di terze parti serviti su infrastruttura Cloudflare, con la qualità del fornitore e i limiti di frequenza della piattaforma. Spesso è la combinazione giusta. Vale la pena dirlo perché quest’anno “girare su Cloudflare” e “girare su un modello aperto” hanno smesso di significare la stessa cosa. Lo stesso ragionamento torna un piano sotto, quando scegli fra edge runtime e Node runtime per il codice che fa la chiamata.
Domande frequenti
Cloudflare Workers AI costa meno delle API di OpenAI?+
Sui modelli open-weight piccoli sì, con largo margine. Llama 3.1 8B fp8-fast sta a 0,045 dollari per milione di token in ingresso e 0,384 in uscita su Workers AI, un ordine di grandezza sotto qualunque modello di punta ospitato. Il confronto si ribalta appena scegli un modello frontier sulla stessa piattaforma: GLM 5.3 costa 1,400 dollari per milione di token in ingresso e 4,400 in uscita, in linea con i fornitori ospitati e non sotto. Il risparmio arriva dallo spostare il lavoro su un livello di modello più basso, non dalla piattaforma in sé.
Posso usare l’SDK di OpenAI con Workers AI?+
Sì. Workers AI espone endpoint compatibili con OpenAI per la generazione di testo su /v1/chat/completions e per gli embedding su /v1/embeddings. Con l’SDK ufficiale openai-node cambi la base URL puntandola all’endpoint del tuo account Cloudflare e imposti il modello su una stringa del catalogo, per esempio @cf/meta/llama-3.1-8b-instruct. Il codice dei prompt, la gestione dello streaming e i retry continuano a funzionare: per questo una struttura di routing a due livelli costa poco da costruire e poco da annullare.
L’inferenza di Workers AI gira nella città più vicina all’utente?+
Non sempre. Cloudflare ha dichiarato GPU in oltre 180 città dopo aver raddoppiato la capacità in un anno, mentre la rete copre 330 città. Una richiesta partita da un Worker in una città senza GPU viaggia fino alla sede più vicina che ne ha. Quel salto resta dentro Cloudflare invece di attraversare internet pubblico verso un altro fornitore, quindi è comunque più corto di una chiamata a una API ospitata, ma chiamarla inferenza sull’edge promette più di quel che succede.
Cosa succede quando finisco i 10.000 Neuron gratuiti della giornata?+
Sul piano Workers gratuito le richieste successive falliscono con un errore fino al reset dell’allocazione alle 00:00 UTC. Sul piano a pagamento il consumo oltre l’allocazione giornaliera viene addebitato a 0,011 dollari ogni 1.000 Neuron senza blocco, quindi il modo in cui le cose si rompono diventa una fattura invece di un disservizio. Alcuni modelli frontier della piattaforma richiedono comunque un metodo di pagamento attivo o crediti AI Gateway prepagati per rispondere. Scegli quale dei due guasti preferisci prima del lancio e imposta un tetto di spesa coerente.
Studio
Inizia un progetto.
Scriviamo riguardo a ciò che costruiamo. Raccontaci cosa vuoi costruire tu.