Quanto costa davvero usare un LLM per scrivere codice? Non in termini astratti - token per milione, prezzi di listino - ma su un task concreto, misurabile, con un risultato verificabile.
Abbiamo provato a rispondere. Usando AIDeskPro come gateway, abbiamo tracciato costi e tempi di esecuzione per un prompt identico su 5 modelli e 3 harness diversi. Il task: creare il gioco del Pong in un unico file HTML.
Il prompt
Crea un gioco Pong completo e giocabile in un unico file HTML chiamato esattamente pong.html, salvato nella directory corrente. Requisiti: canvas HTML5; JavaScript vanilla senza dipendenze esterne; due racchette; una palla che rimbalza sulle pareti e sulle racchette; punteggio a schermo per entrambi i giocatori; racchetta sinistra controllata da tastiera (frecce su/giù oppure W/S) e racchetta destra con una semplice IA. Scrivi davvero il file su disco come pong.html. Quando hai finito, rispondi con una sola parola: FATTO.
Un task reale, non un benchmark sintetico. Il modello deve ragionare, scrivere codice funzionante e salvare il file su disco. Niente trucchi.
Gli harness
Abbiamo testato tre strumenti CLI per agenti di coding:
| Harness | Versione |
|---|---|
| Codex | 0.144.4 |
| ClaudeCode | 2.1.217 |
| Opencode | 1.18.4 |
I risultati
| Modello | Codex | ClaudeCode | Opencode |
|---|---|---|---|
| GPT-5.6 Terra | 0.0577 € / 12.8 s | 0.0759 € / 9.9 s | 0.0588 € / 20.3 s |
| Claude Sonnet 5 | 0.2050 € / 69.4 s | 0.2569 € / 17.2 s | 0.0796 € / 28.5 s |
| Gemini 3.6 Flash | 0.0887 € / 26.5 s | 0.1122 € / 18.1 s | 0.1020 € / 28.0 s |
| GLM-5.2 | 0.0459 € / 38.3 s | 0.1037 € / 67.4 s | 0.0461 € / 37.2 s |
| Kimi K3 | 0.0749 € / 96.2 s | 0.0664 € / 54.2 s | 0.0538 € / 91.7 s |
| Totale harness | 0.472 € / 243 s | 0.615 € / 167 s | 0.340 € / 206 s |
Ogni cella è cliccabile: puoi giocare direttamente al Pong prodotto da quella combinazione modello/harness.
Cosa emerge
GPT-5.6 Terra con codex è la combinazione più veloce: 12,8 secondi, 5,77 centesimi. Difficile battere quel risultato su un task di coding standard.
GLM-5.2 con codex o opencode è il migliore per rapporto qualità/prezzo: 4,59-4,61 centesimi, tempo ragionevole, output di qualità. GLM-5.2 è servito da AIDeskPro tramite Scaleway, con endpoint europeo e zero data retention - il che lo rende anche la scelta più sicura per chi lavora con dati aziendali.
Claude Sonnet 5 mostra una varianza elevata tra harness: con codex costa 20 centesimi, con opencode scende a meno di 8. L’harness conta.
Kimi K3 è il più lento in assoluto: oltre 90 secondi con codex e opencode. Non è un modello pensato per latenza bassa su task semplici.
opencode è l’harness più economico nel totale: 0,340 € contro 0,615 € di Claude Code. Su volumi alti, la differenza è significativa.
Perché AIDeskPro come gateway?
Tracciare i costi reali per token e per chiamata non è banale quando si usano più modelli e più strumenti. AIDeskPro centralizza l’accesso a tutti i principali LLM e registra costi e consumi in tempo reale, per ogni sessione e ogni utente.
Questo benchmark è nato proprio così: un team interno ha usato AIDeskPro per fare un test comparativo e ne è uscita una misurazione pulita, riproducibile, con i numeri veri.
Se vuoi fare lo stesso nella tua azienda - confrontare modelli su task reali, controllare i costi, capire quale combinazione funziona meglio per il tuo workflow - è esattamente quello per cui è fatto AIDeskPro.

