Quanto costa scrivere Pong? Un benchmark reale su 5 LLM e 3 harness

Quanto costa scrivere Pong? Un benchmark reale su 5 LLM e 3 harness

Abbiamo usato AIDeskPro come gateway per misurare costi e tempi di 15 combinazioni LLM/harness su un task di coding concreto: creare il gioco del Pong in un unico file HTML. I risultati sono sorprendenti.

Quanto costa davvero usare un LLM per scrivere codice? Non in termini astratti - token per milione, prezzi di listino - ma su un task concreto, misurabile, con un risultato verificabile.

Abbiamo provato a rispondere. Usando AIDeskPro come gateway, abbiamo tracciato costi e tempi di esecuzione per un prompt identico su 5 modelli e 3 harness diversi. Il task: creare il gioco del Pong in un unico file HTML.

Il prompt

Crea un gioco Pong completo e giocabile in un unico file HTML chiamato esattamente pong.html, salvato nella directory corrente. Requisiti: canvas HTML5; JavaScript vanilla senza dipendenze esterne; due racchette; una palla che rimbalza sulle pareti e sulle racchette; punteggio a schermo per entrambi i giocatori; racchetta sinistra controllata da tastiera (frecce su/giù oppure W/S) e racchetta destra con una semplice IA. Scrivi davvero il file su disco come pong.html. Quando hai finito, rispondi con una sola parola: FATTO.

Un task reale, non un benchmark sintetico. Il modello deve ragionare, scrivere codice funzionante e salvare il file su disco. Niente trucchi.

Gli harness

Abbiamo testato tre strumenti CLI per agenti di coding:

HarnessVersione
Codex0.144.4
ClaudeCode2.1.217
Opencode1.18.4

I risultati

Ogni cella è cliccabile: puoi giocare direttamente al Pong prodotto da quella combinazione modello/harness.

Cosa emerge

GPT-5.6 Terra con codex è la combinazione più veloce: 12,8 secondi, 5,77 centesimi. Difficile battere quel risultato su un task di coding standard.

GLM-5.2 con codex o opencode è il migliore per rapporto qualità/prezzo: 4,59-4,61 centesimi, tempo ragionevole, output di qualità. GLM-5.2 è servito da AIDeskPro tramite Scaleway, con endpoint europeo e zero data retention - il che lo rende anche la scelta più sicura per chi lavora con dati aziendali.

Claude Sonnet 5 mostra una varianza elevata tra harness: con codex costa 20 centesimi, con opencode scende a meno di 8. L’harness conta.

Kimi K3 è il più lento in assoluto: oltre 90 secondi con codex e opencode. Non è un modello pensato per latenza bassa su task semplici.

opencode è l’harness più economico nel totale: 0,340 € contro 0,615 € di Claude Code. Su volumi alti, la differenza è significativa.

Perché AIDeskPro come gateway?

Tracciare i costi reali per token e per chiamata non è banale quando si usano più modelli e più strumenti. AIDeskPro centralizza l’accesso a tutti i principali LLM e registra costi e consumi in tempo reale, per ogni sessione e ogni utente.

Questo benchmark è nato proprio così: un team interno ha usato AIDeskPro per fare un test comparativo e ne è uscita una misurazione pulita, riproducibile, con i numeri veri.

Se vuoi fare lo stesso nella tua azienda - confrontare modelli su task reali, controllare i costi, capire quale combinazione funziona meglio per il tuo workflow - è esattamente quello per cui è fatto AIDeskPro.