OpenAI ha appena presentato GPT‑6 Sol e Luna, due versioni più economiche della sua linea di modelli linguistici. Secondo l’azienda, il prezzo è stato dimezzato rispetto a GPT‑5.6 Sol e Luna grazie a ottimizzazioni di caching e inference, ma i risultati sui benchmark mostrano solo variazioni minime rispetto alle versioni precedenti.
Taglio dei prezzi e nuova struttura tariffaria
Il cambiamento più evidente è la riduzione del 50 % dei costi per token. GPT‑6 Sol costa ora 2 $ per milione di token in ingresso e 10 $ per milione di token in uscita, mentre Luna è disponibile a 0,10 $ per ingresso e 0,50 $ per uscita. In confronto, i prezzi di GPT‑5.6 Sol erano 4 $ (ingresso) e 20 $ (uscita), e quelli di GPT‑5.6 Luna 0,20 $ e 1,20 $ rispettivamente.
- GPT‑6 Sol: ingresso $2 / M, uscita $10 / M (vs. $4 / M ingresso, $20 / M uscita)
- GPT‑6 Luna: ingresso $0,10 / M, uscita $0,50 / M (vs. $0,20 / M ingresso, $1,20 / M uscita)
Con questi prezzi, OpenAI si colloca nella stessa fascia dei modelli open‑weight più economici. Il modello Terra, in precedenza il più economico del catalogo, non è più disponibile.
Destinazione d’uso di Sol e Luna
OpenAI descrive Sol come adatto a compiti ricorrenti e complessi, tra cui lo sviluppo di nuove funzionalità, la revisione del codice, il debugging e l’analisi dei dati. Luna, invece, è pensato per gestire grandi volumi di compiti ben definiti a basso costo, come la sintesi di documenti, l’estrazione di informazioni e le risposte a domande brevi.
Miglioramenti tecnici: caching e dashboard
Insieme alla riduzione dei prezzi, OpenAI ha introdotto un nuovo sistema di prompt caching per GPT‑6, offrendo uno sconto del 90 % sui token di input memorizzati nella cache. Gli sviluppatori possono ora monitorare l’uso della cache tramite un cruscotto dedicato e uno strumento di diagnostica, e modificare il livello di ragionamento o la disponibilità degli strumenti senza invalidare la cache.
Disponibilità dei modelli
Al lancio, i due modelli sono accessibili tramite ChatGPT Work e Codex per gli abbonati Plus, Pro, Business, Enterprise ed Edu. Gli utenti dei piani Free e Go possono utilizzare Luna tramite l’app desktop, ma né Sol né Luna sono disponibili nella chat standard. Per l’API, i nomi dei modelli sono gpt-6-sol e gpt-6-luna, con un rollout graduale anche in ChatGPT.
Benchmark di prezzo‑prestazione contro Anthropic
OpenAI posiziona i nuovi modelli principalmente in termini di rapporto prezzo‑prestazione rispetto alla suite Claude di Anthropic. Su OSWorld 2.0, che valuta l’uso del computer, GPT‑6 risulta comparabile a Claude Opus 5 con un costo circa 80 % inferiore, sebbene il modello Astra rimanga il più competitivo in questa categoria.
Nel benchmark AutomationBench, che testa flussi di lavoro aziendali su 47 strumenti, GPT‑6 Sol al livello di sforzo più alto supera Claude Opus 5, con un costo per compito pari al 9 % di quello di Opus. Luna, d’altro canto, migliora il punteggio di 5,4 punti percentuali rispetto al suo predecessore, riducendo il costo del 58 %.
Risultati sui test di codifica
OpenAI fornisce dati su due benchmark di coding. FrontierCode 1.1 verifica se gli agenti AI producono codice integrabile in un progetto esistente, valutando qualità dei test, stile del codice e conformità ai requisiti. GPT‑6 Sol ottiene il 49,3 % al massimo sforzo, con un costo di 2,14 $ per compito, posizionandosi quasi al pari di Claude Fable 5.1 (50,3 % ma 12,83 $ per compito). Claude Opus 5 raggiunge il 53,4 % a 4,31 $ per compito al livello medio, il suo risultato migliore sul test.
DeepSWE v1.1: ingegneria del software avanzata
Su DeepSWE v1.1, un benchmark per compiti complessi di ingegneria del software su codebase reali, GPT‑6 Sol registra il 68,8 % al massimo sforzo, a 1,00 $ per compito al livello “xhigh”. Questo è a soli 1,1 punti percentuali dal migliore punteggio di Claude Fable 5 (69,9 % a “xhigh”). Claude Opus 5 supera entrambi con il 73,7 % a 11,84 $ per compito, mentre GPT‑5.6 Sol ottiene il 72,7 % a 6,46 $.
Luna, pur essendo più economica, raggiunge lo stesso 66,6 % al massimo sforzo con un costo di 0,22 $ per compito, pari alla performance di Sol a “xhigh”. OpenAI afferma che Luna è comparabile a Claude Opus 5 e Claude Fable 5 a sforzo medio, ma costa rispettivamente il 93 % e il 96 % in meno.
Scelta tra Sol e Luna: una decisione complessa
Le differenze di prezzo e di performance rendono la scelta tra i due modelli poco intuitiva. Luna, più economica, eguaglia Sol a “xhigh” con un risparmio del 78 %, mentre Sol al massimo sforzo supera Luna di soli 2,2 punti percentuali. Gli sviluppatori devono valutare se il leggero vantaggio di Sol giustifica il costo aggiuntivo o se optare per la soluzione più economica di Luna.
Critiche alla selezione dei benchmark
OpenAI sembra aver scelto benchmark favorevoli, escludendo metriche come GDPval per il lavoro intellettuale o Terminal‑Bench 4.0 per la codifica agentica, tradizionalmente presenti nelle valutazioni. Inoltre, l’azienda non ha incluso il lancio di Opus 5.5, che potrebbe essere fino al 40 % più economico di Opus 5 con prestazioni migliori