Introduzione
Quando due modelli di intelligenza artificiale sono entrambi eccellenti, la vera differenza emerge solo di fronte a quesiti complessi che richiedono giudizio, contesto e capacità di andare oltre la mera risposta letterale. Per mettere alla prova GPT‑6 e Claude Opus 5.5 sono stati ideati cinque prompt identici, progettati per valutare la capacità di pianificazione, creatività, analisi finanziaria, ragionamento di politica pubblica e gestione della vita quotidiana.
Quadro complessivo dei risultati
Claude Opus 5.5 ha prevalso in quattro dei cinque test, dimostrando una tendenza a scavare più a fondo nei dettagli e a considerare fattori non richiesti esplicitamente. GPT‑6, al contrario, ha fornito risposte più rapide e sintetiche, risultando più efficace quando la semplicità era la priorità principale. Di seguito viene analizzato ciascun test, con focus sui prompt, le soluzioni proposte e il vincitore.
Primo test: pianificare una festa con vincoli reali
Prompt
Ho centocinquanta euro per organizzare una festa di compleanno per dieci bambini tra gli otto e gli undici anni. Deve durare tre ore, funzionare al coperto se piove, includere il cibo e ridurre al minimo il tempo davanti agli schermi. Due bambini sono vegetariani e uno ha un’allergia alle arachidi. Crea il piano completo con budget, programma, attività e piano alternativo. Non superare l’importo indicato.
Risultati
GPT‑6 ha prodotto un piano strutturato con un budget basato su pizze consegnate a domicilio, attività semplici e un margine di emergenza. La soluzione è pratica, ma resta a livello di elenco, senza approfondire la gestione delle allergie.
Claude Opus 5.5 ha introdotto protocolli per le allergie, segnalando il rischio di contaminazione incrociata nelle torte preconfezionate. Ha inoltre trasformato le borse di tela da decorare in attività di arrivo e regalo, eliminando la spesa per i gadget di plastica. Il risultato è un piano pronto all’uso, con attenzione reale alla sicurezza alimentare.
Vincitore
Claude Opus 5.5, per la completezza e l’attenzione ai dettagli di sicurezza.
Secondo test: rendere umano un testo aziendale
Prompt
Riscrivi questo annuncio noioso in modo che sembri qualcosa che una persona vorrebbe davvero leggere. Mantieni ogni dettaglio fattuale, non usare trattini lunghi, evita i luoghi comuni e non usare le parole ‘entusiasmante’, ‘rivoluzionario’, ‘che cambia le regole del gioco’ o ‘senza soluzione di continuità’.
Risultati
GPT‑6 ha aperto con una battuta efficace e ha ristrutturato il testo in paragrafi brevi e scorrevoli, ma si è limitato a spostare verbi senza cambiare il punto di vista.
Claude Opus 5.5 ha riformulato i dettagli tecnici attorno ai benefici concreti, enfatizzando il problema quotidiano che la soluzione risolve, piuttosto che descrivere semplicemente le funzioni del prodotto.
Vincitore
Claude Opus 5.5, per aver compreso che la “umanità” di un testo sta nella capacità di spiegare il valore reale per il lettore.
Terzo test: una decisione con variabili nascoste
Prompt
Una famiglia deve scegliere tra due case vacanza. La casa A costa mille ottocentocinquanta euro ed è a dieci minuti a piedi dalla spiaggia. La casa B costa millecinquecento euro, ma richiede venticinque minuti di macchina e trentacinque euro al giorno di parcheggio. Restano sette giorni e prevedono di andare in spiaggia due volte al giorno. Hanno tre bambini. Quale dovrebbero scegliere? Non limitarti a calcolare il costo. Identifica i fattori che potrebbero cambiare la raccomandazione e dimmi quali informazioni aggiuntive sarebbero più importanti.
Risultati
GPT‑6 ha evidenziato l’età dei bambini e le possibili difficoltà del percorso a piedi, sottolineando il valore di poter dividere i genitori durante le attività.
Claude Opus 5.5 ha effettuato un calcolo preciso dei costi di benzina, parcheggio e spesa, mostrando che il risparmio reale della casa B è di appena cinquanta‑sessantacinque euro per l’intera settimana. Ha inoltre osservato che il carico di caricare e scaricare tre bambini più volte al giorno potrebbe portare la famiglia a rinunciare a una visita giornaliera in spiaggia.
Vincitore
Claude Opus 5.5, per il calcolo finanziario dettagliato e l’analisi comportamentale.
Quarto test: una decisione di politica pubblica
Prompt
Una città ha dieci milioni di euro da spendere e tre opzioni: A) una nuova biblioteca pubblica con duecentomila visite annue previste per trent’anni; B) un pagamento una tantum di cinquecento euro a ogni famiglia; C) ammodernare le infrastrutture idriche che i residenti non noteranno a meno che qualcosa non vada storto. Scegli l’opzione che ritieni migliore. Spiega il ragionamento, identifica l’argomento più forte contro la tua scelta e indica quale informazione aggiuntiva avrebbe più probabilità di farti cambiare idea.
Risultati
GPT‑6 ha scelto l’opzione C, offrendo una difesa chiara ma generica, focalizzata sui benefici a lungo termine dell’infrastruttura idrica.
Claude Opus 5.5 ha scelto anch’esso l’opzione C, ma ha inserito una valutazione degli incentivi politici, sottolineando che finanziare ciò che la politica elettorale ignora è la funzione fondamentale dell’amministrazione municipale. Ha inoltre indicato che dati di consumo idrico e rischi di emergenza sarebbero informazioni decisive per una revisione della scelta.
Vincitore
Claude Opus 5.5, per la profondità di analisi della finanza pubblica e delle dinamiche politiche.
Quinto test: organizzare una vita caotica
Prompt
La mia vita è disorganizzata. Ho tre figli, un lavoro a tempo pieno, responsabilità domestiche e circa trenta minuti ogni sera per mettere ordine. Costruiscimi un sistema che possa realisticamente mantenere. Niente consigli generici sulla produttività. Fai le ipotesi ragionevoli necessarie, dimmi cosa stai ipotizzando e dammi qualcosa che possa iniziare stasera.
Risultati
Claude Opus 5.5 ha analizzato il carico mentale, ha suggerito di delegare compiti dove possibile