Introduzione

Quando due modelli di intelligenza artificiale sono entrambi eccellenti, la vera differenza emerge solo di fronte a quesiti complessi che richiedono giudizio, contesto e capacità di andare oltre la mera risposta letterale. Per mettere alla prova GPT‑6 e Claude Opus 5.5 sono stati ideati cinque prompt identici, progettati per valutare la capacità di pianificazione, creatività, analisi finanziaria, ragionamento di politica pubblica e gestione della vita quotidiana.

Quadro complessivo dei risultati

Claude Opus 5.5 ha prevalso in quattro dei cinque test, dimostrando una tendenza a scavare più a fondo nei dettagli e a considerare fattori non richiesti esplicitamente. GPT‑6, al contrario, ha fornito risposte più rapide e sintetiche, risultando più efficace quando la semplicità era la priorità principale. Di seguito viene analizzato ciascun test, con focus sui prompt, le soluzioni proposte e il vincitore.

Primo test: pianificare una festa con vincoli reali

Prompt

Ho centocinquanta euro per organizzare una festa di compleanno per dieci bambini tra gli otto e gli undici anni. Deve durare tre ore, funzionare al coperto se piove, includere il cibo e ridurre al minimo il tempo davanti agli schermi. Due bambini sono vegetariani e uno ha un’allergia alle arachidi. Crea il piano completo con budget, programma, attività e piano alternativo. Non superare l’importo indicato.

Risultati

GPT‑6 ha prodotto un piano strutturato con un budget basato su pizze consegnate a domicilio, attività semplici e un margine di emergenza. La soluzione è pratica, ma resta a livello di elenco, senza approfondire la gestione delle allergie.

Claude Opus 5.5 ha introdotto protocolli per le allergie, segnalando il rischio di contaminazione incrociata nelle torte preconfezionate. Ha inoltre trasformato le borse di tela da decorare in attività di arrivo e regalo, eliminando la spesa per i gadget di plastica. Il risultato è un piano pronto all’uso, con attenzione reale alla sicurezza alimentare.

Vincitore

Claude Opus 5.5, per la completezza e l’attenzione ai dettagli di sicurezza.

Secondo test: rendere umano un testo aziendale

Prompt

Riscrivi questo annuncio noioso in modo che sembri qualcosa che una persona vorrebbe davvero leggere. Mantieni ogni dettaglio fattuale, non usare trattini lunghi, evita i luoghi comuni e non usare le parole ‘entusiasmante’, ‘rivoluzionario’, ‘che cambia le regole del gioco’ o ‘senza soluzione di continuità’.

Risultati

GPT‑6 ha aperto con una battuta efficace e ha ristrutturato il testo in paragrafi brevi e scorrevoli, ma si è limitato a spostare verbi senza cambiare il punto di vista.

Claude Opus 5.5 ha riformulato i dettagli tecnici attorno ai benefici concreti, enfatizzando il problema quotidiano che la soluzione risolve, piuttosto che descrivere semplicemente le funzioni del prodotto.

Vincitore

Claude Opus 5.5, per aver compreso che la “umanità” di un testo sta nella capacità di spiegare il valore reale per il lettore.

Terzo test: una decisione con variabili nascoste

Prompt

Una famiglia deve scegliere tra due case vacanza. La casa A costa mille ottocentocinquanta euro ed è a dieci minuti a piedi dalla spiaggia. La casa B costa millecinquecento euro, ma richiede venticinque minuti di macchina e trentacinque euro al giorno di parcheggio. Restano sette giorni e prevedono di andare in spiaggia due volte al giorno. Hanno tre bambini. Quale dovrebbero scegliere? Non limitarti a calcolare il costo. Identifica i fattori che potrebbero cambiare la raccomandazione e dimmi quali informazioni aggiuntive sarebbero più importanti.

Risultati

GPT‑6 ha evidenziato l’età dei bambini e le possibili difficoltà del percorso a piedi, sottolineando il valore di poter dividere i genitori durante le attività.

Claude Opus 5.5 ha effettuato un calcolo preciso dei costi di benzina, parcheggio e spesa, mostrando che il risparmio reale della casa B è di appena cinquanta‑sessantacinque euro per l’intera settimana. Ha inoltre osservato che il carico di caricare e scaricare tre bambini più volte al giorno potrebbe portare la famiglia a rinunciare a una visita giornaliera in spiaggia.

Vincitore

Claude Opus 5.5, per il calcolo finanziario dettagliato e l’analisi comportamentale.

Quarto test: una decisione di politica pubblica

Prompt

Una città ha dieci milioni di euro da spendere e tre opzioni: A) una nuova biblioteca pubblica con duecentomila visite annue previste per trent’anni; B) un pagamento una tantum di cinquecento euro a ogni famiglia; C) ammodernare le infrastrutture idriche che i residenti non noteranno a meno che qualcosa non vada storto. Scegli l’opzione che ritieni migliore. Spiega il ragionamento, identifica l’argomento più forte contro la tua scelta e indica quale informazione aggiuntiva avrebbe più probabilità di farti cambiare idea.

Risultati

GPT‑6 ha scelto l’opzione C, offrendo una difesa chiara ma generica, focalizzata sui benefici a lungo termine dell’infrastruttura idrica.

Claude Opus 5.5 ha scelto anch’esso l’opzione C, ma ha inserito una valutazione degli incentivi politici, sottolineando che finanziare ciò che la politica elettorale ignora è la funzione fondamentale dell’amministrazione municipale. Ha inoltre indicato che dati di consumo idrico e rischi di emergenza sarebbero informazioni decisive per una revisione della scelta.

Vincitore

Claude Opus 5.5, per la profondità di analisi della finanza pubblica e delle dinamiche politiche.

Quinto test: organizzare una vita caotica

Prompt

La mia vita è disorganizzata. Ho tre figli, un lavoro a tempo pieno, responsabilità domestiche e circa trenta minuti ogni sera per mettere ordine. Costruiscimi un sistema che possa realisticamente mantenere. Niente consigli generici sulla produttività. Fai le ipotesi ragionevoli necessarie, dimmi cosa stai ipotizzando e dammi qualcosa che possa iniziare stasera.

Risultati

Claude Opus 5.5 ha analizzato il carico mentale, ha suggerito di delegare compiti dove possibile