Ho testato ChatGPT-6 confrontandolo con Claude Opus 5.5 con 5 richieste giornaliere: la differenza è stata enorme.

Scopri il vincitore: un confronto decisivo tra ChatGPT-6 e Claude Opus 5.5 in 5 attività quotidiane. Uno ha nettamente surclassato l'altro, senza alcun margine!

Le cose più importanti che devi sapere

  • Claude eccelle nella comprensione approfondita di reclami complessi, nell'anticipare esigenze non autorizzate (come la contaminazione incrociata nell'organizzazione di feste) e nel fornire soluzioni integrate e intelligenti.
  • Claude ha dimostrato una notevole capacità di riformulare i problemi per concentrarsi sui benefici concreti per le persone e comprendere le motivazioni sottostanti, riflettendo un approccio strategico più profondo.
  • Nonostante la maggiore approfondimento di Claude, l'approccio semplice e graduale di ChatGPT si è rivelato più efficace nel fornire soluzioni pratiche e immediate a situazioni complesse, come l'organizzazione della frenetica vita quotidiana.

Questo mese OpenAI e Anthropic hanno entrambe rilasciato due nuovi modelli di intelligenza artificiale rivoluzionari: ChatGPT-6 e Claude Opus 5.5. Entrambi possiedono capacità talmente vaste da offrire molto più di quanto la maggior parte degli utenti possa chiedere.

La famiglia GPT-6 di OpenAI si basa su GPT-6 Astra, il modello più impressionante dell'azienda fino ad oggi, che ha ottenuto notevoli progressi in aree come l'inferenza, il lavoro professionale, la programmazione, la navigazione e l'utilizzo del computer. Il più recente GPT-6 Sol porta gran parte di questa intelligenza nella versione progettata per il lavoro quotidiano, posizionandosi come un modello di inferenza più veloce ed economico.

Ho testato ChatGPT-6 confrontandolo con Claude Opus 5.5 con 5 richieste giornaliere: la differenza è stata enorme.

Claude Opus 5.5 affronta il problema da un'angolazione leggermente diversa. Anthropic lo descrive come un modello progettato per un lavoro cognitivo a lungo termine basato su agenti, con un ragionamento adattivo che determina la quantità di sforzo richiesta per una richiesta. Presenta una finestra di contesto fino a un milione di token e può produrre fino a 128,000 output di token. Secondo Anthropic, le sue prestazioni sono quasi pari a quelle del modello di punta, Claude Fable 5.1, nella maggior parte delle attività, pur costando il 40% in meno rispetto alla precedente versione di Opus. Anthropic ha anche evidenziato miglioramenti nella naturalezza con cui il modello comunica e segue le istruzioni di scrittura.

Queste differenze sembrano notevoli, ma non ti dicono necessariamente quale chatbot preferiresti per aiutarti nella vita di tutti i giorni. Per confronti più pratici, consulta il nostro articolo: Ho messo a confronto Claude 4 Sonnet e ChatGPT-4o in 7 attività: uno dei due ha nettamente superato l'altro.

Pertanto, ho sottoposto ChatGPT-6 e Claude Opus 5.5 esattamente alle stesse cinque richieste. Il risultato non è stato la schiacciante vittoria che mi aspettavo. Ecco cosa è successo quando li ho sottoposti a richieste della vita quotidiana.

1. Pianificazione complessa e realistica: vincoli + stima

Uno screenshot

Richiesta: Ho 150 dollari per organizzare una festa di compleanno per 10 bambini di età compresa tra gli 8 e gli 11 anni. La festa deve durare tre ore, svolgersi al chiuso in caso di pioggia, includere del cibo e ridurre al minimo il tempo trascorso davanti agli schermi. Due dei bambini sono vegani e uno è allergico alle arachidi. Crea un piano completo, che includa un budget, un programma, le attività e un piano di riserva. Il budget non deve superare i 150 dollari.

ChatGPT ha fornito un quadro concettuale chiaro, conferendo all'evento un'identità e una direzione immediata. Destinare 36 dollari per tre pizze da asporto al formaggio è praticamente più semplice per un genitore che ospita 10 bambini rispetto a preparare delle mini pizze in una normale cucina domestica. Ha inoltre affrontato la necessità di un "fondo di riserva/prezzo di emergenza" alla fine.

Claude si è dimostrato perspicace nell'anticipare problemi di allergie e protocolli alimentari. Ha anche affrontato il problema della contaminazione incrociata tra torte di pasticceria e preparati pronti. Ha dimostrato una notevole capacità di gestione del budget, stanziando 14 dollari per borse di tela e 12 dollari per pennarelli per tessuti, che sono serviti sia come attività creativa all'arrivo che come bomboniere, consentendo di risparmiare denaro e ridurre gli sprechi di plastica. Ha inoltre fornito una tempistica pratica e specifica, nonché soluzioni ai problemi operativi. Questa capacità di fornire un piano completo e intelligente rende Claude la scelta preferita da molti, come spiegato nell'articolo "6 motivi per cui uso Claude invece di ChatGPT ".

Vincitore: Claude vince perché ha fornito all'ospite un piano completo e ben strutturato, dimostrando una sincera attenzione alla sicurezza, mentre ChatGPT ha fornito una lista della spesa frammentaria.

2. Scrittura: far sì che l'IA sembri umana

Uno screenshot

La richiesta: riscrivi questa noiosa pubblicità in qualcosa che una persona reale vorrebbe leggere. Mantieni tutti i dettagli fattuali, non usare trattini lunghi, evita i cliché e non usare parole come "emozionante", "rivoluzionario", "rivoluzionario" o "senza intoppi".

“La nostra azienda sta introducendo una nuova funzionalità di calendario basata sull'intelligenza artificiale che identifica automaticamente i conflitti di programmazione, suggerisce gli orari delle riunioni e crea riepiloghi post-incontro. La funzionalità sarà disponibile a partire dal 15 ottobre e non comporterà costi aggiuntivi per tutti i clienti.”

ChatGPT ha fornito una frase di apertura avvincente che ha catturato l'attenzione del lettore, evitando le tipiche tecniche di intelligenza artificiale e preservando dettagli realistici. Le interruzioni di paragrafo hanno reso il testo facile da leggere rapidamente.

Claude ha riformulato i punti chiave in benefici concreti per le persone e ha riorganizzato i dettagli per concentrarsi sulla reale riduzione dei carichi di lavoro.

Vincitore: Claude vince perché ha riconosciuto che la parafrasi "umana" richiede di ripensare il modo in cui vengono spiegate le caratteristiche, piuttosto che limitarsi a cambiare alcuni verbi nel testo originale. Questo si allinea con l'affermazione che fa davvero la differenza quando si usa Claude quotidianamente.

3. Ragionamento — La risposta non è chiara

Uno screenshot

Il problema: una famiglia deve scegliere tra due case vacanza. La prima costa 1,850 dollari e si trova a 10 minuti a piedi dalla spiaggia. La seconda costa 1,500 dollari ma richiede 25 minuti di auto per raggiungere la spiaggia, più 35 dollari al giorno per il parcheggio. La famiglia soggiornerà per sette giorni e prevede di andare in spiaggia due volte al giorno. Hanno tre figli. Quale opzione dovrebbero scegliere? Non limitatevi a calcolare il costo. Individuate i fattori che potrebbero influenzare la vostra raccomandazione e indicate quali informazioni aggiuntive sono più importanti.

ChatGPT ha offerto il miglior controargomento in merito all'età dei bambini. Ha inoltre giustamente sottolineato che una "passeggiata di 10 minuti" varia considerevolmente a seconda delle infrastrutture circostanti (si tratta di una passerella di legno, di un'autostrada a quattro corsie o di una duna di sabbia?). Il chatbot ha specificamente notato che la prima abitazione permette ai genitori di dividersi i compiti (ad esempio, un genitore può portare a casa il bambino stanco mentre l'altro rimane in spiaggia con gli altri due).

Claude ha calcolato con precisione la distanza, dimostrando che il risparmio derivante da una seconda casa si aggira sui soli 55-65 dollari a settimana. Ha inoltre fatto un'osservazione psicologica perspicace: caricare e scaricare tre bambini nei seggiolini auto quattro volte al giorno significa che la famiglia probabilmente rinuncerà del tutto alla seconda gita giornaliera in spiaggia. Ha anche correttamente evidenziato il "segreto inconfessabile" delle piattaforme di affitto per le vacanze: i prezzi base non includono le spese di pulizia, le spese di servizio o le tasse di soggiorno, che da sole possono comportare una differenza di 105 dollari.

Vincitore: Claude ha vinto per un margine ristretto. Sebbene ChatGPT abbia sollevato l'obiezione migliore a livello individuale (rendendosi conto che camminare con attrezzatura da spiaggia pesante e bambini piccoli può essere più faticoso che guidare), Claude ha vinto nel complesso perché la sua analisi finanziaria è stata così approfondita e precisa, ha previsto i costi nascosti e la sua osservazione che il pendolarismo avrebbe costretto la famiglia ad annullare le gite programmate è stata assolutamente azzeccata. Scopri 6 motivi per cui sceglierei Claude invece di ChatGPT.

4. Molteplici opzioni: come facciamo a stabilire cosa è più importante?

Uno screenshot

L'affermazione: Una città ha un budget di 10 milioni di dollari da spendere e si trova di fronte a tre opzioni:

a) Costruzione di una nuova biblioteca pubblica che si prevede accoglierà 200,000 visitatori all'anno per almeno 30 anni.
b) Concedere a ciascuna famiglia un pagamento una tantum di 500 dollari.
c) Ammodernare le infrastrutture idriche obsolete, un intervento di cui i residenti si accorgeranno solo in caso di problemi.

La città può scegliere solo un'opzione. Seleziona l'opzione che ritieni migliore. Spiega il tuo ragionamento, individua l'argomento più forte contro la tua scelta e spiega quali informazioni aggiuntive potrebbero farti cambiare idea. Non eludere il problema affermando che tutte le opzioni sono valide.

ChatGPT ha seguito scrupolosamente tutte le istruzioni e ha fornito una difesa dell'opzione C di facile lettura. Ha inoltre definito chiaramente la soglia per la valutazione ingegneristica.

Claude ha inquadrato la sua scelta in termini di incentivi comunali e si è reso conto che finanziare ciò che la politica elettorale ignora è la funzione primaria dell'amministrazione cittadina.

Vincitore: Claude vince perché ha fornito una risposta di gran lunga migliore. Il bot sembrava avere competenze specifiche nella gestione delle finanze pubbliche, mentre la risposta di ChatGPT è apparsa più schematica e superficiale.

5. La prova decisiva: una richiesta vaga + iniziativa

Uno screenshot

La mia richiesta: Sento che la mia vita è disorganizzata. Ho tre figli, un lavoro a tempo pieno, responsabilità domestiche e circa 30 minuti ogni sera per mettere tutto sotto controllo. Create un sistema che io possa realisticamente mantenere. Non datemi consigli generici sulla produttività. Fate delle ipotesi ragionevoli, spiegatemi quali sono le vostre ipotesi e datemi qualcosa che posso iniziare a mettere in pratica già da stasera.

ChatGPT ha fornito semplici metodi per prevenire il burnout, incluse istruzioni suddivise in passaggi in modo che l'utente non debba pianificare o cercare di indovinare da dove iniziare.

Claude ha affrontato il problema del carico mentale, offrendo una comprensione acuta e perspicace della causa principale del caos. Ha inoltre offerto il consiglio utile di delegare i compiti domestici fattibili, riconoscendo che un solo genitore non può essere l'unica forza motrice in una famiglia di cinque persone.

Vincitore: ChatGPT trionfa perché il suo quadro cognitivo protegge meglio lo spazio mentale del genitore esausto. Claude offriva una buona routine per l'organizzazione domestica, mentre ChatGPT forniva un filtro decisionale che impedisce che lavoro, famiglia e vita si distruggano a vicenda.

Vincitore assoluto: Claude

Dopo cinque test, Claude Opus 5.5 ha ottenuto risultati migliori in quattro di essi. Ma ciò che mi ha sorpreso è stata la costanza con cui la differenza tra questi modelli è rimasta invariata anche in compiti completamente diversi. Claude tende ad andare più a fondo.

Quando gli ho chiesto di organizzare una festa di compleanno, ha considerato l'inquinamento incrociato e ha trovato il modo di organizzarne una che assolvesse a una doppia funzione. Quando ho sollevato la questione degli affitti per le vacanze, ha calcolato i costi che non avevo esplicitamente menzionato e ha valutato se l'inconveniente di dover guidare avrebbe effettivamente modificato il comportamento della famiglia. Persino nel decidere come spendere i 10 milioni di dollari destinati a una città, ha guardato oltre i pro e i contro più ovvi, per chiedersi perché i governi prendano queste decisioni.

È stato proprio a questo punto che Claude Opus 5.5 ha dimostrato la sua maggiore forza. Al contrario, ChatGPT-6 si è rivelato generalmente più snello, il che è perfettamente in linea con la natura consolidata di ChatGPT. ChatGPT, indipendentemente dal modello, tende a fornire risposte più concise e meno prolisse, andando dritto al punto più rapidamente. Tuttavia, questo significa anche che le sue risposte non erano sempre così approfondite come quelle di Claude, motivo per cui alcuni utenti preferiscono Claude per determinate attività. Scopri i validi motivi per cui potresti scegliere Claude al posto di ChatGPT-5 . Ciononostante, questo approccio (lo stile diretto di ChatGPT) si è rivelato un vantaggio nei miei recenti test.



I commenti sono chiusi.