Valutazione del pubblico: 27 modelli di intelligenza artificiale, ChatGPT all'8° posto: ecco i modelli che lo hanno superato

Sebbene il mondo dell'intelligenza artificiale (IA) possa spesso apparire un ambito turbolento, dietro le quinte si svolgono un'incredibile quantità di analisi, misurazioni delle prestazioni e test. Queste attività non sono svolte solo dalle aziende stesse, ma anche da gruppi creati appositamente per stilare le proprie classifiche.

Intelligenza artificiale (IA) e un cervello luminoso accanto allo schermo di uno smartphone

Questi gruppi testano tutto, dalla capacità di un chatbot di completare test di matematica,
Crea immagini, o fornire spiegazioni logiche, o addirittura dare consigli medici, o semplicemente dimostrare quanto sia emotivamente intelligente.

Durante questi diversi test, i modelli rivelano i loro punti di forza e di debolezza in diverse aree. Ad esempio, mentre GPT-5 eccelle nella deduzione scientifica, è in ritardo rispetto a modelli come Gemini e Claude nella sua capacità di adattarsi a nuovi concetti.

Ognuno di questi test ci dice qualcosa di nuovo sui modelli di intelligenza artificiale e sono importanti per ricordarci quali strumenti sono più adatti a diversi scenari. Ma spesso manca un parametro: quali modelli di intelligenza artificiale offrono la migliore esperienza utente?

Sistema di classificazione umana

Una classifica dei cinque migliori chatbot AI

Un'azienda tecnologica con sede nel Regno Unito, chiamata Prolific, ha creato una classifica basata sull'intelligenza artificiale denominata Humaine . Invece di testare la capacità dell'IA di completare compiti, Prolific ha testato diverse esperienze utente con questi modelli.

Valutando le esperienze di 21,352 persone con gli strumenti, non solo sono riusciti a trovare un vincitore assoluto, ma sono anche riusciti a suddividere i risultati in base a età, posizione geografica (i test sono stati effettuati sia nel Regno Unito che negli Stati Uniti) e convinzioni politiche.

Ciò include annunci individuali per:

  • Regno Unito: fasce d'età
  • Regno Unito: razza
  • Regno Unito: punto di vista politico
  • Stati Uniti: fasce d'età
  • Stati Uniti: razza
  • Stati Uniti: punto di vista politico

Il team ha chiesto a ciascun partecipante di interagire con due modelli di intelligenza artificiale distinti per un confronto e di fornire un feedback su quale modello avesse ottenuto i risultati migliori in ciascuna interazione.

Il risultato è stato un vincitore assoluto e una classifica per le prestazioni, ma anche classifiche separate per le prestazioni e il ragionamento nelle attività di base, nonché un vincitore per la comunicazione, la resilienza, la fiducia e l'etica.

Cosa mostrano i risultati?

Loghi ChatGPT e Gemini

Dopo un'attenta analisi, è emerso un chiaro vincitore, non solo nella categoria delle prestazioni generali, ma anche nella maggior parte delle sottocategorie. Il Gemini 2.5-Pro ​​ha eccelso in quasi tutti i benchmark esaminati.

I giovani adulti di età compresa tra i 18 e i 34 anni nel Regno Unito, gli elettori democratici e gli over 55 negli Stati Uniti hanno concordato sul fatto che Gemini 2.5 Pro fosse il miglior modello in assoluto. L'unico ambito in cui tutti i gruppi demografici lo hanno classificato al di sopra di Gemini è stato quello della fiducia, dell'etica e della sicurezza, dove Grok-3 ha ottenuto un punteggio superiore: un risultato alquanto ironico, visti alcuni dei problemi di sicurezza ed etica che il modello di intelligenza artificiale ha recentemente dovuto affrontare.

È interessante notare che i tre modelli emersi dopo Gemini sono Deepseek, Magistral Le Chat e Grok . Mentre Deepseek ha goduto di una notevole popolarità all'inizio di quest'anno, di recente è uscito dai riflettori. Le Chat, d'altro canto, è un chatbot meno conosciuto ma vanta un seguito fedele.

Dove si colloca dunque il rinomato ChatGPT in tutto questo? Si trova in fondo alla classifica, all'ottavo posto con il suo modello di punta GPT-4.1. Ancora peggio è Claude , le cui due versioni (4.0 e 4.0) si sono classificate rispettivamente all'undicesimo e al dodicesimo posto.

Quindi, cosa significa tutto questo?

Questo significa che Gemini è il miglior chatbot basato sull'intelligenza artificiale al mondo? Significa che dovresti abbandonare ChatGPT...? Beh, non esattamente.

Questi risultati non riflettono necessariamente le prestazioni di questi modelli. Quando testati sulla maggior parte delle altre metriche, le opzioni che solitamente vediamo in cima sono ChatGPT, Gemini, Claude e Grok.

Tuttavia, si tratta di un'aggiunta importante a questi test. Ci aiuta a comprendere meglio l'intelligenza artificiale dal punto di vista dell'esperienza umana. Ad esempio, Le Chat non ottiene punteggi elevati nei benchmark standard, ma viene spesso citato come un'ottima scelta in termini di esperienza e affidabilità.

Sebbene le prestazioni di Anthropic e OpenAI non abbiano raggiunto questo livello in questa tornata di test, si è trattato di un'altra prestazione eccellente sia per Gemini che per Grok. Entrambe le aziende ottengono spesso punteggi elevati nei benchmark standard, e hanno continuato a farlo anche in questo caso.

I commenti sono chiusi.