Leaderboard: comparazione tra modelli

Nella nostra leaderboard, mappiamo i principali modelli di linguaggio sviluppati e rilasciati dalle aziende di punta operanti nel settore dell’intelligenza artificiale. 

La tabella raccoglie i risultati di diverse valutazioni operate attraverso una serie di benchmark in grado di rappresentare in modo comprensivo le funzionalità e i livelli di efficienza dei large language model in esame, dalle abilità matematiche al ‘ragionamento’, fino alla capacità di elaborazione del testo. A ogni modello riportato nella leaderboard è dedicata una pagina di approfondimento. 

La mappatura include modelli gratuiti e a pagamento ed è aggiornata nel tempo, in modo da seguire l’evoluzione e i trend del settore. 

Modello Average*
Punteggio medio delle prestazioni complessive
MMLU (General)
Comprensione multi-task su vari argomenti
GPQA (Reasoning)
Capacità di ragionamento e deduzione
HumanEval (Coding)
Competenze nella programmazione
Math
Risoluzione di problemi matematici
BFCL (Tool Use)
Uso efficace di strumenti esterni
MGSM (Multilingual)
Comprensione e generazione multilingue
Claude 4.5 Sonnet 82.7% 85% 83.4% 72% 82% 68.7% 87%
DeepSeek R1 80.15% 90.8% 71.5% 71.4% 97.3% 57.5% 88.8%
DeepSeek V3 81.35% 88.5% 64.8% 74.2% 94% 58.6% 89.2%
Gemini 2.5 Pro 87.7% 89% 86.4% 76.9% 96.7% 53.99% 92.8%
GPT 5 89.9% 92.5% 87.3% 93.4% 84.7% 61.6% 94%
GPT-4o 80.5% 88.7% 53.6% 90.2% 76.6% 83.5% 90.5%
GPT-4o Mini 81.5% 82% 40.2% 87.2% 70.2% 81% 87%
Grok 4 84.9% 87% 88.4% 82.7% 88% 62.8% 82.8%
Llama-3.3 70b 77.3% 86% 50.5% 88.4% 77% 77.3% 91.1%
Mistral 3 - 85.5% 71.2% - 90.4% - -
OpenAI o1 79% 91.8% 75.7% 92.4% 96.4% 80.6% 89.3%

* Per alcuni modelli non è presente il dato Average in quanto non sono disponibili i valori di alcuni parametri.

Ultimo aggiornamento: Dicembre 2025

Ultime news


Sam Altman ammette: GPT-4 non ha cambiato l’economia come previsto

Il CEO di OpenAI ha riconosciuto in un'intervista di aver…

Sam Altman ammette: GPT-4 non ha cambiato l’economia come previsto
Nvidia acquisisce Hugging Face per 12,9 miliardi di dollari

Nvidia ha raggiunto un accordo per acquistare Hugging Face, il…

Nvidia acquisisce Hugging Face per 12,9 miliardi di dollari
World Labs presenta Atlas, il nuovo “world model” per creare e simulare ambienti 3D

L'obiettivo di Atlas è sviluppare un sistema capace di generare,…

World Labs presenta Atlas, il nuovo “world model” per creare e simulare ambienti 3D
Anthropic ha emanato linee guida per implementare agenti AI commerciali in vista del periodo natalizio

Questi strumenti sono pensati per guidare la creazione di agenti…

Anthropic ha emanato linee guida per implementare agenti AI commerciali in vista del periodo natalizio

In Evidenza


New York contro i data center (e altre notizie generative) | Weekly AI

Weekly AI è la newsletter settimanale di AI news sulle…

New York contro i data center (e altre notizie generative) | Weekly AI
Più del 50% dei giovani europei usa l’AI per cercare supporto emotivo

Lo riferisce un sondaggio Ipsos BVA condotto su 3.800 ragazzi…

Più del 50% dei giovani europei usa l’AI per cercare supporto emotivo
Intelligenza artificiale: prepararsi al 2026 | Il report di AI News

Il nuovo report di AI News per non farsi sorprendere…

Intelligenza artificiale: prepararsi al 2026 | Il report di AI News
AI, bolla o non bolla? Il parere degli esperti non è unanime

Ne abbiamo intervistati cinque per unire i puntini

AI, bolla o non bolla? Il parere degli esperti non è unanime
Luciano Floridi: “L’intelligenza artificiale non è intelligente”, la nostra intervista | AI Talks #20

"Se potessi tornare indietro, eliminerei l'espressione 'intelligenza artificiale', la chiamerei…

Luciano Floridi: “L’intelligenza artificiale non è intelligente”, la nostra intervista | AI Talks #20

Privacy policy| Cookie policy| Cookie setting| © 2026