Confronto modelli di intelligenza artificiale

Confronta oltre 40 LLM: prezzo, contesto, licenza e costo mensile.

Filtri
Il più economico per questo carico
Costo più alto
Contesto maggiore
Avviso. I prezzi sono una fotografia e possono cambiare senza preavviso. Le cifre sono USD per 1.000.000 di token. I modelli a pesi aperti mostrano prezzi di riferimento su API di inferenza ospitate (Together, Fireworks, Groq, Bedrock, ecc.) e variano per fornitore. I punteggi benchmark sono i migliori numeri riportati pubblicamente nelle schede modello ufficiali e nei blog dei fornitori: dipendono dalla versione del benchmark, dal prompt e dalla configurazione di valutazione; trattali come una classificazione approssimativa, non una misurazione esatta. Verifica sempre con il fornitore prima di impegnare budget o prendere decisioni critiche sulla qualità.
Testa a testa

Seleziona da 2 a 4 modelli nella vista tabella usando la colonna delle caselle di controllo. Appariranno qui fianco a fianco con la metrica vincente evidenziata, più un grafico radar che confronta i loro benchmark pubblicati.

Nessun modello selezionato. Apri la vista tabella, seleziona 2-4 righe e torna qui.
Scegli un caso d'uso

Domande frequenti

Inizia da tre assi — qualità, dimensione del contesto, costo — e classificali per il tuo carico di lavoro. I chatbot tollerano modelli più piccoli (Haiku 4.5, GPT-4o mini, Gemini Flash, Nova Micro). Gli agenti e gli assistenti di codice beneficiano di modelli di ragionamento (o3, o4-mini, Claude Sonnet 4.5 con thinking esteso, DeepSeek R1, Grok 3, Qwen QwQ). I flussi con documenti lunghi necessitano di un contesto 200K+ (Claude, Gemini 2.5 Pro, GPT-4.1 con 1M, Llama 4 Scout con 10M). Inserisci il tuo volume di traffico reale nel calcolatore dei costi su questa pagina per ottenere una stima mensile prima di impegnarti.
Sì, con alcune precisazioni. Non esiste alcun LLM addestrato specificamente per l'ingegneria civile, strutturale o delle costruzioni — ma i modelli di frontiera generali con solide capacità matematiche, di ragionamento, visione e codice possono aiutare con: lettura di norme (Eurocode, ACI, SNiP), verifica delle combinazioni di carico, scrittura di script di calcolo in Python/MATLAB/Grasshopper, estrazione di quantità dai disegni, generazione di fogli di computo metrico, confronto di specifiche e riassunto di RFI o documenti di cantiere. Non fidarti mai di una risposta numerica di un modello senza verifica indipendente. I LLM inventano numeri plausibili, citano male le norme e trascurano i casi limite. Trattali come un occhio in più, non come un ingegnere abilitato.
Cualquier modelo etiquetado con la capacidad Visión acepta imágenes. Para leer planos de construcción, extraer dimensiones de PDFs escaneados o analizar fotos de defectos, las puntuaciones públicas más altas en MMMU (comprensión multimodal) provienen de: o3 y o4-mini, Claude Sonnet/Opus 4.5, Gemini 2.5 Pro y Llama 4 Maverick. Para presupuestos más ajustados, Gemini 2.5 Flash, GPT-4.1 mini, Claude Haiku 4.5 y Nova Lite son opciones sólidas. Opciones de visión de código abierto: Llama 3.2 90B Vision y Pixtral Large. Ten en cuenta que los planos arquitectónicos y estructurales densos requieren un OCR muy preciso; verifica siempre los números y símbolos extraídos con el original antes de usarlos en cálculos.
No. Sono i migliori punteggi pubblicamente riportati nelle schede modello ufficiali e nei blog dei fornitori. Due modelli con lo stesso MMLU spesso si comportano in modo molto diverso nella pratica; i benchmark si saturano col tempo e le valutazioni più recenti (GPQA Diamond, SWE-bench Verified, AIME) sono obiettivi mobili. Usa i numeri come classificazione approssimativa, non come misurazione esatta. Per una decisione importante, esegui la tua valutazione su un campione rappresentativo dei tuoi dati reali.
Le API chiuse (GPT, Claude, Gemini) sono la via più rapida verso la produzione: zero infrastruttura, qualità di frontiera e disponibilità garantita da SLA. Gli svantaggi sono la dipendenza dal fornitore, i vincoli di residenza dei dati e i prezzi elevati al livello flagship. I modelli a pesi aperti (Llama 3.1 e 3.3, Mistral, DeepSeek) consentono il self-hosting per costi prevedibili e pieno controllo dei dati, al costo di gestire l'infrastruttura GPU e la scalabilità. Un punto di mezzo comune è usare un fornitore di inferenza ospitata (Together, Groq, Fireworks, Bedrock) per modelli a pesi aperti: si mantiene la portabilità del checkpoint senza gestire server.
La finestra di contesto è il tetto massimo di testo in una singola chiamata: il prompt di sistema, i messaggi utente e l'output del modello devono rientrare nel limite. Una finestra da 128K contiene circa 100K parole in inglese, una da 200K circa 150K, e 1M di token di Gemini 1.5 corrisponde a un romanzo breve. Se si supera il limite, la richiesta viene rifiutata o troncata silenziosamente, e le parti precedenti della conversazione possono andare perdute. Per pipeline RAG, documenti lunghi o agenti multi-turno, scegli un modello il cui contesto superi comodamente il 95° percentile della tua dimensione di chiamata.
I fornitori chiusi offrono fine-tuning su modelli selezionati (GPT-4o mini, GPT-3.5 Turbo, Gemini 1.5 Flash), tipicamente adattatori di tipo LoRA esposti tramite la loro API. I modelli a pesi aperti sono completamente regolabili — pesi completi, LoRA, QLoRA, DPO, qualsiasi ricetta — perché possiedi il checkpoint. Per la maggior parte dei team, il prompt engineering e il retrieval risolvono il 90% del gap di qualità; ricorri al fine-tuning solo quando gli output strutturati, la corrispondenza del tono o il vocabolario di dominio rimangono ostinatamente errati dopo un prompt ben costruito.
I token di input vengono elaborati in parallelo durante la fase di prefill: l'intero prompt attraversa il modello una volta e viene costruita la cache KV. I token di output vengono generati uno alla volta, in modo autoregressivo, con ogni nuovo token che dipende da tutti i precedenti — le GPU non possono parallelizzare questo passaggio, quindi il throughput cala di un ordine di grandezza. I fornitori trasferiscono quel costo di latenza come un premio di prezzo da 3x a 5x sui token di output. La cache dei prompt e le richieste in batch sono le principali leve per ridurre il costo effettivo.
La tabella riflette una fotografia scattata ad aprile 2026 e include modelli rilasciati fino all'inizio del 2026. I fornitori di LLM modificano i prezzi e deprecano versioni più volte all'anno — verifica sempre la tariffa attuale sulla pagina di prezzi ufficiale del fornitore prima di firmare un contratto o dimensionare un budget di produzione. Nulla di ciò che inserisci nel calcolatore dei costi viene inviato da nessuna parte: l'intero confronto viene eseguito localmente nel tuo browser.

Strumento di confronto per grandi modelli linguistici (LLM): GPT-4o, Claude 3.5, Gemini, Llama, Mistral e oltre 40 modelli. Filtra per fornitore (OpenAI, Anthropic, Google, Meta, ecc.), licenza (commerciale/open-source), prezzo massimo di input e finestra di contesto minima. Confronto testa a testa di due modelli su latenza, prezzo e contesto. Calcolatore di costo mensile: inserisci i token di input/output e le chiamate al mese per stimare la spesa mensile. Prezzi in $/1M token.