Leader di pensiero

I modelli aperti continuano a migliorare. L’economia sta diventando più complessa.

mm
Aggiungi Unite.AI alle tue fonti preferite su Google

I modelli di IA sono ovviamente migliori rispetto a 18 mesi fa. Ma quando ho iniziato ad approfondire, le spiegazioni abituali per questo progresso non quadravano.

Non sono migliorati semplicemente perché sono diventati più grandi. “L’open source sta vincendo” è solo parzialmente vero. Inoltre, il consiglio di guardare i punteggi dei benchmark si è rivelato molto meno utile di quanto mi aspettassi. Ci è voluto un po’ di tempo per accettarlo.

Quindi ho raccolto 18 mesi di dati su 46 modelli provenienti da otto laboratori. Volevo capire se l’intelligenza sta diventando una merce, se i modelli aperti stanno colmando il divario di frontiera e cosa le aziende dovrebbero misurare nella scelta dei sistemi su cui costruiranno.

Il risultato chiave è stato semplice: un punteggio di benchmark non è realmente una proprietà del modello. Riflette il modello, il software e il contesto che lo circondano, e quanta tempo e potenza di calcolo gli sono stati concessi. Pubblicare un solo numero significa nascondere gli altri due.

Le implicazioni, tuttavia, sono molto più ampie. Le aziende confrontano modelli individuali quando dovrebbero valutare l’intero sistema che deve svolgere il lavoro.

I benchmark nascondono il sistema

Quando ho smesso di guardare i punteggi compositi e ho confrontato i modelli test per test, il divario tra i principali modelli open-weight e proprietari non era affatto un unico numero.

Su SWE-bench Verified, un test più vecchio che è comparso in innumerevoli annunci di modelli, il divario era di 0,2 punti. Su SWE-bench Pro, un test più recente progettato attorno a lavori software realistici e multilingue con una configurazione standardizzata, era di 18,2 punti.

Il divario apparente del modello dipende dal benchmark

Benchmark Divario Stato
SWE-bench Verified 0.2 pts Saturato, contaminazione segnalata
GPQA Diamond 2.0 pts Saturato, limite intorno al 92–95%
Terminal-Bench 2.1 4.9 pts In tempo reale, agente
Humanity’s Last Exam 9.8 pts In tempo reale, ragionamento di frontiera
SWE-bench Pro 18.2 pts In tempo reale, struttura standardizzata

Fonte: l’analisi di Jaspreet Singh sui principali modelli open-weight e proprietari, luglio 2026.

Lo stesso modello può anche ricevere punteggi diversi a seconda di chi esegue il test. Kimi K3 ha ottenuto l’80,9% su Terminal-Bench 2.1 in una valutazione indipendente e l’88,3% quando il suo produttore ha riportato il risultato. Questa differenza di 7,4 punti è più ampia del divario open‑versus‑frontiera in tre dei cinque benchmark che ho analizzato.

Un modello riceve istruzioni dal software circostante, attinge al contesto fornito, utilizza gli strumenti a cui può accedere e opera entro un budget di ragionamento stabilito dallo sviluppatore. Modificando queste condizioni, il risultato cambia di conseguenza.

I benchmark pubblici sono utili per comprendere la direzione del progresso. Tuttavia, costituiscono una base poco affidabile per decidere cosa funzionerà all’interno della tua azienda.

L’affidabilità agentica cambia i calcoli

Ciò diventa più importante man mano che l’IA passa dal rispondere a domande al completare una sequenza di azioni.

Considera un flusso di lavoro con 20 passaggi, in cui l’IA esegue correttamente ogni passaggio il 95% delle volte. Sembra affidabile. Tuttavia, sull’intera sequenza, il flusso di lavoro ha successo solo il 36% delle volte.

Un modello migliore può aumentare le probabilità a ogni passaggio, soprattutto su lavori agentici complessi. È l’ingegneria circostante a determinare se un singolo passo errato rovina l’intero compito. Salvare i progressi, verificare i risultati, riprovare in sicurezza e ripristinare da un fallimento spesso distinguono una dimostrazione convincente da un prodotto affidabile.

La scelta del modello è ancora importante. Tuttavia, il modello con il punteggio più alto non produce automaticamente il sistema più affidabile.

Scegli i modelli in base al lavoro

I dati supportano una conclusione più ristretta rispetto a quella che solitamente viene tirata da entrambe le parti del dibattito open‑versus‑proprietario.

I modelli open-weight sono competitivi per lavori ben definiti e a breve termine, dove il risultato può essere misurato direttamente. Classificazione, estrazione, sintesi e generazione strutturata rientrano sempre più in questa categoria.

I modelli di frontiera mantengono ancora il loro premio per compiti agentici più lunghi, per l’aderenza alle istruzioni sotto pressione e per lavori in cui il fallimento è costoso da rilevare a posteriori. È qui che i benchmark più recenti mostrano un divario più vicino a 18 punti che a zero, e dove lo strato di sicurezza fornito dal fornitore del modello ha valore.

Le aziende dovrebbero selezionare i modelli in base al compito, ma non dovrebbero presumere che il passaggio sia gratuito. Il contesto, il ragionamento e le cache dei prompt non si trasferiscono agevolmente tra fornitori. Un modello più economico può diventare più costoso se il cambiamento di sistema costringe il lavoro a ricominciare o aggiunge livelli di ingegneria e governance.

La scelta del modello sta diventando meno permanente. Cambiare fornitore è ancora una decisione architetturale.

Man mano che l’intelligenza diventa più economica, il giudizio resta costoso

La capacità generale competente sta diventando straordinariamente a buon mercato. Tuttavia, nella parte superiore della curva, ogni punto aggiuntivo di prestazione costa più del precedente. Gli ultimi nove punti di capacità costano approssimativamente dieci volte ciò che costa tutto ciò che li precede.

La maggior parte delle aziende non ha bisogno del modello più potente per ogni richiesta. Ha però bisogno di sapere quale lavoro lo richiede.

Riassumere, estrarre, classificare, redigere e tradurre si stanno avvicinando a una capacità di utilità. Ciò che rimane scarso è il giudizio: sapere quale delle cinque risposte plausibili è corretta, accorgersi che la domanda era errata e decidere quando fermarsi e chiedere a un umano.

Il giudizio deriva da contesto proprietario, regole di business, flussi di lavoro, conoscenza storica e dall’ingegneria che verifica il lavoro e contiene i fallimenti.

Costruisci la valutazione che nessun altro può eseguire

Per un’impresa, il benchmark più prezioso è costruito dal proprio lavoro.

Crea un set di valutazione privato con 50‑200 compiti reali della tua attività. Mantieni fisso il sistema circostante, esegui i test ripetutamente e valuta se il lavoro è stato completato correttamente piuttosto che quanto sia raffinata la risposta.

Applica la stessa disciplina ai costi. Il costo per token può fuorviare quando un modello ragiona più a lungo, richiede più tentativi o genera più lavoro per un revisore umano. Misura il costo per risultato accettato invece.

Inizia con un numero limitato di modelli. Instrada il lavoro all’inizio di un compito anziché cambiare fornitore a metà. Conta l’onere di sicurezza, governance e operatività di ogni fornitore aggiuntivo insieme al prezzo pubblicizzato.

Il mercato continuerà a produrre nuovi vincitori di benchmark e le aziende saranno tentate di ricostruire la loro strategia IA attorno a ciascuno di essi. Un approccio migliore è scegliere i modelli per il lavoro, poi valutare l’intero sistema nelle condizioni in cui deve operare.

Il benchmark che dovrebbe guidare la tua architettura è quello che solo la tua azienda può eseguire.

Fondatore e CEO, Jaspreet Singh, porta una combinazione di visione di prodotto e esperienza da general manager e ha guidato Druva a diventare una delle aziende a più rapida crescita nell'industria della protezione e gestione dei dati da diversi miliardi di dollari. Il suo spirito imprenditoriale gli ha permesso di avviare Druva, ora valutata oltre 2 miliardi di dollari e fidata a livello mondiale da migliaia di aziende all'avanguardia nell'adozione dell'era del cloud. Le sue intuizioni di mercato e tecnologiche lo hanno portato a creare la prima piattaforma di protezione dei dati nativa del cloud, che offre soluzioni tecnologiche innovative e un modello di consumo distintivo, sconvolgendo una tradizione di hardware e software obsoleti.

Prima di fondare Druva, Jaspreet ha ricoperto ruoli fondamentali presso Veritas e Ensim Corp. Inoltre, detiene più brevetti e ha una laurea B.S. in Informatica dall'Indian Institute of Technology, Guwahati.