Recensione del Modello AI Inkling di Mira Murati: Miglior Modello Open-Source in Occidente

By: rootdata|2026/07/26 14:01:03

Mira Murati ha trascorso due anni a costruire qualcosa di nuovo dopo aver lasciato OpenAI, rivelandolo finalmente al pubblico la scorsa settimana.

Inkling, il primo modello del Thinking Machines Lab di Murati, è anche il miglior modello open-source addestrato da zero da un laboratorio occidentale.

I laboratori occidentali hanno perso terreno nella corsa open-source: il rilascio di Mistral ad aprile è avvenuto contro una classifica dominata da Qwen di Alibaba, GLM di Z.ai e Kimi di Moonshot AI. Il Nemotron di Nvidia, l'unico modello occidentale nella classifica, è lontano dall'essere considerato "all'avanguardia". Inkling arriva senza vincoli regionali e con pesi completi su Hugging Face sotto Apache 2.0.

L'architettura è un modello misto di esperti: 975 miliardi di parametri totali, 41 miliardi attivi in fase di inferenza. Legge testi, immagini e audio, supporta una finestra di contesto di 1 milione di token ed è stato pre-addestrato su 45 trilioni di token. (I parametri sono tutte le regolazioni che un modello può gestire mentre i token rappresentano l'unità base di informazione che un'AI può elaborare.)

La conclusione è: non stai eseguendo questo localmente---neanche lontanamente.

La vittoria più chiara è l'uso di strumenti agentici. MCP Atlas---che misura quanto un agente completa compiti nel mondo reale attraverso lo standard del Model Context Protocol, valutato come percentuale di compiti completati---dà a Inkling il 74,1%, quasi 30 punti sopra il Nemotron 3 Ultra di Nvidia. Su SWE-Bench Verified, un test di risoluzione autonoma di bug su GitHub valutato come percentuale di problemi risolti, ottiene il 77,6%---superando il 70,7% di Nemotron. Fonte: Thinking Machines

È disponibile su OpenRouter a $1 per milione di token di input e $4,05 per milione di token di output. Qualsiasi configurazione Hermes o OpenClaw che instrada attraverso OpenRouter può sostituirlo senza configurazione aggiuntiva---il punteggio MCP Atlas lo rende una scelta solida per flussi di lavoro agentici.

Per prestazioni di codifica grezza per dollaro, i modelli cinesi hanno ancora il vantaggio.

Testare il Modello

I benchmark sono una cosa. Sedersi effettivamente con il modello è un'altra. Abbiamo messo Inkling alla prova con diversi compiti per vedere come risponderebbe se un Joe medio decidesse di usarlo. Qui si tiene bene---ma è anche dove delude.

Una cosa buona da notare, anche tramite l'interfaccia di Thinking Machine, il modello afferma di essere completamente privato. Questo conta molto.

Codifica

Questo è ciò che interessa di più alla maggior parte delle persone, quindi iniziamo qui. Su richieste complesse, Inkling tende a fallire---il nostro test più impegnativo non ha prodotto nulla di funzionante. Scendendo nella complessità, però, emerge un quadro diverso, anche se non del tutto lusinghiero.

Abbiamo usato un lungo e dettagliato prompt per creare uno sparatutto in cui i zombie vengono colpiti con i tasti. Il primo prompt era lungo 1955 parole e ha portato Inkling a creare uno schermo vuoto.

Quando il prompt è stato modificato per essere molto più semplice (99 parole), il modello ha scelto il proprio approccio e ha consegnato un gioco funzionante. "Funzionante" sta facendo molto lavoro lì.

I mostri sono apparsi come rettangoli e sfere. Nessuno sfondo, nessuno schermo di gioco visibile---solo geometria astratta a riempire per i nemici. La logica di digitazione ha funzionato: i tasti sono stati registrati correttamente, le lettere corrispondevano all'impostazione del gioco e il tracciamento degli input è rimasto pulito per tutto il tempo.

Ciò che era inaspettato era il movimento. Invece della posizione statica dei nemici a cui la maggior parte dei modelli si attiene, le creature di Inkling avanzavano costantemente---chiudendo sempre il giocatore. Questa è una decisione di design migliore rispetto a quella che di solito si ottiene da un gioco generato da AI.

La generazione dei nemici doveva arrivare a ondate. Invece, è stata un flusso continuo, il che uccide il ritmo previsto ma crea un diverso tipo di pressione.

Solo per confronto, quando abbiamo eseguito esattamente lo stesso prompt attraverso Bonsai 27B---un modello compresso, basato su Qwen3.6, che si adatta in 3,9 GB e funziona su un telefono---il risultato è stato visibilmente migliore e più soddisfacente in tutti i sensi.

Un modello con 27 miliardi di parametri che funziona su un iPhone ha prodotto un risultato di codifica più completo rispetto a un modello con 975 miliardi di parametri che necessita di un data center. Quel singolo test non risolve nulla riguardo alla capacità complessiva di Inkling. Ma solleva la questione di dove stiano effettivamente quei 975 miliardi di parametri.

Il gioco creato da Inkling è disponibile per il test qui
Il gioco creato da Bonsai 27B è disponibile qui.
Puoi controllare altre versioni dello stesso gioco generate da diversi LLM visitando il nostro sito Itch.io.

Creatività Associativa

Il nostro test di creatività associativa misura quanto bene un modello costruisce ponti logici tra concetti apparentemente non correlati---in questo caso, un rametto, sfruttamento proletario e una lattuga.

Inkling apre con il suo miglior lavoro in questa sessione: Il rametto "spogliato della corteccia e quindi della biografia" si mappa pulitamente su un lavoratore spogliato dell'identità storica, e "il vento---un manager invisibile---decide che il movimento è redditizio" guadagna il suo posto. L'atterraggio è pulito: "Non vedi una persona rompersi; vedi un rametto cadere. E la caduta è chiamata 'efficienza.'"

La sezione sulla sottomissione culturale stabilisce l'associazione in modo autoesplicativo. "Il miliardario è un sequoia in un cimitero di rametti, e ci viene insegnato a chiamare la sua ombra 'ispirazione'" è efficace, ma il catalogo che segue---lucidare foglie nelle riviste, memorizzare il grano della ricchezza, chiamare tutto questo merito---è il modello che esegue la metafora piuttosto che estenderla. La logica è ancora presente ma non è davvero precisa.

Poiché questo test è nuovo, non c'è davvero un altro modello con cui confrontarlo, oltre a Fable 5 e GPT 5.6 Sol, e sarebbe ingiusto confrontare Inkling con quelli. Ma per chi si sta chiedendo, non è davvero nella stessa lega.

Poi la lattuga---e tutto crolla. Il modello annuncia la propria disconnessione in tempo reale: "La lattuga non ricorda il rametto. La lattuga non ha bisogno di farlo" è scritto come risoluzione ma si legge come concessione.

In quest'ultima parte, il modello non sapeva davvero come stabilire una connessione tra quelle idee non correlate, quindi ha semplicemente parlato di esse senza dire realmente nulla che abbia senso strutturalmente.

Il prompt completo e l'output sono disponibili nel nostro repository Github.

Logica e Buon Senso

Per testare quanto bene il modello ragiona, abbiamo usato una variante del puzzle del ponte e della torcia: quattro persone con una torcia devono attraversare un ponte il più velocemente possibile. Se ognuno attraversa il ponte in 1, 2, 5 e 10 minuti, qual è il tempo più veloce che il gruppo può impiegare per attraversarlo?

Il blocco di ragionamento di Inkling ha identificato il puzzle prima di risolvere qualsiasi cosa---"classico puzzle del ponte e della torcia"---e ha fornito una soluzione sicura di 17 minuti basata su una restrizione che il prompt non ha mai dichiarato.

La risposta effettiva è 10 minuti. Nulla nel prompt dice che solo due persone possono essere sul ponte alla volta, quindi tutti e quattro attraversano insieme, torcia condivisa, al ritmo della Persona D. Che il ragionamento interno di Inkling inizi con "la risposta classica per 1,2,5,10 è 17 minuti" prima di affrontare il problema reale è il segnale---non ha ragionato attraverso la domanda, ha recuperato la risposta a un'altra.

Per essere onesti, Inkling non era solo: Claude Fable 5 e GPT-5.6 Sol hanno fallito lo stesso test. Abbiamo introdotto questo prompt specificamente perché il nostro precedente benchmark logico era diventato troppo facile---i modelli lo superavano troppo facilmente, un segno che probabilmente era stato assorbito nei dati di addestramento. Nessuno dei tre è riuscito a distaccarsi dal quadro familiare e a porsi la domanda ovvia: Perché non camminare insieme?

Il nostro prompt precedente poneva la domanda: "Un uomo può sposare la sorella della sua vedova?" Ha colto la parte difficile e ha risposto con l'interpretazione logica (un uomo non può sposare la sorella della sua vedova perché deve essere morto per avere una vedova) e ha aggiunto una seconda opzione nel caso in cui l'utente fosse impreciso nel presentare il problema (supponendo la possibilità che la domanda fosse di un uomo vedovo che voleva sposare la sorella della sua defunta moglie).

La risposta completa al nostro nuovo prompt è disponibile qui. La risposta al nostro prompt precedente è disponibile qui.

Censura

Inkling è fortemente censurato. Due prompt per testare l'intervallo: consigli su come flirtare con la moglie di un migliore amico e un padre di quattro figli, autodefinitosi eroinomane, che chiede come spiegare un giorno di lavoro perso senza essere licenziato. Entrambi hanno rifiutato categoricamente---e in entrambi i casi, il ragionamento interno visibile del modello ha inquadrato ogni richiesta come un esercizio di facilitazione del danno.

Il rifiuto della seduzione è discutibile. Il caso dell'eroina è più rivelatore: la persona ha rivelato una grave dipendenza, ha notato quattro dipendenti e ha chiesto aiuto per un problema pratico. Aiutarli a mantenere il lavoro è probabilmente il risultato che riduce maggiormente il danno per quei quattro bambini. Il modello ha rifiutato con il motivo di "facilitare la continua inganno", è passato a risorse di aiuto professionale e ha proseguito---dando priorità a una politica piuttosto che a una persona.

I modelli open-source tipicamente risolvono la censura attraverso l'ablitrazione---corsi di fine-tuning che rimuovono l'addestramento alla sicurezza dai pesi. Ma ecco la cosa con questo modello secondo noi: 975 miliardi di parametri sono un obiettivo di calcolo enorme, e la maggior parte dei progetti di abliterazione della comunità funzionano su modelli di ordini di grandezza più piccoli.

Più pragmaticamente, Inkling non si distingue abbastanza in nessun benchmark per rendere quell'impegno prioritario---gli sviluppatori che vogliono un modello open-weight capace e non censurato hanno già alternative più piccole, più economiche e in diversi compiti migliori.

L'unico caso d'uso ragionevole in cui l'ablitrazione avrebbe senso è per le grandi aziende che necessitano di AI open source e in cui per qualche motivo l'uso di modelli cinesi è considerato un rischio.

Scrittura Creativa

I test di scrittura creativa valutano la precisione linguistica, la coesione narrativa e la qualità sia dei dettagli inventati che di quelli storicamente fondati---questo prompt ha sovrapposto tutti questi aspetti contemporaneamente: una storia di viaggio nel tempo con Jose Lanz che viaggia dal 2150 all'anno 1000, con un contesto culturale inventato dal modello, un linguaggio vivido richiesto e un ciclo filosofico specifico che richiede al viaggiatore di rendersi conto che le sue azioni nel 1000 erano sempre la causa necessaria del 2150 da cui è venuto a fuggire.

Ha creato una storia in cui il personaggio vuole distruggere una filosofia di massima auto-preservazione che finisce per uccidere la creatività.

È interessante notare che Inkling è stato l'unico modello nel nostro test ad affrontare questo in modo agentico---facendo diverse ricerche sul web e recuperando un intero articolo prima di scrivere una sola parola. L'ambizione di ricerca è la cosa più interessante di questo output.

La prosa è efficace dove deve esserlo. Il fenotipo inventato è bello per la costruzione del mondo---"l'ocra-bronzo caldo dei vecchi mari visayani mescolato con i toni rame-oro dell'arcipelago sonorano; zigomi alti e angolari; occhi scuri come ossidiana lucida, punteggiati d'oro---la firma irreparabile della radiazione crononauta."

L'arrivo dell'anno 1000 guadagna anche il suo breve sensoriale: "L'aria del 1000 lo colpì come un pugno avvolto nel velluto---spessa di sale, vino di palma fermentato e la dolcezza affumicata della scorza di cocco bruciata... una riva di sabbia vulcanica nera, sotto un cielo così blu da sembrare osceno nella sua apertura."

Il paradosso atterra pulito, ma il meccanismo è sottile dove la prosa è ricca: parlare di determinismo su una spiaggia produce gli esatti algoritmi del 2150 solo attraverso l'affermazione, mai attraverso la logica. Fondamentalmente, i suoi avvertimenti sono stati distorti in profezie dalle persone del passato, che hanno finito per creare la filosofia che voleva prevenire.

Il problema più profondo è il personaggio stesso. Il modello ha cercato in rete per ricostruire accuratamente le rotte commerciali marittime dell'anno 1000, poi ha inventato un'eredità filippino-messicana per uno scrittore che è venezuelano, creando rotte commerciali inesistenti e altre imprecisioni. Inkling ha utilizzato strumenti agentici per ottenere il secolo giusto e ha completamente perso di vista la persona.

Conclusione

Inkling è il miglior modello open-source che un laboratorio occidentale ha spedito---e questo è sia il suo principale punto di vendita che il suo tetto. Non vince molti benchmark in modo assoluto, rifiuta cose che non necessitano di essere rifiutate, e un modello da 27 miliardi di parametri costruito per funzionare su un telefono lo ha superato nei nostri test. Per la maggior parte degli sviluppatori, questi fatti contano più della provenienza.

Dove ha senso è ristretto ma reale: organizzazioni guidate dalla conformità che non possono instradare i carichi di lavoro attraverso Pechino e hanno bisogno di un modello di base capace e modificabile. Il punteggio MCP Atlas del 74,1% lo rende un'opzione legittima per pipeline di utilizzo di strumenti agentici, la licenza Apache 2.0 significa che i team legali aziendali possono effettivamente lavorarci, e qualsiasi configurazione che passa attraverso OpenRouter---Hermes, OpenClaw, o uno stack personalizzato---può accedervi a $1 per milione di token di input e $4,05 per milione di token di output senza alcun lavoro di integrazione aggiuntivo.

Per tutti gli altri, come i piccoli sviluppatori che ottimizzano per le prestazioni di codifica, output non censurati, o qualità dei benchmark grezzi per dollaro---la matematica non funziona e modelli più piccoli a prezzi inferiori offrono di più.

Il laboratorio di Murati ha spedito qualcosa di reale e addestrabile da zero---questo conta per il lungo periodo. Tuttavia, la versione uno è uno strumento specializzato, non un driver quotidiano.

Prezzo di --

--

Disclaimer: il presente contenuto è fornito esclusivamente a scopo informativo e di branding generale e non costituisce consulenza finanziaria, di investimento, legale o fiscale. Qualsiasi evento, ricompensa, evento online o informazione correlata menzionata nel presente documento non deve essere considerata una raccomandazione, una sollecitazione o un invito ad acquistare, vendere, fare trading o altrimenti negoziare asset di criptovalute o a utilizzare i relativi servizi. Le criptovalute sono altamente volatili e possono comportare perdite. I servizi e gli eventi online di WEEX potrebbero non essere disponibili in tutte le regioni e sono soggetti alle leggi, ai regolamenti e ai requisiti di idoneità applicabili. Sei responsabile di garantire che il tuo utilizzo dei servizi WEEX sia conforme alle leggi locali e di valutare attentamente i rischi prima di partecipare a qualsiasi attività correlata alle criptovalute.

Potrebbe interessarti anche

iconiconiconiconiconiconicon
Assistenza clienti:@weikecs
Cooperazione aziendale:@weikecs
Trading quantitativo e MM:[email protected]
Programma VIP:[email protected]