Presentazione


Analisi, opinioni, fatti e (più di rado) arte da una prospettiva di classe.
Visualizzazione post con etichetta LLM. Mostra tutti i post
Visualizzazione post con etichetta LLM. Mostra tutti i post

21/09/2026

Più che l'etica, sull'IA pesa la fragilità delle quotazioni azionarie

L’appello dei big dell’intelligenza artificiale Usa, guidati dal Ceo di Anthropic Dario Amodei, a rallentare lo sviluppo dell’intelligenza artificiale per governarlo maggiormente ha suscitato vasto dibattito. La presunta “svolta etica” dei colossi dell’intelligenza artificiale ha suscitato ampie discussioni. Per Giuliano Noci, prorettore del Politecnico di Milano e attento studioso delle dinamiche geopolitiche ed economiche internazionali connesse anche alla corsa alla supremazia tecnologica e sull’IA, “il vero motivo di questa svolta non è etico”. Parlando con InsideOver, il professor Noci invita a riflettere a ampio raggio su un contesto che vede, oggigiorno, “l’intelligenza artificiale essere molto più di una tecnologia: l’Ia”, spiega Noci, “è una infrastruttura di cambiamento di portata enorme, è davvero un cambio di paradigma del funzionamento dei sistemi sociali, educativi, economici e geopolitici”.

L’IA è un settore che ha suscitato attenzione, interesse, investimenti. Come siamo arrivati fino al dibattito di questi giorni?

L’IA è un’infrastruttura di cambiamento e anche un’infrastruttura di potere, economico, e tecnologico, estremamente contesa. A mio avviso, il punto fondamentale su cui noi dobbiamo riflettere è che in questi due anni si sono creati delle insensate aspettative che hanno alimentato valutazioni oggettivamente senza senso delle big tech e di Nvidia, ed è questo un primo problema che oggi si ripercuote sulle dinamiche concrete della corsa all’IA.

A suo avviso, perché questo è successo?

Perché prima si è raccontato che l’intelligenza artificiale avrebbe molto rapidamente cambiato tutto. Ma proprio perché l’intelligenza artificiale non è una tecnologia ma è molto di più, un sistema complesso e in evoluzione, la sua penetrazione richiederà parecchio tempo prima che venga correttamente digerita dai sistemi economici. In un certo senso, è come avvenne con le ferrovie nel XIX secolo: allora moltissimi operatori investirono su binari e fallirono praticamente tutti. Questo non significa che la tecnologia fosse sbagliata. Come sappiamo, poi le ferrovie sono state infrastrutture che hanno avuto un impatto enorme: il problema è la scala dei tempi con cui un nuovo sistema arriva a maturazione. Sottolineerei, inoltre, il fatto che la stessa cosa avvenne con l’arrivo dell’energia elettrica, gli operatori hanno impiegato 30 anni per capire come usarla.

Questo, per quanto riguarda l’IA, come si è concretizzato?

Si è verificata un’alimentazione di aspettative che non ha riscontro reale nell’economia e che di fatto rende certe quotazioni estremamente fragili. Secondo me tutta questa narrativa è stata assolutamente alimentata dal fondatore di Nvidia, che è l’azienda con la maggior capitalizzazione di borsa al mondo e vale due volte il PIL italiano. Negli anni Jensen Huang sostanzialmente ha fatto di tutto pur di massimizzare entrate e capitalizzazione di borsa. In primo luogo ha fatto operazioni di finanza circolare, in secondo luogo ha fatto anche da “assicurazione”, garantendo ai committenti che compravano le sue GPU che Nvidia avrebbe coperto il mancato fatturato degli operatori se i data center non avessero avuto sufficientemente domanda e, infine, si è accordato con le grandi banche internazionali perché prestassero soldi ai suoi clienti. Quel che è andato in scena, a mio avviso, è stato un meccanismo di totale distorsione delle normali dinamiche di business, e questo ci porta a  renderci conto del fatto che sotto il profilo delle quotazioni l’intero costrutto dell’IA vive un momento di grandissima fragilità e di elevato rischio.

Quali novità principali degli ultimi mesi, a suo avviso, hanno contribuito a tale scenario?

Negli ultimi mesi il quadro si è complicato perché progressivamente è emersa la consapevolezza che i cinesi avessero applicazioni efficienti, sistemi di intelligenza artificiale meno potenti di quelli americani ma operanti a costi infinitamente più bassi. Questo ha reso palese che non era necessariamente vero ciò che affermavano gli americani, e cioè che la via maestra dell’IA passasse per lo sviluppo di Large Language Models sviluppati con un’enorme e costosa potenza di calcolo. Personalmente, credo che gli LLM rischino di fare la fine di molti operatori di telecomunicazioni, titolari di un’infrastruttura indispensabile ma che non genera flussi di cassa positivi e guadagno.

Insomma, le aziende dell’IA che hanno guidato l’inizio della corsa vivono una sfida importante per difendere il vantaggio acquisito...

Il tema della difesa della posizione da parte degli operatori dell’IA è fondamentale. Questi cantori delle intelligenze artificiali che adesso diventano tutto a un tratto cantori dell’etica sulle IA mirano principalmente a erigere delle barriere difensive per cercare di congelare il vantaggio acquisito ed evitare che i cinesi si inseriscano per sottrarre loro parte delle risorse disponibili nel mercato dell’IA. Manovre difensive, queste, operate da soggetti che io ritengo ormai privi di qualsiasi credibilità: mi riferisco a Sam Altman, Dario Amodei, Jensen Huang.

Per che motivo, a suo avviso?

Purtroppo, queste figure di punta dell’IA hanno la responsabilità di aver fatto salire talmente tanto questo mercato e di averlo portato a rappresentare una parte talmente rilevante del valore complessivo della borsa americana che qualora un granello di sabbia arrivasse a inceppare questo infernale meccanismo, si corre il rischio che tutto il costrutto possa venire giù. Insomma, hanno creato una situazione di rischio significativo.

OpenAI e Anthropic hanno annunciato a lungo la loro intenzione di sbarcare a Wall Street. Lo ritiene possibile?

Non si quoteranno, almeno non entrambe: c’è spazio forse per una quotazione, ma secondo me in particolar modo Dario Amodei sarà molto prudente a farla perché questo meccanismo di aspettative esagerate che hanno creato comincia a ritorcersi contro. Tenga peraltro conto che un altro fattore di incertezza è rappresentato dal fatto che questi cantori dell’IA  adesso hanno interessi che dovrebbero divergere da quelli di Trump.

In che modo, a suo avviso?

Trump ha bisogno che l’IA e gli investimenti in data center corrano per sostenere l’economia, la cui crescita è il suo unico interesse. Trump sa che se le big-tech taglieranno la corsa ai data center, già rallentata, i dati di crescita del Pil Usa saranno molto diversi e minori.

Spingendo per rallentare la corsa dell’IA loro sostanzialmente si mettono di traverso rispetto agli interessi di Trump, e questo è un altro fattore di complessità di tutta questa vicenda. Io credo che loro saranno molto prudenti a quotarsi, e secondo me in particolare Altman sa benissimo che OpenAI non può quotarsi, perché il suo è un modello business to consumer che alla luce delle promesse che ha fatto non sta in piedi.

E gli investimenti già annunciati in data center?

Affrontano una forza maggiore che si chiama materia. Di recente, ad esempio, Jensen Huang per tenersi sui mercati ha dichiarato che raddoppierà la capacità produttiva l’anno prossimo.

Vorrei proprio capire come farà, le fabbriche sono tutte a saturazione, non sono sue e per costruire fabbriche nuove di questo tipo servono 5 anni. L’IA ha un collo di bottiglia fisico, che è la catena di fornitura che non regge. Parliamo di  materie prime, semiconduttori, macchinari, ma anche, se non soprattutto, di maestranze addestrate e profili tecnici estremamente specializzati. Non è qualcosa che sia disponibile dall’oggi al domani. Per ora i mercati si stanno bevendo tutto ma alla prima difficoltà l’intera situazione potrebbe complicarsi.

Ci sono paragoni possibili col passato?

La perdita del senso della misura ricorda molto la bolla del “Dot.com” di oltre un quarto di secolo fa. Anche allora emergeva un cambio di paradigma dirompente destinato a cambiare tutto, Internet, ma nonostante l’importanza del nuovo sistema ciò che hanno fatto gli operatori in quel momento non aveva senso per le logiche di mercato. Temo che qui siamo nella stessa situazione.

In relazione a questi sviluppi il mondo cinese ha delle prospettive diverse dai colossi americani?

La Cina si è mossa in modo chiaro e diverso dagli statunitensi. Parliamo di una competizione in cui gli americani hanno fatto una scelta molto chiara: avendo le big tech e i semiconduttori più avanzati del mondo, hanno puntato su un’intelligenza artificiale di potenza, quindi Large Language Models e data center. La Cina, che è la più grande manifattura del Pianeta e non ha i semiconduttori più avanzati, ha fatto una scelta di funzione obiettivo, che è la massimizzazione della diffusione di applicazioni di intelligenza artificiale per la manifattura. Quindi la scelta di Pechino è stata una scelta applicativa, orientata alla massimizzazione della diffusione delle applicazioni, da qui il fatto anche di avere i modelli a pesi aperti.

Due filosofie diverse per due sistemi produttivi diversi...

Questa è stata una scelta ortogonale rispetto alla mossa americana. Una scelta che in qualche modo, a mio avviso, ha presupposti di coerenza con il sistema economico, è più sincrona alle esigenze del modello cinese di oggi e ha come obiettivo ulteriore la volontà di innervare con propri algoritmi altri sistemi, altri Paesi, principalmente nel Sud Globale. Quale dei due modelli prevarrà è presto per dirlo. Diciamo che io ritengo che tutta la potenza americana, allo stato attuale farà fatica a valorizzarla e a trovare un riscontro di business. Quindi credo che le strade per valorizzare al meglio l’intelligenza artificiale siano altre e tra le altre secondo me c’è quella della physical AI, dove, peraltro, anche l’Europa potrebbe trovare un’opportunità significativa e diventerà sempre più una nuova frontiera.

Fonte 

 

20/07/2026

Primo accordo di cooperazione internazionale sull’IA. Senza l’Occidente

Ventinove paesi hanno firmato giovedì a Shanghai un accordo per la creazione dell’Organizzazione Mondiale per la Cooperazione sull’Intelligenza Artificiale (WAICO).

Secondo l’accordo, la WAICO sarà un’organizzazione internazionale intergovernativa indipendente con sede a Shanghai.

Il ministro degli Esteri cinese Wang Yi, che è anche membro dell’Ufficio Politico del Comitato Centrale del Partito Comunista, ha firmato l’accordo a nome del governo cinese.

Rappresentanti dei 29 paesi, tra cui Kazakistan, Laos, Pakistan, Russia e Indonesia, hanno firmato l’accordo, rendendo i loro paesi membri fondatori della WAICO. Il Segretario generale delle Nazioni Unite, António Guterres, era tra i rappresentanti di paesi e organizzazioni internazionali presenti alla cerimonia della firma.

Secondo l’accordo, l’organizzazione sosterrà i principi della Carta delle Nazioni Unite, si impegnerà a favore di ampie consultazioni e contributi congiunti per un beneficio condiviso e aderirà a un approccio incentrato sulle persone.

L’obiettivo è promuovere la cooperazione internazionale e la governance globale sull’IA, garantendo che l’IA sia benefica, sicura ed equa, favorendo così il suo sviluppo sano e ordinato a beneficio di tutta l’umanità.

*****

La cinese Moonshot riduce il divario con i rivali statunitensi

Kimi K3, il più grande modello AI open-weight mai realizzato, è ora al primo posto per lo sviluppo web front-end

di Alex Irwin-Hunt

La startup cinese Moonshot ha rilasciato un nuovo modello linguistico di grandi dimensioni con prestazioni simili a quelle dei rivali statunitensi in diversi benchmark e con più parametri di qualsiasi altro sistema AI open-weight.

Kimi K3, lanciato dal laboratorio con sede a Pechino il 16 luglio, ha ridotto il divario con i laboratori statunitensi all’avanguardia come Anthropic e OpenAI nei test indipendenti sulla sua efficacia nel completare attività come la programmazione.

Moonshot ha dichiarato che Kimi K3 è il suo “modello di punta più capace fino ad oggi” con 2.800 miliardi di parametri, ed è stato progettato per il lavoro intellettuale, la programmazione e i compiti di ragionamento. I rivali cinesi DeepSeek V4 Pro e Longcat 2.0 in precedenza detenevano congiuntamente il primo posto con 1.600 miliardi di parametri, secondo la società di benchmarking Artificial Analysis.

I laboratori AI cinesi hanno concentrato i loro sforzi sui modelli open-weight, che sono gratuiti per gli sviluppatori da scaricare e modificare, con l’obiettivo di aumentarne l’adozione.

I loro rivali statunitensi hanno mantenuto chiusi e proprietari la maggior parte dei loro modelli con le prestazioni più elevate, mentre spendono miliardi di dollari per costruire e ottenere accesso alla capacità di calcolo nei data center.

I rilasci precedenti di Moonshot, tra cui Kimi K2 Thinking nel novembre 2025, hanno fatto notizia dopo aver ridotto il divario con OpenAI e Anthropic in diversi settori. I pesi completi del modello Kimi K3, che determinano come elabora le informazioni, saranno rilasciati il 27 luglio.

Arena AI, una società di benchmarking creata da ricercatori dell’UC Berkeley, ha rilevato che Kimi K3 è ora il miglior modello per i compiti di sviluppo web front-end con 1.679 punti, superando i modelli Anthropic Fable 5 (1.631) e OpenAI GPT 5.6 (1.618). Kimi K3 si classifica ancora al nono posto in tutti i compiti nei benchmark di Arena, dietro ai modelli di Anthropic, Meta e Google.

Reazioni del settore tecnologico

Kimi K3 ha suscitato scalpore negli ambienti tecnologici, mentre gli sviluppatori hanno iniziato a testarne le capacità e i costi rispetto ai modelli concorrenti. Il rilascio arriva un mese dopo che i modelli Fable e Mythos di Anthropic sono stati ritirati dal governo statunitense per motivi di sicurezza.

“Kimi K3 merita attenzione”, ha scritto Paul Cirstean, responsabile dell’innovazione presso Yonder, una società di consulenza IT con sede a Cluj-Napoca, in Romania. “Il divario tra modelli aperti e proprietari si sta riducendo”, ha aggiunto, sottolineando i minori costi di Kimi K3 per i token in input e output.

Alex Finn, CEO con sede a Palo Alto della startup AI Henry Intelligent Machines, ha scritto su X che “questo cambia fondamentalmente per sempre la corsa all’IA”, dato che Kimi K3 ottiene prestazioni migliori di ChatGPT 5.6 e Fable 5 in specifici benchmark.

“Se le persone possono iniziare a eseguire Fable 5 sulla loro scrivania, illimitato e gratuito, non pagheranno migliaia di dollari per abbonamenti”, ha aggiunto.

Le aziende negli Stati Uniti e in Europa utilizzano sempre più i modelli AI cinesi mentre cercano di ridurre i costi crescenti della tecnologia e diminuire la dipendenza da pochi laboratori statunitensi all’avanguardia.

OpenRouter, un’azienda che monitora l’utilizzo dei modelli linguistici di grandi dimensioni, mostra che l’uso di modelli cinesi come Tencent Hy3 (gratuito), Xiaomi Mimo-V2.5 e Z.ai GLM-5.2 è aumentato vertiginosamente nella settimana a partire dal 6 luglio.

I modelli AI cinesi stanno spingendo importanti investitori tecnologici a mettere in discussione la narrazione prevalente secondo cui sarebbero ancora indietro di otto-dodici mesi rispetto ai rivali statunitensi in termini di prestazioni.

Marc Andreessen, socio accomandatario del venture capital statunitense Andreessen Horowitz, ha scritto in un post su X il 27 giugno che GLM-5.2 sviluppato da Z.ai “è il primo modello AI cinese a eguagliare e spesso superare i modelli AI pubblici dei grandi laboratori americani senza compromessi”.

Fonte

16/07/2026

È possibile decolonizzare l’intelligenza artificiale?

Si può prendere una tecnologia nata e sviluppata nei centri di potere e riadattarla alle necessità di un gruppo marginalizzato? La domanda, potenzialmente, riguarda tutte le innovazioni tecnologiche. Il caso dell’intelligenza artificiale generativa è però oggi particolarmente discusso assieme alle molteplici problematiche etiche che i grandi modelli linguistici, come anche le tecnologie text-to-image o text-to-video, sollevano: dal rischio di disinformazione, all’impatto ambientale, fino agli utilizzi di questi strumenti a scopi bellici.

Alla radice c’è la questione del controllo, economico e politico, delle infrastrutture tecnologiche, che resta saldamente nelle mani delle grandi aziende, in gran parte statunitensi. Fuori dal mondo occidentale stanno però nascendo iniziative che mirano a riappropriarsi dei sistemi di generative AI per perseguire l’interesse pubblico o a scopi di giustizia sociale. Queste realtà stanno riorganizzando i dataset per l’addestramento degli algoritmi, modificando alcune delle loro caratteristiche tecniche e riorientando gli usi finali degli strumenti. Arrivando in alcuni casi a immaginare infrastrutture pubbliche gestite localmente.

I limiti e i bias dei modelli commerciali

L’IA generativa commerciale – per intenderci, quella di chatbot come Gemini o ChatGPT – si presenta come un archivio di conoscenza universale e neutrale. Ma le cose non stanno così: i dati impiegati per addestrare questi sistemi provengono da Internet e sono tutt’altro che neutrali. I dati di qualità disponibili sono in gran parte in inglese o in altre lingue europee, escludendo inevitabilmente la conoscenza, e quindi la rappresentazione, di una larga parte del mondo. 

In un saggio intitolato Decolonizing LLMs: An Ethnographic Framework for AI in African Contexts, gli autori (tra cui figurano, peraltro, anche esponenti di Google) spiegano: “La lingua è intrinsecamente fluida, flessibile e multiculturale. I grandi modelli linguistici (LLM) più diffusi e utilizzati oggi, invece, non lo sono. Sono in gran parte addestrati da team dislocati negli Stati Uniti e istruiti per operare su varianti non specificate di testi in inglese”. 

“La diffusione globale degli LLM, un prodotto ‘WEIRD’ (western, educated, industrialised, rich and democratic) rischia quindi di perpetuare i pregiudizi inconsci e i punti ciechi dei suoi creatori”, proseguono gli autori. “Il pericolo è che la loro visione del mondo venga presentata come la visione del mondo a una base di utenti globale, che si aspetta invece risultati neutrali da un programma informatico. Ma che dire del resto della popolazione mondiale, i cui repertori linguistici scritti e parlati non includono l’inglese? E che dire di quegli aspetti della cultura, della lingua e dell’esperienza che non sono ancora stati digitalizzati?”

Di opinione simile è Dima Saber, direttrice esecutiva di Meedan, un’organizzazione non-profit che sviluppa strumenti open source, programmi e ricerche per un’infrastruttura digitale più efficace ed etica. “Internet è fatto per uomini bianchi, della classe media, che parlano inglese. Di conseguenza, gli LLM o i bot vengono addestrati sugli stessi dati presenti in rete, riproducendo così le medesime disuguaglianze”, spiega Saber a Guerre di rete. “Esistono prove del fatto che gli LLM non solo funzionano meno bene nelle lingue diverse dall’inglese, ma anche che le risposte fornite sono piuttosto distorte e riproducono le disuguaglianze già esistenti sul web”.

Riprogettare i sistemi

Proprio per offrire alternative tecnologiche più trasparenti, situate e rispettose delle diversità, Dima Saber e il suo team hanno creato Suwali, un servizio di chatbot pensato per organizzazioni della società civile, redazioni indipendenti e altre realtà di pubblico interesse. L’obiettivo è permettere a queste organizzazioni di archiviare, valorizzare e rendere interrogabili patrimoni di conoscenza spesso sottorappresentati nei modelli mainstream, anche in lingue diverse dall’inglese. Utenti e lettori possono così rivolgere domande al chatbot e ottenere risposte in linguaggio naturale, basate però su un corpus circoscritto e verificabile.

È qui che Suwali si distingue dai servizi commerciali. Il sistema non attinge indistintamente a tutto il materiale disponibile online, ma lavora su una selezione di dati appartenenti alle singole organizzazioni: archivi, report, articoli e altri documenti da loro prodotti o scelti. Suwali è già utilizzato da diverse realtà, soprattutto nel Sud globale. In Libano, la non-profit OMGYNO lo impiega per fornire informazioni affidabili sulla salute riproduttiva delle donne; in India, la redazione di The Quint lo usa per rispondere ai dubbi dei lettori su disinformazione e truffe.

“Un chatbot che utilizza i dati dell’organizzazione e il suo corpus di conoscenze per formulare le risposte permette di aggirare la riproduzione delle stesse disuguaglianze che esistono online”, spiega Saber. “È qualcosa di cui abbiamo assolutamente bisogno. Inoltre, non stiamo cedendo i dati a nessuno, non cerchiamo di venderli agli inserzionisti e le organizzazioni mantengono la proprietà delle informazioni. Questo è un altro aspetto che, per quanto riguarda la sovranità dei dati, per noi è davvero imprescindibile”. I server di Meedan sono ospitati in Irlanda, in modo che la legislazione applicabile sia quella del GDPR europeo, al momento la più avanzata al mondo in termini di tutela dei dati personali.

L’obiettivo centrale è quello di restituire alle organizzazioni, anche quelle con poche risorse, una agency nell’uso di strumenti di intelligenza artificiale, offrendo al contempo elevati standard di trasparenza. Suwali permette infatti, attraverso la dashboard degli amministratori, di analizzare il percorso logico compiuto dal chatbot, risalendo al “ragionamento” effettuato dal modello per capire quali fonti ha utilizzato e che sintesi ha compiuto. Si può insomma guardare dentro la “black box” del pensiero algoritmico.

Meedan non ha costruito un proprio large language model da zero, ma si appoggia a quelli commercialmente disponibili. “Facciamo uso dei modelli linguistici, tra cui quello di OpenAI, esclusivamente per la formulazione finale delle risposte” spiega Haramoun Hamieh, senior partnership manager. “Il corpus di riferimento, il recupero delle informazioni e il processo con cui vengono selezionate le fonti restano invece interamente gestiti dai sistemi di Meedan. L’ottimizzazione dei modelli open-weight è nei nostri piani per il prossimo futuro”. 

Un’intelligenza artificiale femminista?

Su una filosofia simile è costruito il chatbot AfroféminasGPT, sviluppato dal collettivo omonimo con l’obiettivo di raccogliere e rendere accessibile il pensiero femminista decoloniale. La postura delle sviluppatrici è molto chiara: usare gli strumenti attualmente disponibili e sfruttarne le potenzialità per raggiungere i propri obiettivi. 

“L’IA convenzionale ha come norma implicita la persona bianca e riproduce questo pregiudizio in modo sistematico”, spiega la fondatrice Antoinette Torres Soler. “AfroféminasGPT rompe questa logica. Col tempo abbiamo osservato che il pubblico apprezza molto anche la capacità di basarsi sul lavoro di pensatrici e pensatori afrodiscendenti e afro-femministi. Un elemento particolarmente significativo è che, quando le persone del Sud globale interagiscono con lo strumento, questo assume una prospettiva più vicina alla loro esperienza e restituisce risposte con una precisione e una pertinenza che il mainstream dell’IA non offre”.

“La critica più ricorrente è che lo strumento operi all’interno dell’ecosistema di OpenAI, il che pone limiti reali in termini di sovranità tecnologica. È una critica legittima e me ne assumo la responsabilità” continua Torres Soler. “La posizione da cui lavoro è pragmatica e strategica: bisogna utilizzare gli strumenti disponibili e scalare, progressivamente, verso maggiori livelli di autonomia”.

Afroféminas è un “ecosistema” (così lo definisce Torres Soler) composto da quattro strumenti con funzioni diverse: AfroféminasGPT, il GPT Socratico di Afroféminas (pensato per studenti e insegnanti, che invita a “pensare prima di creare, applicando una conoscenza etica, affettiva e consapevole”), il GPT di Assistenza per i Reati d’Odio e Parla con Afroféminas (Habla con Afroféminas). Quest’ultimo è integrato direttamente su afrofeminas.com ed è accessibile senza la necessità di un account ChatGPT, il che, secondo la fondatrice “rappresenta un primo passo verso una maggiore sovranità rispetto all’infrastruttura di OpenAI”.

Anche AfroféminasGPT non ha accesso a Internet: “Ciò significa che non assorbe continuamente nuovi dati e bias a ogni aggiornamento di ChatGPT. Al contrario, quando cerca una risposta, attinge a una base di conoscenza volutamente circoscritta: un corpus curato di circa venti testi e autorialità fondamentali del pensiero nero e decoloniale. È questo a determinare come argomenta, come ragiona e da quale prospettiva risponde. È ciò che la rende diversa”, conclude Torres Soler.

Costruire un LLM pubblico: il caso di LatamGPT

Nel caso di Meedan e del collettivo Afroféminas, la parziale riprogettazione dei sistemi di IA ha dei chiari limiti di scala: si tratta di piccole organizzazioni, con risorse limitate. Cosa succede, invece, se si ragiona in termini di intelligenze artificiali come infrastruttura pubblica?

Una possibile risposta è stata testata da un consorzio latinoamericano di enti pubblici, università e centri di ricerca con il lancio di LatamGPT, il grande esperimento di modello linguistico collaborativo e open source della regione. LatamGPT è stato lanciato ufficialmente il 26 febbraio 2026 dall’allora presidente cileno Gabriel Boric. Il progetto è coordinato dal Centro Nazionale per l’Intelligenza Artificiale del Cile (CENIA) e ad esso partecipano quindici paesi e oltre 200 ricercatori di varie nazionalità.

Il modello è addestrato su un corpus regionale di oltre 300 miliardi di token (gli elementi linguistici alla base dell’addestramento della IA) provenienti da venti paesi dell’America Latina e dei Caraibi. L’obiettivo è anche quello di colmare un divario linguistico. Al momento, per i modelli commerciali, la percentuale di dati in lingua spagnola e portoghese si attesta infatti intorno al 2-3%.

LatamGPT non è un chatbot direttamente utilizzabile con un’interfaccia, ma un’infrastruttura open source che enti governativi, sviluppatori e istituzioni possono adattare alle loro esigenze educative, sanitarie o di protezione del patrimonio culturale. Si tratta di una base per lo sviluppo di applicazioni, prima che di un’applicazione in sé.

Il valore del progetto sta anche nel suo contributo alla ricerca. Alvaro Soto, direttore del CENIA, ha spiegato, parlando con Wired: “Siamo noi i soggetti indicati per occuparci delle nostre stesse necessità. Non possiamo stare seduti ad aspettare che gli altri abbiano il tempo di chiederci di che cosa abbiamo bisogno. Oggi gli accademici dell’America Latina hanno poche opportunità di interagire profondamente con questi modelli. È come voler studiare la risonanza magnetica senza avere a disposizione un risonatore. LatamGPT vuole essere lo strumento fondamentale che consente alla comunità scientifica di sperimentare e progredire”.

Il ricercatore Eduardo Levy Yeyati ha commentato, in un articolo su Brookings: “Ciò che rende straordinario LatamGPT non è la sua architettura tecnica, ma la sua coordinazione istituzionale. In una regione in cui la collaborazione transfrontaliera spesso si arena, la progettazione di LatamGPT riflette la diversità istituzionale del territorio. Fornisce una base condivisa che può essere ottimizzata per le priorità nazionali, come per esempio documenti legali argentini, cartelle cliniche colombiane e programmi scolastici messicani”.

I limiti dei modelli alternativi

Più che la volontà politica, il problema principale resta l’accesso alle risorse. LatamGPT è stato costruito a partire da Llama 3.1, il modello open-weight di Meta e, nella sua prima fase di sviluppo, ha fatto ricorso anche all’infrastruttura cloud di Amazon Web Services. La dipendenza, almeno iniziale, dalle tecnologie e dalle infrastrutture delle Big Tech appare quindi difficile da evitare.

Non solo: un corpus regionale di oltre 300 miliardi di token è notevolmente più piccolo rispetto alla mole di dati a disposizione dei principali laboratori statunitensi e cinesi. Lo stesso vale per i finanziamenti: il progetto LatamGPT ha raccolto circa 550mila dollari (tra fondi CENIA e quelli della Latin America Development Bank) di investimenti iniziali. Si tratta di cifre irrisorie se paragonate agli investimenti da svariati miliardi di dollari delle aziende statunitensi e cinesi.

Infine, c’è un dilemma simile a quello dell’uovo e della gallina, ma in versione tecnologica: “Gli sviluppatori costruiscono solo se gli utenti cambiano piattaforma, e gli utenti cambiano piattaforma solo se gli strumenti sono migliori”, spiega ancora Levy Yeyati su Brookings. “Risolvere questo problema richiede qualcosa in più delle semplici prestazioni: servono un sostegno istituzionale e un ecosistema regionale, specialmente da parte dei paesi che lavorano per progettare e integrare queste scelte strutturali”.

Insomma, prima di poter davvero costruire alternative concrete alle Big Tech ci sono vari ostacoli da superare, sia tecnici che economici. Le pratiche di riappropriazione, da quelle più piccole a quelle più ambiziose, hanno un significato politico ed etico innegabile. Ma continuano a scontrarsi con un divario di potere, risorse tecniche e investimenti che al momento appare difficile da colmare.

Fonte 

05/07/2026

L’economia dei token e il vero prezzo dell’intelligenza artificiale

Negli ultimi mesi, molte delle aziende che avevano sottoscritto contratti con OpenAI o Anthropic hanno avuto una brutta sorpresa. Lo scorso aprile, la società di noleggio auto con conducente Uber ha per esempio scoperto di aver già bruciato tutto il budget annuale destinato all’intelligenza artificiale. Una situazione simile si è verificata anche dalle parti del gigante dei supermercati Walmart, che ha introdotto in tutta fretta un limite all’utilizzo dei large language model da parte dei suoi dipendenti.

Un’azienda rimasta anonima avrebbe invece speso 500 milioni di dollari in un solo mese a causa dell’utilizzo sfrenato di Claude da parte dei suoi dipendenti, mentre persino un colosso come Meta ha imposto dei limiti all’utilizzo dei sistemi d’intelligenza artificiale generativa, come hanno fatto anche Amazon, AT&T, Brex e numerose altre società.

Che cos’è successo? Non eravamo nell’epoca del tokenmaxxing, ovvero la gara a chi usa di più l’intelligenza artificiale all’interno delle aziende? Per capire come mai la situazione sia cambiata così rapidamente basta sapere che, nel corso della prima metà del 2026, OpenAI e Anthropic hanno entrambi cambiato le condizioni dei contratti aziendali: non più una tariffa fissa anche per usare i loro sistemi più avanzati e specialistici, ma una tariffa a consumo – basata sulla quantità di “token” elaborati dai vari ChatGPT Codex, Claude Cowork e altri ancora – che ha fatto esplodere i costi in maniera imprevista.

E così, praticamente da un giorno all’altro, i token – oggetto fino a poco fa noto soltanto agli addetti ai lavori – sono diventati uno degli argomenti più discussi dai manager di mezzo mondo. A questo punto, fermiamoci un secondo: che cosa sono i token?

Che cosa sono i token, i mattoni alla base dei large language model

In sintesi estrema, i token sono l’unità di testo fondamentale che i modelli linguistici elaborano quando leggono, interpretano o generano informazioni. Nella maggior parte dei casi, un token non equivale a una parola, ma a una porzione di essa (in inglese, in media, quattro caratteri). Può però anche essere un segno di punteggiatura, uno spazio o un carattere speciale. Nel momento in cui un modello deve elaborare la frase “il gattino sta dormendo sul divano?”, la scompone in token con una forma simile a “il / gatt / ino / sta / dorm / endo / sul / divano / ?”.

Ogni volta che un modello linguistico elabora una forma testuale, indipendentemente dall’obiettivo o dalle mansioni per cui è impiegato, sta quindi elaborando una sequenza di token: li trasforma in rappresentazioni numeriche, li confronta con il contesto già ricevuto e calcola quale token abbia maggiore probabilità di venire dopo. È così che risponde a una domanda, riassume un documento, scrive codice o traduce una frase: non “capendo” le parole, ma prevedendo la sequenza di token più coerente con ciò che gli è stato chiesto. È il meccanismo noto come “next token prediction”.

Un po’ come il consumo elettrico si calcola in kilowattora o il traffico internet in gigabyte, il lavoro svolto da un’intelligenza artificiale generativa si misura in token. Con una differenza: il consumo effettivo può crescere molto rapidamente, perché non dipende solo dalla lunghezza della richiesta o della risposta finale, ma anche dalla quantità di informazioni che il modello deve leggere prima di produrla. Una domanda posta all’inizio di una chat con Claude consumerà quindi meno token della stessa domanda inserita in una lunga conversazione, perché il “contesto” che il modello linguistico deve analizzare è, nel primo caso, molto più ridotto.

Un ultimo elemento importante è che i token sono elementi linguistici nel caso degli LLM, mentre nei modelli che generano immagini possono corrispondere a porzioni di immagine, nei modelli audio a frammenti di suono, nei modelli video a sequenze di informazioni che combinano immagini, movimento e durata. Il principio però resta lo stesso: qualunque sia il contenuto generato – testo, voce, musica, immagini o video – il modello non lo elabora come un blocco unico, ma lo scompone in unità più piccole, le trasforma in numeri e lavora su quelle.

Un altro aspetto importante è che nel corso degli anni, grazie alla crescente efficienza dei modelli, il costo dei token è crollato: se nel 2023 il prezzo di un LLM come GPT-4 era di 30 dollari per milione di token in fase di input (quindi il testo che inseriamo noi) e di 60 dollari in output (quindi quello generato dall’IA), oggi GPT-5.5 costa rispettivamente 5 e 30 dollari. Secondo alcune stime, dal 2020 al 2026 i prezzi medi per token sono calati addirittura di 600 volte.

La paradossale economia dei token

Ma se il prezzo dei token è crollato – e possiamo sostenere che sia sceso significativamente anche per le società che sviluppano LLM, pur in assenza di dati trasparenti a riguardo – com’è possibile che il passaggio a una tariffa a consumo abbia fatto esplodere i costi, al punto da consumare in pochi mesi l’intero budget annuale di Uber e costringere Meta a limitare l’uso dell’intelligenza artificiale in ufficio?

La ragione è duplice. Da una parte, i modelli più avanzati e basati sul “ragionamento” – che scompongono la richiesta in più passaggi – consumano molti più token delle loro controparti tradizionali (e spesso forniscono risposte più lunghe). Dall’altra, la diffusione dei modelli linguistici e il loro utilizzo spesso intensivo (e non mirato) hanno provocato un enorme aumento dei token da elaborare. Un singolo dipendente che usa ogni giorno un modello di frontiera può quindi consumare molti più token rispetto anche solo a due anni fa.

Unendo questi due aspetti, si capisce perché Google – come spiegato dal CEO Sundar Pichai – sia passato in un trimestre da 10 a 16 miliardi di token elaborati ogni minuto. OpenAI ha invece dichiarato che la sua piattaforma API (cioè l’infrastruttura attraverso cui aziende e sviluppatori collegano i propri software ai modelli di OpenAI) è passata da 6 a oltre 15 miliardi di token al minuto tra l’autunno 2025 e la primavera 2026, dopo essere già cresciuta di circa venti volte nei due anni precedenti.

Questa impennata del consumo di token è stata a lungo nascosta dalle tariffe fisse ed è invece improvvisamente diventata evidente con il passaggio a una tariffazione a consumo: “L’intelligenza artificiale è oggi la voce di spesa che sta aumentando più rapidamente nei budget aziendali”, si legge in un report Deloitte di inizio anno. “Alcune società hanno affermato che oggi l’IA consuma fino alla metà della loro spesa in tecnologie dell’informazione. Nonostante il prezzo unitario dei token stia calando, la spesa complessiva delle aziende per i sistemi di intelligenza artificiale, e la loro scala di utilizzo, stanno aumentando. Il numero di utenti, la complessità dei modelli e l’intensità dei carichi di lavoro porteranno probabilmente a un maggiore consumo di token e, di conseguenza, a costi più elevati”.

Il passaggio a una fatturazione a consumo è probabilmente il principale responsabile dell’impennata del fatturato di Anthropic, passato dai 4,8 miliardi di dollari del primo trimestre 2026 ai 10,9 miliardi attesi per il secondo trimestre. Sarà però interessante capire che cosa succederà nel trimestre ancora successivo, quando i manager delle aziende avranno definitivamente fatto i conti con le spese fuori controllo per utilizzare Claude Code, Cowork o gli altri sistemi avanzati di Anthropic: “I costi della computazione sono ormai diventati una priorità per i direttori finanziari e per i consigli d’amministrazione”, ha spiegato al Financial Times Costi Perricos, responsabile IA di Deloitte. “[OpenAI e Anthropic] hanno insegnato a utenti e aziende che l’intelligenza artificiale fosse economica o addirittura gratis, ma le cose non stanno affatto così”.

Carter Busse, dirigente della società di software Workato, ha raccontato sempre al Financial Times come l’utilizzo dell’intelligenza artificiale sia esploso tra i suoi dipendenti non appena hanno iniziato a sfruttare gli agenti IA. La brutta sorpresa è arrivata alla prima fattura a consumo di Anthropic: “La nostra spesa è salita improvvisamente di 7 volte e ho pensato: ‘merda, abbiamo creato un mostro’”, ha spiegato Busse, che adesso sta spronando i suoi dipendenti a usare modelli più economici e in modo più responsabile. Ancora più preoccupanti per i colossi dell’intelligenza artificiale sono le dichiarazioni del presidente di Cisco Jeetu Patel: “Il costo dei token è molto più elevato dell’effettivo valore che essi generano su larga scala”.

Il vicolo cieco di OpenAI e Anthropic

Nel momento in cui le aziende iniziano a sobbalzare di fronte alle bollette e a domandarsi se il gioco valga la candela, OpenAI e Anthropic si trovano di fronte a quello che lo stesso Sam Altman ha definito “un enorme problema”. E come si risolve questo problema? Stando alle indiscrezioni, nell’unico modo (per ora) possibile: tagliando i prezzi pur di non perdere clienti, come starebbe per fare OpenAI anticipando una possibile mossa di Anthropic in questa stessa direzione.

Come ha riassunto Ed Zitron sul suo blog, “sono passati meno di tre mesi da quando le aziende hanno iniziato a pagare il vero costo dei servizi basati su LLM e sono già così chiaramente infuriate che sia Anthropic sia OpenAI stanno pianificando di tagliare il prezzo dei loro servizi già in perdita, facendo probabilmente crollare il fatturato mentre aumentano i costi complessivi”.

Il rischio è che i due colossi dell’intelligenza artificiale generativa si trovino alle prese con la più classica alternativa del diavolo: se non tagliano i prezzi, le aziende potrebbero ridurre l’impiego dei modelli linguistici (e come abbiamo visto, parecchie l’hanno già fatto). Se tagliano i prezzi, riducono gli introiti di società già oggi in rosso per decine di miliardi di dollari l’anno.

E qui si crea un secondo vicolo cieco: se le aziende tagliano l’uso dell’IA generativa, a cosa serviranno i 190 gigawatt di capacità elettrica per data center già pianificati, in una corsa globale che secondo McKinsey potrebbe richiedere investimenti fino a 7mila miliardi di dollari entro il 2030? E se invece OpenAI e Anthropic devono tagliare i loro prezzi per non perdere clienti aziendali, come faranno a rispettare i contratti da centinaia e centinaia di miliardi di dollari che hanno sottoscritto con Microsoft, Amazon, Google, CoreWeave e altri fornitori di potenza di calcolo?

Quanto pagheresti per usare ChatGPT?

A questo punto, viene da chiedersi che cosa potrebbe succedere se anche noi utenti comuni di ChatGPT e Claude fossimo costretti a pagare una tariffa a consumo invece di quelle fisse, che per gli usi più intensivi coprono solo una piccola parte dei costi reali.

In verità, qualcosa del genere si sta già verificando. A partire da giugno 2026, gli utenti di GitHub Copilot – ovvero l’assistente IA per scrivere codice collegato alla piattaforma per la condivisione di progetti software di proprietà di Microsoft – sono passati da un abbonamento fisso mensile a un sistema di fatturazione legato anche al consumo di token. Secondo quanto riporta un utente, il prezzo da lui pagato potrebbe salire da 29 fino a 750 dollari al mese; un altro segnala che nel suo caso il costo potrebbe schizzare fino a 3mila dollari.

Attenzione, perché una parte della responsabilità va attribuita al cosiddetto “vibe-coding”, ovvero la scrittura di codice in cui tutti i passaggi tecnici sono affidati all’intelligenza artificiale, aumentando drasticamente il consumo di token. Difficile però incolpare i “vibe-coders” per il loro uso indiscriminato di Copilot, visto che è stata proprio Microsoft a incoraggiarlo e adesso invece lo punisce con bollette fuori controllo.

E se anche OpenAI e Anthropic, conclusa la guerra al ribasso per conquistare gli utenti, dovessero decidere di far pagare i token in base al consumo? È qualcosa che, in realtà, potrebbe avvenire in un futuro non troppo distante, vista la probabile quotazione in borsa di entrambe e la conseguente necessità di ridurre le stratosferiche perdite (per colmare le quali hanno dovuto raccogliere finanziamenti tra i più elevati della storia) e mostrare bilanci in miglioramento.

A questo punto, la domanda sorge spontanea: quanto dovremmo pagare per usare gli strumenti d’intelligenza artificiale se non avessimo a disposizione tariffe fisse tenute artificialmente basse? Una possibile risposta ce la fornisce una simulazione condotta dalla società di analisi SemiAnalysis. Secondo queste stime, il “vero prezzo” (inteso come il prezzo che pagheremmo se fossimo soggetti ad abbonamenti a consumo pari a quelli delle API) di un abbonamento a ChatGPT da 20 dollari al mese potrebbe arrivare fino a 700 dollari, mentre un abbonamento Pro da 200 dollari può raggiungere anche 14mila dollari (situazione simile per Anthropic).

Il vantaggio della Cina

Il problema, insomma, è sempre lo stesso: l’intelligenza artificiale generativa costa troppo e un modello di business sostenibile non è ancora all’orizzonte. È una situazione che riguarda però soprattutto i più avanzati modelli di frontiera sviluppati negli Stati Uniti. E che potrebbe invece avvantaggiare l’ecosistema IA della Cina.

Il segnale più evidente arriva sempre dal consumo di token. Secondo i dati di OpenRouter, a giugno i tre modelli più utilizzati per quantità di token elaborati sono tutti cinesi: MiMo di Xiaomi, MiniMax e DeepSeek. È un segnale di come una quota crescente dell’uso degli LLM – a partire da quello che avviene all’interno di applicazioni, strumenti di lavoro, agenti e servizi aziendali – si stia spostando verso i più economici modelli made in China.

Ad avvantaggiare la Cina è un mix di fattori, tra cui troviamo l’energia meno cara, i data center più economici, le infrastrutture sostenute dallo stato, l’aggressiva concorrenza interna e il fatto che i modelli siano spesso progettati per consumare meno, grazie a scelte di architettura informatica e anche a causa delle restrizioni che impediscono alla Cina di avere accesso ai chip più avanzati. Il vantaggio cinese diventa ancora più evidente guardando i prezzi: i modelli cinesi più usati costano infatti una frazione dei modelli di punta di OpenAI e Anthropic.

Il prezzo per milione di token è però solo una parte del costo reale. Come ha spiegato il ricercatore indipendente Wong Qi Han a CNA, se un modello sbaglia spesso e quindi richiede più tentativi, funziona peggio in una lingua straniera, ha maggiore latenza o pone problemi di sicurezza e compliance, il risparmio iniziale può essere illusorio. In linea teorica, la metrica decisiva non dovrebbe essere il costo per milione di token, ma quanto spendiamo per ottenere un risultato soddisfacente (per gli utenti comuni) o il ritorno sull’investimento (per le aziende). Il problema è che entrambe queste metriche sono estremamente difficili da misurare.

È possibile che i più costosi modelli statunitensi continueranno a essere usati per le attività complesse, mentre quelli cinesi potrebbero conquistare la fascia più ampia del mercato, quella degli usi quotidiani come supporto professionale o assistente personale.

Tutto è bene quel che finisce bene? Non è detto. Per la Cina, il rischio principale è l’eccessiva concorrenza sui prezzi e la compressione dei margini, che potrebbe mettere a rischio la profittabilità di DeepSeek e compagni. Per gli Stati Uniti, il rischio è invece che essere esclusi (a causa dei prezzi elevati) dalla massa dei casi d’uso quotidiani e ad alto volume causerebbe non tanto (o non solo) una riduzione dei potenziali ricavi, ma potrebbe provocare soprattutto una riduzione della potenza di calcolo necessaria.

Considerando le cifre immense che sono investite in GPU, cloud e data center, ritrovarsi con una richiesta di potenza computazionale inferiore alle attese potrebbe trasformare l’attuale corsa alle infrastrutture in un enorme azzardo finanziario. E a quel punto, la temuta bolla dell’intelligenza artificiale potrebbe scoppiare per davvero.

Fonte

11/05/2026

Cosa fa l’intelligenza artificiale in guerra

“La guerra è il dominio dell’incertezza: tre quarti delle cose su cui si basa l’azione bellica giacciono nella nebbia di un’incertezza più o meno grande”. A due secoli di distanza dal trattato di strategia militare Della guerra di Von Clausewitz, potremmo dire che, oggi, uno dei principali obiettivi dell’impiego dei sistemi d’intelligenza artificiale in ambito bellico è proprio quello di dissipare quanto più possibile la celeberrima “nebbia della guerra” teorizzata nell’Ottocento dal generale prussiano.

Navigare e pattugliare territori estesi mediante droni a guida autonoma, riconoscere e classificare rapidamente gli obiettivi che compaiono in video e immagini, ottenere un’analisi predittiva delle minacce, stimare i potenziali danni collaterali, rilevare anomalie. Tutti gli impieghi militari dell’intelligenza artificiale hanno principalmente due scopi: ridurre l’incertezza – raccogliendo, filtrando e interpretando enormi quantità di dati provenienti da sensori, satelliti, droni e sistemi di intelligence – e aumentare la velocità decisionale, valutando le opzioni operative in tempi ridotti, stimando rischi e conseguenze, coordinando le unità e reagendo quasi in tempo reale agli sviluppi del conflitto.

Il paradosso è che questi algoritmi predittivi – che aggregano migliaia di dati di intelligence raccolti da centinaia di fonti diverse – in molti casi rischiano di infittire, invece che diradare, la nebbia della guerra, perché producono una tale quantità di informazioni da rendere la loro interpretazione e gestione particolarmente complessa. Ed è qui che entrano in gioco i modelli linguistici di OpenAI, Anthropic, xAI e, in Europa, Mistral, il cui compito è aiutare a dissipare la coltre di nebbia provocata dall’enorme mole di dati prodotti dai sistemi predittivi.

Il ruolo cruciale dell’IA predittiva

Che cosa fa infatti un chatbot pressoché identico a quelli che usiamo nella vita quotidiana quando è utilizzato in ambito bellico? Prima di tutto, bisogna chiarire alcuni aspetti importanti. Come mostrato anche da un paper della NATO Science and Technology Organization, si tende infatti a fare confusione tra gli impieghi degli algoritmi predittivi (che analizzano dati per individuare schemi, classificare eventi e stimare probabilità future) e quelli invece generativi (capaci di generare probabilisticamente testo, immagini, video o altro).

I large language model non possono riconoscere automaticamente i bersagli, non guidano i missili o i droni, non raccolgono informazioni, non analizzano direttamente i dati dei sensori e non eseguono autonomamente azioni nel mondo reale. La capacità fondamentale di ChatGPT e dei suoi compagni è infatti (provare a) comprendere, elaborare e generare il linguaggio umano sulla base del dataset testuale su cui sono stati addestrati.

Sul campo di battaglia, il grosso del lavoro sporco lo svolgono quindi i sistemi basati su algoritmi predittivi. Due dei casi più (tristemente) noti sono quelli relativi alle piattaforme di intelligenza artificiale massicciamente impiegate dall’esercito israeliano durante l’invasione di Gaza: The Gospel e Lavender.

The Gospel analizza direttamente i dati raccolti tramite intelligence e sorveglianza per identificare obiettivi infrastrutturali – edifici, tunnel, depositi – che vengono poi colpiti dall’esercito. Secondo l’ex capo dell’IDF Aviv Kochavi, questo sistema è in grado di individuare fino a 100 bersagli al giorno: “Per dare una prospettiva”, ha spiegato Kochavi, “in passato ottenevamo 50 obiettivi all’anno”.

Lavender è invece un sistema statistico che assegna a ogni individuo presente nella Striscia di Gaza un punteggio relativo alla probabilità di appartenenza a gruppi armati, elaborando dati provenienti anche in questo caso da intelligence e sorveglianza, oltre a segnali comportamentali e indicatori demografici. Secondo le inchieste del magazine israeliano +972, nel corso del conflitto Lavender ha identificato – con un margine di errore accettato del 10% – circa 37mila palestinesi come potenziali bersagli.

Per quanto invece riguarda gli Stati Uniti (e la NATO), il più diffuso sistema di supporto decisionale (DSS, decision support system) è il Maven Smart System. Sviluppato a partire dal 2017 da Palantir – subentrata dopo il passo indietro di Google, che al tempo aveva rinunciato in seguito alle proteste dei dipendenti – in collaborazione con Amazon (che fornisce in appoggio la piattaforma cloud AWS), una prima versione di Maven è stata impiegata nel 2021 durante il ritiro statunitense dall’Afghanistan. Successivamente è stato utilizzato in supporto a Israele durante l’invasione di Gaza ed è fino a oggi stato impiegato anche per gli attacchi contro l’Iran.

A differenza di The Gospel, Maven non è solo un sistema di AI assisted targeting, ma una piattaforma di comando e controllo che offre anche “consapevolezza situazionale in tempo reale” – ovvero una rappresentazione di ciò che accade sul terreno, comprese posizioni delle forze amiche e nemiche, asset disponibili e minacce attive – e supporto alla pianificazione operativa: dalla generazione e valutazione delle azioni potenziali alla stesura di elementi utili per gli ordini operativi. Secondo gli stessi funzionari della NATO, che hanno siglato nel 2025 un contratto con Palantir per il suo utilizzo, Maven fornisce ai comandanti delle “abilità in stile videogioco” di supervisionare ciò che avviene sul campo di battaglia.

Che cosa fanno i modelli linguistici

E allora i large language model? Prima di vedere i loro usi più avanzati e il modo in cui Claude prima e ChatGPT poi (dopo lo scontro tra Anthropic e il Pentagono) stanno venendo integrati in Maven e in altri sistemi bellici, partiamo dagli impieghi più semplici. In modo non dissimile dai suoi utilizzi civili – ma sfruttando delle versioni appositamente ottimizzate – i modelli linguistici vengono impiegati dagli eserciti per riassumere i manuali operativi, i rapporti delle missioni, i briefing dell’intelligence e altro ancora. Viceversa, possono essere utilizzati anche per generare, a partire dalle indicazioni dei soldati, rapporti, traduzioni, trascrizioni e documentazione di vario tipo.

Durante le esercitazioni, questi sistemi possono anche contribuire alla generazione di scenari bellici; mentre nell’ambito della medicina militare, gli LLM vengono utilizzati per sintetizzare cartelle cliniche e storia medica dei pazienti, consentendo ai medici di campo un accesso rapido alle informazioni essenziali. Possono inoltre essere usati – in maniera simile al “civile” Claude for Healthcare – come strumenti di supporto decisionale, in grado di confrontare opzioni terapeutiche e assistere i medici nelle loro valutazioni.

Nei casi più avanzati, bisogna invece immaginare l’impiego bellico di Claude o ChatGPT come una “interfaccia di conversazione” integrata, per esempio, in Maven Smart System, che permette agli utenti di interpretare più facilmente le informazioni provenienti dalle piattaforme di supporto decisionale. Messa così, può sembrare una cosa da poco. In realtà – come scrive James O’Donnell sulla MIT Tech Review – “è difficile sopravvalutare tutto ciò: l’intelligenza artificiale già da tempo svolge compiti di analisi per i militari, estraendo informazioni utili da un oceano di dati”. Oltre a permettere di navigarli sfruttando il linguaggio naturale e ricevendo risposte immediatamente comprensibili, “l’uso dell’AI generativa permette di ottenere consigli su quale azione intraprendere sul campo, una funzione che sta venendo testata sul serio per la prima volta in Iran”.

Il large language model viene quindi integrato nelle piattaforme predittive per rendere più facilmente comprensibile la complessità delle informazioni da essi ricavate: “Una possibile applicazione potrebbe consistere nell’assistere i comandanti militari nel prendere la decisione giusta alla velocità richiesta, supportando lo staff nello sviluppo, nella valutazione e nella raccomandazione delle opzioni operative disponibili (Courses of Action, COA)”, si legge sulla rivista del Joint Air Power Competence Centre (un centro di ricerca della NATO). “Gli LLM potrebbero inoltre aiutare l’operatore umano nell’analisi e nella valutazione dei dati in tempo reale, accorciando così il ciclo operativo e fornendo un vantaggio decisivo sul campo di battaglia”.

Per fare un (teorico) esempio concreto, possiamo immaginare il seguente scenario: durante un conflitto, i sistemi predittivi rilevano un’anomalia termica in un complesso industriale nemico, i sensori intercettano un picco di comunicazioni crittografate nella stessa area e un drone cattura immagini di veicoli classificati come lanciatori missilistici mobili. Il modello linguistico integrato nella piattaforma di comando incrocia questi dati, provenienti da tre sistemi diversi, con i rapporti di intelligence ricevuti nelle settimane precedenti. In questo modo, individua che lo stesso sito era già stato segnalato come possibile deposito e che il pattern delle comunicazioni somiglia a quelli osservati prima di lanci precedenti. In pochi minuti – anziché nelle ore che servirebbero a un team di analisti – genera un briefing sintetico con tre possibili azioni: attacco, sorveglianza intensificata, richiesta di conferma. Il comandante lo legge, interroga il sistema su ulteriori aspetti specifici e decide il da farsi.

In sintesi, Maven unisce i dati provenienti da satelliti, droni, report di intelligence e segnali radar. Claude o ChatGPT, integrati nella stessa piattaforma, analizzano questi dati, li rendono consultabili in linguaggio naturale e possono fornire suggerimenti sull’azione da intraprendere o la forza da impiegare. Nel corso degli attacchi in Iran, scrive il Washington Post, “Maven ha suggerito centinaia di obiettivi, fornito coordinate di localizzazione precise e dato priorità a questi obiettivi in base alla loro importanza. L’integrazione tra Maven e Claude ha creato uno strumento che sta accelerando il ritmo della campagna, riducendo la capacità dell’Iran di contrattaccare e trasformando una pianificazione delle operazioni che richiedeva settimane in operazioni in tempo reale”. Uno studio della Georgetown University ha invece analizzato i modi in cui il 18° Airborne Corps dell’esercito statunitense utilizza Maven e Claude, concludendo, tra le altre cose, che consente di fare con una squadra di 20 persone ciò che prima ne avrebbe richieste duemila.

Nel 2024 è stata poi siglata una collaborazione tra Anduril – startup che produce armi autonome e semiautonome, come il drone Altius-600M, l’aereo da guerra autonomo Fury e il sottomarino da battaglia Dive-LD – e OpenAI. Come si legge ancora sulla MIT Tech Review, “Anduril addestra da tempo i propri modelli di intelligenza artificiale per analizzare riprese video e dati dei sensori al fine di identificare le minacce. Ciò su cui si concentra meno sono invece i sistemi di AI conversazionale che consentono ai soldati di interrogare direttamente questi sistemi o ricevere indicazioni in linguaggio naturale. Ed è in questo spazio che i modelli di OpenAI potrebbero inserirsi”.

Qualcosa si muove anche in Europa, dove la francese Mistral AI ha siglato alla fine del 2025 un accordo quadro triennale con il ministero delle Forze Armate di Parigi per integrare i propri modelli linguistici nelle operazioni di esercito, marina e aviazione, oltre che in enti strategici come il commissariato per l’energia atomica e il centro di ricerca aerospaziale ONERA. Gli impieghi previsti sono simili a quelli statunitensi: analisi documentale, traduzione, redazione di briefing, supporto decisionale. In questo caso, Mistral sfrutta esclusivamente l’infrastruttura informatica francese, al riparo dai potenziali sguardi indiscreti del cloud statunitense.

Le criticità dell’IA in guerra

In sintesi, i modelli linguistici impiegati in ambito militare sono complementari ai modelli predittivi e spesso integrati nelle stesse piattaforme, permettendo, tra le altre cose, di analizzare con maggiore facilità e rapidità la grande mole di dati raccolta ed elaborata dai sistemi di supporto decisionale.

Che cosa succede, però, quando l’obiettivo principale per il quale si sfruttano questi sistemi di “supporto decisionale” – in cui quindi l’ultima parola spetta agli esseri umani – è aumentare al massimo la velocità con cui si opta per una particolare strategia o si reagisce a uno scenario inatteso? “Avevo a disposizione 20 secondi per ciascun bersaglio, valutandone dozzine ogni giorno”, ha raccontato al Guardian un soldato israeliano che utilizzava Lavender. “Non avevo nessun valore aggiunto come essere umano, se non il fatto di apporre il timbro di approvazione”.

Nel momento in cui la velocità diventa l’imperativo fondamentale, l’essere umano è quasi d’intralcio alla macchina, che quindi da sistema di supporto decisionale rischia di diventare il “sistema decisionale”, mentre i soldati e gli ufficiali si limitano a certificare la loro approvazione alle decisioni prese dalla macchina. Una situazione che è ulteriormente esacerbata dall’integrazione dei modelli linguistici: “Mentre l’interfaccia di Maven costringe gli utenti a ispezionare e interpretare direttamente i dati presenti sulla mappa, i risultati forniti dai modelli generativi sono più semplici da ottenere ma più difficili da verificare”, scrive ancora James O’Donnell.

“Il cambio di paradigma cruciale è che l’IA permette all’esercito statunitense di individuare bersagli alla velocità della macchina invece che a quella umana”, ha spiegato, parlando con il Washington Post, Paule Scharre, vicepresidente del Center for a New American Security. “Il lato negativo è che l’intelligenza artificiale sbaglia e abbiamo bisogno di esseri umani per controllare i suoi output, soprattutto quando ci sono in ballo delle vite”.

Il controllo umano è però tanto indispensabile quanto problematico. Prima di tutto perché, inevitabilmente, riduce la velocità, ma anche perché la capacità degli esseri umani di supervisionare, correggere o ignorare le decisioni della macchina è regolarmente sovrastimata. Le ragioni sono varie e in parte già note: uno studio pubblicato di recente dalla Wharton School definisce “resa cognitiva” il fenomeno per cui gli utenti dei modelli linguistici tendono a dedicare sempre meno tempo alla verifica dei risultati. È una sorta di versione ancora più insidiosa del noto “automation bias”, secondo cui le persone si fidano del giudizio della macchina a causa della patina di oggettività che circonda (erroneamente) questi strumenti statistici e del modo in cui le loro capacità vengono magnificate senza essere adeguatamente problematizzate.

Un altro elemento che sta emergendo è quello del de-skilling causato dalla necessità di prendere decisioni sempre più rapide, che spinge a delegare un numero crescente di responsabilità decisionali alla macchina: “Stiamo riducendo le nostre stesse abilità”, ha spiegato Elke Schwarz, docente del dipartimento di Studi bellici dell’Università di Londra. “I comandanti stanno diventando sempre meno abili a identificare ciò di cui sono responsabili in un campo di battaglia”.

Tutto ciò è ulteriormente complicato dalla tendenza di questi sistemi – ormai accertata e anche ammessa dagli stessi sviluppatori – a dare ragione agli utenti con troppa facilità (fenomeno chiamato AI Sycophancy). Per certi versi, è il contrario dell’automation bias: se nel primo caso sono gli umani che si fidano troppo della macchina, in questo caso sono le macchine che tendono a confermare ciò che gli umani vogliono sentirsi dire, con il rischio che, sul campo di battaglia, i soldati sfruttino questi sistemi, magari inconsapevolmente, per ottenere una conferma di decisioni già prese, indipendentemente dalla loro bontà.

C’è poi il noto e ineliminabile problema delle allucinazioni (quando un sistema di intelligenza artificiale presenta come se fosse certa un’informazione invece sbagliata o completamente inventata), che potrebbero annidarsi in ogni sintesi di report, documento generato a partire dai dati o traduzione. Criticità che diventa ancora più allarmante se combinata alla tendenza dei modelli generativi, recentemente osservata, a prediligere nelle simulazioni l’escalation bellica rispetto a soluzioni più caute.

E questo senza nemmeno aver aperto il fondamentale capitolo dell’etica, della responsabilità (e tracciabilità) decisionale e della trasparenza, soprattutto considerando che – come riporta l’Independent – l’esercito statunitense non tiene traccia del ruolo giocato dall’IA nei singoli attacchi. “Uno stato ha la responsabilità di sapere se l’intelligenza artificiale è stata impiegata in uno qualsiasi dei suoi attacchi”, ha affermato Jessica Dorsey, professoressa di diritto internazionale dell’Università di Utrecht. “I comandanti dovrebbero avere accesso alle informazioni di intelligence su cui si basano i loro attacchi”.

Da questo punto di vista, un recente e tragico episodio avvenuto agli inizi dei bombardamenti sull’Iran riassume perfettamente quanto ciò possa essere problematico. Un numero schiacciante di prove indica che gli Stati Uniti siano responsabili dell’attacco alla scuola di Minab, in Iran, in cui hanno perso la vita 175 persone, la maggior parte delle quali studentesse. Attacco che potrebbe essere stato condotto a causa di dati di intelligence obsoleti, risalenti a quando il sito faceva effettivamente parte di una base navale adiacente delle Guardie Rivoluzionarie iraniane.

Considerando che Maven ha generato oltre mille opzioni di attacco solo nelle prime 24 ore, viene da porsi una domanda: e se l’errore fosse stato causato da una decisione sbagliata dell’intelligenza artificiale (come tra l’altro sospettato), magari a causa di un “pacchetto di bersagli” obsoleto ma che l’IA ha riciclato presentandolo in maniera convincente? Oppure se, più semplicemente, la quantità di bersagli individuati in un tempo rapidissimo non avesse dato ai militari il tempo necessario a verificare che fossero quelli giusti?

L’intelligenza artificiale potrebbe non essere responsabile di questa strage, ma di sicuro sta rendendo più complesso risalire la catena delle responsabilità. Tutti questi rischi e queste criticità vengono sollevate da anni dalle organizzazioni che chiedono di vietare – o almeno regolamentare rigidamente, a livello internazionale – l’impiego dell’intelligenza artificiale in ambito bellico. Quel treno, ormai, sembra però essere passato.

Fonte

04/04/2026

Assalto al trono di Nvidia

A prima vista, le cose per Nvidia non potrebbero andare meglio. Il colosso statunitense delle GPU detiene oggi il 92% di questo specifico settore e una quota pari al 70-75% del più complessivo mercato dei chip impiegati nell’ambito IA. Nel 2025, la società fondata da Jensen Huang ha messo a segno ricavi per circa 200 miliardi di dollari (oltre il doppio di quanto fatturato nell’anno precedente), ha ottenuto guadagni per 32 miliardi nel corso di un unico trimestre e può vantare al momento la maggiore capitalizzazione di mercato al mondo (4.600 miliardi di dollari, contro i 3.900 della seconda classificata Apple).

Un dominio quasi inevitabile, per l’azienda che con le sue GPU – processori nati per l’elaborazione grafica dei videogiochi, ma che si sono dimostrati estremamente efficienti per l’addestramento e l’utilizzo dei sistemi d’intelligenza artificiale – ha reso possibile la rivoluzione del deep learning ed è oggi praticamente l’unica azienda in grado di guadagnare dal complicato, dal punto di vista economico, settore dell’IA generativa.

Il ruolo di Nvidia è talmente centrale che, lo scorso novembre, gli occhi di tutti gli operatori finanziari erano puntati proprio sui suoi risultati trimestrali, perché si temeva che una crescita anche solo leggermente inferiore alle attese avrebbe fatto scoppiare la bolla dell’intelligenza artificiale (pericolo per il momento scongiurato o almeno rinviato).

In questa fase, Nvidia può addirittura farsi carico dell’espansione infrastrutturale del settore dell’IA generativa, essendo diventata il fulcro di un complicatissimo meccanismo di prestiti e finanziamenti che ha ovviamente l’obiettivo finale di vendere un numero sempre maggiore di GPU. Nonostante alcuni inciampi (com’è il caso del promesso investimento in OpenAI, recentemente ritirato), questo meccanismo può essere sintetizzato così: Nvidia presta o investe capitale in startup e grandi sviluppatori di modelli, che utilizzano quei fondi per acquistare infrastruttura di calcolo – spesso proprio GPU Nvidia – alimentando una domanda che in parte contribuisce essa stessa a creare.

Se tutto ciò non bastasse, Jensen Huang ha ultimamente messo in atto la più classica pratica da monopolista della Silicon Valley, iniziando a inglobare le startup che potrebbero in futuro minacciarne la posizione dominante. È il caso del maxi-accordo da 20 miliardi di dollari con cui ha acquistato gli asset tecnologici e ha assunto parte del team di Groq, società che produce chip specializzati – in termini tecnici ASIC – nella fase di inferenza dell’intelligenza artificiale (vale a dire il carico di lavoro svolto durante l’utilizzo dei sistemi generativi).

Basterà tutto ciò a mettere al riparo Nvidia da un numero crescente di concorrenti sempre più agguerriti, che puntano a ridurre la loro dipendenza dalle GPU di Jensen Huang, a produrre chip specializzati dalle prestazioni ancora più elevate (in termini computazionali o di efficienza energetica) e a consentire alla seconda superpotenza tecnologica – la Cina – di liberare tutte le proprie potenzialità?

La minaccia di Google

“C’è la sensazione strategica, tra i clienti e nel mercato complessivo, che la dipendenza da Nvidia, e dai suoi prezzi elevati, debba essere interrotta”, ha spiegato, parlando con El País, l’analista Fernando Maldonado. “Tutti i principali fornitori di servizi cloud stanno progettando i loro specifici chip per compiti differenti. Più in là nel tempo, la quota di mercato di Nvidia potrebbe iniziare a ridursi”.

Dei vari concorrenti che stanno scaldando i motori nessuno è più minaccioso di Google: azienda storicamente leader nel campo dell’intelligenza artificiale, che ha reso possibile l’avvento dei large language model, sviluppando nel 2017 l’architettura Transformer, e che per il loro addestramento sfrutta da sempre una combinazione di GPU Nvidia e delle sue TPU (Tensor Processing Unit), ovvero acceleratori hardware progettati internamente, in collaborazione con Broadcom, e ottimizzati per il calcolo delle reti neurali.

Questa coabitazione di GPU e TPU potrebbe presto giungere al termine: Gemini 3 – il più avanzato large language model di Google – è stato infatti addestrato utilizzando esclusivamente le TPU prodotte dal colosso di Mountain View, prefigurando quindi un futuro in cui Nvidia potrebbe perdere uno dei suoi più importanti clienti. Ma c’è altro: Google ha infatti iniziato a stringere accordi commerciali che consentono a varie società del settore di utilizzare le proprie TPU al posto delle GPU di Nvidia.

Il più importante di questi accordi è stato stipulato a ottobre 2025 e prevede che Anthropic – una delle principali realtà dell’intelligenza artificiale e sviluppatrice di Claude – spenda “decine di miliardi di dollari” per accedere fino a un milione delle TPU di Google. Un accordo simile, ma su scala più ridotta, è stato siglato con la startup Safe Superintelligence (fondata dall’ex di OpenAI Ilya Sutskever).

Fino a oggi, gli sviluppatori di intelligenza artificiale potevano accedere alle TPU soltanto attraverso i data center di proprietà di Google, rendendoli così dipendenti dal suo ecosistema cloud e consentendo una flessibilità molto inferiore rispetto alle GPU di Nvidia, che si acquistano invece fisicamente e poi si sfruttano a piacimento (al netto della lunghissima lista d’attesa). Adesso la situazione è cambiata: Google ha da pochissimo iniziato, secondo le ultime notizie, a vendere direttamente i propri acceleratori.

Tra i clienti troviamo ancora una volta Anthropic (con un acquisto completato da dieci miliardi di dollari e un secondo ordine da 11 miliardi già concordato) e secondo le indiscrezioni anche Meta, che collocherebbe fisicamente le TPU nei propri data center, dove fino a oggi avevano trovato spazio soprattutto le GPU di Nvidia. È questa evoluzione di Google, che si sta quindi trasformando in un vero e proprio produttore di chip, ad aver fatto salire le sue azioni quasi del 50% negli ultimi sei mesi, mentre quelle di Nvidia hanno fatto registrare soltanto un +5%.

“La capitalizzazione di mercato è cresciuta di quasi mille miliardi a partire dall’ottobre scorso, anche grazie alla decisione di Warren Buffett di acquistare 4,9 miliardi di azioni durante il terzo trimestre del 2025 e al più generale entusiasmo di Wall Street per le iniziative di Google nel campo dell’intelligenza artificiale”, si legge su Bloomberg. “Google è sempre stato il vero outsider nella corsa dell’intelligenza artificiale. Un gigante per qualche tempo dormiente, ma che adesso si è pienamente risvegliato”.

Amazon e non solo

Google è sicuramente il rivale più temibile per Nvidia, ma non è l’unico. Ormai da qualche tempo, Amazon (per la precisione AWS) ha iniziato a sviluppare acceleratori per l’intelligenza artificiale – chiamati Trainium – e dall’anno scorso li sta usando nei propri data center, vendendo l’accesso a svariate realtà del settore. Tra queste troviamo ancora una volta Anthropic, la società di “data intelligence” Databricks, l’azienda giapponese di servizi per l’assistenza clienti Karakuri e parecchie altre. Stando alle dichiarazioni del CEO di Amazon Andy Jassy, gli introiti garantiti dai chip Trainium e Graviton (classiche CPU usate internamente in ambito cloud) sono oggi di “circa 10 miliardi di dollari” e crescono “a tripla cifra” anno dopo anno.

Come spiega il New York Times, “sebbene non siano potenti come quelli di Google o Nvidia, Amazon sta installando il doppio dei suoi chip all’interno di ciascun data center, nella speranza di offrire maggiore potenza computazionale usando la stessa quantità di energia” (grazie alla loro migliore efficienza energetica, ndA). Al momento, Anthropic è l’unico vero grande cliente dei Trainium di Amazon, ma in futuro le cose potrebbero cambiare: “Gli esperti ritengono che una partnership di questo calibro possa prefigurare cambiamenti ancor più importanti: quando Anthropic utilizza i chip di Amazon o di Google mostra al resto del mercato che le GPU di Nvidia non sono l’unica opzione”.

Al contrario: le alternative continuano ad aumentare. La CEO di AMD, Lisa Su, aveva annunciato qualche mese fa l’intenzione di centrare la produzione aziendale sull’IA generativa, scommettendo che la “domanda insaziabile di capacità di calcolo” non si sarebbe esaurita nel giro di pochi trimestri. Finora i numeri sembrano darle ragione: la capitalizzazione di mercato di AMD è quasi quadruplicata, superando i 350 miliardi di dollari, e l’azienda ha firmato accordi rilevanti per fornire chip a OpenAI e Oracle.

Anche Broadcom si sta ritagliando uno spazio crescente grazie alla produzione di chip – le cosiddette XPU – progettati per compiti di calcolo specifici, oltre a hardware di rete indispensabile per collegare tra loro i giganteschi rack di server che popolano i data center dell’IA. Intel, uno dei nomi storici della Silicon Valley, ha clamorosamente mancato la prima ondata dell’I Agenerativa, ma sta adesso investendo massicciamente sia nella progettazione sia nella produzione di processori avanzati per i data center, nel tentativo di recuperare terreno. E infine c’è Qualcomm, tradizionalmente associata ai chip per smartphone e automobili, ma che nell’ottobre scorso ha annunciato il lancio di due nuovi acceleratori per l’intelligenza artificiale, l’AI200 e l’AI250, caratterizzati da un’attenzione particolare all’efficienza energetica.

L’ascesa delle startup

La scommessa è quindi duplice: da una parte che la richiesta di processori da utilizzare nell’ambito dell’intelligenza artificiale continuerà ad aumentare; dall’altra che si aprano maggiori opportunità per chi produce hardware specializzato, laddove fino a oggi hanno dominato i processori programmabili e generalisti di Nvidia. “Se si osserva il tasso di crescita del settore, si vede [aumentare la domanda] di hardware specializzato”, ha spiegato Alex Davies, CTO della società finanziaria Jump. “È sempre stato così in tutta la storia dell’ingegneria: si inizia con qualcosa di più generico, poi si cresce a grandissima velocità e alla fine qualcuno capisce che non si può avere un unico prodotto per tutto”.

Fino a questo momento, la versatilità delle GPU ha rappresentato il principale vantaggio di Nvidia, che attraverso la piattaforma software CUDA consente di programmare i suoi processori in base alle specifiche esigenze aziendali, fidelizzando inoltre una vastissima schiera di programmatori. I chip di uso generale hanno però i loro svantaggi: “C’è un costo energetico da pagare, perché ci sono parti del processore che non si utilizzano per ciò che serve ma consumano comunque energia”, ha spiegato ancora Maldonado a El País.

Considerando quanto sta crescendo il mercato, c’è sicuramente spazio per tutte le soluzioni: dai processori generalisti e programmabili di Nvidia fino alle architetture ASIC più specifiche. Nel complesso, si stima che il giro di affari degli acceleratori per sistemi d’intelligenza artificiale dovrebbe crescere del 16% su base annua fino a raggiungere i 604 miliardi di dollari nel 2033: “Certo, Nvidia continuerà a controllare una parte significativa del mercato, ma anche una piccola percentuale può valere miliardi di dollari”, ha spiegato al New York Times l’analista Jordan Nanos.

Mentre i colossi si riorganizzano per aumentare la loro presenza in questo ricchissimo mercato, una serie di startup ambisce a conquistare una fetta della torta, presentando nuove soluzioni: Cerebras è una startup californiana, guidata da Andrew Feldman, che progetta processori creati esclusivamente per l’intelligenza artificiale. Processori, tra l’altro, dalle dimensioni inusuali: “Il nostro chip è grande quanto un piatto da tavola, mentre quello di una GPU ha le dimensioni di un francobollo”, ha spiegato Feldman parlando con l’Economist.

Potrebbe sembrare una mossa controintuitiva, visto che il progresso tecnologico è sempre stato anche una corsa alla miniaturizzazione. Eppure, Cerebras permette di usare un solo, enorme chip laddove con le GPU di Nvidia bisogna collegarne un gran numero. Questo permette alle connessioni tra i vari core presenti nel chip di operare migliaia di volte più rapidamente di quanto avviene con le connessioni tra GPU separate.

Il suo Wafer-Scale Engine 3 (WSE-3) – il più grande chip per IA mai costruito, con circa 4mila miliardi di transistor e 900mila core – è attualmente impiegato da OpenAI (per Codex-Spark, un LLM ottimizzato per la generazione di codice), Mistral, Perplexity e anche dai laboratori scientifici statunitensi (che lo hanno impiegato, per esempio, nell’ambito della “simulazione molecolare dinamica”). Una lista di clienti impressionante, che ha convinto gli investitori a finanziare Cerebras con un miliardo di dollari per una valutazione da 23 miliardi.

Cerebras non è però l’unica startup che partecipa alla grande corsa per ritagliarsi uno spazio nel mondo degli acceleratori per IA. Un’altra realtà californiana, fondata da ex ingegneri di Google, è MatX, che sta sviluppando processori che mirano a fare piazza pulita di tutti gli elementi delle GPU non necessari per l’addestramento degli LLM. In poche parole, MatX punta a creare processori che facciano meno cose, ma in maniera più efficiente. La startup nata nel 2022 ha appena raccolto oltre 500 milioni di dollari in un nuovo round di finanziamento e punta a completare il design del suo chip nel 2026, con spedizioni previste nel 2027. L’elenco delle startup include anche le statunitensi d-Matrix e SambaNova, l’israeliana Hailo, la britannica Graphcore (acquistata nel 2024 da SoftBank), la canadese-statunitense Tenstorrent e tantissime altre.

La Cina punta all’autosufficienza

Le maggiori sorprese per Nvidia potrebbero però arrivare dall’altro lato del Pacifico. Non è un caso che Jensen Huang abbia pubblicamente espresso la sua contrarietà alle sanzioni che impediscono la vendita delle GPU più avanzate alla Cina (per quanto recentemente allentate), argomentando che questa politica rischia di accelerare la corsa della Repubblica Popolare per rendersi del tutto autonoma dai processori statunitensi (e quindi intaccando il fatturato di Nvidia, proveniente per il 13% dal mercato cinese).

Che la Cina sia dietro agli Stati Uniti soltanto di “pochi nanosecondi” – come affermato dallo stesso Huang – è un’esagerazione, ma i progressi fatti dai produttori di chip del colosso asiatico sono molto significativi. Al momento, le prestazioni del modello H20 – il chip più potente che Nvidia può vendere in Cina, variante dell’H200 – sono già state ampiamente superate da numerosi processori cinesi, tra cui l’Ascend 910C di Huawei e il BW1000 di Hygon (per capacità di calcolo grezza e al netto di un maggiore consumo energetico).

Probabilmente proprio allo scopo di aumentare l’adozione di chip autoctoni, Pechino sta adesso a sua volta ostacolando l’acquisto dei chip Nvidia da parte delle aziende cinesi, complicando ulteriormente una situazione già molto difficile. In sintesi: al momento gli Stati Uniti hanno riammesso la vendita dei processori H20, ma è ora la Cina che ne blocca l’acquisto da parte delle sue aziende, adducendo ragioni di sicurezza nazionale.

La situazione è caotica e in continua evoluzione, ma l’impressione è che la Cina voglia approfittare della guerra commerciale per aumentare la quota dei suoi campioni nazionali (Huawei, Hygon, Cambricon, MetaX), che oggi detengono il 40% del mercato – per un valore di circa 38 miliardi di dollari – e che potrebbero crescere fino al 50% nel giro di un paio d’anni. Dal punto di vista tecnologico, un aiuto importante potrebbe giungere dai progressi fatti dalla Semiconductor Manufacturing International Corporation (SMIC): l’azienda cinese che si occupa di fabbricare concretamente i chip progettati da Huawei e dagli altri.

SMIC è oggi il cuore della strategia industriale cinese nel campo dei processori. Secondo alcuni report, l’azienda sarebbe ormai in grado di produrre anche chip a 5 nanometri, seppur con costi più elevati e rese inferiori rispetto a quelli realizzati dal colosso taiwanese TSMC per i marchi occidentali, le cui dimensioni hanno da poco raggiunto la soglia dei 2 nanometri. Allo stesso tempo, Huawei starebbe investendo per dare vita a delle proprie strutture produttive, diventando quindi un concorrente di SMIC con l’obiettivo di far progredire ulteriormente la capacità cinese di produrre chip avanzati.

Ci vorrà ancora parecchio tempo prima che le prestazioni dei chip cinesi possano effettivamente raggiungere quelle statunitensi, ma i timori di Jensen Huang sono fondati: SMIC, Huawei e gli altri campioni di Pechino o Shenzhen stanno facendo rapidi e importanti passi avanti. E un domani potrebbero contribuire ad allargare le crepe del dominio di Nvidia.

Fonte

19/07/2025

Come ti riconosco un LLM in 7 personaggi

di Walter Quattrociocchi

Da un po’ di tempo stiamo provando a fare chiarezza sui temi della data science – abbiamo anche scritto un libello.

Ultimamente, vista la confusione crescente, ci stiamo concentrando molto sui LLM (Large Language Model).

Cerco di raccontare quello che so, quello che sto studiando, e quello che ho capito finora. Mi diverte, spero sia utile, ma a volte è strano. È un po’ una commedia dell’assurdo. Ogni volta che si apre una discussione, il dibattito si popola sempre degli stessi personaggi. Provo a descriverli.

Il tecnoentusiasta riscattato.

Per lui l’LLM è una rivincita. Non ha mai avuto gli strumenti per capire davvero le cose, ma adesso si sente competente perché la macchina gli dà risposte articolate. Non distingue tra plausibilità e conoscenza. Se l’output è ben scritto, per lui è vero.

Poi c’è il supercazzolista sistemico.

È quello che parla di “System-0”, “cognizione emergente”, “intelligenza simbiotica”. Ha letto tre articoli di blog e un libro divulgativo, li ha scambiati per letteratura scientifica, e adesso gira per conferenze spiegando che i token sono come neuroni. Spesso fa più danni del primo, perché veste di tecnicismo quello che è puro aneddoto.

Il terzo è il filosofante post-tutto.

Non discute mai dei modelli. Discute delle parole. Dice che bisogna ridefinire “pensiero”, “intelligenza”, “mente”, “mento”, “menta”, “rosmarino”, “juve”, “scudetto”, e che non possiamo escludere nulla a priori, manco i priori. Se provi a parlare di architetture o funzioni obiettivo, ti risponde che il linguaggio è performativo.

Poi c’è il luddista apocalittico.

Non sa cos’è un transformer, ma è convinto che stiamo creando un dio o un mostro. Mescola fantascienza, etica e panico morale. Di solito non ha mai scritto una riga di codice né letto un paper, ma ha un’opinione forte su tutto. E si inventa delle frasi assurde piene di tecnicismo per far vedere che ne capisce.

Segue poi, a volte, ma per fortuna sempre più raro, l’umanista sentimentale.

È quello che dice “questa macchina non potrà mai scrivere come me”, ma poi la usa per scrivere le email, le bio, i titoli delle slide. Difende l’umanità del linguaggio, ma non sa distinguere un embedding da un rastrello. A volte scrive testi peggiori dell’LLM, ma ci tiene a dire che “c’è l’intenzione dietro”.

Il professore tardivo.

Ha scoperto l’intelligenza artificiale nel 2023, ma adesso ci tiene a spiegarti perché è tutto riconducibile a Peirce, a Vico o a Busto Arsizio. Fa lezione su concetti che non ha mai testato. Cita Wittgenstein, Marx e lo Zen e l’Ukulele ogni tre frasi, ma non conosce il meccanismo di attention. Il suo corso ha “AI” nel titolo – che sta per “AI studenti” – e nel syllabus c’è solo letteratura secondaria, quasi interamente riconducibile all’epoca babilonese.

Infine, il prompt engineer autoproclamato.

Ha fatto un corso da autodidatta. Ha messo “prompting” nel profilo LinkedIn prima ancora di capire cosa stava ottimizzando. Fa corsi su come “parlare alla macchina”, ma non ha idea del fatto che l’LLM non sta ascoltando, sta solo completando sequenze di testo. Ti vende “prompt magici” per ottenere risultati che il modello avrebbe dato comunque.

Tutti questi personaggi, pur diversi, hanno un tratto in comune: parlano dell’output, ma ignorano il processo. Discutono l’effetto, non la struttura.

Allora, giusto per fare chiarezza: come funziona davvero un LLM?

Genera testo un token alla volta, scegliendo ogni volta la parola più probabile da mettere subito dopo quelle già scritte.

Non ha in mente l’intera frase, né un significato globale da trasmettere. Procede in modo sequenziale, chiedendosi: “dato quello che ho già scritto, quale parola viene di solito dopo in casi simili?”

Questo approccio si chiama autoregressivo. Significa che il modello usa il testo precedente per prevedere il testo successivo, costruendo la frase un pezzo alla volta.

Il modello è stato addestrato leggendo enormi quantità di testo, imparando a riconoscere le regolarità statistiche nelle sequenze di parole.

Non costruisce una rappresentazione del contenuto, non ragiona sul significato. Semplicemente, riproduce pattern linguistici appresi.

Di default, non ha accesso a conoscenze esterne. Alcuni modelli possono essere connessi a strumenti esterni (come database o motori di ricerca), ma queste fonti non diventano parte strutturale del modello: restano accessi temporanei al contesto.

Il criterio che guida la generazione non è la verità, la coerenza logica o la pertinenza rispetto a un obiettivo. È la plausibilità linguistica: scegliere, a ogni passo, la parola che “suona giusta” data la storia precedente.

Questo spiega perché può generare risposte credibili e ben scritte anche su temi che non “conosce”: sta imitando il modo in cui quei temi sono stati trattati nei testi su cui è stato addestrato.

E spiega anche perché può dire cose false con sicurezza: se una bugia è stata scritta abbastanza spesso, per lui è una sequenza plausibile.

Non ha un modello del Mondo.

Non separa in modo esplicito input, conoscenza e obiettivo: tutto è trattato come una sequenza di testo da completare.

Non rappresenta simbolicamente, non ragiona, non verifica.

Non ha intenzione, memoria o controllo interno.

L’output è plausibile. A volte è corretto, a volte no. Ma il criterio con cui viene prodotto è sempre lo stesso: continuità statistica rispetto ai dati visti durante l’addestramento.

Si parla spesso di “emergenza” per descrivere il fatto che, man mano che questi modelli crescono di dimensione, iniziano a fare cose che prima non facevano: risolvere problemi logici, fare calcoli, rispondere a domande complesse.

A prima vista sembra che “a un certo punto succeda qualcosa”. In realtà, quasi tutto quello che oggi chiamiamo emergente è il risultato di una combinazione di due fattori: più dati e maggiore capacità parametrica.

Non c’è un salto qualitativo, ma un accumulo di correlazioni sempre più sottili che portano a comportamenti più raffinati.

Nel senso tecnico del termine, l’emergenza dovrebbe implicare l’apparizione di una struttura nuova, più semplice e stabile, che nasce da un sistema molto complesso.

Nei LLM, invece, si tratta per lo più di prestazioni che migliorano gradualmente e che, con gli strumenti giusti, possiamo anche prevedere.

Quando sembra “intelligente” è perché le correlazioni imparate riflettono pattern linguistici umani. L’apparenza concettuale è un effetto di superficie, non il risultato di una struttura interna di ragionamento.

Il sistema non sa cosa sta dicendo. Sta solo proiettando, token dopo token, la sequenza più probabile.

Anche gli avanzamenti più recenti – finestre contestuali più ampie, retrieval aumentato, strumenti esterni – non cambiano questa architettura di base.

Restano modelli di plausibilità linguistica, non sistemi cognitivi. Non ragionano, non decidono, non capiscono.

Capirlo non serve a sminuire. Serve a usare bene.

Delegare funzioni cognitive a un sistema che cognitivo non è, richiede più consapevolezza di quanta ne vedo in giro.

Fonte