AMD, World Labs e la physical AI: l’intelligenza torna nel mondo
Hans Moravec, negli anni Ottanta, notò una cosa che ancora oggi mi sembra la chiave per leggere quasi tutto quello che succede nell’intelligenza artificiale: per un computer è facile ciò che per noi è difficile, giocare a scacchi o risolvere un’equazione, ed è difficilissimo ciò che un bambino di due anni fa senza pensarci, come prendere una tazza senza romperla o attraversare una stanza piena di giocattoli. Il 28 settembre AMD ha annunciato l’acquisizione di World Labs, il laboratorio fondato da Fei-Fei Li, con un’operazione in azioni da circa 8,2 miliardi di dollari, e la leggo come la prima vera scommessa industriale di un produttore di chip sul lato difficile del paradosso di Moravec.
La physical AI, l’intelligenza artificiale che percepisce e agisce nello spazio attraverso robot, macchine e sensori, fino a ieri era una promessa da conferenza. Da questa settimana è una voce di bilancio da otto miliardi nel conto di chi progetta i processori su cui girerà il prossimo decennio.
ImageNet e il ritorno della visione
C’è una simmetria che trovo quasi letteraria. Fei-Fei Li è la ricercatrice che con ImageNet, alla fine degli anni Duemila, ha dato alle reti neurali abbastanza immagini da imparare a vedere, e da quella scintilla, insieme alle GPU, è partita la stagione moderna del deep learning. Poi l’AI ha preso un’altra strada, quella del linguaggio, e per tre anni abbiamo misurato il progresso in token, in parole generate, in chatbot sempre più eloquenti chiusi dentro uno schermo.
Li ha fondato World Labs all’inizio del 2024 proprio contro questa deriva testuale. Nel post con cui annuncia l’ingresso in AMD scrive che l’universo è fatto di cose reali e non di parole, e che senza uno sforzo dedicato sull’hardware l’AI resta prigioniera del mondo digitale. È una frase che avrei voluto scrivere io, perché è il filo di tutto quello che ho provato a raccontare in Spatial Shift: il calcolo che esce dallo schermo e si deposita nello spazio che abitiamo.
Dal token al gesto nel silicio AMD
Per trent’anni l’informatica ha fatto un solo movimento, prendere il mondo e ridurlo a dati. Abbiamo digitalizzato documenti, immagini, relazioni, perfino il corpo, e ne ho scritto in Pelle Digitale quando raccontavo di una pelle fatta di sensori e notifiche. Con i world model il movimento si inverte: un modello come Atlas, presentato da World Labs a inizio settembre, prende due o tre fotografie e restituisce uno spazio tridimensionale coerente, dentro cui un robot simulato può muoversi, sbagliare, riprovare. I dati tornano a essere mondo.
Il salto che mi colpisce di più però arriva da SceniX, la società di simulazione robotica che World Labs ha assorbito a luglio. Secondo quanto pubblicato dall’azienda, alcune politiche di controllo sono state addestrate interamente in simulazione, con zero dati raccolti nel mondo reale, e poi hanno lavorato su robot veri per un’ora di fila senza interventi umani, infilando cavi elastici o estraendo matite da un mucchio disordinato. Sono risultati dichiarati, ancora da verificare in modo indipendente, ma se verranno confermati da laboratori terzi raccontano che l’esperienza fisica, la cosa più rara e costosa della robotica, sta diventando qualcosa che si genera in un data center.
Ecco perché un’azienda di chip paga otto miliardi per un laboratorio che non ha ricavi. L’unità di valore dell’AI si sta spostando dal token al gesto, dalla parola scritta all’azione compiuta nello spazio, e chi disegna il silicio ha bisogno di sapere oggi come saranno fatti i modelli che nel 2029 dovranno far camminare, afferrare e ispezionare. L’analista Patrick Moorhead l’ha chiamata un’acquisizione di comprensione dei modelli: AMD compra la possibilità di vedere il futuro dei carichi di lavoro prima dei concorrenti.
Atlas come fabbrica di esperienza
Provo a spingere il ragionamento un passo più in là. Se l’esperienza si può generare, la risorsa strategica della prossima fase smette di essere il dato raccolto dal web e diventa il mondo simulato: ambienti, fisica, varianti di luce e di disordine, milioni di prove che nessun robot potrebbe compiere nella realtà. Chi possiede le fabbriche di esperienza possiede la capacità dei robot che da quelle fabbriche escono addestrati, un po’ come chi possedeva gli indici del web ha posseduto per vent’anni l’accesso all’informazione.
È qui che l’operazione di AMD si salda con quella di Nvidia, che a inizio settembre ha firmato per comprare Hugging Face per circa 12,9 miliardi. In un mese i due grandi costruttori di acceleratori sono saliti dal silicio ai modelli, uno comprando il più grande archivio di modelli aperti, l’altro uno dei laboratori più avanzati sui mondi tridimensionali. Credo che tra qualche anno chiameremo questa fase il momento in cui le aziende di chip hanno smesso di vendere pale ai cercatori d’oro e hanno cominciato a comprarsi le miniere.
L’edge di AMD non è una periferia
La seconda metà della storia si svolge lontano dai data center. A luglio AMD ha lanciato i Ryzen AI Embedded X100, processori pensati per stare dentro i robot, con CPU, GPU e acceleratore neurale sullo stesso chip e un ciclo di vita di dieci anni, come si chiede a un componente industriale. La divisione del lavoro che si intravede è netta: nel data center si generano i mondi e si addestrano i comportamenti, sull’edge, cioè a bordo della macchina, quei comportamenti vengono eseguiti in millisecondi, senza connessione, con un consumo che una batteria può sostenere.
Siamo abituati a pensare l’edge come la periferia del cloud, il posto dove arrivavano le briciole del calcolo. Nella physical AI l’edge diventa il luogo dove l’intelligenza accade davvero, perché è lì che un braccio decide se stringere o lasciare, ed è il territorio esatto del paradosso di Moravec, dove un errore di cinquanta millisecondi è una tazza rotta. Secondo me il mercato dei processori per robot, nel giro di cinque anni, somiglierà a quello dei chip per smartphone del 2010: pochi fornitori, volumi enormi, una battaglia feroce per diventare la piattaforma su cui gli sviluppatori scrivono.
Il 2030 di chi abita il mondo fisico
Metto in fila le previsioni, sapendo che almeno una sarà sbagliata. Entro il 2030 la maggior parte delle ore di addestramento dei robot industriali avverrà in simulazione, e la prova sul campo diventerà il collaudo finale più che la scuola. I produttori di chip venderanno sempre meno componenti e sempre più piattaforme complete, dal mondo simulato al processore di bordo, e AMD proverà a farlo con modelli aperti, perché è l’unico modo per rompere l’abbraccio in cui Nvidia tiene gli sviluppatori. E le aziende manifatturiere, quelle italiane comprese, scopriranno che il loro patrimonio più prezioso sono i reparti, i magazzini e i gesti degli operatori, ossia la materia prima da cui si costruiscono i mondi su cui i robot imparano.
Quest’ultimo punto è quello che mi sta più a cuore, e ne parlo spesso con le aziende che seguo come advisor. Nell’era del linguaggio l’Europa ha scoperto tardi di aver regalato i propri testi ai modelli altrui. Nell’era del mondo fisico il rischio è regalare le proprie fabbriche, digitalizzate in ambienti simulati che girano su piattaforme americane. Avevo iniziato a ragionarne quando scrivevo che l’AI inizia a immaginare il mondo, e l’acquisizione di questa settimana rende quella riflessione molto meno teorica.
Moravec aveva ragione quarant’anni fa e ha ragione ancora oggi: la parte difficile dell’intelligenza è quella che facciamo senza pensarci, con le mani e con il corpo. Per decenni l’abbiamo lasciata da parte perché i computer erano bravi in tutt’altro. Adesso un’azienda che progetta chip ha deciso di mettere quella parte al centro del proprio futuro, e chi ha un capannone, una linea produttiva o un reparto ospedaliero farebbe bene a considerarsi, da oggi, un fornitore di mondo.
Fonti: AMD, «AMD to Acquire World Labs to Advance the Future of AI Compute»; Fei-Fei Li, «To Seek a Newer World»; World Labs, «Atlas: A World Model for Spatial Intelligence».






