Nel 2019 vi raccontammo che alcune città si stavano costruendo un gemello virtuale per testare in anticipo strade, edifici, reti idriche. All’epoca sembrava un esperimento di nicchia per urbanisti col pallino della simulazione. Sette anni dopo, quella stessa idea (tradurre lo spazio fisico in dati tridimensionali che una macchina può leggere) muove un mercato da centinaia di miliardi e sta dentro il visore che Apple vi vende come il futuro del lavoro d’ufficio. Il nome tecnico è computer spaziale (spatial computing, o più precisamente 3D computer vision quando si parla del lato percettivo).
In pratica: è la capacità di un sistema, umano o macchina che sia, di capire non solo “cosa” c’è in una scena ma “dove”, “quanto è grande” e “come si relaziona con il resto”. È la differenza tra guardare una foto e camminare in una stanza, e trasformerà tutto quello che conosciamo.
Perché un’immagine piatta non basta più
Per un decennio la computer vision ha funzionato bene su un compito preciso: guardare una griglia di pixel e riconoscerci dentro un pattern, un oggetto, una targa. Utilissimo per un controllo qualità in fabbrica. Inutile se devi sapere quanto è largo un corridoio, se dietro quello scaffale c’è spazio per un pallet, o se il drone che stai pilotando sta per infilarsi in un crepaccio che dalla foto non si vede.
Un’immagine 2D butta via esattamente l’informazione che serve per muoversi nel mondo reale: la profondità. E quando il problema diventa “misura”, “naviga” o “confronta questo posto oggi con questo posto tra tre mesi”, la fotografia smette di bastare da sola. Serve un modello dello spazio, non una sua istantanea.
Come nasce il computer spaziale: i sensori che catturano la profondità
Non esiste un sensore universale, e questo è il primo dettaglio che i comunicati stampa tendono a saltare. Le telecamere stereo stimano la profondità confrontando due punti di vista leggermente sfalsati, un po’ come fanno i vostri due occhi: economiche, efficaci a corto e medio raggio. I sensori Time-of-Flight misurano quanto impiega la luce a rimbalzare su una superficie, utili nel raggio ravvicinato. Il LiDAR spara impulsi laser e costruisce nuvole di punti precise anche a grande distanza: è la tecnologia che nel 2023 vi raccontammo aver rivelato in Amazzonia migliaia di strutture antiche nascoste sotto la foresta, e oggi è lo stesso principio che guida i carrelli autonomi nei magazzini di mezzo mondo. Poi ci sono i sensori RGB-D, che uniscono colore e profondità in un solo dispositivo, e infine la stima monoculare: reti neurali che indovinano la profondità da una singola foto normale, senza hardware speciale, pagando in precisione quello che guadagnano in semplicità.
La scelta tra questi sistemi non è mai neutra. Un cantiere all’aperto e un robot che si muove in un corridoio d’ospedale hanno esigenze di portata, luce e budget agli antipodi, anche se il risultato finale, “un modello 3D dello spazio”, si chiama allo stesso modo in entrambi i casi.
Il mercato ha due velocità
Le stime sul mercato dello spatial computing (inteso come interfacce e hardware indossabile) oscillano tra i 260 e gli 830 miliardi di euro entro il 2028-2033 a seconda dell’analista, con una crescita annua stimata tra il 18% e il 23%.
I nomi che tornano sempre sono gli stessi. Apple con Vision Pro, Meta con Quest, Microsoft con HoloLens, Google con ARCore, Nvidia con Omniverse per la simulazione industriale. Parallelamente, il solo mercato dei robot mobili autonomi (che usano LiDAR e SLAM per orientarsi) vale oggi circa 1,7 miliardi di euro e punta a superare i 3,7 miliardi entro il 2028.
Da notare: sono due mercati diversi, con velocità diverse, che condividono la stessa tecnologia di fondo. Perché alla fine il computer spaziale non è un prodotto: è un livello dell’infrastruttura.
Dal punto alla comprensione: come funziona davvero la pipeline
Catturare la profondità è solo il primo passo. I dati grezzi dei sensori diventano prima una nuvola di punti, un insieme di coordinate 3D che rappresentano le superfici della scena. Poi arriva la fase di registrazione: dati raccolti da più angolazioni o più sensori vengono allineati in un sistema di coordinate unico. Qui basta un errore di calibrazione minimo per far collassare tutto il resto a valle. Segue la ricostruzione delle superfici, che trasforma i punti in mesh o modelli solidi.
L’ultima frontiera, quella che nell’ultimo anno ha fatto più rumore nei laboratori, sono le tecniche di sintesi di nuove viste. Si chiamano neural radiance fields e Gaussian splatting, capaci di generare scorci fotorealistici di una scena mai ripresa da quell’angolo. È la tecnologia dietro i walkthrough virtuali e i gemelli digitali di interi edifici.
Ogni passaggio ha il suo modo di andare storto: letture rumorose, scansioni disallineate, superfici trasparenti o riflettenti che confondono qualsiasi sensore ottico, indipendentemente da quanto sia sofisticato il modello a valle.
Costruire una pipeline 3D affidabile richiede in pratica più iterazioni di quante ne preventivi all’inizio chi non ci è mai passato.
Chi ci lavora, e dove si vede già il computer spaziale
Nella logistica, la percezione 3D ottimizza i layout dei magazzini e guida i veicoli a guida autonoma tra corsie affollate di persone e carrelli manuali. Ouster, tra i principali produttori di LiDAR industriali, ha un accordo per fornire migliaia di sensori a Vecna Robotics proprio per questo: mappare in tempo reale un ambiente che cambia ogni ora.
Nella robotica in senso più ampio, il principio è lo stesso che vi abbiamo mostrato quando un robot ha iniziato ad allenare tennisti. Senza una stima precisa della posizione della palla nello spazio, in tre dimensioni e in tempo reale, non c’è correzione tecnica che tenga.
Nell’edilizia e nell’immobiliare, le scansioni di cantiere confrontano l’avanzamento lavori con il progetto originale e individuano deviazioni strutturali quando costano ancora poco correggerle. Nel campo dei droni, la stessa logica ha reso possibile mappare in sicurezza le rotte sull’Everest senza mandare un alpinista a controllare di persona ogni crepaccio.
E poi, come detto, c’è il lato che avete già in tasca o sul comodino: la stima di profondità monoculare, quella che non richiede sensori dedicati, è lo stesso principio che regge il ritratto sfocato del vostro smartphone.
Il divario che nessun comunicato stampa mette in prima pagina
Sui visori indossabili si parla di centinaia di miliardi di euro di mercato entro fine decennio. Sui robot che quel mercato lo alimentano dal basso, cioè i sensori LiDAR e le pipeline SLAM che permettono a un carrello o a un drone di non sbattere contro un muro, si parla di pochi miliardi. È normale: il pubblico guarda lo schermo che indossa, non il sensore che gli evita di inciampare mentre lo indossa.
E c’è un secondo attrito, più tecnico. Quale? Le superfici riflettenti: vetro, metallo lucido, pareti bianche senza texture restano un problema irrisolto per quasi tutti i metodi di rilevamento della profondità. E questo a prescindere da quanto sia buono il modello che elabora i dati a valle. Non è un limite che sparirà con la prossima generazione di GPU: è un limite fisico del modo in cui la luce si comporta su certe superfici.
I tempi veri, non quelli del keynote
Dai 3 ai 7 anni per l’adozione di massa in logistica e industria (già in corso, ma non ancora standard). Dai 7 ai 12 anni per un uso quotidiano dei visori spaziali fuori dal lavoro specializzato, forse mai per certe categorie di superfici che restano cieche ai sensori attuali.
Chi beneficia per primo: magazzini, cantieri e chi fa manutenzione predittiva, dove l’errore di misura costa subito soldi veri. L’utente finale che compra un visore per lavorare da casa arriva dopo, quando l’hardware sarà sceso di prezzo e il software avrà smesso di richiedere un ingegnere per ogni installazione.
Il costo che ridimensiona: costruire una pipeline 3D affidabile oggi richiede competenze di calibrazione, fusione sensoriale e modellazione che la maggior parte dei team interni non ha mai avuto motivo di sviluppare. Chi ha questi problemi, spesso si rivolge fuori piuttosto che assumersi mesi di apprendimento sul campo.
Perché ci porterà via dalle scrivanie
Vent’anni fa un computer era una scatola su una scrivania e un’interfaccia fatta di finestre rettangolari. Il computer spaziale rovescia il rapporto. Esatto: non sei tu ad entrare nello schermo, è lo schermo che entra nella tua stanza, capisce dove sono i muri, sa che il divano non si può attraversare. È lo stesso salto concettuale del gemello digitale delle città di cui vi scrivevamo nel 2021, applicato a un metro quadro invece che a un centro urbano intero.
Il paradosso è che la parte più rivoluzionaria non sarà quella che vedrete addosso a qualcuno in un ufficio open space. Sarà quella invisibile: il sensore dentro un carrello elevatore, il LiDAR su un trattore, il modulo di stima di profondità dentro un’app che misura una stanza per l’arredamento senza un metro. Il visore fa notizia. Il sensore muto che lavora tutto il giorno in un magazzino, no. Eppure è quest’ultimo, non il primo, a spostare davvero l’ago del “come lavoriamo”.
Dieci anni fa insegnare a una macchina a riconoscere un gatto in una foto era all’avanguardia. Oggi è dato per scontato, e i problemi che contano davvero (misurare con precisione, o muoversi nello spazio fisico) vivono in tre dimensioni. Chi tratta lo spazio come parte integrante della propria strategia tecnologica, e non come un accessorio da aggiungere dopo, sta risolvendo problemi che una fotografia piatta non toccherà mai.