La prossima era della competizione nel settore delle fotocamere: l'essenza della gara risiede nella loro capacità di comprendere.
La competizione nel settore delle fotocamere si sta evolvendo, puntando ora sulla comprensione della scena e sulla realizzazione di foto intelligenti basate sull'intelligenza artificiale, andando oltre le semplici specifiche tecniche.
Le cose più importanti che devi sapere
- La funzione del sensore passa dall'acquisizione di immagini di alta qualità per l'occhio umano alla fornitura di segnali nitidi che possono essere elaborati dalla macchina, rendendolo uno strumento di percezione essenziale.
- Il collo di bottiglia nell'elaborazione AI in tempo reale si sta spostando verso il sensore, spingendo verso soluzioni come l'elaborazione su chip, i sensori basati su eventi, gli otturatori universali e le tecnologie HDR modificate per migliorare la leggibilità da parte delle macchine.
- La prossima competizione nel settore delle fotocamere ruoterà attorno al sistema integrato che comprende sensore, elaborazione delle immagini e periferiche di calcolo, con particolare attenzione alla "qualità dell'inferenza" come priorità strategica che va oltre la tradizionale "qualità dell'immagine".
La dimostrazione che mi ha convinto si è svolta in una galleria d'arte che ho costruito io stesso.

Non potevamo fornire una squadra di guide, quindi ho sviluppato un progetto parallelo per sostituirle. Non c'era nessun modulo di input o altro da digitare. Bastava puntare il telefono verso un oggetto e il sistema diceva cosa si stava guardando. Poi la mostra è finita, ma la gente ha continuato a usarlo comunque.
Lo indirizzarono verso gli edifici, i fiori, i giocattoli dei loro figli, i manifesti per strada, e nessuna di queste cose aveva a che fare con la mostra.
Senza che nessuno glielo chiedesse, decisero che la macchina fotografica avrebbe dovuto essere in grado di spiegare loro il mondo.
Questa aspettativa è ora responsabilità del settore, e arriva in un momento in cui l'intelligenza artificiale si sta spostando da un problema di addestramento a un problema di inferenza, dove la maggior parte del lavoro effettivo viene svolto sul dispositivo stesso mentre qualcuno punta il proprio telefono verso un mondo reale non collaborativo.
Una modella ha bisogno di cose diverse da un'inquadratura rispetto all'occhio umano: bordi su cui appoggiarsi e struttura da recuperare quando lo scatto è pieno di riflessi o sfocato. I colori e il contrasto che rendono una foto gradevole sono, per una modella, spesso un ostacolo.
Il sensore necessario per un osservatore umano e il sensore necessario per un modello richiedono progetti diversi.
Il sensore è diventato una questione di percezione, e chi progetta sistemi di visione in tempo reale ora se ne preoccupa allo stesso modo in cui se ne preoccupavano i fotografi un tempo.
Da dove proviene il sensore?
Il sensore CMOS a pixel attivi, inventato da Eric Fossum e sviluppato all'inizio degli anni '90, è il motivo per cui oggi quasi tutti abbiamo una fotocamera di buona qualità in tasca.
Il suo lavoro successivo prende una direzione completamente diversa: il sensore di immagine quantistico, che conta i singoli fotoni. Questa traiettoria illustra ciò che sta accadendo oggi con l'intelligenza artificiale: si sta passando dal catturare un'immagine che potrebbe piacere a una persona al catturare il segnale più puro possibile affinché la macchina lo elabori.
Il sensore diventa uno strumento di percezione, e la fotografia è solo uno dei suoi utilizzi.
Perché il ragionamento cambia la natura del lavoro?
È l'inferenza che rende il problema urgente. In precedenza, quando l'IA si concentrava principalmente sull'addestramento, il ruolo della telecamera era indiretto: produceva dati da categorizzare e da cui apprendere in seguito, con calma. L'inferenza non è lenta. Avviene in tempo reale, su un dispositivo con risorse limitate e già sottoposto a temperature elevate, come nel caso delle applicazioni di IA sensibili al fattore tempo.
Quando un sistema deve riconoscere un oggetto mentre la telecamera è ancora puntata su di esso e reagire prima che sia troppo tardi, l'anello debole è rappresentato dal modello stesso, che pone il limite a tutto ciò che il prodotto può fare.
Parte del settore continua a puntare sulla cosa sbagliata. Si presume che un modello sufficientemente grande sia in grado di ripulire qualsiasi immagine ripresa dalla telecamera. Ho visto questo presupposto ostacolare lo sviluppo dei prodotti per due anni di fila e non credo che regga alle leggi della fisica.
Nessun modello di dimensioni può ripristinare i dettagli già distrutti dalla sfocatura da movimento o dai riflessi, o quelli scartati da un'elaborazione che privilegia la bellezza prima ancora che la modella veda l'inquadratura. Il collo di bottiglia ora si sposta verso l'alto, verso il sensore e ciò che si trova tra esso e la modella.
Che cosa fanno concretamente questi dispositivi?
Alcuni sensori ora eseguono parte dell'elaborazione direttamente sul chip, quindi i calcoli iniziali avvengono prima che i dati lascino l'array di pixel. I sensori basati sugli eventi, a volte chiamati neuromorfici, registrano solo le parti della scena che cambiano, il che è molto più adatto alla percezione in tempo reale rispetto allo streaming di fotogrammi completi. Anche gli otturatori globali contribuiscono a ridurre le distorsioni da movimento che possono falsare le letture automatiche.
Anche l'HDR (High Dynamic Range), originariamente concepito per rendere il cielo in modo spettacolare, viene ora ricalibrato per adattarsi a ciò che il modello è in grado di leggere chiaramente in condizioni di elevato contrasto. Nonostante le differenze, tutte queste tecnologie puntano nella stessa direzione: verso una versione del mondo che il modello è in grado di gestire.
Dall'identificazione alla conclusione
La cosa più intuitiva da realizzare è la ricerca visiva: puntando la fotocamera su un oggetto, questo viene etichettato. Ma quando si punta il telefono su un menu, ciò che si desidera è un aiuto per decidere cosa mangiare; quando lo si punta su un poster, un passaggio utile potrebbe essere quello di salvare l'evento sul calendario. Il riconoscimento degli oggetti è solo il punto di partenza. L'essenza del prodotto sta nel sapere cosa dovrebbe succedere dopo. È qui che il sensore diventa il primo anello di una catena di interpretazione più lunga, andando oltre la semplice acquisizione di informazioni.
Non avevo mai avuto intenzione di costruire un prodotto fotografico; è nato come un modo economico per evitare di assumere guide per una singola mostra. Ma questo piccolo progetto mi ha insegnato che questo istinto è già presente in me. La prossima sfida nel mondo delle fotocamere riguarderà l'intero sistema: il sensore, il percorso di elaborazione dell'immagine, l' elaborazione periferica , la formattazione del modello e ciò che il sistema fa in definitiva.
I produttori di hardware hanno dedicato anni al miglioramento della qualità delle immagini e dovranno prendere altrettanto seriamente la qualità dell'inferenza. Gli sviluppatori di software non possono considerare l'acquisizione come un problema di qualcun altro: il modo in cui un segnale viene catturato e instradato ne influenza il risultato ben prima che l'utente lo veda. I vecchi confini tra hardware e software diventano meno importanti man mano che ci addentriamo nella percezione in tempo reale.
C'è ancora spazio per le startup. Il loro vantaggio sta nella velocità di identificazione: formulare il problema prima che i grandi attori abbiano finito di discuterne. La stessa capacità del modello generale sta diventando sempre più difficile da difendere. La domanda è: cosa succederà quando un singolo sistema sarà in grado di vedere, anticipare e agire sullo stesso evento? Chi arriverà per primo con un prodotto pienamente funzionante?
Occhi umani contro menti artificiali
La mia previsione è che nei prossimi anni le aziende si divideranno in due schieramenti: quelle che ottimizzano le prestazioni per la visualizzazione umana e quelle che le ottimizzano per ciò che la macchina deve leggere. All'interno di uno smartphone di punta, questi obiettivi si sovrappongono ancora a sufficienza da rendere la differenza quasi impercettibile.
Ma, come strategia, questi obiettivi hanno già iniziato a divergere. La posizione più sostenibile sarà quella di chiunque riuscirà a trasformare il caotico mondo reale nel segnale più pulito che la macchina possa dedurre.
Si comincia con il sensore.
Abbiamo esaminato, valutato e classificato i migliori smartphone con fotocamera.
I commenti sono chiusi.