Photon-1: modello 'imagination' che impara da video senza etichette e simula desktop

Cosa è accaduto

Induction Labs ha descritto Photon-1, un modello di tipo "imagination" preaddestrato su video di uso del computer senza etichette d'azione. L'architettura è un transformer sparse Mixture-of-Experts (106B parametri totali, 5B attivi) che apprende prevedendo i token latenti successivi (next-latent-token prediction) invece di generare pixel durante il pretraining.

Il dataset di pretraining è stato ricavato da un indice interno di 2 miliardi di video pubblici, filtrato fino a circa 2 milioni di registrazioni dello schermo; il corpus finale conta 575 milioni di frame (campionati a 1 fps, pari a 552 miliardi di token, indicati come l'equivalente di ~18 anni di video). Il modello è stato preaddestrato per un solo epoch, usando ~30.000 ore H200 (circa 4.4×10^22 FLOPs) e un encoder visivo che applica Finite Scalar Quantization (FSQ) per comprimere ogni frame in 960 token discreti (~2.2 KB per frame). Dopo il pretraining Photon-1 è stato finetunato con meno di 35.000 traiettorie di uso del desktop e sottoposto a fasi di reinforcement learning online su macchine virtuali.

Perché è importante

Il punto centrale è che Photon-1 apprende una sorta di "implicit policy": prevedendo futuri stati latenti senza vedere etichette d'azione durante il pretraining, il modello svilupperebbe concetti di comportamento umano rilevanti per il completamento di compiti. Tecnicamente, la combinazione di compressione FSQ e un encoder differenziale (che codifica differenze fra coppie di frame) permette di scalare il pretraining su grandi volumi di video mantenendo informazioni su testo, layout e cambiamenti di stato.

Induction Labs riporta inoltre che, su un benchmark interno (non pubblico), Photon-1 supera Gemini 3.1 Flash-Lite con circa 27–30× meno pretraining FLOPs e costi di serving inferiori. Dopo finetuning il modello ha mostrato capacità di simulazione esterna al dominio desktop: migliori prestazioni su 20.000 partite di dama e una mean absolute error di 0.47 su 10.000 partite di biliardo sintetiche rispetto a due baselines.

Possibili impatti

Se confermato e riproducibile, l'approccio esemplifica come rappresentazioni latenti autoregressive possano ridurre il fabbisogno di dati etichettati per compiti agentici, con possibili benefici sui costi di addestramento e sulla velocità di sviluppo di agenti capaci di ragionare su stati futuri.

La compressione FSQ e l'encoder differenziale suggeriscono strade praticabili per gestire grandi archivi video preservando informazioni utili alla pianificazione; ciò potrebbe influenzare ricerca su agenti che apprendono dall'osservazione, simulazioni fisiche apprese e integrazione con policy basate su RL.

Contemporaneamente, i risultati pongono interrogativi su riproducibilità e valutazione: il confronto con Gemini è basato su stime interne e su un benchmark non pubblicato, mentre la disponibilità di pesi, API o licenze è assente (si tratta di un risultato di ricerca, non di un prodotto già distribuibile).

Una possibile lettura

Un'interpretazione prudente è che Photon-1 mostri la fattibilità tecnica di addestrare un modello di pianificazione implicita a partire da video non etichettati, riducendo il costo della scalatura grazie a compressione e modelli MoE. Se tale metodo fosse verificato con benchmark pubblici e repliche indipendenti, potrebbe accelerare lo sviluppo di agenti capaci di trasferire conoscenze da compiti di interfaccia a domini nuovi tramite finetuning e RL. Rimane però cruciale la verifica esterna dei risultati e la trasparenza sul corpus di training prima di trarre conclusioni operative.

Fonte: MarkTechPost