Physis-Lang: un linguaggio fisico autoadattante che migliora la coerenza fisica dei modelli video e supera Veo 3.1 su più benchmark

Cosa è accaduto

Un gruppo di ricercatori di NVIDIA, MIT e University of Oxford ha presentato Physis-Lang, una metodologia che rappresenta la fisica di una scena come testo ottimizzabile e lo usa in tre fasi chiave: data curation, addestramento e inferenza. Il framework aggiunge ai tradizionali caption descrittivi un campo physics_reasoning (entità, cause, interazioni, leggi e evoluzione temporale) e un physics_negative_prompt per scoraggiare esiti fisicamente implausibili. I risultati riportati nel paper indicano miglioramenti significativi in più benchmark di valutazione fisica per modelli video basati su backbone Cosmos3.

Perché è importante

Molti world model video possono generare clip visivamente convincenti che però violano leggi fisiche elementari (oggetti che attraversano muri, liquidi che si comportano in modo non realistico). Physis-Lang propone di intervenire a livello di linguaggio che descrive e spiega la scena, invece che solo con segnali visivi o latenti: la stessa rappresentazione testuale guida il recupero di dati pertinenti, la generazione di caption fisiche per il training e la prompt engineering in inferenza. Questo approccio agisce contemporaneamente su dati, istruzioni e supervisione, con un potenziale diretto nel ridurre errori fisici nei sistemi multimodali.

Possibili impatti

I risultati riportati mostrano guadagni coerenti su diverse suite di benchmark. Su PhyGenBench la versione Physis-Lang con Cosmos3-Nano raggiunge 71.04 vs 65.63 di Veo 3.1; su Physics-IQ Verified il confronto è 43.41 vs 34.99; su PhyGround 69.90 vs 69.24. In un snapshot pubblico della leaderboard Physics-IQ Verified la variante Cosmos3-Super con Physis-Lang è indicata a 48.2 ± 1.4, mentre la Cosmos3-Nano a 43.3 ± 1.5. L’approccio migliora inoltre il processo di selezione del training set: il dataset finale descritto conta 183k video (71k filtrati + 112k recuperati) e la sola fase di retrieval aggiunge in media +3.01 punti su tre benchmark.

Dal punto di vista operativo, la pipeline mantiene il modello di captioning con pesi congelati e fa evolvere invece le istruzioni tramite un agente di evoluzione che sfrutta un critic di tipo physics-aware (valutatore GPT-5.5 e, nel loop, Gemini-3.1-Pro come critic). Le fasi iterative hanno mostrato un aumento della F1 su PhysCapBench da 78.64 (iterazione 1) a 87.82 (iterazione 9), con passaggi intermedi non lineari e modifiche come l’aumento del frame sampling.

Una possibile lettura

I contributi di Physis-Lang sono rilevanti perché spostano parte del problema della coerenza fisica dal dominio numerico e visivo al dominio del linguaggio strutturato: se il testo che accompagna i clip esprime cause, leggi ed esiti attesi, diventa possibile indirizzare sia la raccolta dei dati sia la fine-tuning verso esempi e segnali più informativi per la fisica. Questa strategia può essere combinata con metodi di modellazione tradizionali (ad esempio LoRA su attention) senza cambiare l’architettura di base, rendendola potenzialmente applicabile a molte piattaforme esistenti.

Tuttavia, resta da verificare la robustezza del metodo in scenari real-world più diversificati rispetto ai benchmark e la riproducibilità pratica, dato che al momento il paper è l’unica fonte pubblicata e il codice/weights non risultano ancora disponibili. L’uso di valutatori basati su grandi modelli per misurare la coerenza fisica introduce inoltre una dipendenza metodologica che andrà valutata in termini di bias e stabilità delle metriche.

Fonte: MarkTechPost