PROVE di Xiaomi: metriche no‑reference RC‑S e RC‑T e un benchmark video reale per valutare l’object removal
Cosa è accaduto
Un gruppo di ricerca di MiLM Plus (Xiaomi Inc.) ha rilasciato PROVE (Perceptual RemOVal cohErence), un framework di valutazione per l'object removal composto da due metriche no‑reference, RC‑S e RC‑T, e da un benchmark video reale (PROVE‑Bench). L'obiettivo è ridurre la discrepanza tra le capacità dei modelli di rimozione e gli strumenti che le giudicano: secondo i risultati riportati, RC‑S e RC‑T allineano meglio le valutazioni con giudizi umani rispetto a metriche tradizionali come PSNR, SSIM, LPIPS, ReMOVE e CFD.
Perché è importante
La rimozione di oggetti è un compito intrinsecamente ill‑posed e «one‑to‑many»: non esiste un unico ground truth valido per ogni foro da ricostruire. Le metriche full‑reference possono favorire operazioni di copy‑paste o immagini sovrapposte che peggiorano la percezione visiva reale, mentre metriche no‑reference esistenti presentano blind spot e insensibilità temporale. PROVE propone di misurare localmente la coerenza della regione editata in spazio e tempo usando Maximum Mean Discrepancy (MMD) su caratteristiche DINOv2, senza bisogno di video di riferimento.
Possibili impatti
Per team di ricerca e ingegneria applicata, RC‑S e RC‑T possono diventare un harness di valutazione utile per bake‑off di modelli, gating CI, tuning di inference e per filtrare o selezionare dati di training senza dipendere da coppie input/target. RC‑S è riportata funzionare a 134.6 ms/frame su una singola RTX 4090 e risulta fino a 13.7× più veloce di CFD nelle prove citate, rendendola praticabile in pipeline di valutazione notturne piuttosto che in scoring on‑device in tempo reale.
I benchmark PROVE‑M (80 video paired, acquisiti con tre fasi di controllo qualità e augment sincronizzato) e PROVE‑H (100 video difficili senza ground truth) consentono di testare metriche su scenari reali: movimenti di camera, riflessi multipli, folla e superfici complesse. Nelle valutazioni con 20 annotatori aggregati via Borda count, RC‑S raggiunge 0.59 di Kendall's τ (Spearman ρ 0.66), nettamente superiore alle alternative citate.
Una possibile lettura
I contributi principali vanno letti come un tentativo di portare la metrica di valutazione più vicina alla percezione umana, spostando il confronto da punti corrispondenti globali a una misurazione locale di distribuzioni di feature. Questo approccio riduce comportamenti paradossali delle metriche tradizionali (per esempio il miglioramento apparente al crescere della sfocatura) e affronta la sensibilità temporale mediante il confronto su intersezioni spaziali tra frame adiacenti. Rimane tuttavia evidente un limite operativo: RC‑S e RC‑T richiedono maschere accurate e sono pensate come strumenti di valutazione offline o in CI, non come feature in tempo reale su device con risorse ridotte. Inoltre, alcune modalità di fallimento persistono quando effetti quali ombre o riflessi si estendono oltre la regione valutata o quando la maschera non cattura la reale estensione del contenuto rimosso.
Per chi progetta pipeline di editing video, la disponibilità di codice Apache 2.0, pesi DINOv2‑giant e di un dataset pubblico favorisce l'adozione sperimentale in ambienti di ricerca e produzione. L'adozione sistematica richiederà però integrazione con sistemi di masking affidabili e valutazioni di costo su larga scala per cataloghi estesi.
Fonte: MarkTechPost

