Fastino rilascia GLiNER2.5‑Decide: modello decisionale open‑weight 340M eseguibile su CPU

Cosa è accaduto

Fastino ha reso disponibile GLiNER2.5‑Decide, un modello decisionale open‑weight da 340 milioni di parametri distribuito con licenza Apache 2.0 e installabile tramite pip. Si tratta di un classificatore non generativo basato su un encoder DeBERTa‑v3‑large, pensato per automatizzare giudizi operativi frequenti nelle pipeline agentiche, come instradamento, triage, selezione di tool e applicazione di guardrail.

Perché è importante

Il modello accetta in input testo più uno schema di domande tipizzate e restituisce risposte strutturate con distribuzioni di probabilità, un punteggio di confidenza e metadata sulla fattibilità rispetto ai vincoli dichiarati. Le caratteristiche dichiarate — pesi open‑weight, esecuzione su CPU e compatibilità con ambienti air‑gapped — lo rendono immediatamente distribuibile in contesti dove il controllo dei dati e la costanza dei costi infra sono requisiti rilevanti.

Possibili impatti

GLiNER2.5‑Decide è pensato come componente specialistico per decisioni operative, non per spiegazioni o ragionamenti aperti. L'architettura include due fasi: un encoder che valuta ogni risposta ammessa e un decoder vincolato che cerca l'assegnazione congiunta di etichette massimizzando il punteggio nel rispetto delle regole dello schema. Questo approccio permette di far valere vincoli tra risposte correlate (ad esempio: se viene rilevato un danno, la verdict di sicurezza diventa "unsafe"), riducendo incoerenze tra output multipli.

Fastino riporta risultati su una suite interna denominata Fast Decisions: il checkpoint da 340M ottiene una media di 60.1% di exact‑match accuracy su 5.100 esempi distribuiti su 17 dataset, guidando 9 di questi. Le aree più forti includono l'intent routing (es. 75.3% su support intent, 64.3% su banking intent).

Dal punto di vista delle prestazioni, il team ha misurato latenze end‑to‑end a batch 1: per una chiamata con schema a 2 testate e 15 etichette, il p50 a 64 token è 167.3 ms su CPU (Intel Xeon 48‑vCPU); su GPU i valori riportati variano tra ~38 ms (V100) e ~47 ms (A100) per lo stesso scenario. Fastino pubblica anche varianti (1B e multi‑lingua) e strumenti per il fine‑tuning e l'uso in locale o tramite API ospitate.

Una possibile lettura

I punti chiave per chi considera l'adozione sono la natura specialistica del modello e la combinazione di vincoli espliciti con decoding congiunto: questo lo rende adatto a scenari in cui è cruciale ottenere output coerenti e conformi a regole aziendali o di sicurezza, come i sistemi di routing automatico o i blocchi di guardrail prima di chiamare LLM più generativi. La disponibilità dei pesi sotto Apache 2.0 e la compatibilità CPU facilitano sperimentazione, audit e deployment in infrastrutture con vincoli di riservatezza o costi GPU.

Tuttavia, la metrica pubblicata (exact‑match accuracy 60.1% sulla suite interna) indica margini di errore significativi: l'uso pratico richiederà valutazioni su dati reali di dominio, soglie di confidenza adeguate e logiche di fallback (ad es. escalation a un operatore umano o a un giudice LLM) per mitigare falsi negativi o conflitti residui. Le latenze riportate mostrano che l'esecuzione su CPU è praticabile per richieste brevi in scenari a bassa latenza critica, ma le differenze con GPU restano rilevanti per carichi più lunghi o ad alto throughput.

Fonte: MarkTechPost