Altar-1: Aikido rilascia un modello open-weight di sicurezza compresso da GLM-5.3 a 328 GB, pronto per il self-hosting
Cosa è accaduto
Aikido Security ha reso pubblici i pesi di Altar-1, un modello di sicurezza open-weight derivato da GLM-5.3 e ottimizzato per essere eseguito all'interno dell'infrastruttura controllata dal cliente. La trasformazione riduce lo storage delle weight da 1.506,7 GB (GLM-5.3 BF16) a 328,0 GB, consentendo il deploy su un singolo nodo composto da 4x NVIDIA H200 con vLLM e operazioni in ambienti on‑premise o air‑gapped.
Perché è importante
Il rilascio mira a rispondere a un vincolo operativo e di sicurezza concreto: evitare che contesti sensibili (codice sorgente, documentazione architetturale, risultati di pentest) escano dalla rete aziendale verso modelli SaaS. Altar-1 propone una soluzione tecnica che abbatte l'ostacolo di memoria tipico dei modelli MoE (mixture-of-experts), garantendo al contempo una fedeltà misurata rispetto al modello parent.
Possibili impatti
Dal punto di vista tecnico, Altar-1 combina due passaggi principali: una quantizzazione AWQ (W4A16) e una potatura degli expert tramite REAP (Router-weighted Expert Activation Pruning). Il risultato lascia 168 expert per layer (su 256) e mantiene la selezione di 8 expert per token, con circa 40 miliardi di parametri attivi per token. Questo produce un pacchetto pesi da 328 GB e una KL divergence dichiarata di 0,506 nats rispetto alla versione BF16 su un panel sigillato di 25 prompt.
In termini di efficacia sui task di sicurezza, i benchmark interni di Aikido (CVE benchmark: 32 vulnerabilità, 30 repository, 3 run per caso) mostrano una riduzione della recall media dal 65,6% del parent BF16 al 60,4% di Altar-1 e una copertura trovata almeno una volta diminuita da 25 a 23 casi. Aikido segnala inoltre il ritrovamento, in produzione presso un cliente, di una vulnerabilità critica identificata dal modello (caso singolo riportato dal vendor).
Per il deploy operativo, il modello richiede GPU della famiglia Hopper (H100/H200). La configurazione di riferimento indicata è 4x H200 (141 GB ciascuna) con vLLM che seleziona automaticamente il kernel Marlin per MoE; la capacità residua di HBM dopo il caricamento dei pesi è un elemento cruciale perché la cache KV dei long‑running agents compete per la stessa memoria GPU.
La licenza eredita quella di GLM-5.3: uso commerciale, modifica e ridistribuzione sono consentiti, con la clausola che operatori Model-as-a-Service con ricavi oltre 10 miliardi di dollari su 12 mesi devono sottoporsi a una security review di Z.AI. Altar-1 è definito open-weight ma non corrisponde a una licenza OSI‑approved open source.
Una possibile lettura
I fatti indicano un trade-off tecnico esplicito: riduzione significativa dello spazio dei pesi con perdita misurabile di recall sui benchmark CVE, ma con benefici concreti per chi deve rispettare vincoli di data residency o operare in reti isolate. Per team di sicurezza e operatori OT che richiedono esecuzione on‑premise, Altar-1 abbassa la barriera pratica al self‑hosting di un MoE di grandi dimensioni, pur richiedendo infrastrutture GPU di fascia alta e attenzione alla gestione della cache KV per agenti a lungo contesto.
In prospettiva, il percorso descritto (quantizzazione + pruning senza retraining) è replicabile come strategia tecnica per altri modelli MoE, ma impone valutazioni operate caso per caso: la perdita di performance su benchmark specializzati e la necessità di calibrazione con tracce rappresentative sono aspetti che chi valuta il deploy deve monitorare. Aikido menziona inoltre esperimenti futuri su formati a bit ancora inferiori (EXL3) e fine-tuning mirato per flussi di lavoro di sicurezza, che potrebbero ridurre ulteriormente il divario di prestazioni.
Fonte: MarkTechPost

