Luglio 2026
Come il retrieval rende le risposte verificabili
La retrieval-augmented generation riduce le allucinazioni dei modelli generativi perché vincola la risposta a testi recuperati e verificabili. Scopri perché funziona, quali limiti restano e come verificare rapidamente le risposte chiedendo estratti.
Model routing: il modello che paghi può non essere quello che esegue la richiesta e le conseguenze legali
Routing a livello di richiesta, quantizzazione e aggiornamenti silenziosi possono trasformare l'ID modello in un identificatore legale. L'articolo analizza rischi contrattuali, probatori e la proposta di attestazioni firmate per ricostruire l'identità del modello servito.
Cosa condividere nelle chat AI: guida pratica sulla privacy
Quando si usa una chat AI i testi inseriti possono essere registrati e talvolta usati per migliorare i modelli. Questa guida spiega cosa controllare, quali dati evitare e quali azioni pratiche adottare per ridurre i rischi.
Open ASR nel 2026: perché la classifica WER non basta per scegliere un modello
Nel 2026 i modelli open-weight da ~2B dominano il top delle classifiche WER, ma la scelta pratica dipende oggi da licenza, copertura linguistica, supporto streaming e costi per ora audio, non dalla sola posizione in leaderboard.
Cisco Foundation AI rilascia Antares: modelli open-weight (350M e 1B) per localizzare vulnerabilità nei repository
Cisco Foundation AI ha pubblicato Antares, una famiglia di security SLM open-weight (Antares-350M e Antares-1B) e il benchmark VLoc Bench. Il modello 1B raggiunge 0.209 File F1 su 500 task, offrendo una soluzione specializzata per la prima fase di triage delle vulnerabilità.
srt-slurm di NVIDIA: validare benchmark distribuiti per il serving di LLM con ricette SLURM e analisi Pareto
Un tutorial mostra come usare NVIDIA srt-slurm e srtctl per trasformare configurazioni YAML in workflow SLURM riproducibili, includendo dry‑run, sweep parametrici, disaggregazione prefill/decode e analisi Pareto per throughput vs latenza.
Quali LLM locali possono girare su una singola GPU da 24 GB nel 2026
Una panoramica sui modelli LLM che entrano su una GPU da 24 GB: come si spende la VRAM, perché i modelli MoE sono una criticità per il single‑GPU, e quali runtime usare per inferenza locale in produzione.
WANDR di Perplexity: benchmark open per agenti di ricerca 'wide-and-deep'
Perplexity ha pubblicato WANDR, un benchmark open con 500 task progettati per valutare agenti che devono scoprire ampie raccolte di entità e fornire prove per ogni voce. I risultati evidenziano limiti nella scoperta e nella validazione delle evidenze.
Always‑On Memory Agent di Google Cloud: memoria continua con Gemini 3.1 Flash‑Lite senza vettori
Google Cloud pubblica un esempio di agent che mantiene una memoria continua: Always‑On Memory Agent usa Gemini 3.1 Flash‑Lite e SQLite, eliminando l'uso di embeddings e vector DB e consolidando ricordi ogni 30 minuti.
Perdere la passkey: come reagire
Le passkey possono risiedere su un solo dispositivo: se lo perdi rischi di non poter accedere agli account. Scopri le misure preventive e le azioni da compiere subito per ridurre il rischio di lockout.




