Luglio 2026

Sciamano Digitale
Come il retrieval rende le risposte verificabili

La retrieval-augmented generation riduce le allucinazioni dei modelli generativi perché vincola la risposta a testi recuperati e verificabili. Scopri perché funziona, quali limiti restano e come verificare rapidamente le risposte chiedendo estratti.

Leggi tutto
Intelligenza Artificiale
Model routing: il modello che paghi può non essere quello che esegue la richiesta e le conseguenze legali

Routing a livello di richiesta, quantizzazione e aggiornamenti silenziosi possono trasformare l'ID modello in un identificatore legale. L'articolo analizza rischi contrattuali, probatori e la proposta di attestazioni firmate per ricostruire l'identità del modello servito.

Leggi tutto
Sciamano Digitale
Cosa condividere nelle chat AI: guida pratica sulla privacy

Quando si usa una chat AI i testi inseriti possono essere registrati e talvolta usati per migliorare i modelli. Questa guida spiega cosa controllare, quali dati evitare e quali azioni pratiche adottare per ridurre i rischi.

Leggi tutto
Intelligenza Artificiale
Open ASR nel 2026: perché la classifica WER non basta per scegliere un modello

Nel 2026 i modelli open-weight da ~2B dominano il top delle classifiche WER, ma la scelta pratica dipende oggi da licenza, copertura linguistica, supporto streaming e costi per ora audio, non dalla sola posizione in leaderboard.

Leggi tutto
Intelligenza Artificiale
Cisco Foundation AI rilascia Antares: modelli open-weight (350M e 1B) per localizzare vulnerabilità nei repository

Cisco Foundation AI ha pubblicato Antares, una famiglia di security SLM open-weight (Antares-350M e Antares-1B) e il benchmark VLoc Bench. Il modello 1B raggiunge 0.209 File F1 su 500 task, offrendo una soluzione specializzata per la prima fase di triage delle vulnerabilità.

Leggi tutto
Intelligenza Artificiale
srt-slurm di NVIDIA: validare benchmark distribuiti per il serving di LLM con ricette SLURM e analisi Pareto

Un tutorial mostra come usare NVIDIA srt-slurm e srtctl per trasformare configurazioni YAML in workflow SLURM riproducibili, includendo dry‑run, sweep parametrici, disaggregazione prefill/decode e analisi Pareto per throughput vs latenza.

Leggi tutto
Intelligenza Artificiale
Quali LLM locali possono girare su una singola GPU da 24 GB nel 2026

Una panoramica sui modelli LLM che entrano su una GPU da 24 GB: come si spende la VRAM, perché i modelli MoE sono una criticità per il single‑GPU, e quali runtime usare per inferenza locale in produzione.

Leggi tutto
Intelligenza Artificiale
WANDR di Perplexity: benchmark open per agenti di ricerca 'wide-and-deep'

Perplexity ha pubblicato WANDR, un benchmark open con 500 task progettati per valutare agenti che devono scoprire ampie raccolte di entità e fornire prove per ogni voce. I risultati evidenziano limiti nella scoperta e nella validazione delle evidenze.

Leggi tutto
Intelligenza Artificiale
Always‑On Memory Agent di Google Cloud: memoria continua con Gemini 3.1 Flash‑Lite senza vettori

Google Cloud pubblica un esempio di agent che mantiene una memoria continua: Always‑On Memory Agent usa Gemini 3.1 Flash‑Lite e SQLite, eliminando l'uso di embeddings e vector DB e consolidando ricordi ogni 30 minuti.

Leggi tutto
Sciamano Digitale
Perdere la passkey: come reagire

Le passkey possono risiedere su un solo dispositivo: se lo perdi rischi di non poter accedere agli account. Scopri le misure preventive e le azioni da compiere subito per ridurre il rischio di lockout.

Leggi tutto