Intelligenza Artificiale
Adattare Open Instruct Tulu 3 a un post‑training compatto su Colab: SFT, DPO e GRPO con verificatoriNuovo!
MarkTechPost pubblica un tutorial che mostra come ridurre la stack di post‑training Tulu 3 di AllenAI per eseguirla in un runtime da 16 GB: SFT, DPO e reinforcement learning con GRPO, LoRA e verificatori deterministici su GSM8K.
NVIDIA rilascia Nemotron 3.5 Lightning e NeMo Switchyard: MoE 30B con 3B attivi per l'esecuzione agenticaNuovo!
NVIDIA ha reso disponibile Nemotron 3.5 Lightning, una MoE da 30 miliardi di parametri con 3 miliardi attivi e contesto fino a 1M token, insieme a NeMo Switchyard per instradare chiamate agentiche. Proposte ottimizzazioni per velocità e costo in scenari always‑on.
PROVE di Xiaomi: metriche no‑reference RC‑S e RC‑T e un benchmark video reale per valutare l’object removalNuovo!
MiLM Plus (Xiaomi) pubblica PROVE: due metriche perception‑aligned (RC‑S per la coerenza spaziale, RC‑T per quella temporale) che non richiedono ground truth, accompagnate dal dataset PROVE‑Bench e codice Apache 2.0.
LTX‑2.5: un world model video open‑weights ottimizzato per GPU localiNuovo!
LTX ha rilasciato LTX‑2.5, un world model open‑weights per generazione video e applicazioni real‑time ottimizzato per GPU NVIDIA locali. Nei benchmark pubblicati, la generazione on‑prem è molto più veloce rispetto a alternative chiuse; la release promette multishot coerente e opzioni per robotics.
ByteDance Seed presenta SeedRealtime: un LLM audio‑visuale full‑duplex per interazione multimodale in tempo realeNuovo!
ByteDance Seed ha presentato SeedRealtime, un modello end‑to‑end che fonde audio, video e testo per interazioni full‑duplex su stream continui. È già integrato nell'app Doubao ma manca un report tecnico, pesi aperti e API pubbliche.
LLM observability ed evaluation: confronto 2026 e raccomandazioni per chi mette AI in produzioneNuovo!
Un confronto delle principali piattaforme di LLM observability del 2026 mostra come tracing profondo, valutazioni automatiche e monitoring di produzione siano diventati infrastruttura critica; OpenTelemetry GenAI è lo standard di portabilità da richiedere.
Reflex XY: tutorial su visualizzazioni Python scalabili con rendering a milioni di punti, streaming e mark personalizzatiNuovo!
Un tutorial illustra le capacità della libreria Python XY (Reflex) per creare visualizzazioni interattive scalabili: composizione di più mark, rendering density per milioni di punti, streaming, selezioni col ritorno al kernel e mark riutilizzabili.
Pipeline multimodale RAG con NVIDIA NeMo Retriever, NIM hosted e LanceDB
Un tutorial tecnico descrive come combinare NVIDIA NeMo Retriever, endpoint NIM hosted, LanceDB, reranking vision-language e generation grounded per trasformare PDF multimodali in conoscenza indicizzata e citabile.
Cloudflare Kitesurf: un browser 'agent-first' in V8 isolates pensato per ridurre costi e scala degli agenti AI
Cloudflare ha lanciato Kitesurf, un browser senza Chromium che gira interamente in V8 isolates su Cloudflare Workers, ottimizzato per agenti AI: promette riduzioni di CPU e memoria significative a discapito di maggiore latenza in alcuni compiti.
SkillOpt: un artefatto testuale di competenze che si trasferisce tra modelli e harness diversi
SkillOpt ottimizza un file testuale di skill (best_skill.md) su modelli fissi e mostra che procedure operative — in particolare per task su fogli di calcolo — possono trasferirsi tra modelli e tra harness (Codex ↔ Claude Code) con perdite limitate.










