Luglio 2026
Tono sicuro, verità incerta: perché i modelli di linguaggio possono sembrare convincenti anche quando sbagliano
I modelli di linguaggio spesso rispondono con tono sicuro perché sono addestrati a prevedere il token successivo: la loro "fiducia" misura la probabilità linguistica, non la veridicità. Questo articolo spiega il fenomeno e suggerisce come ridurre il rischio di essere fuorviati.
Fireworks Nexus: layer di routing e controllo costi per spostare compiti di routine su open-weight models
Fireworks ha lanciato Nexus, una piattaforma che unisce controllo dei costi, compatibilità con gli strumenti di sviluppo esistenti e un router che inoltra richieste semplici a modelli open-weight, riducendo i costi sistemici secondo dati preliminari e studi indipendenti.
Quando il pensiero rende persuasivi gli errori
La tecnica chain-of-thought chiede al modello di esplicitare i passaggi logici: può migliorare il ragionamento su problemi complessi, ma i passaggi intermedi possono rendere gli errori più convincenti. Scopri quando usare la catena di ragionamento e come verificarne i punti critici.
Perplexity lancia pplx, CLI single‑binary per la Search API pensata per agenti
Perplexity ha rilasciato pplx, un client CLI single‑binary per la sua Search API che restituisce risultati e testo pulito in JSON. Contratto I/O esplicito, autenticazione TTY vs variabile d'ambiente e strumenti per gestire il budget token rendono lo strumento pensato anche per coding agents.
In‑context learning: apprendimento temporaneo
L'in‑context learning è il fenomeno per cui un modello modifica temporaneamente il proprio comportamento leggendo esempi nel prompt. Questo articolo spiega cosa succede, come verificare se un cambiamento dipende dal prompt e quando ricorrere a soluzioni persistenti.
Photon-1: modello 'imagination' che impara da video senza etichette e simula desktop
Induction Labs presenta Photon-1, un modello di 'imagination' preaddestrato su 18 anni di video desktop senza etichette d’azione. L’approccio usa una compressione FSQ molto densa e, secondo i test interni, consuma molto meno compute e generalizza a simulazioni come biliardo e damiera.
Sakana rilascia Fugu-Cyber: un endpoint di orchestrazione che dichiara 86,9% su CyberGym e 72,1% su CTI-REALM
Sakana presenta Fugu-Cyber, variante del suo orchestratore Fugu dedicata alla sicurezza: risultati vendor‑segnalati elevati su due benchmark distinti, accesso gated, nessun peso distribuibile e costi pubblicati con premio del 20%.
TileLang per kernel GPU ad alte prestazioni: tensor‑core GEMM, FlashAttention, epiloghi fusi e autotuning
Un tutorial pubblicato su MarkTechPost mostra come TileLang, un DSL Python basato su TVM, consenta di progettare, compilare e autotunare kernel GPU ottimizzati per GEMM su tensor‑core, softmax fuso e FlashAttention, confrontando i risultati con PyTorch e cuBLAS.
Datalab Marker 2: throughput molto più alto di MinerU e confronto con Docling e LiteParse
Datalab rilascia Marker 2: rewrite del pipeline di conversione documenti che, secondo i test forniti, raggiunge 76.0% su olmOCR-bench e 2.9 pg/s su una B200 GPU, cambiando le scelte tecniche e di licensing per implementazioni ad alto volume.
OpenWorker: il desktop agent open-source di Andrew Ng che consegna deliverable, non chat
OpenWorker è un agente desktop open‑source, local‑first e MIT‑licensed che lavora per obiettivi (outcomes), opera su file locali e connettori e adotta un motore di permessi tipizzato per ogni azione.








