StepFun lancia Step 5 Preview: MoE da 600B con 1M token di contesto e focus sul costo per agenti a lungo orizzonte
Cosa è accaduto
StepFun ha rilasciato Step 5 Preview, un modello sparse Mixture‑of‑Experts (MoE) progettato per carichi agentici a lungo orizzonte come engineering del software, lavoro conoscitivo professionale e finanza. Il modello dichiara circa 600 miliardi di parametri totali e circa 27 miliardi attivati per token (circa il 4,5% della rete per token), offre una finestra di contesto fino a 1 milione di token e supporta input testuali, immagini e video. La novità viene proposta soprattutto come alternativa a basso costo per esecuzioni prolungate via API ospitata; i pesi aperti sono pianificati per il 15 ottobre 2026.
Perché è importante
La combinazione di architettura MoE, contesto molto esteso e ottimizzazioni per RL a lungo orizzonte mira a ridurre il costo per singola attività complessa svolta da agenti automatizzati. StepFun rende disponibili prezzi listino per token (input cache‑miss $1.00/1M, input cache‑hit $0.05/1M, output $2.70/1M) e segnala tecniche come FP8 MoE, KV‑cache offload e MTP‑3 speculative decoding per aumentare efficienza e throughput. La possibilità di attivare solo una porzione limitata dei pesi per token è centrale per contenere i costi operativi: tuttavia, la quantità di token generati durante la fase di ragionamento influisce direttamente sul conto finale.
Possibili impatti
Dal punto di vista tecnico, il layout «narrow‑and‑deep» con 92 layer Transformer è pensato per favorire percorsi di ragionamento multi‑hop impliciti durante prefill e fasi di integrazione con tool esterni; ciò può migliorare l'efficacia degli agenti che eseguono molteplici azioni sequenziali. Per l'implementazione, la stima indicata dalla fonte è che i 600B richiederanno circa 1,2 TB in BF16 prima della cache KV, implicando infrastrutture multi‑GPU per l'hosting dei pesi una volta pubblicati.
Dal punto di vista economico e operativo, il modello è offerto oggi come API ospitata: questo abbassa la barriera d'ingresso per le organizzazioni che vogliano sperimentare agenti long‑horizon senza sostenere subito costi di infrastruttura elevati. Contemporaneamente, verifiche indipendenti citate misurano comportamento diverso rispetto ai benchmark aziendali: StepFun riporta risultati competitivi su benchmark selezionati, ma un controllo di Artificial Analysis assegna al modello un punteggio 44 su un indice di intelligenza e rileva un elevato numero di token di output (160M nell'esecuzione indicata), che può erodere i vantaggi di prezzo nel caso di ragionamenti verbosi.
Una possibile lettura
I dati disponibili delineano due tendenze convergenti: da un lato, le architetture MoE con finestre di contesto molto estese e ottimizzazioni per RL a lungo raggio stanno diventando praticabili per carichi agentici reali; dall'altro, il vincolo economico rimane il consumo di token durante il ragionamento. Se il modello mantiene la promessa di prestazioni adeguate a costi inferiori per task agentici, potrebbe accelerare l'adozione di agenti in ambiti dove il lavoro è sequenziale e orientato a processi complessi. Tuttavia, il risparmio effettivo dipenderà da metriche operative come il numero di token generati per run, l'efficacia del caching e la maturità delle integrazioni con tool esterni.
La pubblicazione dei pesi annunciata per ottobre 2026 rappresenta un passaggio cruciale: renderà possibili verifiche indipendenti più estese, build self‑hosted e ottimizzazioni da parte della comunità che potrebbero ridurre ulteriormente i costi o rivelare limiti pratici non visibili con solo test API. Nel frattempo, le organizzazioni interessate a agenti long‑horizon devono valutare attentamente il trade‑off tra accesso immediato via API e la necessità futura di investire in infrastrutture per il self‑hosting.
Fonte: MarkTechPost


