OpenAI lancia GPT-6 Sol e Luna: modelli API-only, prezzi dimezzati e nuove funzionalità di prompt caching

Cosa è accaduto

OpenAI ha pubblicato due nuovi modelli della famiglia GPT-6, GPT-6 Sol e GPT-6 Luna, resi disponibili oggi tramite API come gpt-6-sol e gpt-6-luna. I due modelli sono API-only, quindi non sono disponibili pesi per il self-hosting, e sono stati addestrati con metodi analoghi a quelli impiegati per GPT-6 Astra, che rimane il livello superiore della famiglia.

Secondo la comunicazione raccolta dalla fonte, OpenAI ha ridotto i prezzi per Sol e Luna rispetto alle tariffe promozionali di GPT-5.6: GPT-6 Sol è quotato a $2.00 input / $10.00 output per 1M token (era $4 / $20), mentre GPT-6 Luna è quotato a $0.10 input / $0.50 output per 1M token (era $0.20 / $1.20). La società indica una riduzione di prezzo del 50% in confronto alle quote promozionali antecedenti; nel caso specifico la riduzione dell'output di Luna è di circa il 58% rispetto al valore precedente.

Perché è importante

La notizia è rilevante perché combina due elementi che incidono direttamente sui costi e sul design di sistemi che integrano modelli di linguaggio: prezzi significativamente più bassi su due livelli ottimizzati per volumi diversi e interventi tecnici mirati alla riduzione del carico di elaborazione dei prompt. Questo può influire sulle valutazioni di costo-per-task per applicazioni ad alto volume o per agenti persistenti che rielaborano contesti lunghi.

OpenAI ha inoltre pubblicato benchmark riferiti a diverse suite di valutazione: AutomationBench (Sol 33.2% a costo per task segnalato di $0.27), Agents’ Last Exam (Sol 56.4% al massimo sforzo), DeepSWE v1.1 (Sol 68.8%, Luna 66.6%), FrontierCode e OSWorld 2.0. Nei test di factuality interni, Sol compie circa la metà degli errori del predecessore e Luna, a sforzi maggiori, raggiunge livelli di accuratezza comparabili al modello precedente a costi molto inferiori, secondo i dati riportati.

Possibili impatti

Per team di prodotto e operation, la combinazione di lower-tier pricing e caching avanzato può tradursi in risparmi sostanziali: per flussi ad alto volume la scelta di Luna potrebbe ridurre il costo operativo, mentre Sol viene proposto come compromesso per attività professionali e di coding complesse. Le percentuali di riduzione costo-per-task riportate dalla fonte andranno verificate caso per caso sulle workload reali.

Dal punto di vista tecnico, GPT-6 introduce un sistema di prompt caching con sconti fino al 90% sulle letture cache e riconoscimento di prefissi riutilizzabili entro una finestra di 30 minuti. Sono presenti nuovi strumenti per sviluppatori: una Prompt Caching Dashboard, diagnostica sulle cache, breakpoints espliciti, la possibilità di cambiare l’effort di ragionamento via configuration_update senza invalidare la cache, il parametro allowed_tools e meccanismi di prewarming. Questi controlli possono modificare le strategie di progettazione di agenti a lunga durata e di servizi conversazionali che riutilizzano contesti condivisi.

Una possibile lettura

I fatti riportati dalla fonte suggeriscono che OpenAI stia consolidando una strategia a più livelli per permettere trade-off più espliciti tra capacità e costo: Astra per il lavoro più impegnativo, Sol per compiti professionali con focus su coding e qualità, Luna per volumi elevati e latenza/budget contenuti. In termini pratici, l'adozione di Sol o Luna dipenderà dal rapporto tra qualità richiesta e costo per task nelle singole applicazioni.

Resta cruciale che le organizzazioni effettuino test propri sulle proprie workload: i benchmark pubblicati forniscono indicazioni utili, ma la differenza di costo-efficienza effettiva dipenderà dalle caratteristiche dei carichi, dall'utilizzo del caching e dalle scelte di integrazione degli strumenti (allowed_tools, breakpoints, prewarming). Infine, verificare le condizioni ufficiali e la disponibilità effettiva sui provider è consigliato prima di riorientare budget o architetture.

Fonte: MarkTechPost