SkillOpt: un artefatto testuale di competenze che si trasferisce tra modelli e harness diversi
Cosa è accaduto
Un gruppo di ricerca guidato da Microsoft ha presentato SkillOpt, un ottimizzatore nello spazio testuale che produce un singolo documento di skill (best_skill.md) mentre il modello target resta congelato. L’esperimento dimostra che questi artefatti testuali, composti da poche modifiche accettate, possono essere esportati e applicati su modelli e harness diversi con risultati spesso migliori del baseline senza alcuna riottimizzazione.
Perché è importante
Il risultato cambia la prospettiva operativa sulle skill agentiche: invece di distribuire pesi fine-tuned o invocare modelli addizionali in produzione, è possibile addestrare offline un documento leggibile e tracciabile. Quando il trasferimento mantiene buona parte del guadagno ottenuto con l’addestramento in-domain, il costo di training si diluisce su più ambienti e la verifica umana dell’artefatto diventa pratica.
Possibili impatti
I dati riportati coprono tre tipi di trasferimento: cross-model (varianti GPT-5.4), cross-harness (Codex ↔ Claude Code su GPT-5.5) e cross-benchmark (OlympiadBench → Omni-MATH). Esempi concreti: uno skill addestrato in Codex ha sollevato Claude Code da 22.1 a 81.8 punti su SpreadsheetBench, leggermente sopra il risultato in-domain di 80.4; in altri casi la retention varia ampiamente (es. 82% su GPT-5.4-mini per SpreadsheetBench, ma solo 16% su GPT-5.4-nano in un’altra riga). Proceduralità e tipo di compito emergono come fattori determinanti: le skill che codificano procedure di ispezione, verifica e materializzazione di valori sono più portabili; competenze di ragionamento matematico trasferiscono meno efficacemente.
Dal punto di vista operativo, l’artefatto ha dimensione contenuta (379–1.995 token, mediana ≈920) ed è prodotto con 1–4 edit accettati. L’ottimizzatore usa rollouts valutati su hold-out e accetta modifica solo se migliora il punteggio, rendendo ogni modifica tracciabile tramite report di applicazione.
Una possibile lettura
I risultati suggeriscono che un’architettura di sviluppo centrata su artefatti testuali di skill può essere praticabile per casi d’uso procedurali: addestrare dove è più economico e distribuire senza costi di inferenza aggiuntivi. Tuttavia la prova non è generalizzata: la sperimentazione riguarda una famiglia GPT, due harness principali e pochi benchmark. Le differenze di retention tra task indicano che la strategia è più adatta a skill proceduralizzabili che a competenze di ragionamento profondo. In sede di adozione è quindi prudente valutare task per task e misurare la perdita di guadagno quando il skill viene trasferito.
Fonte: MarkTechPost


