TL;DR

    • Esegui in produzione in modo efficiente. Usa caching e compaction per gestire il contesto e i costi. Misura il successo dei task, la latenza e pianifica monitoraggio e controlli sui dati.
    • Abbina il modello al carico di lavoro. Bilancia capacità, costo e latenza scegliendo modello, livello di ragionamento e velocità adatti al compito.
    • Regola prompt e competenze. Mantieni coerenza su cosa il modello deve consegnare, cosa può fare autonomamente e cosa conta come completato.
    • Gestisci lavori prolungati. Utilizza steering, strumenti asincroni e delegazione per aggiornamenti e attività indipendenti, fissando limiti chiari su quando il modello deve richiedere input.

1. Esegui in produzione in modo efficiente

Prepara il flusso di lavoro per la produzione

Prima di mettere in funzione un’applicazione, è necessario verificare una serie di controlli e best practice.

    • Mantieni l’efficienza: Riduci il contesto non necessario conservando le prove necessarie. Quando l’app supporta l’esecuzione parallela, raggruppa compiti indipendenti così un passo lento non blocca il resto.
    • Riutilizza il contesto condiviso con caching dei prompt. I token di input memorizzati costano fino al 95 % in meno rispetto a quelli non memorizzati, a seconda del modello. Inserisci istruzioni stabili e materiale di riferimento prima dei dettagli variabili e mantieni costanti le definizioni degli strumenti. La dashboard di caching e la guida diagnostica mostrano dove il riuso si interrompe. Include le scritture nella cache e i tassi di contesto lungo nella stima dei costi dell’intero flusso.
    • Per conversazioni prolungate, compaction riduce la dimensione del contesto preservando lo stato necessario per continuare.
    • Decidi come monitorare il comportamento e rivedi i controlli sui dati per la tua applicazione.
    • Esegui test prima del rilascio: avvia task rappresentativi e misura il tasso di successo, la latenza e il costo per task completato. Consulta la nostra checklist di deployment API.

Abbina il modello al carico di lavoro

Il modello e il livello di ragionamento rappresentano un trade‑off tra intelligenza e prezzo.

    • Modelli disponibili:
      • GPT‑6 Astra per i compiti di ragionamento più complessi, dove è richiesta la massima intelligenza.
      • GPT‑6.1 Sol per codifica avanzata, ricerca e utilizzo di computer.
      • GPT‑6 Luna per attività focalizzate su larga scala e lavoro ripetitivo con obiettivo chiaro, come estrazione di campi da fatture, classificazione di richieste o sintesi strutturate.
    Confronta i prezzi di ciascun modello per scegliere quello più adatto.
    • Livello di ragionamento (API):
      • Basso: attività di routine, estrazione di fatti o piccole modifiche.
      • Medio: compiti che richiedono giudizio, ad es. pianificazione di una feature o comparazione di opzioni.
      • Alto: debug difficile, analisi approfondita o revisione attenta.
      • Estremamente alto / Max: testare quando il livello Alto non basta; mantenerlo solo se il miglioramento giustifica tempo e costo aggiuntivi.
    In Codex, parti dal livello predefinito per il modello e riducilo per task più semplici o aumentalo per analisi più profonde.
    • Velocità:
      • API – Fast mode quando il tempo di risposta è cruciale, ad esempio in app di chat o strumenti di coding. Offre tempi più rapidi e più coerenti a un costo per token più alto rispetto al processamento standard.
      • API e Codex – Ultrafast quando la rapidità è premiata, ad esempio iterazioni di codice veloci. Accelera la generazione di token indipendentemente dallo sforzo di ragionamento. Disponibile per GPT‑6 Astra.

2. Regola i tuoi prompt e le competenze

Fornisci al modello un incarico chiaro

—Eric Provencher, Developer Experience at OpenAI

In