Dove finiscono i token dell’AI: tre controlli sul consumo
Una domanda breve può consumare molti token. Il motivo sta in quello che l’assistente si porta dietro a ogni risposta.
Anthropic lo spiega per Claude Code: a ogni turno il modello considera la conversazione precedente, le istruzioni del progetto e la nuova richiesta. Più la conversazione è lunga e più documenti ha letto, più pesa ogni domanda, anche quella di una riga.
Per Codex, OpenAI indica i fattori che incidono sul consumo: il modello scelto, la complessità del lavoro, il contesto, il ragionamento e gli strumenti usati.
Conta anche il modello. Sempre secondo Anthropic, Opus usa sensibilmente più quota di Sonnet.
Come vedere dove finiscono
Nel terminale di Claude Code ci sono due comandi:
/usagemostra il consumo e i limiti del tuo piano;/contextmostra cosa occupa spazio nella conversazione e suggerisce come alleggerirla.
Lanciali a metà di un lavoro lungo: vedi subito quanto pesa quello che l’assistente si porta dietro.
Tre controlli prima del prossimo lavoro
- Una sessione per lavoro. Quando cambi attività, apri una sessione nuova.
- Solo i documenti utili. Fai leggere quello che serve a quel lavoro.
- Il modello giusto per il compito. Un modello leggero per le attività ordinarie, uno più forte per quelle difficili.
Il criterio
Il contesto stabile della tua azienda va tenuto in file che l’assistente legge quando servono: memoria, regole, documenti e procedure, in una casa sola.
Così ogni sessione parte leggera e riprende subito il filo.
Il risparmio va misurato sul tuo lavoro. Prova per una settimana e confronta i numeri di /usage prima e dopo.
Come lavoriamo noi
Nell’Ecosistema memoria, regole, documenti e procedure della tua azienda stanno in una cartella tua. Claude Code e Codex leggono la stessa cartella.
Così puoi cambiare assistente senza ricostruire ogni volta il contesto.
Di questo si parla ogni settimana dentro AI con Sal.
Entra nella community
