Dimostra i risparmi sui tuoi dati.
BV-SALA si posiziona davanti al tuo provider e, per ogni richiesta, sceglie l'esecuzione più economica che rispetta comunque il tuo standard di qualità. Ogni cifra di questa pagina è misurata con il contatore del provider stesso, con accanto il suo intervallo di confidenza — mai una stima.
gpt-4o-miniclaude-sonnet-4-5Ogni passo cade in UN registro diverso, quindi queste cifre non si sommano tra loro. Un passo il cui registro non supera lo zero non compare qui: la restrizione dell'output è stata misurata e non fa risparmiare, quindi non viene annunciata.
Entrambi i rami misurati dal tokenizer del provider stesso — nessuna baseline modellata.
Questo è l'output del benchmark A/B (pnpm ab): per ogni scenario invia una richiesta ingenua e la richiesta BV‑SALA allo stesso modello, calcola il prezzo di entrambe dall'utilizzo di token del provider stesso e riporta il limite inferiore di confidenza al 95% — mai la lusinghiera stima puntuale. Nulla è modellato.
Quattro registri, mai sommati — ognuno è una leva misurata separatamente, così un dollaro non può essere contato due volte. Il residuo di riconciliazione ≈ 0 lo dimostra. Queste sono leve di riferimento: la tua linea in tempo reale ne misura altre quattro — provider-cached sostituisce output-restriction — quindi non le facciamo mai coincidere.
| scenario | tipo | A in/out | B in/out | costo A | costo B | risparmio ▾ | qa |
|---|---|---|---|---|---|---|---|
| Local arithmetic | resolver | 19/77 | 0/0 | $0.000049 | $0.00 | 100.0% | 4/4 |
| Forwarded support thread (compression) | ran | 3,838/368 | 1,861/194 | $0.000703 | $0.000354 | 49.7% | 24/24 |
| Large uniform table | ran | 1,212/319 | 781/116 | $0.000356 | $0.000187 | 47.6% | 9/9 |
| Big tool catalogue (schema-on-demand) | ran | 3,091/216 | 1,062/263 | $0.000575 | $0.000317 | 44.9% | 12/12 |
| Tool-heavy request | ran | 300/30 | 121/36 | $0.000063 | $0.000039 | 37.3% | 11/11 |
| Stable-prefix agent turn | ran | 5,307/58 | 5,307/58 | $0.000655 | $0.000623 | 4.9% | 24/24 |
| Constrained structured answer | ran | 60/71 | 60/70 | $0.000052 | $0.000051 | 1.0% | 24/24 |
| FAQ (first ask) | ran | 72/19 | 72/19 | $0.000022 | $0.000022 | 0.7% | 11/11 |
| Triage decision (output codebook) | ran | 184/72 | 184/72 | $0.000071 | $0.000071 | 0.0% | 8/8 |
| Summarize provided text | ran | 66/25 | 66/25 | $0.000025 | $0.000025 | −0.3% | 8/8 |
| FAQ (repeat ask) | cache | 72/18 | 72/19 | $0.000022 | $0.000022 | −2.8% | 6/6 |
claude-sonnet-4-5Anthropic non fa cache da sola. La tua integrazione non gliela chiede; la nostra sì.
OpenAI applica la sua cache di prefisso automaticamente: quello sconto ce l'hai con noi o senza di noi. Anthropic no. Richiede di marcare il punto di taglio a ogni richiesta, e chi non lo marca paga l'input intero, sempre.
Cosa è stato misurato
Un turno di agente con contesto di sistema lungo e ripetuto — un assistente di supporto, un estrattore documentale. Otto coppie, stesso modello in entrambi i bracci, tariffati con il contatore di Anthropic stessa.
- Senza il layer
- 0 token serviti dalla cache
- Con il layer
- 58.624 token serviti dalla cache
Cosa NON dice questa cifra
È il risparmio di quella leva su quel traffico, non quello della tua fattura intera. Viene dallo scenario a prefisso stabile, dove stanno i soldi della cache; su traffico senza contesto ripetuto questa leva vale zero. Il dato principale della campagna completa si misura a parte, e lo pubblichiamo con il suo intervallo, sopra.
E non devi crederci sulla parola
È verificabile sulla tua stessa fattura senza installare nulla: guarda se le tue chiamate a Claude portano cache_read_input_tokens. Se escono a zero, quello sconto oggi lo stai lasciando sul tavolo.
gpt-4o-miniQuattro registri separati. Mai sommati in un'unica cifra di facciata.
Un hit della cache elimina un'intera chiamata. BV‑SALA ricodifica i dati strutturati in modo più compatto. La compressione elimina le parole ridondanti. Una cache di prefisso del provider rende i token più economici senza eliminarli. Mescolarli ti inganna — quindi non lo facciamo.
Quattro registri misurati contro l'API di OpenAI. Una percentuale senza il suo modello accanto non significa nulla: la stessa leva può far risparmiare su un modello e costare su un altro.
avoided_calls
Chiamate a LLM, recupero e strumenti che non sono mai state eseguite.
eliminated_tokens
Informazioni eliminate perché semplicemente non necessarie.
compressed_tokens
Informazioni conservate, ma codificate con meno token.
Eseguilo nella tua app. I tuoi prompt non toccano mai i nostri server.
Metti l'SDK davanti al tuo provider. Ogni risposta include un SavingsReport completo che puoi rappresentare in grafici — le stesse cifre che legge la dashboard.
# 1 · il pacchetto pnpm add @bivelio/savings-layer # 2 · la licenza (dalla tua dashboard) export BIVELIO_LICENSE_KEY=… # 3 · avvolgere la chiamata — questo è tutto il cambio di codice const layer = createSavingsLayer({ provider, licenseKey, … }); const { text, report } = await layer.generate({ model, messages }); console.log(report.cost.netSavings) // ← il risparmio, misurato
Dove già vivono le tue automazioni. Se chiama l'API di OpenAI o Anthropic con la tua chiave, si misura — l'SDK avvolge la chiamata; il gateway si mette davanti.
Claude Code con chiave API? Guarda la spesa reale, token per token.
Un solo comando mette un contatore locale davanti al tuo terminale. Niente codice da toccare, niente da configurare — e i tuoi prompt non lasciano mai la tua macchina: a questo pannello arrivano solo conteggi e costo.
npm i -g @bivelio/savings-layer export BIVELIO_SERVICE_KEY=bvk_… bvsala claude
Oggi misura; lì non ottimizza ancora. Funziona anche con Codex CLI, Goose e Qwen Code — e bvsala doctor stampa la configurazione esatta del resto. Guarda come funziona →
La skill che allunga i tuoi limiti di abbonamento
Niente fattura non significa niente dolore: la finestra di cinque ore e il tetto settimanale. savings-mode è una skill di sole istruzioni — nessun proxy, il tuo traffico intatto — che taglia le due masse che davvero bruciano il tetto: l'output del modello e i risultati degli strumenti. È gratuita; ciò che si paga con Savings è sapere quanto ti fa risparmiare.
letture di cache
L'intero contesto viene riletto a ogni turno — per questo tenerlo snello conta.
scrittura di cache (un'ora)
Ogni risultato di strumento viene scritto in cache con sovrapprezzo prima di essere riletto.
output del modello
Meno dell'uno per cento dei token; la skill lo attacca direttamente.
Misurato con il misuratore su 959 richieste reali di Claude Code, contro i contatori del provider (2026-09-01). L'effetto della skill stessa sarà pubblicato quando sarà misurato in A/B — mai prima.
npx -y @bivelio/savings-layer skillUn solo comando: si installa in ~/.claude/skills e si attiva da sola quando la conversazione parla di limiti o di risparmiare token.
Pochi centesimi per eseguirlo. Molto di più da risparmiare.
Nessun piano gratuito e nessuna prova: quello che puoi verificare prima di pagare è il risparmio MISURATO qui sopra, con accanto il suo intervallo. Ti abboni e lo esegui nella tua app. Prezzo per postazione, in EUR.
PRO — fatturato per postazione. Oppure 39 € / postazione / anno (risparmi ~19%). Enterprise, con funzionalità in pacchetto, arriverà più avanti.
IVA esclusa. Se la Sua azienda ha una partita IVA intracomunitaria, si applica l'inversione contabile.
Una postazione è una macchina o identità di servizio attiva, non una persona — fatturata solo se attiva per 3+ giorni in un mese. CI e runner effimeri non contano.
- Ogni ottimizzazione BV‑SALA, senza limiti
- Cache semantica gestita e soglie apprese
- Dashboard di risparmio e analitiche di team
- I tuoi prompt non lasciano mai la tua infrastruttura
E quanto ci pagheresti tu?
StimaGioca con i tuoi numeri: scegli provider e modello, e guarda il tuo risparmio, il nostro extra e quello che ti resta — con i prezzi reali del catalogo e la tariffa reale.
Caricamento del catalogo prezzi…
Come si calcola quello che ci paghi
- Il tuo primo mese: solo 4 € per posto. Misuriamo tutto e non addebitiamo commissioni — alla chiusura vedrai l'estratto esatto di quanto sarebbe costato.
- Dopo, commissione solo sul risparmio misurato: quello che puoi riscontrare con la fattura del tuo provider. Lo stimato non si fattura mai.
- E ti tieni sempre il 90% o più di ogni euro risparmiato: la commissione esiste solo quando esiste il tuo risparmio misurato.
- A scaglioni, ciascuno alla sua aliquota — 10% ≤ 1000 € · 8% ≤ 5000 € · 6% ≤ 20.000 € · 4% +. Più risparmi, più basso è il nostro percentuale.
- Un mese senza risparmio? Commissione: 0 €. Senza vincoli — e la tua prima fattura variabile contiene solo numeri che hai già visto nel tuo estratto.