Savings Layer fa parte della piattaforma BiVelio
Il layer di costo LLM che chiunque può installare — con licenza per l'esecuzione

Dimostra i risparmi sui tuoi dati.

BV-SALA si posiziona davanti al tuo provider e, per ogni richiesta, sceglie l'esecuzione più economica che rispetta comunque il tuo standard di qualità. Ogni cifra di questa pagina è misurata con il contatore del provider stesso, con accanto il suo intervallo di confidenza — mai una stima.

Installazione in cinque righe. La licenza si attiva dalla tua dashboard.
OpenAIAnthropicGoogle
Misurato contro un provider reale
OpenAIgpt-4o-mini
≥ 23,1%di fattura in meno, verificato al 95%
Anthropicclaude-sonnet-4-5
78%di costo in meno con la cache di prefisso
Vince l'esecuzione più economicamisurato · soglia del 95%
01Evita del tutto la chiamataresolver · cache esatta · singleflight17.9%
02Togli ciò che non serviva inviarestrumenti potati · retrieval · contesto ridondante38.6%
03Comprimi ciò che restacodifica più leggera · solo se conviene45.1%
Book 15-min callTi diciamo quanto risparmieresti con il tuo traffico, senza installare nulla.

Ogni passo cade in UN registro diverso, quindi queste cifre non si sommano tra loro. Un passo il cui registro non supera lo zero non compare qui: la restrizione dell'output è stata misurata e non fa risparmiare, quindi non viene annunciata.

Passo 2 · Come si misurano i risparmi — riproducibile

Entrambi i rami misurati dal tokenizer del provider stesso — nessuna baseline modellata.

Questo è l'output del benchmark A/B (pnpm ab): per ogni scenario invia una richiesta ingenua e la richiesta BV‑SALA allo stesso modello, calcola il prezzo di entrambe dall'utilizzo di token del provider stesso e riporta il limite inferiore di confidenza al 95% — mai la lusinghiera stima puntuale. Nulla è modellato.

LIVE · la tua orgLIVE — misurato contro un provider reale, con controllo qualità.
23.1%
risparmio netto, limite inferiore dell'IC al 95%. Stima puntuale 31.0%, superiore 38.1% — evidenziamo il minimo.
−5.0%0%60.0%
avoided_calls
59.1%
95% ≥ 17.9% · Δ $0.000193
comprovato
eliminated_tokens
43.0%
95% ≥ 38.6% · Δ $0.003352
comprovato
compressed_tokens
49.3%
95% ≥ 45.1% · Δ $0.009909
comprovato
provider_cached
non esercitata in questa esecuzione — il suo zero non è una misurazione
output_restriction
1.0%
95% ≥ −9.1% · Δ $0.000012
non comprovato
output_codebook
non esercitata in questa esecuzione — il suo zero non è una misurazione

Quattro registri, mai sommati — ognuno è una leva misurata separatamente, così un dollaro non può essere contato due volte. Il residuo di riconciliazione ≈ 0 lo dimostra. Queste sono leve di riferimento: la tua linea in tempo reale ne misura altre quattro — provider-cached sostituisce output-restriction — quindi non le facciamo mai coincidere.

Controllo qualità 100% superatoI registri quadranoStesso modello su entrambi i ramiPareggio della cache K=2comprovato al 95%Una risposta peggiorata annulla il suo risparmio
scenariotipoA in/outB in/outcosto Acosto Brisparmioqa
Local arithmeticresolver19/770/0$0.000049$0.00100.0%4/4
Forwarded support thread (compression)ran3,838/3681,861/194$0.000703$0.00035449.7%24/24
Large uniform tableran1,212/319781/116$0.000356$0.00018747.6%9/9
Big tool catalogue (schema-on-demand)ran3,091/2161,062/263$0.000575$0.00031744.9%12/12
Tool-heavy requestran300/30121/36$0.000063$0.00003937.3%11/11
Stable-prefix agent turnran5,307/585,307/58$0.000655$0.0006234.9%24/24
Constrained structured answerran60/7160/70$0.000052$0.0000511.0%24/24
FAQ (first ask)ran72/1972/19$0.000022$0.0000220.7%11/11
Triage decision (output codebook)ran184/72184/72$0.000071$0.0000710.0%8/8
Summarize provided textran66/2566/25$0.000025$0.000025−0.3%8/8
FAQ (repeat ask)cache72/1872/19$0.000022$0.000022−2.8%6/6
cache · ammortizzataFAQ (repeat ask): miss a freddo $0.000022 → hit $0.00. Va in pareggio a K=2 ripetizioni — il risparmio della cache riguarda il traffico ripetuto, non una singola chiamata, quindi una chiamata a freddo segna onestamente ≈0%.
Anthropicclaude-sonnet-4-5
Misurato · cache di prefisso di Anthropic

Anthropic non fa cache da sola. La tua integrazione non gliela chiede; la nostra sì.

OpenAI applica la sua cache di prefisso automaticamente: quello sconto ce l'hai con noi o senza di noi. Anthropic no. Richiede di marcare il punto di taglio a ogni richiesta, e chi non lo marca paga l'input intero, sempre.

Cosa è stato misurato

Un turno di agente con contesto di sistema lungo e ripetuto — un assistente di supporto, un estrattore documentale. Otto coppie, stesso modello in entrambi i bracci, tariffati con il contatore di Anthropic stessa.

Senza il layer
0 token serviti dalla cache
Con il layer
58.624 token serviti dalla cache
78%di costo in meno su quelle richieste · limite inferiore al 95% a 78,0% · qualità 8/8, nessuna regressione

Cosa NON dice questa cifra

È il risparmio di quella leva su quel traffico, non quello della tua fattura intera. Viene dallo scenario a prefisso stabile, dove stanno i soldi della cache; su traffico senza contesto ripetuto questa leva vale zero. Il dato principale della campagna completa si misura a parte, e lo pubblichiamo con il suo intervallo, sopra.

E non devi crederci sulla parola

È verificabile sulla tua stessa fattura senza installare nulla: guarda se le tue chiamate a Claude portano cache_read_input_tokens. Se escono a zero, quello sconto oggi lo stai lasciando sul tavolo.

OpenAIgpt-4o-mini
Contabilità onesta

Quattro registri separati. Mai sommati in un'unica cifra di facciata.

Un hit della cache elimina un'intera chiamata. BV‑SALA ricodifica i dati strutturati in modo più compatto. La compressione elimina le parole ridondanti. Una cache di prefisso del provider rende i token più economici senza eliminarli. Mescolarli ti inganna — quindi non lo facciamo.

Quattro registri misurati contro l'API di OpenAI. Una percentuale senza il suo modello accanto non significa nulla: la stessa leva può far risparmiare su un modello e costare su un altro.

01

avoided_calls

Chiamate a LLM, recupero e strumenti che non sono mai state eseguite.

17.9%
misurato · soglia del 95%
02

eliminated_tokens

Informazioni eliminate perché semplicemente non necessarie.

38.6%
misurato · soglia del 95%
03

compressed_tokens

Informazioni conservate, ma codificate con meno token.

45.1%
misurato · soglia del 95%
Cinque righe per iniziare

Eseguilo nella tua app. I tuoi prompt non toccano mai i nostri server.

Metti l'SDK davanti al tuo provider. Ogni risposta include un SavingsReport completo che puoi rappresentare in grafici — le stesse cifre che legge la dashboard.

# 1 · il pacchetto
pnpm add @bivelio/savings-layer

# 2 · la licenza (dalla tua dashboard)
export BIVELIO_LICENSE_KEY=…

# 3 · avvolgere la chiamata — questo è tutto il cambio di codice
const layer = createSavingsLayer({ provider, licenseKey, … });
const { text, report } = await layer.generate({ model, messages });

console.log(report.cost.netSavings)  // ← il risparmio, misurato
Salesforce HubSpot Odoo Zapier n8n UiPath

Dove già vivono le tue automazioni. Se chiama l'API di OpenAI o Anthropic con la tua chiave, si misura — l'SDK avvolge la chiamata; il gateway si mette davanti.

Novità · terminali di codice

Claude Code con chiave API? Guarda la spesa reale, token per token.

Un solo comando mette un contatore locale davanti al tuo terminale. Niente codice da toccare, niente da configurare — e i tuoi prompt non lasciano mai la tua macchina: a questo pannello arrivano solo conteggi e costo.

npm i -g @bivelio/savings-layer
export BIVELIO_SERVICE_KEY=bvk_…

bvsala claude

Oggi misura; lì non ottimizza ancora. Funziona anche con Codex CLI, Goose e Qwen Code — e bvsala doctor stampa la configurazione esatta del resto. Guarda come funziona →

savings-mode · skill gratuita

La skill che allunga i tuoi limiti di abbonamento

Niente fattura non significa niente dolore: la finestra di cinque ore e il tetto settimanale. savings-mode è una skill di sole istruzioni — nessun proxy, il tuo traffico intatto — che taglia le due masse che davvero bruciano il tetto: l'output del modello e i risultati degli strumenti. È gratuita; ciò che si paga con Savings è sapere quanto ti fa risparmiare.

01

letture di cache

L'intero contesto viene riletto a ogni turno — per questo tenerlo snello conta.

68,2%
della spesa misurata
02

scrittura di cache (un'ora)

Ogni risultato di strumento viene scritto in cache con sovrapprezzo prima di essere riletto.

19,6%
della spesa misurata
03

output del modello

Meno dell'uno per cento dei token; la skill lo attacca direttamente.

11,6%
della spesa misurata

Misurato con il misuratore su 959 richieste reali di Claude Code, contro i contatori del provider (2026-09-01). L'effetto della skill stessa sarà pubblicato quando sarà misurato in A/B — mai prima.

npx -y @bivelio/savings-layer skill

Un solo comando: si installa in ~/.claude/skills e si attiva da sola quando la conversazione parla di limiti o di risparmiare token.

Un unico piano, con prezzo per postazione

Pochi centesimi per eseguirlo. Molto di più da risparmiare.

Nessun piano gratuito e nessuna prova: quello che puoi verificare prima di pagare è il risparmio MISURATO qui sopra, con accanto il suo intervallo. Ti abboni e lo esegui nella tua app. Prezzo per postazione, in EUR.

4 € / postazione / mese

PRO — fatturato per postazione. Oppure 39 € / postazione / anno (risparmi ~19%). Enterprise, con funzionalità in pacchetto, arriverà più avanti.

IVA esclusa. Se la Sua azienda ha una partita IVA intracomunitaria, si applica l'inversione contabile.

Una postazione è una macchina o identità di servizio attiva, non una persona — fatturata solo se attiva per 3+ giorni in un mese. CI e runner effimeri non contano.

  • Ogni ottimizzazione BV‑SALA, senza limiti
  • Cache semantica gestita e soglie apprese
  • Dashboard di risparmio e analitiche di team
  • I tuoi prompt non lasciano mai la tua infrastruttura
Inizia ora →

E quanto ci pagheresti tu?

Stima

Gioca con i tuoi numeri: scegli provider e modello, e guarda il tuo risparmio, il nostro extra e quello che ti resta — con i prezzi reali del catalogo e la tariffa reale.

Caricamento del catalogo prezzi…

Come si calcola quello che ci paghi

  • Il tuo primo mese: solo 4 € per posto. Misuriamo tutto e non addebitiamo commissioni — alla chiusura vedrai l'estratto esatto di quanto sarebbe costato.
  • Dopo, commissione solo sul risparmio misurato: quello che puoi riscontrare con la fattura del tuo provider. Lo stimato non si fattura mai.
  • E ti tieni sempre il 90% o più di ogni euro risparmiato: la commissione esiste solo quando esiste il tuo risparmio misurato.
  • A scaglioni, ciascuno alla sua aliquota — 10% ≤ 1000 € · 8% ≤ 5000 € · 6% ≤ 20.000 € · 4% +. Più risparmi, più basso è il nostro percentuale.
  • Un mese senza risparmio? Commissione: 0 €. Senza vincoli — e la tua prima fattura variabile contiene solo numeri che hai già visto nel tuo estratto.