Savings Layer maakt deel uit van het BiVelio-platform
De LLM-kostenlaag die iedereen kan installeren — met licentie om te draaien

Bewijs de besparingen op je eigen gegevens.

BV-SALA staat vóór elke LLM-provider en kiest voor elk verzoek de goedkoopste uitvoering die nog aan je kwaliteitsnorm voldoet. Elk besparingscijfer dat we publiceren is gemeten tegen de tokenteller van de provider zelf, met het betrouwbaarheidsinterval erbij — nooit een schatting.

Installatie in vijf regels code. De licentie activeer je in je dashboard.
OpenAIAnthropicGoogle
Gemeten tegen een echte provider
OpenAIgpt-4o-mini
≥ 23,1%minder factuur, geverifieerd op 95%
Anthropicclaude-sonnet-4-5
78%minder kosten met prefix-cache
De goedkoopste uitvoering wintgemeten · 95%-ondergrens
01Vermijd de aanroep volledigresolvers · exacte cache · singleflight17.9%
02Verwijder wat nooit verstuurd hoefde te wordengesnoeide tools · retrieval · redundante context38.6%
03Comprimeer wat overblijftlichtere codering · alleen als het loont45.1%
Book 15-min callWe vertellen je wat je zou besparen op jouw verkeer, zonder iets te installeren.

Elke stap valt in ÉÉN ander ledger, dus deze cijfers tellen niet bij elkaar op. Een stap waarvan het ledger niet boven nul komt, staat hier niet: de uitvoerbeperking is gemeten en bespaart niet, dus we adverteren die niet.

Stap 2 · Hoe besparingen worden gemeten — reproduceerbaar

Beide takken gemeten door de tokenizer van de provider zelf — geen gemodelleerde baseline.

Dit is de uitvoer van de A/B-benchmark (pnpm ab): voor elk scenario stuurt hij een naïef verzoek en het BV‑SALA-verzoek naar hetzelfde model, prijst beide op basis van het eigen tokengebruik van de provider en rapporteert de 95%-betrouwbaarheidsondergrens — nooit de vleiende puntschatting. Niets is gemodelleerd.

LIVE · jouw organisatieLIVE — gemeten tegen een echte provider, met kwaliteitscontrole.
23.1%
netto besparingen, ondergrens van het 95%-BI. Puntschatting 31.0%, bovengrens 38.1% — we zetten de ondergrens voorop.
−5.0%0%60.0%
avoided_calls
59.1%
95% ≥ 17.9% · Δ $0.000193
bewezen
eliminated_tokens
43.0%
95% ≥ 38.6% · Δ $0.003352
bewezen
compressed_tokens
49.3%
95% ≥ 45.1% · Δ $0.009909
bewezen
provider_cached
niet uitgeoefend in deze run — de nul is geen meting
output_restriction
1.0%
95% ≥ −9.1% · Δ $0.000012
niet bewezen
output_codebook
niet uitgeoefend in deze run — de nul is geen meting

Vier grootboeken, nooit opgeteld — elk is een afzonderlijk gemeten hefboom, dus een dollar kan niet dubbel geteld worden. Het reconciliatierestant ≈ 0 bewijst het. Dit zijn referentiehefbomen: je live-rail meet een andere vier — provider-cached vervangt output-restriction — dus we projecteren de een nooit op de ander.

Kwaliteitscontrole 100% geslaagdGrootboeken sluiten aanZelfde model in beide armenCache break-even K=2bewezen op 95%Een verslechterd antwoord doet zijn besparing teniet
scenariosoortA in/uitB in/uitkosten Akosten Bbesparingqa
Local arithmeticresolver19/770/0$0.000049$0.00100.0%4/4
Forwarded support thread (compression)ran3,838/3681,861/194$0.000703$0.00035449.7%24/24
Large uniform tableran1,212/319781/116$0.000356$0.00018747.6%9/9
Big tool catalogue (schema-on-demand)ran3,091/2161,062/263$0.000575$0.00031744.9%12/12
Tool-heavy requestran300/30121/36$0.000063$0.00003937.3%11/11
Stable-prefix agent turnran5,307/585,307/58$0.000655$0.0006234.9%24/24
Constrained structured answerran60/7160/70$0.000052$0.0000511.0%24/24
FAQ (first ask)ran72/1972/19$0.000022$0.0000220.7%11/11
Triage decision (output codebook)ran184/72184/72$0.000071$0.0000710.0%8/8
Summarize provided textran66/2566/25$0.000025$0.000025−0.3%8/8
FAQ (repeat ask)cache72/1872/19$0.000022$0.000022−2.8%6/6
cache · geamortiseerdFAQ (repeat ask): koude misser $0.000022 → treffer $0.00. Bereikt break-even bij K=2 herhalingen — cachebesparing komt van herhaald verkeer, niet van één aanroep, dus een koude aanroep leest eerlijk ≈0%.
Anthropicclaude-sonnet-4-5
Gemeten · prefix-cache van Anthropic

Anthropic cachet niet uit zichzelf. Jouw integratie vraagt er niet om; de onze wel.

OpenAI past zijn prefix-cache automatisch toe: die korting krijg je met ons of zonder ons. Anthropic niet. Daar moet je het afkappunt bij elke aanvraag markeren, en wie dat niet doet betaalt altijd de volledige invoer.

Wat er gemeten is

Een agent-beurt met lange, herhaalde systeemcontext — een supportassistent, een documentextractor. Acht paren, hetzelfde model in beide armen, afgerekend met Anthropics eigen teller.

Zonder de laag
0 tokens uit de cache geleverd
Met de laag
58.624 tokens uit de cache geleverd
78%minder kosten op die aanvragen · 95%-ondergrens op 78,0% · kwaliteit 8/8, geen regressie

Wat dit cijfer NIET zegt

Het is de besparing van die hefboom op dat verkeer, niet die van je hele factuur. Het komt uit het scenario met stabiele prefix, waar het cachegeld zit; op verkeer zonder herhaalde context is deze hefboom nul waard. Het hoofdcijfer van de volledige run wordt apart gemeten, en dat publiceren we met zijn interval, hierboven.

En je hoeft ons niet op ons woord te geloven

Je kunt het op je eigen factuur controleren zonder iets te installeren: kijk of je Claude-aanroepen cache_read_input_tokens bevatten. Staan ze op nul, dan laat je die korting vandaag liggen.

OpenAIgpt-4o-mini
Eerlijke boekhouding

Vier afzonderlijke grootboeken. Nooit opgeteld tot één ijdel getal.

Een cachetreffer verwijdert een hele aanroep. BV‑SALA hercodeert gestructureerde gegevens compacter. Compressie schrapt overbodige woorden. Een prefixcache van de provider maakt tokens goedkoper zonder ze te verwijderen. Ze door elkaar halen liegt tegen je — dus dat doen we niet.

Vier ledgers gemeten tegen de OpenAI-API. Een percentage zonder zijn model ernaast betekent niets: dezelfde hefboom kan besparen op het ene model en geld kosten op het andere.

01

avoided_calls

LLM-, ophaal- en tool-aanroepen die helemaal niet zijn uitgevoerd.

17.9%
gemeten · 95%-ondergrens
02

eliminated_tokens

Informatie die is geschrapt omdat ze simpelweg niet nodig was.

38.6%
gemeten · 95%-ondergrens
03

compressed_tokens

Informatie behouden, maar gecodeerd met minder tokens.

45.1%
gemeten · 95%-ondergrens
Vijf regels om te beginnen

Draai het in je eigen app. Je prompts raken nooit onze servers.

Plaats de SDK vóór je provider. Elke respons bevat een volledig SavingsReport dat je kunt uitzetten in grafieken — dezelfde cijfers die het dashboard leest.

# 1 · het pakket
pnpm add @bivelio/savings-layer

# 2 · de licentie (uit je dashboard)
export BIVELIO_LICENSE_KEY=…

# 3 · de aanroep omhullen — dit is de hele codewijziging
const layer = createSavingsLayer({ provider, licenseKey, … });
const { text, report } = await layer.generate({ model, messages });

console.log(report.cost.netSavings)  // ← de besparing, gemeten
Salesforce HubSpot Odoo Zapier n8n UiPath

Waar je automatiseringen al leven. Roept het de OpenAI- of Anthropic-API aan met jouw sleutel, dan wordt het gemeten — de SDK omhult de aanroep; de gateway staat ervoor.

Nieuw · codeterminals

Claude Code met een API-sleutel? Zie de echte uitgaven, token voor token.

Eén commando zet een lokale meter vóór je terminal. Geen code aanpassen, niets configureren — en je prompts verlaten nooit je machine: alleen aantallen en kosten bereiken dit paneel.

npm i -g @bivelio/savings-layer
export BIVELIO_SERVICE_KEY=bvk_…

bvsala claude

Vandaag meet hij; daar optimaliseert hij nog niet. Werkt ook met Codex CLI, Goose en Qwen Code — en bvsala doctor drukt de exacte configuratie voor de rest af. Zo werkt het →

savings-mode · gratis skill

De skill die je abonnementslimieten oprekt

Geen factuur betekent niet geen pijn: het venster van vijf uur en de weeklimiet. savings-mode is een skill van pure instructies — geen proxy, je verkeer onaangeraakt — die de twee massa's snijdt die echt limiet verbranden: modeloutput en toolresultaten. Hij is gratis; waar je Savings voor betaalt is weten hoeveel hij je bespaart.

01

cache-lezingen

De hele context wordt elke beurt opnieuw gelezen — daarom telt hem slank houden.

68,2%
van de gemeten uitgaven
02

cache-schrijven (één uur)

Elk toolresultaat wordt met toeslag in de cache geschreven voordat het opnieuw wordt gelezen.

19,6%
van de gemeten uitgaven
03

modeloutput

Minder dan één procent van de tokens; de skill pakt hem direct aan.

11,6%
van de gemeten uitgaven

Gemeten met de meter over 959 echte Claude Code-verzoeken, tegen de tellers van de provider (2026-09-01). Het effect van de skill zelf wordt gepubliceerd zodra het in A/B gemeten is — nooit eerder.

npx -y @bivelio/savings-layer skill

Eén commando: installeert in ~/.claude/skills en activeert zichzelf zodra het gesprek over limieten of tokens besparen gaat.

Eén abonnement, geprijsd per seat

Centen om te draaien. Veelvouden om te besparen.

Geen gratis versie en geen proefperiode: wat je vóór betaling kunt controleren, is de GEMETEN besparing hierboven, met het interval erbij. Je abonneert je en draait het in je eigen app. Geprijsd per seat, in EUR.

€ 4 / seat / maand

PRO — gefactureerd per seat. Of € 39 / seat / jaar (bespaar ~19%). Enterprise, met gebundelde functies, komt later.

Exclusief btw. Heeft uw bedrijf een EU-btw-nummer, dan geldt de verleggingsregeling.

Een seat is één actieve machine- of service-identiteit, geen persoon — alleen gefactureerd bij activiteit op 3+ dagen in een maand. CI en kortstondige runners tellen niet mee.

  • Elke BV‑SALA-optimalisatie, ongelimiteerd
  • Beheerde semantische cache en geleerde drempels
  • Besparingsdashboards en teamanalyses
  • Je prompts verlaten nooit je infrastructuur
Aan de slag →

En hoeveel zou jij ons betalen?

Schatting

Speel met je cijfers: kies provider en model, en zie je besparing, ons extra en wat je overhoudt — met de echte catalogusprijzen en het echte tarief.

Prijscatalogus laden…

Hoe wat je ons betaalt wordt berekend

  • Je eerste maand: alleen € 4 per seat. We meten alles en rekenen geen commissie — bij afsluiting zie je het exacte afschrift van wat het gekost zou hebben.
  • Daarna commissie alleen over de gemeten besparing: die je kunt afstemmen met de factuur van je provider. Geschat wordt nooit gefactureerd.
  • En je houdt altijd 90% of meer van elke bespaarde euro: de commissie bestaat alleen als jouw gemeten besparing bestaat.
  • In schijven, elk tegen zijn eigen tarief — 10% ≤ € 1.000 · 8% ≤ € 5.000 · 6% ≤ € 20.000 · 4% +. Hoe meer je bespaart, hoe lager ons percentage.
  • Een maand zonder besparing? Commissie: € 0. Geen verplichtingen — en je eerste variabele factuur bevat alleen cijfers die je al op je afschrift zag.