Savings Layer ist Teil der BiVelio-Plattform
Die LLM-Kostenschicht, die jeder installieren kann — lizenziert zum Ausführen

Beweise die Einsparungen mit deinen eigenen Daten.

BV-SALA sitzt vor jedem LLM-Provider und wählt für jede Anfrage die günstigste Ausführung, die trotzdem deine Qualitätsschwelle erfüllt. Jede Einsparungszahl, die wir veröffentlichen, ist am Token-Zähler des Providers selbst gemessen und kommt mit ihrem Konfidenzintervall — niemals eine Schätzung.

Installation in fünf Zeilen. Die Lizenz aktivierst du in deinem Dashboard.
OpenAIAnthropicGoogle
Gegen echten Provider gemessen
OpenAIgpt-4o-mini
≥ 23,1 %weniger Rechnung, zu 95 % verifiziert
Anthropicclaude-sonnet-4-5
78 %weniger Kosten mit Prefix-Cache
Die günstigste Ausführung gewinntgemessen · 95-%-Untergrenze
01Den Aufruf ganz vermeidenResolver · exakter Cache · Singleflight17.9%
02Entfernen, was nie gesendet werden musstebeschnittene Tools · Retrieval · redundanter Kontext38.6%
03Komprimieren, was übrig bleibtschlankere Kodierung · nur wenn es sich lohnt45.1%
Book 15-min callWir sagen dir, was du mit deinem Traffic sparen würdest — ohne etwas zu installieren.

Jeder Schritt fällt in EIN anderes Ledger, deshalb addieren sich diese Zahlen nicht. Ein Schritt, dessen Ledger die Null nicht übersteigt, erscheint hier nicht: die Ausgabebeschränkung wurde gemessen und spart nicht, also wird sie nicht beworben.

Schritt 2 · Wie die Einsparungen gemessen werden — reproduzierbar

Beide Arme durch den Tokenizer des Anbieters selbst gemessen — keine modellierte Baseline.

Dies ist die Ausgabe des A/B-Benchmarks (pnpm ab): für jedes Szenario sendet er eine naive Anfrage und die BV‑SALA-Anfrage an das gleiche Modell, berechnet beide anhand der tatsächlichen Token-Nutzung des Providers und meldet die untere 95%-Konfidenzgrenze — niemals die schmeichelhafte Punktschätzung. Nichts wird modelliert.

LIVE · deine OrganisationLIVE — gegen einen echten Provider gemessen, mit Quality-Gate.
23.1%
Netto-Einsparung, untere 95%-Konfidenzgrenze. Punktschätzung 31.0%, obere 38.1% — wir stellen den unteren Wert in den Vordergrund.
−5.0%0%60.0%
avoided_calls
59.1%
95% ≥ 17.9% · Δ $0.000193
bewiesen
eliminated_tokens
43.0%
95% ≥ 38.6% · Δ $0.003352
bewiesen
compressed_tokens
49.3%
95% ≥ 45.1% · Δ $0.009909
bewiesen
provider_cached
in diesem Lauf nicht ausgeübt — ihre Null ist keine Messung
output_restriction
1.0%
95% ≥ −9.1% · Δ $0.000012
nicht bewiesen
output_codebook
in diesem Lauf nicht ausgeübt — ihre Null ist keine Messung

Vier Ledger, niemals summiert — jeder ist ein separat gemessener Hebel, sodass ein Dollar nicht doppelt gezählt werden kann. Der Abstimmungsrest ≈ 0 beweist es. Dies sind Referenz-Hebel: dein Live-Rail misst vier andere — provider-cached ersetzt output-restriction — daher bilden wir niemals das eine auf das andere ab.

Quality-Gate 100% bestandenLedger stimmen übereinGleiches Modell in beiden ArmenCache-Break-even K=2bewiesen bei 95%Eine verschlechterte Antwort macht ihre Einsparung zunichte
SzenarioArtA E/AB E/AA KostenB KostenEinsparungqa
Local arithmeticresolver19/770/0$0.000049$0.00100.0%4/4
Forwarded support thread (compression)ran3,838/3681,861/194$0.000703$0.00035449.7%24/24
Large uniform tableran1,212/319781/116$0.000356$0.00018747.6%9/9
Big tool catalogue (schema-on-demand)ran3,091/2161,062/263$0.000575$0.00031744.9%12/12
Tool-heavy requestran300/30121/36$0.000063$0.00003937.3%11/11
Stable-prefix agent turnran5,307/585,307/58$0.000655$0.0006234.9%24/24
Constrained structured answerran60/7160/70$0.000052$0.0000511.0%24/24
FAQ (first ask)ran72/1972/19$0.000022$0.0000220.7%11/11
Triage decision (output codebook)ran184/72184/72$0.000071$0.0000710.0%8/8
Summarize provided textran66/2566/25$0.000025$0.000025−0.3%8/8
FAQ (repeat ask)cache72/1872/19$0.000022$0.000022−2.8%6/6
Cache · amortisiertFAQ (repeat ask): Cold-Miss $0.000022 → Hit $0.00. Erreicht den Break-even bei K=2 Wiederholungen — Cache-Einsparungen entstehen durch wiederkehrenden Traffic, nicht durch eine einzelne Aufruf-Zahl, daher zeigt ein Cold-Aufruf ehrlicherweise ≈0%.
Anthropicclaude-sonnet-4-5
Gemessen · Prefix-Cache von Anthropic

Anthropic cacht nicht von selbst. Deine Integration bittet nicht darum; unsere schon.

OpenAI wendet seinen Prefix-Cache automatisch an: diesen Rabatt bekommst du mit uns oder ohne uns. Anthropic nicht. Dort muss der Schnittpunkt bei jeder Anfrage markiert werden, und wer ihn nicht markiert, zahlt immer die volle Eingabe.

Was gemessen wurde

Agenten-Turn mit langem, wiederholtem System-Kontext — ein Support-Assistent, ein Dokumenten-Extraktor. Acht Paare, dasselbe Modell in beiden Armen, abgerechnet mit Anthropics eigenem Zähler.

Ohne die Schicht
0 Tokens aus dem Cache bedient
Mit der Schicht
58.624 Tokens aus dem Cache bedient
78 %weniger Kosten bei diesen Anfragen · 95-%-Untergrenze bei 78,0 % · Qualität 8/8, keine Regression

Was diese Zahl NICHT sagt

Es ist die Ersparnis dieses Hebels auf diesem Traffic, nicht die deiner gesamten Rechnung. Sie stammt aus dem Szenario mit stabilem Prefix, wo das Geld des Caches liegt; bei Traffic ohne wiederholten Kontext ist dieser Hebel null wert. Die Schlagzeile des vollständigen Laufs wird separat gemessen, und wir veröffentlichen sie mit ihrem Intervall, oben.

Und du musst uns nicht glauben

Auf deiner eigenen Rechnung prüfbar, ohne etwas zu installieren: schau nach, ob deine Claude-Aufrufe cache_read_input_tokens enthalten. Stehen sie auf null, lässt du diesen Rabatt heute liegen.

OpenAIgpt-4o-mini
Ehrliche Abrechnung

Vier separate Ledger. Niemals zu einer einzigen Schönfärbe-Zahl summiert.

Ein Cache-Hit entfernt einen ganzen Aufruf. BV‑SALA kodiert strukturierte Daten kompakter neu. Die Komprimierung verwirft redundante Wörter. Ein Prefix-Cache des Providers macht Tokens günstiger, ohne sie zu entfernen. Sie zu vermischen belügt dich — also tun wir es nicht.

Vier Ledger, gemessen gegen die OpenAI-API. Ein Prozentsatz ohne sein Modell daneben bedeutet nichts: derselbe Hebel kann bei einem Modell sparen und bei einem anderen kosten.

01

avoided_calls

LLM-, Retrieval- und Tool-Aufrufe, die überhaupt nie ausgeführt wurden.

17.9%
gemessen · 95-%-Untergrenze
02

eliminated_tokens

Informationen, die verworfen wurden, weil sie einfach nicht nötig waren.

38.6%
gemessen · 95-%-Untergrenze
03

compressed_tokens

Informationen, die erhalten bleiben, aber mit weniger Tokens kodiert sind.

45.1%
gemessen · 95-%-Untergrenze
Fünf Zeilen zum Starten

Führe es in deiner eigenen App aus. Deine Prompts berühren niemals unsere Server.

Setze das SDK vor deinen Provider. Jede Antwort enthält einen vollständigen SavingsReport, den du visualisieren kannst — dieselben Zahlen, die das Dashboard liest.

# 1 · das Paket
pnpm add @bivelio/savings-layer

# 2 · die Lizenz (aus deinem Dashboard)
export BIVELIO_LICENSE_KEY=…

# 3 · den Aufruf umhüllen — das ist die ganze Code-Änderung
const layer = createSavingsLayer({ provider, licenseKey, … });
const { text, report } = await layer.generate({ model, messages });

console.log(report.cost.netSavings)  // ← die Ersparnis, gemessen
Salesforce HubSpot Odoo Zapier n8n UiPath

Wo deine Automatisierungen schon leben. Ruft es die OpenAI- oder Anthropic-API mit deinem Schlüssel auf, wird es gemessen — das SDK umhüllt den Aufruf; das Gateway setzt sich davor.

Neu · Coding-Terminals

Claude Code mit API-Schlüssel? Sieh die echten Ausgaben, Token für Token.

Ein einziger Befehl setzt einen lokalen Zähler vor dein Terminal. Kein Code, keine Konfiguration — und deine Prompts verlassen nie deine Maschine: in dieses Panel gelangen nur Zählwerte und Kosten.

npm i -g @bivelio/savings-layer
export BIVELIO_SERVICE_KEY=bvk_…

bvsala claude

Heute misst es; dort optimiert es noch nicht. Funktioniert auch mit Codex CLI, Goose und Qwen Code — und bvsala doctor druckt die exakte Konfiguration für den Rest. So funktioniert es →

savings-mode · kostenloser Skill

Der Skill, der deine Abo-Limits dehnt

Keine Rechnung heißt nicht kein Schmerz: das Fünf-Stunden-Fenster und das Wochenlimit. savings-mode ist ein Skill aus reinen Anweisungen — kein Proxy, dein Traffic bleibt unberührt — der die zwei Massen kürzt, die wirklich Limit verbrennen: Modellausgabe und Tool-Ergebnisse. Er ist kostenlos; wofür man Savings bezahlt, ist zu wissen, wie viel er dir spart.

01

Cache-Lesevorgänge

Der gesamte Kontext wird in jedem Zug neu gelesen — deshalb zählt, ihn schlank zu halten.

68,2%
der gemessenen Ausgaben
02

Cache-Schreiben (eine Stunde)

Jedes Tool-Ergebnis wird mit Aufschlag in den Cache geschrieben, bevor es neu gelesen wird.

19,6%
der gemessenen Ausgaben
03

Modellausgabe

Unter einem Prozent der Tokens; der Skill greift sie direkt an.

11,6%
der gemessenen Ausgaben

Gemessen mit dem Meter über 959 echte Claude-Code-Anfragen, gegen die Zähler des Providers (2026-09-01). Die Wirkung des Skills selbst wird veröffentlicht, sobald sie im A/B gemessen ist — nie vorher.

npx -y @bivelio/savings-layer skill

Ein Befehl: installiert nach ~/.claude/skills und aktiviert sich von selbst, wenn es um Limits oder Token-Sparen geht.

Ein Plan, Preis pro Seat

Cent zum Ausführen. Ein Vielfaches beim Sparen.

Kein Gratis-Tarif, keine Testphase: Was du prüfen kannst, bevor du zahlst, ist die gemessene Ersparnis weiter oben — mit dem Konfidenzintervall direkt daneben. Du abonnierst und führst BV-SALA in deiner eigenen App aus. Preis pro Seat, in EUR.

4 € / Seat / Monat

PRO — pro Seat abgerechnet. Oder 39 € / Seat / Jahr (spare ~19%). Enterprise, mit gebündelten Funktionen, kommt später.

Zzgl. MwSt. Bei Unternehmen mit EU-USt-IdNr. gilt das Reverse-Charge-Verfahren.

Ein Seat ist eine aktive Maschine oder Dienstidentität, keine Person — nur abgerechnet, wenn an 3+ Tagen im Monat aktiv. CI und kurzlebige Runner zählen nicht.

  • Jede BV‑SALA-Optimierung, ohne Limit
  • Verwalteter semantischer Cache und gelernte Schwellenwerte
  • Einsparungs-Dashboards und Team-Analysen
  • Deine Prompts verlassen niemals deine Infrastruktur
Loslegen →

Und wie viel würdest du uns zahlen?

Schätzung

Spiel mit deinen Zahlen: wähle Anbieter und Modell und sieh deine Ersparnis, unser Extra und was dir bleibt — mit den echten Katalogpreisen und dem echten Tarif.

Preiskatalog wird geladen…

Wie sich das berechnet, was du uns zahlst

  • Dein erster Monat: nur 4 € pro Sitz. Wir messen alles und berechnen keine Provision — zum Abschluss siehst du die exakte Abrechnung dessen, was es gekostet hätte.
  • Danach Provision nur auf die gemessene Ersparnis: die, die du mit der Rechnung deines Anbieters abgleichen kannst. Geschätztes wird nie berechnet.
  • Und dir bleiben immer 90% oder mehr jedes gesparten Euros: die Provision existiert nur, wenn deine gemessene Ersparnis existiert.
  • Gestuft, jede Stufe zu ihrem Satz — 10% ≤ 1.000 € · 8% ≤ 5.000 € · 6% ≤ 20.000 € · 4% +. Je mehr du sparst, desto niedriger unser Prozentsatz.
  • Ein Monat ohne Ersparnis? Provision: 0 €. Keine Bindung — und deine erste variable Rechnung enthält nur Zahlen, die du schon auf deiner Abrechnung gesehen hast.