Beweise die Einsparungen mit deinen eigenen Daten.
BV-SALA sitzt vor jedem LLM-Provider und wählt für jede Anfrage die günstigste Ausführung, die trotzdem deine Qualitätsschwelle erfüllt. Jede Einsparungszahl, die wir veröffentlichen, ist am Token-Zähler des Providers selbst gemessen und kommt mit ihrem Konfidenzintervall — niemals eine Schätzung.
gpt-4o-miniclaude-sonnet-4-5Jeder Schritt fällt in EIN anderes Ledger, deshalb addieren sich diese Zahlen nicht. Ein Schritt, dessen Ledger die Null nicht übersteigt, erscheint hier nicht: die Ausgabebeschränkung wurde gemessen und spart nicht, also wird sie nicht beworben.
Beide Arme durch den Tokenizer des Anbieters selbst gemessen — keine modellierte Baseline.
Dies ist die Ausgabe des A/B-Benchmarks (pnpm ab): für jedes Szenario sendet er eine naive Anfrage und die BV‑SALA-Anfrage an das gleiche Modell, berechnet beide anhand der tatsächlichen Token-Nutzung des Providers und meldet die untere 95%-Konfidenzgrenze — niemals die schmeichelhafte Punktschätzung. Nichts wird modelliert.
Vier Ledger, niemals summiert — jeder ist ein separat gemessener Hebel, sodass ein Dollar nicht doppelt gezählt werden kann. Der Abstimmungsrest ≈ 0 beweist es. Dies sind Referenz-Hebel: dein Live-Rail misst vier andere — provider-cached ersetzt output-restriction — daher bilden wir niemals das eine auf das andere ab.
| Szenario | Art | A E/A | B E/A | A Kosten | B Kosten | Einsparung ▾ | qa |
|---|---|---|---|---|---|---|---|
| Local arithmetic | resolver | 19/77 | 0/0 | $0.000049 | $0.00 | 100.0% | 4/4 |
| Forwarded support thread (compression) | ran | 3,838/368 | 1,861/194 | $0.000703 | $0.000354 | 49.7% | 24/24 |
| Large uniform table | ran | 1,212/319 | 781/116 | $0.000356 | $0.000187 | 47.6% | 9/9 |
| Big tool catalogue (schema-on-demand) | ran | 3,091/216 | 1,062/263 | $0.000575 | $0.000317 | 44.9% | 12/12 |
| Tool-heavy request | ran | 300/30 | 121/36 | $0.000063 | $0.000039 | 37.3% | 11/11 |
| Stable-prefix agent turn | ran | 5,307/58 | 5,307/58 | $0.000655 | $0.000623 | 4.9% | 24/24 |
| Constrained structured answer | ran | 60/71 | 60/70 | $0.000052 | $0.000051 | 1.0% | 24/24 |
| FAQ (first ask) | ran | 72/19 | 72/19 | $0.000022 | $0.000022 | 0.7% | 11/11 |
| Triage decision (output codebook) | ran | 184/72 | 184/72 | $0.000071 | $0.000071 | 0.0% | 8/8 |
| Summarize provided text | ran | 66/25 | 66/25 | $0.000025 | $0.000025 | −0.3% | 8/8 |
| FAQ (repeat ask) | cache | 72/18 | 72/19 | $0.000022 | $0.000022 | −2.8% | 6/6 |
claude-sonnet-4-5Anthropic cacht nicht von selbst. Deine Integration bittet nicht darum; unsere schon.
OpenAI wendet seinen Prefix-Cache automatisch an: diesen Rabatt bekommst du mit uns oder ohne uns. Anthropic nicht. Dort muss der Schnittpunkt bei jeder Anfrage markiert werden, und wer ihn nicht markiert, zahlt immer die volle Eingabe.
Was gemessen wurde
Agenten-Turn mit langem, wiederholtem System-Kontext — ein Support-Assistent, ein Dokumenten-Extraktor. Acht Paare, dasselbe Modell in beiden Armen, abgerechnet mit Anthropics eigenem Zähler.
- Ohne die Schicht
- 0 Tokens aus dem Cache bedient
- Mit der Schicht
- 58.624 Tokens aus dem Cache bedient
Was diese Zahl NICHT sagt
Es ist die Ersparnis dieses Hebels auf diesem Traffic, nicht die deiner gesamten Rechnung. Sie stammt aus dem Szenario mit stabilem Prefix, wo das Geld des Caches liegt; bei Traffic ohne wiederholten Kontext ist dieser Hebel null wert. Die Schlagzeile des vollständigen Laufs wird separat gemessen, und wir veröffentlichen sie mit ihrem Intervall, oben.
Und du musst uns nicht glauben
Auf deiner eigenen Rechnung prüfbar, ohne etwas zu installieren: schau nach, ob deine Claude-Aufrufe cache_read_input_tokens enthalten. Stehen sie auf null, lässt du diesen Rabatt heute liegen.
gpt-4o-miniVier separate Ledger. Niemals zu einer einzigen Schönfärbe-Zahl summiert.
Ein Cache-Hit entfernt einen ganzen Aufruf. BV‑SALA kodiert strukturierte Daten kompakter neu. Die Komprimierung verwirft redundante Wörter. Ein Prefix-Cache des Providers macht Tokens günstiger, ohne sie zu entfernen. Sie zu vermischen belügt dich — also tun wir es nicht.
Vier Ledger, gemessen gegen die OpenAI-API. Ein Prozentsatz ohne sein Modell daneben bedeutet nichts: derselbe Hebel kann bei einem Modell sparen und bei einem anderen kosten.
avoided_calls
LLM-, Retrieval- und Tool-Aufrufe, die überhaupt nie ausgeführt wurden.
eliminated_tokens
Informationen, die verworfen wurden, weil sie einfach nicht nötig waren.
compressed_tokens
Informationen, die erhalten bleiben, aber mit weniger Tokens kodiert sind.
Führe es in deiner eigenen App aus. Deine Prompts berühren niemals unsere Server.
Setze das SDK vor deinen Provider. Jede Antwort enthält einen vollständigen SavingsReport, den du visualisieren kannst — dieselben Zahlen, die das Dashboard liest.
# 1 · das Paket pnpm add @bivelio/savings-layer # 2 · die Lizenz (aus deinem Dashboard) export BIVELIO_LICENSE_KEY=… # 3 · den Aufruf umhüllen — das ist die ganze Code-Änderung const layer = createSavingsLayer({ provider, licenseKey, … }); const { text, report } = await layer.generate({ model, messages }); console.log(report.cost.netSavings) // ← die Ersparnis, gemessen
Wo deine Automatisierungen schon leben. Ruft es die OpenAI- oder Anthropic-API mit deinem Schlüssel auf, wird es gemessen — das SDK umhüllt den Aufruf; das Gateway setzt sich davor.
Claude Code mit API-Schlüssel? Sieh die echten Ausgaben, Token für Token.
Ein einziger Befehl setzt einen lokalen Zähler vor dein Terminal. Kein Code, keine Konfiguration — und deine Prompts verlassen nie deine Maschine: in dieses Panel gelangen nur Zählwerte und Kosten.
npm i -g @bivelio/savings-layer export BIVELIO_SERVICE_KEY=bvk_… bvsala claude
Heute misst es; dort optimiert es noch nicht. Funktioniert auch mit Codex CLI, Goose und Qwen Code — und bvsala doctor druckt die exakte Konfiguration für den Rest. So funktioniert es →
Der Skill, der deine Abo-Limits dehnt
Keine Rechnung heißt nicht kein Schmerz: das Fünf-Stunden-Fenster und das Wochenlimit. savings-mode ist ein Skill aus reinen Anweisungen — kein Proxy, dein Traffic bleibt unberührt — der die zwei Massen kürzt, die wirklich Limit verbrennen: Modellausgabe und Tool-Ergebnisse. Er ist kostenlos; wofür man Savings bezahlt, ist zu wissen, wie viel er dir spart.
Cache-Lesevorgänge
Der gesamte Kontext wird in jedem Zug neu gelesen — deshalb zählt, ihn schlank zu halten.
Cache-Schreiben (eine Stunde)
Jedes Tool-Ergebnis wird mit Aufschlag in den Cache geschrieben, bevor es neu gelesen wird.
Modellausgabe
Unter einem Prozent der Tokens; der Skill greift sie direkt an.
Gemessen mit dem Meter über 959 echte Claude-Code-Anfragen, gegen die Zähler des Providers (2026-09-01). Die Wirkung des Skills selbst wird veröffentlicht, sobald sie im A/B gemessen ist — nie vorher.
npx -y @bivelio/savings-layer skillEin Befehl: installiert nach ~/.claude/skills und aktiviert sich von selbst, wenn es um Limits oder Token-Sparen geht.
Cent zum Ausführen. Ein Vielfaches beim Sparen.
Kein Gratis-Tarif, keine Testphase: Was du prüfen kannst, bevor du zahlst, ist die gemessene Ersparnis weiter oben — mit dem Konfidenzintervall direkt daneben. Du abonnierst und führst BV-SALA in deiner eigenen App aus. Preis pro Seat, in EUR.
PRO — pro Seat abgerechnet. Oder 39 € / Seat / Jahr (spare ~19%). Enterprise, mit gebündelten Funktionen, kommt später.
Zzgl. MwSt. Bei Unternehmen mit EU-USt-IdNr. gilt das Reverse-Charge-Verfahren.
Ein Seat ist eine aktive Maschine oder Dienstidentität, keine Person — nur abgerechnet, wenn an 3+ Tagen im Monat aktiv. CI und kurzlebige Runner zählen nicht.
- Jede BV‑SALA-Optimierung, ohne Limit
- Verwalteter semantischer Cache und gelernte Schwellenwerte
- Einsparungs-Dashboards und Team-Analysen
- Deine Prompts verlassen niemals deine Infrastruktur
Und wie viel würdest du uns zahlen?
SchätzungSpiel mit deinen Zahlen: wähle Anbieter und Modell und sieh deine Ersparnis, unser Extra und was dir bleibt — mit den echten Katalogpreisen und dem echten Tarif.
Preiskatalog wird geladen…
Wie sich das berechnet, was du uns zahlst
- Dein erster Monat: nur 4 € pro Sitz. Wir messen alles und berechnen keine Provision — zum Abschluss siehst du die exakte Abrechnung dessen, was es gekostet hätte.
- Danach Provision nur auf die gemessene Ersparnis: die, die du mit der Rechnung deines Anbieters abgleichen kannst. Geschätztes wird nie berechnet.
- Und dir bleiben immer 90% oder mehr jedes gesparten Euros: die Provision existiert nur, wenn deine gemessene Ersparnis existiert.
- Gestuft, jede Stufe zu ihrem Satz — 10% ≤ 1.000 € · 8% ≤ 5.000 € · 6% ≤ 20.000 € · 4% +. Je mehr du sparst, desto niedriger unser Prozentsatz.
- Ein Monat ohne Ersparnis? Provision: 0 €. Keine Bindung — und deine erste variable Rechnung enthält nur Zahlen, die du schon auf deiner Abrechnung gesehen hast.