Savings Layer jest częścią platformy BiVelio
Warstwa kosztów LLM, którą każdy może zainstalować — licencjonowana do uruchamiania

Udowodnij oszczędności na własnych danych.

BV-SALA stoi przed dowolnym dostawcą LLM i dla każdego żądania wybiera najtańszą realizację, która wciąż spełnia Twój próg jakości. Każdy wynik oszczędności, jaki publikujemy, jest mierzony względem licznika tokenów samego dostawcy i podawany z przedziałem ufności — to pomiar, nigdy szacunek.

Instalacja w pięciu linijkach. Licencję aktywujesz w swoim panelu.
OpenAIAnthropicGoogle
Zmierzone względem prawdziwego dostawcy
OpenAIgpt-4o-mini
≥ 23,1%mniejszy rachunek, zweryfikowane na 95%
Anthropicclaude-sonnet-4-5
78%mniejszy koszt dzięki cache'owi prefiksu
Wygrywa najtańsza realizacjazmierzone · próg 95%
01Unikaj wywołania w całościresolvery · dokładny cache · singleflight17.9%
02Usuń to, czego nie trzeba było wysyłaćprzycięte narzędzia · retrieval · zbędny kontekst38.6%
03Skompresuj to, co zostałolżejsze kodowanie · tylko gdy się opłaca45.1%
Book 15-min callPowiemy ci, ile zaoszczędziłbyś na swoim ruchu, bez instalowania czegokolwiek.

Każdy krok trafia do INNEJ księgi, więc te liczby nie sumują się ze sobą. Krok, którego księga nie przekracza zera, nie pojawia się tutaj: ograniczenie wyjścia zostało zmierzone i nie oszczędza, więc go nie reklamujemy.

Krok 2 · Jak mierzone są oszczędności — powtarzalne

Obie gałęzie mierzone tokenizerem samego dostawcy — bez modelowanej linii bazowej.

To wynik benchmarku A/B (pnpm ab): dla każdego scenariusza wysyła żądanie naiwne oraz żądanie BV‑SALA do tego samego modelu, wycenia oba na podstawie własnego zużycia tokenów dostawcy i raportuje dolną granicę 95% przedziału ufności — nigdy pochlebnej estymacji punktowej. Nic nie jest modelowane.

LIVE · Twoja organizacjaLIVE — mierzone względem prawdziwego dostawcy, z bramką jakości.
23.1%
oszczędności netto, dolna granica 95% przedziału ufności. Estymacja punktowa 31.0%, górna 38.1% — nagłówkiem czynimy dolny próg.
−5.0%0%60.0%
avoided_calls
59.1%
95% ≥ 17.9% · Δ $0.000193
udowodnione
eliminated_tokens
43.0%
95% ≥ 38.6% · Δ $0.003352
udowodnione
compressed_tokens
49.3%
95% ≥ 45.1% · Δ $0.009909
udowodnione
provider_cached
niewykorzystana w tym przebiegu — jej zero nie jest pomiarem
output_restriction
1.0%
95% ≥ −9.1% · Δ $0.000012
nieudowodnione
output_codebook
niewykorzystana w tym przebiegu — jej zero nie jest pomiarem

Cztery księgi, nigdy nie sumowane — każda to osobno mierzona dźwignia, więc dolara nie da się policzyć dwa razy. Reszta uzgodnienia ≈ 0 to potwierdza. To są dźwignie referencyjne: Twoja ścieżka na żywo mierzy inne cztery — provider-cached zastępuje output-restriction — więc nigdy nie odwzorowujemy jednej na drugą.

Bramka jakości 100% zaliczonaKsięgi się zgadzająTen sam model w obu ramionachPróg opłacalności cache K=2udowodnione przy 95%Pogorszona odpowiedź unieważnia swoją oszczędność
scenariuszrodzajA wej/wyjB wej/wyjkoszt Akoszt Boszczędnościqa
Local arithmeticresolver19/770/0$0.000049$0.00100.0%4/4
Forwarded support thread (compression)ran3,838/3681,861/194$0.000703$0.00035449.7%24/24
Large uniform tableran1,212/319781/116$0.000356$0.00018747.6%9/9
Big tool catalogue (schema-on-demand)ran3,091/2161,062/263$0.000575$0.00031744.9%12/12
Tool-heavy requestran300/30121/36$0.000063$0.00003937.3%11/11
Stable-prefix agent turnran5,307/585,307/58$0.000655$0.0006234.9%24/24
Constrained structured answerran60/7160/70$0.000052$0.0000511.0%24/24
FAQ (first ask)ran72/1972/19$0.000022$0.0000220.7%11/11
Triage decision (output codebook)ran184/72184/72$0.000071$0.0000710.0%8/8
Summarize provided textran66/2566/25$0.000025$0.000025−0.3%8/8
FAQ (repeat ask)cache72/1872/19$0.000022$0.000022−2.8%6/6
cache · zamortyzowaneFAQ (repeat ask): chybienie na zimno $0.000022 → trafienie $0.00. Osiąga próg opłacalności przy K=2 powtórzeniach — oszczędności z cache dotyczą ruchu powtarzalnego, a nie pojedynczego wywołania, więc zimne wywołanie uczciwie pokazuje ≈0%.
Anthropicclaude-sonnet-4-5
Zmierzone · cache prefiksu Anthropic

Anthropic nie cache'uje sam z siebie. Twoja integracja o to nie prosi; nasza tak.

OpenAI stosuje swój cache prefiksu automatycznie: ten rabat masz z nami albo bez nas. Anthropic nie. Wymaga oznaczenia punktu odcięcia w każdym żądaniu, a kto go nie oznaczy, zawsze płaci za całe wejście.

Co zostało zmierzone

Tura agenta z długim, powtarzanym kontekstem systemowym — asystent wsparcia, ekstraktor dokumentów. Osiem par, ten sam model w obu ramionach, rozliczone licznikiem samego Anthropic.

Bez warstwy
0 tokenów obsłużonych z cache'u
Z warstwą
58 624 tokenów obsłużonych z cache'u
78%mniej kosztów przy tych żądaniach · dolna granica 95% na 78,0% · jakość 8/8, bez regresji

Czego ta liczba NIE mówi

To oszczędność tej dźwigni na tym ruchu, a nie na całym twoim rachunku. Pochodzi ze scenariusza ze stabilnym prefiksem, gdzie leżą pieniądze cache'u; przy ruchu bez powtarzanego kontekstu ta dźwignia jest warta zero. Nagłówkowy wynik pełnego przebiegu mierzymy osobno i publikujemy go z przedziałem, powyżej.

I nie musisz wierzyć nam na słowo

Możesz to sprawdzić na własnym rachunku bez instalowania czegokolwiek: zobacz, czy twoje wywołania Claude niosą cache_read_input_tokens. Jeśli wychodzą zerowe, zostawiasz ten rabat na stole już dziś.

OpenAIgpt-4o-mini
Uczciwe rozliczanie

Cztery osobne księgi. Nigdy nie sumowane w jedną próżną liczbę.

Trafienie w cache usuwa całe wywołanie. BV‑SALA przekodowuje dane strukturalne w bardziej zwarty sposób. Kompresja odrzuca zbędne słowa. Cache prefiksu dostawcy potania tokeny bez ich usuwania. Mieszanie ich Cię okłamuje — więc tego nie robimy.

Cztery księgi zmierzone względem API OpenAI. Procent bez modelu obok nic nie znaczy: ta sama dźwignia może oszczędzać na jednym modelu i kosztować na innym.

01

avoided_calls

Wywołania LLM, wyszukiwania i narzędzi, które w ogóle się nie wykonały.

17.9%
zmierzone · próg 95%
02

eliminated_tokens

Informacje odrzucone, ponieważ po prostu nie były potrzebne.

38.6%
zmierzone · próg 95%
03

compressed_tokens

Informacje zachowane, ale zakodowane mniejszą liczbą tokenów.

45.1%
zmierzone · próg 95%
Pięć linijek na start

Uruchom to w swojej własnej aplikacji. Twoje prompty nigdy nie dotykają naszych serwerów.

Umieść SDK przed swoim dostawcą. Każda odpowiedź niesie pełny SavingsReport, który możesz przedstawić na wykresie — te same liczby, które odczytuje panel.

# 1 · pakiet
pnpm add @bivelio/savings-layer

# 2 · licencja (z Twojego panelu)
export BIVELIO_LICENSE_KEY=…

# 3 · owinięcie wywołania — to cała zmiana kodu
const layer = createSavingsLayer({ provider, licenseKey, … });
const { text, report } = await layer.generate({ model, messages });

console.log(report.cost.netSavings)  // ← oszczędność, zmierzona
Salesforce HubSpot Odoo Zapier n8n UiPath

Tam, gdzie już żyją Twoje automatyzacje. Jeśli wywołuje API OpenAI lub Anthropic Twoim kluczem, jest mierzone — SDK opakowuje wywołanie; brama staje z przodu.

Nowość · terminale programistyczne

Claude Code z kluczem API? Zobacz realny wydatek, token po tokenie.

Jedno polecenie stawia lokalny licznik przed Twoim terminalem. Bez zmian w kodzie i bez konfiguracji — a Twoje prompty nigdy nie opuszczają Twojej maszyny: do tego panelu trafiają tylko liczby i koszt.

npm i -g @bivelio/savings-layer
export BIVELIO_SERVICE_KEY=bvk_…

bvsala claude

Dziś mierzy; tam jeszcze nie optymalizuje. Działa też z Codex CLI, Goose i Qwen Code — a bvsala doctor drukuje dokładną konfigurację reszty. Zobacz, jak to działa →

savings-mode · darmowy skill

Skill, który rozciąga limity Twojej subskrypcji

Brak faktury nie znaczy brak bólu: pięciogodzinne okno i tygodniowy limit. savings-mode to skill z samych instrukcji — bez proxy, Twój ruch nietknięty — który tnie dwie masy naprawdę spalające limit: wyjście modelu i wyniki narzędzi. Jest darmowy; w Savings płaci się za wiedzę, ile Ci oszczędza.

01

odczyty cache

Cały kontekst jest odczytywany ponownie w każdej turze — dlatego liczy się jego szczupłość.

68,2%
zmierzonych wydatków
02

zapisy cache (jedna godzina)

Każdy wynik narzędzia jest zapisywany do cache z narzutem, zanim zostanie ponownie odczytany.

19,6%
zmierzonych wydatków
03

wyjście modelu

Poniżej jednego procenta tokenów; skill atakuje je bezpośrednio.

11,6%
zmierzonych wydatków

Zmierzone miernikiem na 959 prawdziwych żądaniach Claude Code, wobec liczników dostawcy (2026-09-01). Efekt samego skilla zostanie opublikowany po zmierzeniu w A/B — nigdy wcześniej.

npx -y @bivelio/savings-layer skill

Jedno polecenie: instaluje się w ~/.claude/skills i aktywuje sam, gdy rozmowa schodzi na limity lub oszczędzanie tokenów.

Jeden plan, cena za stanowisko

Grosze za uruchomienie. Wielokrotności do zaoszczędzenia.

Bez darmowego planu i bez okresu próbnego: zanim zapłacisz, możesz sprawdzić ZMIERZONE oszczędności powyżej, razem z ich przedziałem ufności. Wykupujesz subskrypcję i uruchamiasz warstwę w swojej aplikacji. Cena za stanowisko, w EUR.

4 € / stanowisko / mies.

PRO — rozliczane za stanowisko. Lub 39 € / stanowisko / rok (oszczędzasz ~19%). Enterprise, z pakietowymi funkcjami, pojawi się później.

Bez VAT. Jeśli Państwa firma ma unijny numer VAT, stosuje się odwrotne obciążenie.

Stanowisko to jedna aktywna maszyna lub tożsamość usługi, nie osoba — rozliczane tylko wtedy, gdy jest aktywne przez 3+ dni w miesiącu. CI i efemeryczne runnery się nie liczą.

  • Każda optymalizacja BV‑SALA, bez limitu
  • Zarządzany cache semantyczny i wyuczone progi
  • Panele oszczędności i analityka zespołowa
  • Twoje prompty nigdy nie opuszczają Twojej infrastruktury
Rozpocznij →

A ile Ty byś nam płacił?

Szacunek

Pobaw się swoimi liczbami: wybierz dostawcę i model, i zobacz swoje oszczędności, naszą dopłatę i to, co Ci zostaje — z prawdziwymi cenami katalogu i prawdziwą taryfą.

Ładowanie katalogu cen…

Jak liczy się to, co nam płacisz

  • Twój pierwszy miesiąc: tylko 4 € za miejsce. Mierzymy wszystko i nie pobieramy prowizji — na zamknięciu zobaczysz dokładny wyciąg tego, ile by to kosztowało.
  • Potem prowizja tylko od zmierzonych oszczędności: takich, które możesz uzgodnić z fakturą dostawcy. Szacowane nigdy nie są rozliczane.
  • I zawsze zatrzymujesz 90% lub więcej z każdego zaoszczędzonego euro: prowizja istnieje tylko wtedy, gdy istnieją Twoje zmierzone oszczędności.
  • Progowo, każdy próg według własnej stawki — 10% ≤ 1000 € · 8% ≤ 5000 € · 6% ≤ 20 000 € · 4% +. Im więcej oszczędzasz, tym niższy nasz procent.
  • Miesiąc bez oszczędności? Prowizja: 0 €. Bez zobowiązań — a Twoja pierwsza zmienna faktura zawiera tylko liczby, które już widziałeś na wyciągu.