Udowodnij oszczędności na własnych danych.
BV-SALA stoi przed dowolnym dostawcą LLM i dla każdego żądania wybiera najtańszą realizację, która wciąż spełnia Twój próg jakości. Każdy wynik oszczędności, jaki publikujemy, jest mierzony względem licznika tokenów samego dostawcy i podawany z przedziałem ufności — to pomiar, nigdy szacunek.
gpt-4o-miniclaude-sonnet-4-5Każdy krok trafia do INNEJ księgi, więc te liczby nie sumują się ze sobą. Krok, którego księga nie przekracza zera, nie pojawia się tutaj: ograniczenie wyjścia zostało zmierzone i nie oszczędza, więc go nie reklamujemy.
Obie gałęzie mierzone tokenizerem samego dostawcy — bez modelowanej linii bazowej.
To wynik benchmarku A/B (pnpm ab): dla każdego scenariusza wysyła żądanie naiwne oraz żądanie BV‑SALA do tego samego modelu, wycenia oba na podstawie własnego zużycia tokenów dostawcy i raportuje dolną granicę 95% przedziału ufności — nigdy pochlebnej estymacji punktowej. Nic nie jest modelowane.
Cztery księgi, nigdy nie sumowane — każda to osobno mierzona dźwignia, więc dolara nie da się policzyć dwa razy. Reszta uzgodnienia ≈ 0 to potwierdza. To są dźwignie referencyjne: Twoja ścieżka na żywo mierzy inne cztery — provider-cached zastępuje output-restriction — więc nigdy nie odwzorowujemy jednej na drugą.
| scenariusz | rodzaj | A wej/wyj | B wej/wyj | koszt A | koszt B | oszczędności ▾ | qa |
|---|---|---|---|---|---|---|---|
| Local arithmetic | resolver | 19/77 | 0/0 | $0.000049 | $0.00 | 100.0% | 4/4 |
| Forwarded support thread (compression) | ran | 3,838/368 | 1,861/194 | $0.000703 | $0.000354 | 49.7% | 24/24 |
| Large uniform table | ran | 1,212/319 | 781/116 | $0.000356 | $0.000187 | 47.6% | 9/9 |
| Big tool catalogue (schema-on-demand) | ran | 3,091/216 | 1,062/263 | $0.000575 | $0.000317 | 44.9% | 12/12 |
| Tool-heavy request | ran | 300/30 | 121/36 | $0.000063 | $0.000039 | 37.3% | 11/11 |
| Stable-prefix agent turn | ran | 5,307/58 | 5,307/58 | $0.000655 | $0.000623 | 4.9% | 24/24 |
| Constrained structured answer | ran | 60/71 | 60/70 | $0.000052 | $0.000051 | 1.0% | 24/24 |
| FAQ (first ask) | ran | 72/19 | 72/19 | $0.000022 | $0.000022 | 0.7% | 11/11 |
| Triage decision (output codebook) | ran | 184/72 | 184/72 | $0.000071 | $0.000071 | 0.0% | 8/8 |
| Summarize provided text | ran | 66/25 | 66/25 | $0.000025 | $0.000025 | −0.3% | 8/8 |
| FAQ (repeat ask) | cache | 72/18 | 72/19 | $0.000022 | $0.000022 | −2.8% | 6/6 |
claude-sonnet-4-5Anthropic nie cache'uje sam z siebie. Twoja integracja o to nie prosi; nasza tak.
OpenAI stosuje swój cache prefiksu automatycznie: ten rabat masz z nami albo bez nas. Anthropic nie. Wymaga oznaczenia punktu odcięcia w każdym żądaniu, a kto go nie oznaczy, zawsze płaci za całe wejście.
Co zostało zmierzone
Tura agenta z długim, powtarzanym kontekstem systemowym — asystent wsparcia, ekstraktor dokumentów. Osiem par, ten sam model w obu ramionach, rozliczone licznikiem samego Anthropic.
- Bez warstwy
- 0 tokenów obsłużonych z cache'u
- Z warstwą
- 58 624 tokenów obsłużonych z cache'u
Czego ta liczba NIE mówi
To oszczędność tej dźwigni na tym ruchu, a nie na całym twoim rachunku. Pochodzi ze scenariusza ze stabilnym prefiksem, gdzie leżą pieniądze cache'u; przy ruchu bez powtarzanego kontekstu ta dźwignia jest warta zero. Nagłówkowy wynik pełnego przebiegu mierzymy osobno i publikujemy go z przedziałem, powyżej.
I nie musisz wierzyć nam na słowo
Możesz to sprawdzić na własnym rachunku bez instalowania czegokolwiek: zobacz, czy twoje wywołania Claude niosą cache_read_input_tokens. Jeśli wychodzą zerowe, zostawiasz ten rabat na stole już dziś.
gpt-4o-miniCztery osobne księgi. Nigdy nie sumowane w jedną próżną liczbę.
Trafienie w cache usuwa całe wywołanie. BV‑SALA przekodowuje dane strukturalne w bardziej zwarty sposób. Kompresja odrzuca zbędne słowa. Cache prefiksu dostawcy potania tokeny bez ich usuwania. Mieszanie ich Cię okłamuje — więc tego nie robimy.
Cztery księgi zmierzone względem API OpenAI. Procent bez modelu obok nic nie znaczy: ta sama dźwignia może oszczędzać na jednym modelu i kosztować na innym.
avoided_calls
Wywołania LLM, wyszukiwania i narzędzi, które w ogóle się nie wykonały.
eliminated_tokens
Informacje odrzucone, ponieważ po prostu nie były potrzebne.
compressed_tokens
Informacje zachowane, ale zakodowane mniejszą liczbą tokenów.
Uruchom to w swojej własnej aplikacji. Twoje prompty nigdy nie dotykają naszych serwerów.
Umieść SDK przed swoim dostawcą. Każda odpowiedź niesie pełny SavingsReport, który możesz przedstawić na wykresie — te same liczby, które odczytuje panel.
# 1 · pakiet pnpm add @bivelio/savings-layer # 2 · licencja (z Twojego panelu) export BIVELIO_LICENSE_KEY=… # 3 · owinięcie wywołania — to cała zmiana kodu const layer = createSavingsLayer({ provider, licenseKey, … }); const { text, report } = await layer.generate({ model, messages }); console.log(report.cost.netSavings) // ← oszczędność, zmierzona
Tam, gdzie już żyją Twoje automatyzacje. Jeśli wywołuje API OpenAI lub Anthropic Twoim kluczem, jest mierzone — SDK opakowuje wywołanie; brama staje z przodu.
Claude Code z kluczem API? Zobacz realny wydatek, token po tokenie.
Jedno polecenie stawia lokalny licznik przed Twoim terminalem. Bez zmian w kodzie i bez konfiguracji — a Twoje prompty nigdy nie opuszczają Twojej maszyny: do tego panelu trafiają tylko liczby i koszt.
npm i -g @bivelio/savings-layer export BIVELIO_SERVICE_KEY=bvk_… bvsala claude
Dziś mierzy; tam jeszcze nie optymalizuje. Działa też z Codex CLI, Goose i Qwen Code — a bvsala doctor drukuje dokładną konfigurację reszty. Zobacz, jak to działa →
Skill, który rozciąga limity Twojej subskrypcji
Brak faktury nie znaczy brak bólu: pięciogodzinne okno i tygodniowy limit. savings-mode to skill z samych instrukcji — bez proxy, Twój ruch nietknięty — który tnie dwie masy naprawdę spalające limit: wyjście modelu i wyniki narzędzi. Jest darmowy; w Savings płaci się za wiedzę, ile Ci oszczędza.
odczyty cache
Cały kontekst jest odczytywany ponownie w każdej turze — dlatego liczy się jego szczupłość.
zapisy cache (jedna godzina)
Każdy wynik narzędzia jest zapisywany do cache z narzutem, zanim zostanie ponownie odczytany.
wyjście modelu
Poniżej jednego procenta tokenów; skill atakuje je bezpośrednio.
Zmierzone miernikiem na 959 prawdziwych żądaniach Claude Code, wobec liczników dostawcy (2026-09-01). Efekt samego skilla zostanie opublikowany po zmierzeniu w A/B — nigdy wcześniej.
npx -y @bivelio/savings-layer skillJedno polecenie: instaluje się w ~/.claude/skills i aktywuje sam, gdy rozmowa schodzi na limity lub oszczędzanie tokenów.
Grosze za uruchomienie. Wielokrotności do zaoszczędzenia.
Bez darmowego planu i bez okresu próbnego: zanim zapłacisz, możesz sprawdzić ZMIERZONE oszczędności powyżej, razem z ich przedziałem ufności. Wykupujesz subskrypcję i uruchamiasz warstwę w swojej aplikacji. Cena za stanowisko, w EUR.
PRO — rozliczane za stanowisko. Lub 39 € / stanowisko / rok (oszczędzasz ~19%). Enterprise, z pakietowymi funkcjami, pojawi się później.
Bez VAT. Jeśli Państwa firma ma unijny numer VAT, stosuje się odwrotne obciążenie.
Stanowisko to jedna aktywna maszyna lub tożsamość usługi, nie osoba — rozliczane tylko wtedy, gdy jest aktywne przez 3+ dni w miesiącu. CI i efemeryczne runnery się nie liczą.
- Każda optymalizacja BV‑SALA, bez limitu
- Zarządzany cache semantyczny i wyuczone progi
- Panele oszczędności i analityka zespołowa
- Twoje prompty nigdy nie opuszczają Twojej infrastruktury
A ile Ty byś nam płacił?
SzacunekPobaw się swoimi liczbami: wybierz dostawcę i model, i zobacz swoje oszczędności, naszą dopłatę i to, co Ci zostaje — z prawdziwymi cenami katalogu i prawdziwą taryfą.
Ładowanie katalogu cen…
Jak liczy się to, co nam płacisz
- Twój pierwszy miesiąc: tylko 4 € za miejsce. Mierzymy wszystko i nie pobieramy prowizji — na zamknięciu zobaczysz dokładny wyciąg tego, ile by to kosztowało.
- Potem prowizja tylko od zmierzonych oszczędności: takich, które możesz uzgodnić z fakturą dostawcy. Szacowane nigdy nie są rozliczane.
- I zawsze zatrzymujesz 90% lub więcej z każdego zaoszczędzonego euro: prowizja istnieje tylko wtedy, gdy istnieją Twoje zmierzone oszczędności.
- Progowo, każdy próg według własnej stawki — 10% ≤ 1000 € · 8% ≤ 5000 € · 6% ≤ 20 000 € · 4% +. Im więcej oszczędzasz, tym niższy nasz procent.
- Miesiąc bez oszczędności? Prowizja: 0 €. Bez zobowiązań — a Twoja pierwsza zmienna faktura zawiera tylko liczby, które już widziałeś na wyciągu.