Savings Layer adalah bagian dari platform BiVelio
Lapisan biaya LLM yang bisa dipasang siapa saja — berlisensi untuk berjalan

Buktikan penghematan pada data Anda sendiri.

BV-SALA berada di depan penyedia LLM mana pun dan, untuk setiap permintaan, memilih eksekusi termurah yang tetap memenuhi standar kualitas Anda. Setiap angka penghematan yang kami publikasikan diukur terhadap penghitung token milik penyedia sendiri dan disertai interval keyakinannya — sama sekali bukan estimasi.

Pemasangan dalam lima baris. Lisensi diaktifkan dari dasbor Anda.
OpenAIAnthropicGoogle
Diukur terhadap penyedia nyata
OpenAIgpt-4o-mini
≥ 23,1%tagihan lebih rendah, terverifikasi 95%
Anthropicclaude-sonnet-4-5
78%biaya lebih rendah dengan cache prefiks
Eksekusi termurah menangterukur · batas bawah 95%
01Hindari panggilan sepenuhnyaresolver · cache persis · singleflight17.9%
02Buang yang memang tak perlu dikirimalat dipangkas · retrieval · konteks berlebih38.6%
03Kompres sisanyapengodean lebih ringan · hanya bila menguntungkan45.1%
Book 15-min callKami beri tahu berapa yang bisa kamu hemat dengan trafikmu, tanpa memasang apa pun.

Setiap langkah jatuh ke SATU buku yang berbeda, jadi angka-angka ini tidak saling dijumlahkan. Langkah yang bukunya tidak melewati nol tidak muncul di sini: pembatasan keluaran sudah diukur dan tidak menghemat, jadi tidak diiklankan.

Langkah 2 · Bagaimana penghematan diukur — dapat direproduksi

Kedua sisi diukur oleh tokenizer penyedia itu sendiri — tanpa baseline yang dimodelkan.

Ini adalah keluaran dari benchmark A/B (pnpm ab): untuk setiap skenario, ia mengirim permintaan naif dan permintaan BV‑SALA ke model yang sama, menetapkan harga keduanya dari penggunaan token milik penyedia sendiri, dan melaporkan batas bawah tingkat keyakinan 95% — bukan estimasi titik yang menyanjung. Tidak ada yang dimodelkan.

LIVE · organisasi AndaLIVE — diukur terhadap penyedia nyata, dengan gerbang kualitas.
23.1%
penghematan bersih, batas bawah CI 95%. Estimasi titik 31.0%, atas 38.1% — kami menonjolkan angka terendah.
−5.0%0%60.0%
avoided_calls
59.1%
95% ≥ 17.9% · Δ $0.000193
terbukti
eliminated_tokens
43.0%
95% ≥ 38.6% · Δ $0.003352
terbukti
compressed_tokens
49.3%
95% ≥ 45.1% · Δ $0.009909
terbukti
provider_cached
tidak diaktifkan pada eksekusi ini — angka nolnya bukan pengukuran
output_restriction
1.0%
95% ≥ −9.1% · Δ $0.000012
tidak terbukti
output_codebook
tidak diaktifkan pada eksekusi ini — angka nolnya bukan pengukuran

Empat ledger, tidak pernah dijumlahkan — masing-masing adalah tuas yang diukur terpisah, sehingga satu dolar tidak bisa dihitung dua kali. Residual rekonsiliasi ≈ 0 membuktikannya. Ini adalah tuas referensi: rel langsung Anda mengukur empat yang berbeda — provider-cached menggantikan output-restriction — jadi kami tidak pernah memetakan yang satu ke yang lain.

Gerbang kualitas 100% lolosLedger cocokModel sama di kedua lenganTitik impas cache K=2terbukti pada 95%Jawaban yang memburuk membatalkan penghematannya
skenariojenisA masuk/keluarB masuk/keluarbiaya Abiaya Bpenghematanqa
Local arithmeticresolver19/770/0$0.000049$0.00100.0%4/4
Forwarded support thread (compression)ran3,838/3681,861/194$0.000703$0.00035449.7%24/24
Large uniform tableran1,212/319781/116$0.000356$0.00018747.6%9/9
Big tool catalogue (schema-on-demand)ran3,091/2161,062/263$0.000575$0.00031744.9%12/12
Tool-heavy requestran300/30121/36$0.000063$0.00003937.3%11/11
Stable-prefix agent turnran5,307/585,307/58$0.000655$0.0006234.9%24/24
Constrained structured answerran60/7160/70$0.000052$0.0000511.0%24/24
FAQ (first ask)ran72/1972/19$0.000022$0.0000220.7%11/11
Triage decision (output codebook)ran184/72184/72$0.000071$0.0000710.0%8/8
Summarize provided textran66/2566/25$0.000025$0.000025−0.3%8/8
FAQ (repeat ask)cache72/1872/19$0.000022$0.000022−2.8%6/6
cache · teramortisasiFAQ (repeat ask): miss dingin $0.000022 → hit $0.00. Mencapai titik impas pada K=2 pengulangan — penghematan cache berasal dari lalu lintas berulang, bukan angka satu panggilan, sehingga panggilan dingin secara jujur terbaca ≈0%.
Anthropicclaude-sonnet-4-5
Terukur · cache prefiks Anthropic

Anthropic tidak melakukan cache sendiri. Integrasimu tidak memintanya; milik kami meminta.

OpenAI menerapkan cache prefiksnya secara otomatis: diskon itu kamu dapat dengan atau tanpa kami. Anthropic tidak. Ia menuntut penandaan titik potong pada setiap permintaan, dan yang tidak menandainya membayar seluruh input, selalu.

Apa yang diukur

Giliran agen dengan konteks sistem yang panjang dan berulang — asisten dukungan, pengekstrak dokumen. Delapan pasang, model yang sama di kedua lengan, ditarifkan dengan penghitung milik Anthropic sendiri.

Tanpa lapisan
0 token dilayani dari cache
Dengan lapisan
58.624 token dilayani dari cache
78%biaya lebih rendah pada permintaan tersebut · batas bawah 95% di 78,0% · kualitas 8/8, tanpa regresi

Apa yang TIDAK dikatakan angka ini

Ini penghematan dari tuas itu pada trafik itu, bukan pada seluruh tagihanmu. Angkanya berasal dari skenario prefiks stabil, tempat uang cache berada; pada trafik tanpa konteks berulang tuas ini bernilai nol. Angka utama dari uji penuh diukur terpisah, dan kami publikasikan dengan intervalnya, di atas.

Dan kamu tidak perlu percaya begitu saja

Bisa kamu periksa di tagihanmu sendiri tanpa memasang apa pun: lihat apakah panggilan Claude-mu membawa cache_read_input_tokens. Kalau hasilnya nol, diskon itu kamu tinggalkan begitu saja hari ini.

OpenAIgpt-4o-mini
Penghitungan yang jujur

Empat ledger terpisah. Tidak pernah dijumlahkan menjadi satu angka gengsi.

Cache hit menghapus satu panggilan penuh. BV‑SALA mengodekan ulang data terstruktur secara lebih ringkas. Kompresi membuang kata-kata yang berlebihan. Cache prefix penyedia membuat token lebih murah tanpa menghapusnya. Mencampurnya berarti membohongi Anda — jadi kami tidak melakukannya.

Empat buku diukur terhadap API OpenAI. Persentase tanpa modelnya di sebelahnya tidak berarti apa-apa: tuas yang sama bisa menghemat pada satu model dan justru memakan biaya pada model lain.

01

avoided_calls

Panggilan LLM, retrieval, dan tool yang sama sekali tidak pernah dieksekusi.

17.9%
terukur · batas bawah 95%
02

eliminated_tokens

Informasi yang dibuang karena memang tidak diperlukan.

38.6%
terukur · batas bawah 95%
03

compressed_tokens

Informasi tetap dipertahankan, tetapi dikodekan dengan lebih sedikit token.

45.1%
terukur · batas bawah 95%
Lima baris untuk memulai

Jalankan di aplikasi Anda sendiri. Prompt Anda tidak pernah menyentuh server kami.

Tempatkan SDK di depan penyedia Anda. Setiap respons membawa SavingsReport lengkap yang bisa Anda grafikkan — angka yang sama yang dibaca dasbor.

# 1 · paketnya
pnpm add @bivelio/savings-layer

# 2 · lisensinya (dari dasbor kamu)
export BIVELIO_LICENSE_KEY=…

# 3 · membungkus panggilan — ini seluruh perubahan kodenya
const layer = createSavingsLayer({ provider, licenseKey, … });
const { text, report } = await layer.generate({ model, messages });

console.log(report.cost.netSavings)  // ← penghematan, terukur
Salesforce HubSpot Odoo Zapier n8n UiPath

Tempat otomasimu sudah hidup. Jika ia memanggil API OpenAI atau Anthropic dengan kuncimu, ia terukur — SDK membungkus panggilan; gateway berdiri di depannya.

Baru · terminal pemrograman

Claude Code dengan kunci API? Lihat pengeluaran nyata, token demi token.

Satu perintah menempatkan pengukur lokal di depan terminalmu. Tanpa menyentuh kode, tanpa konfigurasi — dan prompt-mu tidak pernah meninggalkan mesinmu: hanya hitungan dan biaya yang sampai ke panel ini.

npm i -g @bivelio/savings-layer
export BIVELIO_SERVICE_KEY=bvk_…

bvsala claude

Hari ini ia mengukur; di sana ia belum mengoptimalkan. Juga bekerja dengan Codex CLI, Goose, dan Qwen Code — dan bvsala doctor mencetak konfigurasi persis untuk sisanya. Lihat cara kerjanya →

savings-mode · skill gratis

Skill yang merenggangkan batas langgananmu

Tanpa tagihan bukan berarti tanpa sakit: jendela lima jam dan batas mingguan. savings-mode adalah skill berisi instruksi murni — tanpa proxy, lalu lintasmu tak tersentuh — yang memangkas dua massa yang benar-benar membakar batas: keluaran model dan hasil alat. Gratis; yang dibayar ke Savings adalah mengetahui berapa banyak ia menghematmu.

01

pembacaan cache

Seluruh konteks dibaca ulang setiap giliran — karena itu menjaganya ramping penting.

68,2%
dari pengeluaran terukur
02

penulisan cache (satu jam)

Setiap hasil alat ditulis ke cache dengan premi sebelum dibaca ulang.

19,6%
dari pengeluaran terukur
03

keluaran model

Kurang dari satu persen token; skill menyerangnya langsung.

11,6%
dari pengeluaran terukur

Diukur dengan meteran pada 959 permintaan Claude Code nyata, terhadap penghitung penyedia (2026-09-01). Efek skill itu sendiri akan dipublikasikan setelah diukur secara A/B — tidak pernah sebelumnya.

npx -y @bivelio/savings-layer skill

Satu perintah: terpasang di ~/.claude/skills dan aktif sendiri saat percakapan menyinggung batas atau menghemat token.

Satu paket, dihargai per kursi

Recehan untuk menjalankan. Berlipat untuk menghemat.

Tanpa paket gratis, tanpa uji coba: yang bisa Anda periksa sebelum membayar adalah penghematan TERUKUR di atas, lengkap dengan intervalnya. Anda berlangganan, lalu menjalankannya di aplikasi Anda. Dihargai per kursi, dalam EUR.

€4 / kursi / bulan

PRO — ditagih per kursi. Atau €39 / kursi / tahun (hemat ~19%). Enterprise, dengan fitur terpaket, hadir kemudian.

Belum termasuk PPN. Jika perusahaan Anda memiliki nomor PPN Uni Eropa, berlaku mekanisme reverse charge.

Satu kursi adalah satu mesin atau identitas layanan aktif, bukan orang — ditagih hanya jika aktif pada 3+ hari dalam sebulan. CI dan runner sementara tidak dihitung.

  • Setiap optimasi BV‑SALA, tanpa batas
  • Cache semantik terkelola & ambang batas yang dipelajari
  • Dasbor penghematan & analitik tim
  • Prompt Anda tidak pernah keluar dari infrastruktur Anda
Mulai →

Dan berapa kamu akan membayar kami?

Perkiraan

Mainkan angkamu: pilih penyedia dan model, lalu lihat penghematanmu, tambahan kami, dan yang tersisa untukmu — dengan harga katalog asli dan tarif asli.

Memuat katalog harga…

Bagaimana yang kamu bayar ke kami dihitung

  • Bulan pertamamu: hanya €4 per seat. Kami mengukur semuanya dan tidak memungut komisi — saat penutupan kamu akan melihat rekening persis dari biaya yang seharusnya.
  • Setelah itu, komisi hanya atas penghematan terukur: yang bisa kamu cocokkan dengan faktur penyedia. Estimasi tidak pernah ditagih.
  • Dan Anda selalu menyimpan 90% atau lebih dari setiap euro yang dihemat: komisi hanya ada jika penghematan terukur Anda ada.
  • Berjenjang, tiap jenjang dengan tarifnya — 10% ≤ €1.000 · 8% ≤ €5.000 · 6% ≤ €20.000 · 4% +. Makin besar hematmu, makin kecil persentase kami.
  • Sebulan tanpa penghematan? Komisi: €0. Tanpa kontrak — dan faktur variabel pertamamu hanya berisi angka yang sudah kamu lihat di rekeningmu.