Buktikan penghematan pada data Anda sendiri.
BV-SALA berada di depan penyedia LLM mana pun dan, untuk setiap permintaan, memilih eksekusi termurah yang tetap memenuhi standar kualitas Anda. Setiap angka penghematan yang kami publikasikan diukur terhadap penghitung token milik penyedia sendiri dan disertai interval keyakinannya — sama sekali bukan estimasi.
gpt-4o-miniclaude-sonnet-4-5Setiap langkah jatuh ke SATU buku yang berbeda, jadi angka-angka ini tidak saling dijumlahkan. Langkah yang bukunya tidak melewati nol tidak muncul di sini: pembatasan keluaran sudah diukur dan tidak menghemat, jadi tidak diiklankan.
Kedua sisi diukur oleh tokenizer penyedia itu sendiri — tanpa baseline yang dimodelkan.
Ini adalah keluaran dari benchmark A/B (pnpm ab): untuk setiap skenario, ia mengirim permintaan naif dan permintaan BV‑SALA ke model yang sama, menetapkan harga keduanya dari penggunaan token milik penyedia sendiri, dan melaporkan batas bawah tingkat keyakinan 95% — bukan estimasi titik yang menyanjung. Tidak ada yang dimodelkan.
Empat ledger, tidak pernah dijumlahkan — masing-masing adalah tuas yang diukur terpisah, sehingga satu dolar tidak bisa dihitung dua kali. Residual rekonsiliasi ≈ 0 membuktikannya. Ini adalah tuas referensi: rel langsung Anda mengukur empat yang berbeda — provider-cached menggantikan output-restriction — jadi kami tidak pernah memetakan yang satu ke yang lain.
| skenario | jenis | A masuk/keluar | B masuk/keluar | biaya A | biaya B | penghematan ▾ | qa |
|---|---|---|---|---|---|---|---|
| Local arithmetic | resolver | 19/77 | 0/0 | $0.000049 | $0.00 | 100.0% | 4/4 |
| Forwarded support thread (compression) | ran | 3,838/368 | 1,861/194 | $0.000703 | $0.000354 | 49.7% | 24/24 |
| Large uniform table | ran | 1,212/319 | 781/116 | $0.000356 | $0.000187 | 47.6% | 9/9 |
| Big tool catalogue (schema-on-demand) | ran | 3,091/216 | 1,062/263 | $0.000575 | $0.000317 | 44.9% | 12/12 |
| Tool-heavy request | ran | 300/30 | 121/36 | $0.000063 | $0.000039 | 37.3% | 11/11 |
| Stable-prefix agent turn | ran | 5,307/58 | 5,307/58 | $0.000655 | $0.000623 | 4.9% | 24/24 |
| Constrained structured answer | ran | 60/71 | 60/70 | $0.000052 | $0.000051 | 1.0% | 24/24 |
| FAQ (first ask) | ran | 72/19 | 72/19 | $0.000022 | $0.000022 | 0.7% | 11/11 |
| Triage decision (output codebook) | ran | 184/72 | 184/72 | $0.000071 | $0.000071 | 0.0% | 8/8 |
| Summarize provided text | ran | 66/25 | 66/25 | $0.000025 | $0.000025 | −0.3% | 8/8 |
| FAQ (repeat ask) | cache | 72/18 | 72/19 | $0.000022 | $0.000022 | −2.8% | 6/6 |
claude-sonnet-4-5Anthropic tidak melakukan cache sendiri. Integrasimu tidak memintanya; milik kami meminta.
OpenAI menerapkan cache prefiksnya secara otomatis: diskon itu kamu dapat dengan atau tanpa kami. Anthropic tidak. Ia menuntut penandaan titik potong pada setiap permintaan, dan yang tidak menandainya membayar seluruh input, selalu.
Apa yang diukur
Giliran agen dengan konteks sistem yang panjang dan berulang — asisten dukungan, pengekstrak dokumen. Delapan pasang, model yang sama di kedua lengan, ditarifkan dengan penghitung milik Anthropic sendiri.
- Tanpa lapisan
- 0 token dilayani dari cache
- Dengan lapisan
- 58.624 token dilayani dari cache
Apa yang TIDAK dikatakan angka ini
Ini penghematan dari tuas itu pada trafik itu, bukan pada seluruh tagihanmu. Angkanya berasal dari skenario prefiks stabil, tempat uang cache berada; pada trafik tanpa konteks berulang tuas ini bernilai nol. Angka utama dari uji penuh diukur terpisah, dan kami publikasikan dengan intervalnya, di atas.
Dan kamu tidak perlu percaya begitu saja
Bisa kamu periksa di tagihanmu sendiri tanpa memasang apa pun: lihat apakah panggilan Claude-mu membawa cache_read_input_tokens. Kalau hasilnya nol, diskon itu kamu tinggalkan begitu saja hari ini.
gpt-4o-miniEmpat ledger terpisah. Tidak pernah dijumlahkan menjadi satu angka gengsi.
Cache hit menghapus satu panggilan penuh. BV‑SALA mengodekan ulang data terstruktur secara lebih ringkas. Kompresi membuang kata-kata yang berlebihan. Cache prefix penyedia membuat token lebih murah tanpa menghapusnya. Mencampurnya berarti membohongi Anda — jadi kami tidak melakukannya.
Empat buku diukur terhadap API OpenAI. Persentase tanpa modelnya di sebelahnya tidak berarti apa-apa: tuas yang sama bisa menghemat pada satu model dan justru memakan biaya pada model lain.
avoided_calls
Panggilan LLM, retrieval, dan tool yang sama sekali tidak pernah dieksekusi.
eliminated_tokens
Informasi yang dibuang karena memang tidak diperlukan.
compressed_tokens
Informasi tetap dipertahankan, tetapi dikodekan dengan lebih sedikit token.
Jalankan di aplikasi Anda sendiri. Prompt Anda tidak pernah menyentuh server kami.
Tempatkan SDK di depan penyedia Anda. Setiap respons membawa SavingsReport lengkap yang bisa Anda grafikkan — angka yang sama yang dibaca dasbor.
# 1 · paketnya pnpm add @bivelio/savings-layer # 2 · lisensinya (dari dasbor kamu) export BIVELIO_LICENSE_KEY=… # 3 · membungkus panggilan — ini seluruh perubahan kodenya const layer = createSavingsLayer({ provider, licenseKey, … }); const { text, report } = await layer.generate({ model, messages }); console.log(report.cost.netSavings) // ← penghematan, terukur
Tempat otomasimu sudah hidup. Jika ia memanggil API OpenAI atau Anthropic dengan kuncimu, ia terukur — SDK membungkus panggilan; gateway berdiri di depannya.
Claude Code dengan kunci API? Lihat pengeluaran nyata, token demi token.
Satu perintah menempatkan pengukur lokal di depan terminalmu. Tanpa menyentuh kode, tanpa konfigurasi — dan prompt-mu tidak pernah meninggalkan mesinmu: hanya hitungan dan biaya yang sampai ke panel ini.
npm i -g @bivelio/savings-layer export BIVELIO_SERVICE_KEY=bvk_… bvsala claude
Hari ini ia mengukur; di sana ia belum mengoptimalkan. Juga bekerja dengan Codex CLI, Goose, dan Qwen Code — dan bvsala doctor mencetak konfigurasi persis untuk sisanya. Lihat cara kerjanya →
Skill yang merenggangkan batas langgananmu
Tanpa tagihan bukan berarti tanpa sakit: jendela lima jam dan batas mingguan. savings-mode adalah skill berisi instruksi murni — tanpa proxy, lalu lintasmu tak tersentuh — yang memangkas dua massa yang benar-benar membakar batas: keluaran model dan hasil alat. Gratis; yang dibayar ke Savings adalah mengetahui berapa banyak ia menghematmu.
pembacaan cache
Seluruh konteks dibaca ulang setiap giliran — karena itu menjaganya ramping penting.
penulisan cache (satu jam)
Setiap hasil alat ditulis ke cache dengan premi sebelum dibaca ulang.
keluaran model
Kurang dari satu persen token; skill menyerangnya langsung.
Diukur dengan meteran pada 959 permintaan Claude Code nyata, terhadap penghitung penyedia (2026-09-01). Efek skill itu sendiri akan dipublikasikan setelah diukur secara A/B — tidak pernah sebelumnya.
npx -y @bivelio/savings-layer skillSatu perintah: terpasang di ~/.claude/skills dan aktif sendiri saat percakapan menyinggung batas atau menghemat token.
Recehan untuk menjalankan. Berlipat untuk menghemat.
Tanpa paket gratis, tanpa uji coba: yang bisa Anda periksa sebelum membayar adalah penghematan TERUKUR di atas, lengkap dengan intervalnya. Anda berlangganan, lalu menjalankannya di aplikasi Anda. Dihargai per kursi, dalam EUR.
PRO — ditagih per kursi. Atau €39 / kursi / tahun (hemat ~19%). Enterprise, dengan fitur terpaket, hadir kemudian.
Belum termasuk PPN. Jika perusahaan Anda memiliki nomor PPN Uni Eropa, berlaku mekanisme reverse charge.
Satu kursi adalah satu mesin atau identitas layanan aktif, bukan orang — ditagih hanya jika aktif pada 3+ hari dalam sebulan. CI dan runner sementara tidak dihitung.
- Setiap optimasi BV‑SALA, tanpa batas
- Cache semantik terkelola & ambang batas yang dipelajari
- Dasbor penghematan & analitik tim
- Prompt Anda tidak pernah keluar dari infrastruktur Anda
Dan berapa kamu akan membayar kami?
PerkiraanMainkan angkamu: pilih penyedia dan model, lalu lihat penghematanmu, tambahan kami, dan yang tersisa untukmu — dengan harga katalog asli dan tarif asli.
Memuat katalog harga…
Bagaimana yang kamu bayar ke kami dihitung
- Bulan pertamamu: hanya €4 per seat. Kami mengukur semuanya dan tidak memungut komisi — saat penutupan kamu akan melihat rekening persis dari biaya yang seharusnya.
- Setelah itu, komisi hanya atas penghematan terukur: yang bisa kamu cocokkan dengan faktur penyedia. Estimasi tidak pernah ditagih.
- Dan Anda selalu menyimpan 90% atau lebih dari setiap euro yang dihemat: komisi hanya ada jika penghematan terukur Anda ada.
- Berjenjang, tiap jenjang dengan tarifnya — 10% ≤ €1.000 · 8% ≤ €5.000 · 6% ≤ €20.000 · 4% +. Makin besar hematmu, makin kecil persentase kami.
- Sebulan tanpa penghematan? Komisi: €0. Tanpa kontrak — dan faktur variabel pertamamu hanya berisi angka yang sudah kamu lihat di rekeningmu.