Savings Layer là một phần của nền tảng BiVelio
Lớp chi phí LLM mà ai cũng có thể cài đặt — được cấp phép để chạy

Chứng minh mức tiết kiệm trên dữ liệu của chính bạn.

BV-SALA đứng trước bất kỳ nhà cung cấp LLM nào và, với mỗi yêu cầu, chọn phương án thực thi rẻ nhất mà vẫn đáp ứng ngưỡng chất lượng của bạn. Mọi con số tiết kiệm mà chúng tôi công bố đều được đo bằng chính bộ đếm token của nhà cung cấp và luôn đi kèm khoảng tin cậy — không bao giờ là ước tính.

Cài đặt trong năm dòng. Giấy phép được kích hoạt từ bảng điều khiển của bạn.
OpenAIAnthropicGoogle
Đo với nhà cung cấp thật
OpenAIgpt-4o-mini
≥ 23,1%hóa đơn thấp hơn, đã xác minh ở mức 95%
Anthropicclaude-sonnet-4-5
78%chi phí thấp hơn nhờ bộ nhớ đệm tiền tố
Phương án thực thi rẻ nhất thắngđã đo · sàn 95%
01Tránh hoàn toàn lệnh gọibộ giải · bộ nhớ đệm chính xác · singleflight17.9%
02Bỏ những gì không cần gửicông cụ đã cắt tỉa · truy hồi · ngữ cảnh dư thừa38.6%
03Nén phần còn lạimã hóa nhẹ hơn · chỉ khi có lợi45.1%
Book 15-min callChúng tôi sẽ cho bạn biết bạn tiết kiệm được bao nhiêu với lưu lượng của mình, không cần cài gì.

Mỗi bước rơi vào MỘT sổ khác nhau, nên các con số này không cộng dồn với nhau. Một bước mà sổ của nó không vượt qua số không sẽ không xuất hiện ở đây: việc hạn chế đầu ra đã được đo và không tiết kiệm, nên chúng tôi không quảng bá nó.

Bước 2 · Cách đo lường mức tiết kiệm — có thể tái lập

Cả hai nhánh được đo bằng chính tokenizer của nhà cung cấp — không có đường cơ sở mô hình hóa.

Đây là kết quả của benchmark A/B (pnpm ab): với mỗi kịch bản, nó gửi một yêu cầu ngây thơ yêu cầu BV‑SALA đến cùng một mô hình, định giá cả hai từ chính mức sử dụng token của nhà cung cấp, và báo cáo giới hạn dưới của khoảng tin cậy 95% — không bao giờ là ước tính điểm hào nhoáng. Không có gì được mô hình hóa.

LIVE · tổ chức của bạnLIVE — được đo đối chiếu với một nhà cung cấp thực, có kiểm soát chất lượng.
23.1%
tiết kiệm ròng, giới hạn dưới của khoảng tin cậy 95%. Ước tính điểm 31.0%, cận trên 38.1% — chúng tôi lấy mức sàn làm tiêu đề.
−5.0%0%60.0%
avoided_calls
59.1%
95% ≥ 17.9% · Δ $0.000193
đã chứng minh
eliminated_tokens
43.0%
95% ≥ 38.6% · Δ $0.003352
đã chứng minh
compressed_tokens
49.3%
95% ≥ 45.1% · Δ $0.009909
đã chứng minh
provider_cached
chưa được kích hoạt trong lần chạy này — số 0 không phải là một phép đo
output_restriction
1.0%
95% ≥ −9.1% · Δ $0.000012
chưa chứng minh
output_codebook
chưa được kích hoạt trong lần chạy này — số 0 không phải là một phép đo

Bốn sổ cái, không bao giờ cộng gộp — mỗi cái là một đòn bẩy được đo riêng biệt, nên một đô la không thể bị đếm hai lần. Phần dư đối chiếu ≈ 0 chứng minh điều đó. Đây là các đòn bẩy tham chiếu: đường truyền trực tiếp của bạn đo bốn cái khác — provider-cached thay thế cho output-restriction — nên chúng tôi không bao giờ ánh xạ cái này sang cái kia.

Cổng chất lượng 100% đã vượt quaCác sổ cái khớp nhauCùng một mô hình ở cả hai nhánhĐiểm hòa vốn bộ đệm K=2đã chứng minh ở mức 95%Một câu trả lời bị suy giảm sẽ làm mất hiệu lực mức tiết kiệm của nó
kịch bảnloạiA vào/raB vào/rachi phí Achi phí Btiết kiệmqa
Local arithmeticresolver19/770/0$0.000049$0.00100.0%4/4
Forwarded support thread (compression)ran3,838/3681,861/194$0.000703$0.00035449.7%24/24
Large uniform tableran1,212/319781/116$0.000356$0.00018747.6%9/9
Big tool catalogue (schema-on-demand)ran3,091/2161,062/263$0.000575$0.00031744.9%12/12
Tool-heavy requestran300/30121/36$0.000063$0.00003937.3%11/11
Stable-prefix agent turnran5,307/585,307/58$0.000655$0.0006234.9%24/24
Constrained structured answerran60/7160/70$0.000052$0.0000511.0%24/24
FAQ (first ask)ran72/1972/19$0.000022$0.0000220.7%11/11
Triage decision (output codebook)ran184/72184/72$0.000071$0.0000710.0%8/8
Summarize provided textran66/2566/25$0.000025$0.000025−0.3%8/8
FAQ (repeat ask)cache72/1872/19$0.000022$0.000022−2.8%6/6
bộ đệm · khấu haoFAQ (repeat ask): miss lạnh $0.000022 → hit $0.00. Hòa vốn ở K=2 lần lặp — tiết kiệm từ bộ đệm là của lưu lượng lặp lại, không phải con số một-lần-gọi, nên một lệnh gọi lạnh trung thực mà nói sẽ hiển thị ≈0%.
Anthropicclaude-sonnet-4-5
Đã đo · bộ nhớ đệm tiền tố của Anthropic

Anthropic không tự lưu đệm. Tích hợp của bạn không yêu cầu điều đó; của chúng tôi thì có.

OpenAI áp dụng bộ nhớ đệm tiền tố tự động: khoản giảm giá đó bạn có dù có chúng tôi hay không. Anthropic thì không. Nó đòi hỏi đánh dấu điểm cắt ở mỗi yêu cầu, và ai không đánh dấu sẽ luôn trả tiền cho toàn bộ đầu vào.

Những gì đã được đo

Một lượt tác tử với ngữ cảnh hệ thống dài và lặp lại — một trợ lý hỗ trợ, một bộ trích xuất tài liệu. Tám cặp, cùng một mô hình ở cả hai nhánh, tính giá bằng chính bộ đếm của Anthropic.

Không có lớp
0 token được phục vụ từ bộ nhớ đệm
Có lớp
58.624 token được phục vụ từ bộ nhớ đệm
78%chi phí thấp hơn trên những yêu cầu đó · cận dưới 95% ở mức 78,0% · chất lượng 8/8, không suy giảm

Điều con số này KHÔNG nói

Đây là khoản tiết kiệm của đòn bẩy đó trên lưu lượng đó, không phải của toàn bộ hóa đơn. Nó đến từ kịch bản tiền tố ổn định, nơi có tiền của bộ nhớ đệm; với lưu lượng không có ngữ cảnh lặp lại, đòn bẩy này bằng không. Con số tổng của toàn bộ đợt chạy được đo riêng, và chúng tôi công bố kèm khoảng tin cậy, ở phía trên.

Và bạn không cần tin lời chúng tôi

Bạn có thể kiểm tra trên chính hóa đơn của mình mà không cần cài gì: xem các lệnh gọi Claude của bạn có mang cache_read_input_tokens hay không. Nếu chúng bằng không, hôm nay bạn đang bỏ lại khoản giảm giá đó trên bàn.

OpenAIgpt-4o-mini
Hạch toán trung thực

Bốn sổ cái riêng biệt. Không bao giờ cộng gộp thành một con số phù phiếm.

Một lần trúng bộ đệm loại bỏ nguyên một lệnh gọi. BV‑SALA mã hóa lại dữ liệu có cấu trúc gọn gàng hơn. Nén loại bỏ những từ ngữ dư thừa. Bộ đệm tiền tố của nhà cung cấp làm token rẻ hơn mà không loại bỏ chúng. Trộn lẫn chúng là dối gạt bạn — nên chúng tôi không làm vậy.

Bốn sổ được đo với API của OpenAI. Một tỷ lệ phần trăm mà không có mô hình đi kèm thì chẳng có nghĩa gì: cùng một đòn bẩy có thể tiết kiệm trên mô hình này và tốn kém trên mô hình khác.

01

avoided_calls

Các lệnh gọi LLM, truy xuất và công cụ chưa từng được thực thi.

17.9%
đã đo · sàn 95%
02

eliminated_tokens

Thông tin bị loại bỏ vì đơn giản là không cần thiết.

38.6%
đã đo · sàn 95%
03

compressed_tokens

Thông tin được giữ lại, nhưng mã hóa bằng ít token hơn.

45.1%
đã đo · sàn 95%
Năm dòng để bắt đầu

Chạy nó trong ứng dụng của riêng bạn. Prompt của bạn không bao giờ chạm tới máy chủ của chúng tôi.

Đặt SDK trước nhà cung cấp của bạn. Mỗi phản hồi đều mang theo một SavingsReport đầy đủ mà bạn có thể vẽ biểu đồ — cùng những con số mà bảng điều khiển đọc.

# 1 · gói
pnpm add @bivelio/savings-layer

# 2 · giấy phép (từ bảng điều khiển của bạn)
export BIVELIO_LICENSE_KEY=…

# 3 · bọc lệnh gọi — đây là toàn bộ thay đổi mã
const layer = createSavingsLayer({ provider, licenseKey, … });
const { text, report } = await layer.generate({ model, messages });

console.log(report.cost.netSavings)  // ← khoản tiết kiệm, đã đo
Salesforce HubSpot Odoo Zapier n8n UiPath

Nơi các tự động hóa của bạn đã sống. Nếu nó gọi API của OpenAI hay Anthropic bằng khóa của bạn, nó được đo — SDK bọc lời gọi; gateway đứng chắn phía trước.

Mới · terminal lập trình

Dùng Claude Code với khóa API? Xem chi tiêu thật, từng token một.

Một lệnh duy nhất đặt một bộ đo cục bộ trước terminal của bạn. Không sửa mã, không cấu hình — và prompt của bạn không bao giờ rời khỏi máy: bảng điều khiển này chỉ nhận số đếm và chi phí.

npm i -g @bivelio/savings-layer
export BIVELIO_SERVICE_KEY=bvk_…

bvsala claude

Hôm nay nó đo; ở đó nó chưa tối ưu. Cũng hoạt động với Codex CLI, Goose và Qwen Code — và bvsala doctor in ra cấu hình chính xác cho phần còn lại. Xem cách hoạt động →

savings-mode · skill miễn phí

Skill kéo giãn giới hạn gói thuê bao của bạn

Không có hóa đơn không có nghĩa là không đau: cửa sổ năm giờ và giới hạn tuần. savings-mode là một skill thuần chỉ dẫn — không proxy, lưu lượng của bạn nguyên vẹn — cắt hai khối thực sự đốt giới hạn: đầu ra của mô hình và kết quả công cụ. Nó miễn phí; điều bạn trả cho Savings là biết nó tiết kiệm cho bạn bao nhiêu.

01

đọc bộ đệm

Toàn bộ ngữ cảnh được đọc lại mỗi lượt — vì thế giữ nó gọn rất quan trọng.

68,2%
của chi tiêu đo được
02

ghi bộ đệm (một giờ)

Mỗi kết quả công cụ được ghi vào bộ đệm với phụ phí trước khi được đọc lại.

19,6%
của chi tiêu đo được
03

đầu ra của mô hình

Dưới một phần trăm số token; skill tấn công trực tiếp vào đó.

11,6%
của chi tiêu đo được

Đo bằng bộ đo trên 959 yêu cầu Claude Code thực, so với bộ đếm của nhà cung cấp (2026-09-01). Hiệu quả của chính skill sẽ được công bố khi đo xong bằng A/B — không bao giờ trước đó.

npx -y @bivelio/savings-layer skill

Một lệnh duy nhất: cài vào ~/.claude/skills và tự kích hoạt khi cuộc trò chuyện nói về giới hạn hoặc tiết kiệm token.

Một gói, tính giá theo ghế

Vài xu để chạy. Gấp nhiều lần để tiết kiệm.

Không có gói miễn phí, không có bản dùng thử: thứ bạn kiểm chứng được trước khi trả tiền là khoản tiết kiệm ĐÃ ĐO ở ngay phía trên, có khoảng tin cậy đi kèm. Bạn đăng ký thuê bao rồi chạy nó trong ứng dụng của mình. Tính giá theo ghế, bằng EUR.

4 € / ghế / tháng

PRO — tính phí theo ghế. Hoặc 39 € / ghế / năm (tiết kiệm ~19%). Enterprise, với các tính năng đóng gói, sẽ đến sau.

Chưa bao gồm VAT. Nếu công ty của quý vị có mã số VAT của EU, cơ chế reverse charge sẽ được áp dụng.

Một ghế là một máy hoặc danh tính dịch vụ đang hoạt động, không phải một người — chỉ tính phí nếu hoạt động từ 3 ngày trở lên trong một tháng. CI và các trình chạy tạm thời không được tính.

  • Mọi tối ưu hóa của BV‑SALA, không giới hạn
  • Bộ đệm ngữ nghĩa được quản lý & ngưỡng được học
  • Bảng điều khiển tiết kiệm & phân tích cho nhóm
  • Prompt của bạn không bao giờ rời khỏi hạ tầng của bạn
Bắt đầu →

Và bạn sẽ trả chúng tôi bao nhiêu?

Ước tính

Chơi với con số của bạn: chọn nhà cung cấp và mô hình, rồi xem khoản tiết kiệm, phần thêm của chúng tôi và phần bạn giữ lại — với giá danh mục thật và biểu phí thật.

Đang tải danh mục giá…

Cách tính số tiền bạn trả cho chúng tôi

  • Tháng đầu của bạn: chỉ 4 € mỗi chỗ. Chúng tôi đo tất cả và không thu hoa hồng — khi chốt kỳ bạn sẽ thấy sao kê chính xác của số tiền lẽ ra phải trả.
  • Sau đó, hoa hồng chỉ trên khoản tiết kiệm đã đo: khoản bạn có thể đối chiếu với hóa đơn nhà cung cấp. Ước tính không bao giờ bị tính phí.
  • bạn luôn giữ lại 90% trở lên của mỗi euro tiết kiệm được: hoa hồng chỉ tồn tại khi khoản tiết kiệm đo được của bạn tồn tại.
  • Theo bậc, mỗi bậc theo mức riêng — 10% ≤ 1.000 € · 8% ≤ 5.000 € · 6% ≤ 20.000 € · 4% +. Bạn tiết kiệm càng nhiều, phần trăm của chúng tôi càng thấp.
  • Một tháng không có tiết kiệm? Hoa hồng: 0 €. Không ràng buộc — và hóa đơn biến đổi đầu tiên chỉ chứa những con số bạn đã thấy trong sao kê.