A Savings Layer faz parte da plataforma BiVelio
A camada de custo de LLM que qualquer um pode instalar — licenciada para executar

Prova a poupança com os teus próprios dados.

O BV-SALA coloca-se à frente do teu fornecedor e, em cada pedido, escolhe a execução mais barata que ainda cumpre o teu contrato de qualidade. Cada número desta página está medido contra o contador do próprio fornecedor, com o seu intervalo de confiança ao lado — nunca uma estimativa.

Instalação em cinco linhas. A licença ativa-se no teu painel.
OpenAIAnthropicGoogle
Medido contra fornecedor real
OpenAIgpt-4o-mini
≥ 23,1%menos fatura, verificado a 95%
Anthropicclaude-sonnet-4-5
78%menos custo com cache de prefixo
Ganha a execução mais baratamedido · piso de 95%
01Evita a chamada por completoresolvedores · cache exato · singleflight17.9%
02Retira o que não era preciso enviarferramentas podadas · recuperação · contexto redundante38.6%
03Comprime o que restacodificação mais leve · só se compensar45.1%
Book 15-min callDizemos-te quanto pouparias com o teu tráfego, sem instalar nada.

Cada passo cai num livro contabilístico DIFERENTE, por isso estes números não se somam entre si. Um passo cujo livro não ultrapassa o zero não aparece aqui: a restrição de saída foi medida e não poupa, por isso não é anunciada.

Passo 2 · Como as economias são medidas — reproduzível

Ambos os braços medidos pelo tokenizador do próprio provedor — sem linha de base modelada.

Este é o resultado do benchmark A/B (pnpm ab): para cada cenário envia um pedido ingénuo e o pedido do BV‑SALA ao mesmo modelo, calcula o preço de ambos a partir da própria utilização de tokens do fornecedor e reporta o limite inferior do intervalo de confiança de 95% — nunca a estimativa pontual lisonjeira. Nada é modelado.

LIVE · a tua organizaçãoLIVE — medido contra um fornecedor real, com controlo de qualidade.
23.1%
poupança líquida, limite inferior do IC de 95%. Estimativa pontual 31.0%, superior 38.1% — destacamos o mínimo.
−5.0%0%60.0%
avoided_calls
59.1%
95% ≥ 17.9% · Δ $0.000193
comprovado
eliminated_tokens
43.0%
95% ≥ 38.6% · Δ $0.003352
comprovado
compressed_tokens
49.3%
95% ≥ 45.1% · Δ $0.009909
comprovado
provider_cached
não exercitada nesta execução — o seu zero não é uma medição
output_restriction
1.0%
95% ≥ −9.1% · Δ $0.000012
não comprovado
output_codebook
não exercitada nesta execução — o seu zero não é uma medição

Quatro livros-razão, nunca somados — cada um é uma alavanca medida separadamente, por isso um dólar não pode ser contado duas vezes. O resíduo de reconciliação ≈ 0 prova-o. Estas são alavancas de referência: a tua via em direto mede outras quatro — provider-cached substitui output-restriction — por isso nunca mapeamos uma na outra.

Controlo de qualidade 100% aprovadoOs livros-razão batem certoMesmo modelo nos dois braçosPonto de equilíbrio da cache K=2comprovado a 95%Uma resposta que regride anula a sua poupança
cenáriotipoA ent/saíB ent/saícusto Acusto Bpoupançaqa
Local arithmeticresolver19/770/0$0.000049$0.00100.0%4/4
Forwarded support thread (compression)ran3,838/3681,861/194$0.000703$0.00035449.7%24/24
Large uniform tableran1,212/319781/116$0.000356$0.00018747.6%9/9
Big tool catalogue (schema-on-demand)ran3,091/2161,062/263$0.000575$0.00031744.9%12/12
Tool-heavy requestran300/30121/36$0.000063$0.00003937.3%11/11
Stable-prefix agent turnran5,307/585,307/58$0.000655$0.0006234.9%24/24
Constrained structured answerran60/7160/70$0.000052$0.0000511.0%24/24
FAQ (first ask)ran72/1972/19$0.000022$0.0000220.7%11/11
Triage decision (output codebook)ran184/72184/72$0.000071$0.0000710.0%8/8
Summarize provided textran66/2566/25$0.000025$0.000025−0.3%8/8
FAQ (repeat ask)cache72/1872/19$0.000022$0.000022−2.8%6/6
cache · amortizadoFAQ (repeat ask): falha a frio $0.000022 → acerto $0.00. Atinge o equilíbrio a K=2 repetições — a poupança de cache é de tráfego repetido, não um número de uma única chamada, por isso uma chamada a frio honestamente marca ≈0%.
Anthropicclaude-sonnet-4-5
Medido · cache de prefixo da Anthropic

A Anthropic não faz cache sozinha. A tua integração não pede; a nossa pede.

A OpenAI aplica o seu cache de prefixo automaticamente: esse desconto já o tens connosco ou sem nós. A Anthropic não. Exige marcar o ponto de corte em cada pedido, e quem não o marca paga a entrada inteira, sempre.

O que foi medido

Turno de agente com contexto de sistema longo e repetido — um assistente de suporte, um extrator documental. Oito pares, mesmo modelo nos dois braços, tarifados com o contador da própria Anthropic.

Sem a camada
0 tokens servidos a partir do cache
Com a camada
58.624 tokens servidos a partir do cache
78%menos custo nesses pedidos · limite inferior de 95% em 78,0% · qualidade 8/8, sem regressão

O que este número NÃO diz

É a poupança daquela alavanca sobre aquele tráfego, não a da tua fatura inteira. Vem do cenário de prefixo estável, onde está o dinheiro do cache; em tráfego sem contexto repetido esta alavanca vale zero. O número principal da campanha completa é medido à parte, e publicamo-lo com o seu intervalo, acima.

E não tens de acreditar em nós

É verificável na tua própria fatura sem instalar nada: vê se as tuas chamadas ao Claude trazem cache_read_input_tokens. Se saírem a zero, esse desconto estás a deixá-lo em cima da mesa hoje.

OpenAIgpt-4o-mini
Contabilidade honesta

Quatro livros-razão separados. Nunca somados numa única cifra de vaidade.

Um acerto de cache remove uma chamada inteira. O BV‑SALA recodifica dados estruturados de forma mais compacta. A compressão elimina palavras redundantes. Uma cache de prefixo do fornecedor torna os tokens mais baratos sem os remover. Misturá-los mente-te — por isso não o fazemos.

Quatro livros medidos contra a API da OpenAI. Uma percentagem sem o seu modelo ao lado não significa nada: a mesma alavanca pode poupar num modelo e custar noutro.

01

avoided_calls

Chamadas a LLM, recuperação e ferramentas que nunca chegaram a executar.

17.9%
medido · piso de 95%
02

eliminated_tokens

Informação descartada porque simplesmente não era necessária.

38.6%
medido · piso de 95%
03

compressed_tokens

Informação mantida, mas codificada com menos tokens.

45.1%
medido · piso de 95%
Cinco linhas para começar

Executa-o na tua própria app. Os teus prompts nunca tocam nos nossos servidores.

Coloca o SDK à frente do teu fornecedor. Cada resposta traz um SavingsReport completo que podes representar em gráfico — os mesmos números que o painel lê.

# 1 · o pacote
pnpm add @bivelio/savings-layer

# 2 · a licença (do seu painel)
export BIVELIO_LICENSE_KEY=…

# 3 · envolver a chamada — essa é toda a mudança de código
const layer = createSavingsLayer({ provider, licenseKey, … });
const { text, report } = await layer.generate({ model, messages });

console.log(report.cost.netSavings)  // ← a economia, medida
Salesforce HubSpot Odoo Zapier n8n UiPath

Onde as tuas automações já vivem. Se chama a API da OpenAI ou da Anthropic com a tua chave, mede-se — o SDK envolve a chamada; o gateway fica à frente.

Novo · terminais de código

Claude Code com chave de API? Vê o gasto real, token a token.

Um único comando põe um medidor local à frente do teu terminal. Sem tocar em código, sem configurar nada — e os teus prompts nunca saem da tua máquina: a este painel só chegam contagens e custo.

npm i -g @bivelio/savings-layer
export BIVELIO_SERVICE_KEY=bvk_…

bvsala claude

Hoje mede; ali ainda não otimiza. Também funciona com Codex CLI, Goose e Qwen Code — e o bvsala doctor imprime a configuração exata do resto. Vê como funciona →

savings-mode · skill gratuita

A skill que estica os teus limites de subscrição

Sem fatura não quer dizer sem dor: a janela de cinco horas e o teto semanal. savings-mode é uma skill de instruções puras — sem proxy, o teu tráfego intacto — que corta as duas massas que realmente queimam o teto: a saída do modelo e os resultados de ferramentas. É gratuita; o que se paga com o Savings é saber quanto te poupa.

01

leituras de cache

O contexto inteiro é relido a cada turno — por isso mantê-lo magro importa.

68,2%
do gasto medido
02

escrita de cache (uma hora)

Cada resultado de ferramenta é escrito em cache com sobretaxa antes de ser relido.

19,6%
do gasto medido
03

saída do modelo

Menos de um por cento dos tokens; a skill ataca-a diretamente.

11,6%
do gasto medido

Medido com o medidor sobre 959 pedidos reais do Claude Code, contra os contadores do fornecedor (2026-09-01). O efeito da própria skill será publicado quando estiver medido em A/B — nunca antes.

npx -y @bivelio/savings-layer skill

Um único comando: instala-se em ~/.claude/skills e ativa-se sozinho quando a conversa fala de limites ou de poupar tokens.

Um só plano, com preço por lugar

Cêntimos para executar. Múltiplos para poupar.

Sem plano gratuito e sem período experimental: o que podes comprovar antes de pagar é a poupança MEDIDA aqui acima, com o respetivo intervalo ao lado. Subscreves e executas o BV-SALA na tua app. Preço por lugar, em EUR.

€ 4 / lugar / mês

PRO — faturado por lugar. Ou € 39 / lugar / ano (poupa ~19%). O Enterprise, com funcionalidades empacotadas, chega mais tarde.

IVA não incluído. Se a sua empresa tiver número de IVA intracomunitário, aplica-se a autoliquidação.

Um lugar é uma máquina ou identidade de serviço ativa, não uma pessoa — faturado apenas se estiver ativo em 3 ou mais dias num mês. CI e executores efémeros não contam.

  • Todas as otimizações do BV‑SALA, sem limite
  • Cache semântica gerida e limiares aprendidos
  • Painéis de poupança e analíticas de equipa
  • Os teus prompts nunca saem da tua infraestrutura
Começar →

E quanto você nos pagaria?

Estimativa

Brinque com seus números: escolha provedor e modelo, e veja sua economia, nosso extra e o que fica com você — com os preços reais do catálogo e a tarifa real.

Carregando o catálogo de preços…

Como se calcula o que você nos paga

  • Seu primeiro mês: só € 4 por assento. Medimos tudo e não cobramos comissão — no fechamento você verá o extrato exato do que teria custado.
  • Depois, comissão só sobre a economia medida: a que você pode conciliar com a fatura do seu provedor. O estimado nunca é faturado.
  • E ficas sempre com 90% ou mais de cada euro poupado: a comissão só existe quando existe a tua poupança medida.
  • Por faixas, cada uma à sua taxa — 10% ≤ € 1.000 · 8% ≤ € 5.000 · 6% ≤ € 20.000 · 4% +. Quanto mais você economiza, menor o nosso percentual.
  • Um mês sem poupança? Comissão: € 0. Sem fidelização — e sua primeira fatura variável só contém números que você já viu no seu extrato.