Prova a poupança com os teus próprios dados.
O BV-SALA coloca-se à frente do teu fornecedor e, em cada pedido, escolhe a execução mais barata que ainda cumpre o teu contrato de qualidade. Cada número desta página está medido contra o contador do próprio fornecedor, com o seu intervalo de confiança ao lado — nunca uma estimativa.
gpt-4o-miniclaude-sonnet-4-5Cada passo cai num livro contabilístico DIFERENTE, por isso estes números não se somam entre si. Um passo cujo livro não ultrapassa o zero não aparece aqui: a restrição de saída foi medida e não poupa, por isso não é anunciada.
Ambos os braços medidos pelo tokenizador do próprio provedor — sem linha de base modelada.
Este é o resultado do benchmark A/B (pnpm ab): para cada cenário envia um pedido ingénuo e o pedido do BV‑SALA ao mesmo modelo, calcula o preço de ambos a partir da própria utilização de tokens do fornecedor e reporta o limite inferior do intervalo de confiança de 95% — nunca a estimativa pontual lisonjeira. Nada é modelado.
Quatro livros-razão, nunca somados — cada um é uma alavanca medida separadamente, por isso um dólar não pode ser contado duas vezes. O resíduo de reconciliação ≈ 0 prova-o. Estas são alavancas de referência: a tua via em direto mede outras quatro — provider-cached substitui output-restriction — por isso nunca mapeamos uma na outra.
| cenário | tipo | A ent/saí | B ent/saí | custo A | custo B | poupança ▾ | qa |
|---|---|---|---|---|---|---|---|
| Local arithmetic | resolver | 19/77 | 0/0 | $0.000049 | $0.00 | 100.0% | 4/4 |
| Forwarded support thread (compression) | ran | 3,838/368 | 1,861/194 | $0.000703 | $0.000354 | 49.7% | 24/24 |
| Large uniform table | ran | 1,212/319 | 781/116 | $0.000356 | $0.000187 | 47.6% | 9/9 |
| Big tool catalogue (schema-on-demand) | ran | 3,091/216 | 1,062/263 | $0.000575 | $0.000317 | 44.9% | 12/12 |
| Tool-heavy request | ran | 300/30 | 121/36 | $0.000063 | $0.000039 | 37.3% | 11/11 |
| Stable-prefix agent turn | ran | 5,307/58 | 5,307/58 | $0.000655 | $0.000623 | 4.9% | 24/24 |
| Constrained structured answer | ran | 60/71 | 60/70 | $0.000052 | $0.000051 | 1.0% | 24/24 |
| FAQ (first ask) | ran | 72/19 | 72/19 | $0.000022 | $0.000022 | 0.7% | 11/11 |
| Triage decision (output codebook) | ran | 184/72 | 184/72 | $0.000071 | $0.000071 | 0.0% | 8/8 |
| Summarize provided text | ran | 66/25 | 66/25 | $0.000025 | $0.000025 | −0.3% | 8/8 |
| FAQ (repeat ask) | cache | 72/18 | 72/19 | $0.000022 | $0.000022 | −2.8% | 6/6 |
claude-sonnet-4-5A Anthropic não faz cache sozinha. A tua integração não pede; a nossa pede.
A OpenAI aplica o seu cache de prefixo automaticamente: esse desconto já o tens connosco ou sem nós. A Anthropic não. Exige marcar o ponto de corte em cada pedido, e quem não o marca paga a entrada inteira, sempre.
O que foi medido
Turno de agente com contexto de sistema longo e repetido — um assistente de suporte, um extrator documental. Oito pares, mesmo modelo nos dois braços, tarifados com o contador da própria Anthropic.
- Sem a camada
- 0 tokens servidos a partir do cache
- Com a camada
- 58.624 tokens servidos a partir do cache
O que este número NÃO diz
É a poupança daquela alavanca sobre aquele tráfego, não a da tua fatura inteira. Vem do cenário de prefixo estável, onde está o dinheiro do cache; em tráfego sem contexto repetido esta alavanca vale zero. O número principal da campanha completa é medido à parte, e publicamo-lo com o seu intervalo, acima.
E não tens de acreditar em nós
É verificável na tua própria fatura sem instalar nada: vê se as tuas chamadas ao Claude trazem cache_read_input_tokens. Se saírem a zero, esse desconto estás a deixá-lo em cima da mesa hoje.
gpt-4o-miniQuatro livros-razão separados. Nunca somados numa única cifra de vaidade.
Um acerto de cache remove uma chamada inteira. O BV‑SALA recodifica dados estruturados de forma mais compacta. A compressão elimina palavras redundantes. Uma cache de prefixo do fornecedor torna os tokens mais baratos sem os remover. Misturá-los mente-te — por isso não o fazemos.
Quatro livros medidos contra a API da OpenAI. Uma percentagem sem o seu modelo ao lado não significa nada: a mesma alavanca pode poupar num modelo e custar noutro.
avoided_calls
Chamadas a LLM, recuperação e ferramentas que nunca chegaram a executar.
eliminated_tokens
Informação descartada porque simplesmente não era necessária.
compressed_tokens
Informação mantida, mas codificada com menos tokens.
Executa-o na tua própria app. Os teus prompts nunca tocam nos nossos servidores.
Coloca o SDK à frente do teu fornecedor. Cada resposta traz um SavingsReport completo que podes representar em gráfico — os mesmos números que o painel lê.
# 1 · o pacote pnpm add @bivelio/savings-layer # 2 · a licença (do seu painel) export BIVELIO_LICENSE_KEY=… # 3 · envolver a chamada — essa é toda a mudança de código const layer = createSavingsLayer({ provider, licenseKey, … }); const { text, report } = await layer.generate({ model, messages }); console.log(report.cost.netSavings) // ← a economia, medida
Onde as tuas automações já vivem. Se chama a API da OpenAI ou da Anthropic com a tua chave, mede-se — o SDK envolve a chamada; o gateway fica à frente.
Claude Code com chave de API? Vê o gasto real, token a token.
Um único comando põe um medidor local à frente do teu terminal. Sem tocar em código, sem configurar nada — e os teus prompts nunca saem da tua máquina: a este painel só chegam contagens e custo.
npm i -g @bivelio/savings-layer export BIVELIO_SERVICE_KEY=bvk_… bvsala claude
Hoje mede; ali ainda não otimiza. Também funciona com Codex CLI, Goose e Qwen Code — e o bvsala doctor imprime a configuração exata do resto. Vê como funciona →
A skill que estica os teus limites de subscrição
Sem fatura não quer dizer sem dor: a janela de cinco horas e o teto semanal. savings-mode é uma skill de instruções puras — sem proxy, o teu tráfego intacto — que corta as duas massas que realmente queimam o teto: a saída do modelo e os resultados de ferramentas. É gratuita; o que se paga com o Savings é saber quanto te poupa.
leituras de cache
O contexto inteiro é relido a cada turno — por isso mantê-lo magro importa.
escrita de cache (uma hora)
Cada resultado de ferramenta é escrito em cache com sobretaxa antes de ser relido.
saída do modelo
Menos de um por cento dos tokens; a skill ataca-a diretamente.
Medido com o medidor sobre 959 pedidos reais do Claude Code, contra os contadores do fornecedor (2026-09-01). O efeito da própria skill será publicado quando estiver medido em A/B — nunca antes.
npx -y @bivelio/savings-layer skillUm único comando: instala-se em ~/.claude/skills e ativa-se sozinho quando a conversa fala de limites ou de poupar tokens.
Cêntimos para executar. Múltiplos para poupar.
Sem plano gratuito e sem período experimental: o que podes comprovar antes de pagar é a poupança MEDIDA aqui acima, com o respetivo intervalo ao lado. Subscreves e executas o BV-SALA na tua app. Preço por lugar, em EUR.
PRO — faturado por lugar. Ou € 39 / lugar / ano (poupa ~19%). O Enterprise, com funcionalidades empacotadas, chega mais tarde.
IVA não incluído. Se a sua empresa tiver número de IVA intracomunitário, aplica-se a autoliquidação.
Um lugar é uma máquina ou identidade de serviço ativa, não uma pessoa — faturado apenas se estiver ativo em 3 ou mais dias num mês. CI e executores efémeros não contam.
- Todas as otimizações do BV‑SALA, sem limite
- Cache semântica gerida e limiares aprendidos
- Painéis de poupança e analíticas de equipa
- Os teus prompts nunca saem da tua infraestrutura
E quanto você nos pagaria?
EstimativaBrinque com seus números: escolha provedor e modelo, e veja sua economia, nosso extra e o que fica com você — com os preços reais do catálogo e a tarifa real.
Carregando o catálogo de preços…
Como se calcula o que você nos paga
- Seu primeiro mês: só € 4 por assento. Medimos tudo e não cobramos comissão — no fechamento você verá o extrato exato do que teria custado.
- Depois, comissão só sobre a economia medida: a que você pode conciliar com a fatura do seu provedor. O estimado nunca é faturado.
- E ficas sempre com 90% ou mais de cada euro poupado: a comissão só existe quando existe a tua poupança medida.
- Por faixas, cada uma à sua taxa — 10% ≤ € 1.000 · 8% ≤ € 5.000 · 6% ≤ € 20.000 · 4% +. Quanto mais você economiza, menor o nosso percentual.
- Um mês sem poupança? Comissão: € 0. Sem fidelização — e sua primeira fatura variável só contém números que você já viu no seu extrato.