Savings Layer forma parte de la plataforma BiVelio
Capa de coste para LLM · SDK con licencia

Tu factura de LLM, medida y recortada.

BV‑SALA se sitúa delante de tu proveedor y, en cada petición, elige la ejecución más barata que aún cumple tu contrato de calidad. Cada cifra de ahorro que publicamos está medida contra el contador del propio proveedor, con su intervalo de confianza al lado — nunca una estimación.

Instalación en cinco líneas. La licencia se activa desde tu panel.
OpenAIAnthropicGoogle
Medido contra proveedor real
OpenAIgpt-4o-mini
≥ 23,1 %menos factura, verificado al 95 %
Anthropicclaude-sonnet-4-5
78 %menos coste con caché de prefijo
Gana la ejecución más baratamedido · suelo del 95 %
01Evita la llamada por completoresolutores · caché exacta · singleflight17.9%
02Quita lo que no hacía falta enviarherramientas podadas · recuperación · contexto redundante38.6%
03Comprime lo que quedacodificación más ligera · solo si sale a cuenta45.1%
Book 15-min callTe decimos qué ahorrarías con tu tráfico, sin instalar nada.

Cada paso cae en UN libro contable distinto, así que estas cifras no se suman entre sí. Un paso cuyo libro no despeja el cero no aparece aquí: la restricción de salida se midió y no ahorra, así que no se anuncia.

Cómo se miden los ahorros — reproducible

Ambos brazos medidos por el tokenizador del propio proveedor — sin línea base modelada.

Este es el resultado del benchmark A/B (pnpm ab): para cada escenario envía una solicitud ingenua y la solicitud de BV‑SALA al mismo modelo, cotiza ambas a partir del propio uso de tokens del proveedor e informa el límite inferior del intervalo de confianza del 95% — nunca la estimación puntual halagadora. Nada está modelado.

LIVE · tu organizaciónLIVE — medido contra un proveedor real, con control de calidad.
23.1%
ahorro neto, límite inferior del IC del 95%. Estimación puntual 31.0%, superior 38.1%: destacamos el piso.
−5.0%0%60.0%
avoided_calls
59.1%
95% ≥ 17.9% · Δ $0.000193
comprobado
eliminated_tokens
43.0%
95% ≥ 38.6% · Δ $0.003352
comprobado
compressed_tokens
49.3%
95% ≥ 45.1% · Δ $0.009909
comprobado
provider_cached
no ejercitada en esta tirada — su cero no es una medición
output_restriction
1.0%
95% ≥ −9.1% · Δ $0.000012
no comprobado
output_codebook
no ejercitada en esta tirada — su cero no es una medición

Cuatro libros, nunca sumados: cada uno es una palanca medida por separado, así que un dólar no se puede contar dos veces. El residual de conciliación ≈ 0 lo demuestra. Estas son palancas de referencia: tu vía en vivo mide otras cuatro (provider-cached reemplaza a output-restriction), así que nunca las equiparamos entre sí.

Control de calidad 100% superadoLos libros cuadranMismo modelo en ambos brazosPunto de equilibrio de caché K=2comprobado al 95%Una respuesta que empeora anula su ahorro
escenariotipoA ent/salB ent/salcosto Acosto Bahorroqa
Local arithmeticresolver19/770/0$0.000049$0.00100.0%4/4
Forwarded support thread (compression)ran3,838/3681,861/194$0.000703$0.00035449.7%24/24
Large uniform tableran1,212/319781/116$0.000356$0.00018747.6%9/9
Big tool catalogue (schema-on-demand)ran3,091/2161,062/263$0.000575$0.00031744.9%12/12
Tool-heavy requestran300/30121/36$0.000063$0.00003937.3%11/11
Stable-prefix agent turnran5,307/585,307/58$0.000655$0.0006234.9%24/24
Constrained structured answerran60/7160/70$0.000052$0.0000511.0%24/24
FAQ (first ask)ran72/1972/19$0.000022$0.0000220.7%11/11
Triage decision (output codebook)ran184/72184/72$0.000071$0.0000710.0%8/8
Summarize provided textran66/2566/25$0.000025$0.000025−0.3%8/8
FAQ (repeat ask)cache72/1872/19$0.000022$0.000022−2.8%6/6
caché · amortizadoFAQ (repeat ask): fallo en frío $0.000022 → acierto $0.00. Alcanza el equilibrio con K=2 repeticiones: el ahorro de caché es de tráfico repetido, no una cifra de una sola llamada, por lo que una llamada en frío honestamente marca ≈0%.
Anthropicclaude-sonnet-4-5
Medido · caché de prefijo de Anthropic

Anthropic no cachea sola. Tu integración no se lo pide; la nuestra sí.

OpenAI aplica su caché de prefijo automáticamente: ese descuento ya lo tienes con nosotros o sin nosotros. Anthropic no. Exige marcar el punto de corte en cada petición, y quien no lo marca paga la entrada entera, siempre.

Lo que se midió

Turno de agente con contexto de sistema largo y repetido — un asistente de soporte, un extractor documental. Ocho pares, mismo modelo en los dos brazos, tarifados con el contador del propio Anthropic.

Sin la capa
0 tokens servidos desde caché
Con la capa
58 624 tokens servidos desde caché
78 %menos coste en esas peticiones · límite inferior del 95 % en 78,0 % · calidad 8/8, sin regresión

Qué NO dice esta cifra

Es el ahorro de esa palanca sobre ese tráfico, no el de tu factura entera. Sale del escenario de prefijo estable, donde vive el dinero de la caché; en tráfico sin contexto repetido esta palanca vale cero. El titular de la tirada completa se mide aparte, y lo publicamos con su intervalo, arriba.

Y no hace falta que nos creas

Es comprobable en tu propia factura sin instalar nada: mira si tus llamadas a Claude traen cache_read_input_tokens. Si salen a cero, ese descuento lo estás dejando en la mesa hoy.

OpenAIgpt-4o-mini
Contabilidad honesta

Cuatro libros contables separados. Nunca sumados en una sola cifra de vanidad.

Un acierto de caché elimina una llamada entera. BV‑SALA recodifica los datos estructurados de forma más compacta. La compresión descarta palabras redundantes. Una caché de prefijo del proveedor abarata los tokens sin eliminarlos. Mezclarlos te miente — así que no lo hacemos.

Cuatro libros medidos contra la API de OpenAI. Un porcentaje sin su modelo al lado no significa nada: la misma palanca puede ahorrar en un modelo y costar en otro.

01

avoided_calls

Llamadas a LLM, recuperación y herramientas que nunca se ejecutaron.

17.9%
medido · suelo del 95 %
02

eliminated_tokens

Información descartada porque simplemente no era necesaria.

38.6%
medido · suelo del 95 %
03

compressed_tokens

Información conservada, pero codificada con menos tokens.

45.1%
medido · suelo del 95 %
Cinco líneas para empezar

Ejecútalo en tu propia app. Tus prompts nunca tocan nuestros servidores.

Coloca el SDK delante de tu proveedor. Cada respuesta lleva un SavingsReport completo que puedes graficar — las mismas cifras que lee el panel.

# 1 · el paquete
pnpm add @bivelio/savings-layer

# 2 · la licencia (de tu dashboard)
export BIVELIO_LICENSE_KEY=…

# 3 · envolver la llamada — esto es todo el cambio de código
const layer = createSavingsLayer({ provider, licenseKey, … });
const { text, report } = await layer.generate({ model, messages });

console.log(report.cost.netSavings)  // ← el ahorro, medido
Salesforce HubSpot Odoo Zapier n8n UiPath

Donde ya viven tus automatizaciones. Si llama a la API de OpenAI o Anthropic con tu clave, se mide — el SDK envuelve la llamada; el gateway se pone delante.

Nuevo · terminales de código

¿Claude Code con API key? Mira su gasto real, token a token.

Un solo comando pone un medidor local delante de tu terminal. Sin tocar código y sin configurar nada — y tus prompts jamás salen de tu máquina: a este panel solo llegan conteos y coste.

npm i -g @bivelio/savings-layer
export BIVELIO_SERVICE_KEY=bvk_…

bvsala claude

Hoy mide; todavía no optimiza ahí. Funciona también con Codex CLI, Goose y Qwen Code — y bvsala doctor imprime la configuración exacta del resto. Ver cómo funciona →

Un solo plan, con precio por asiento

Céntimos para ejecutar. Múltiplos para ahorrar.

Sin plan gratuito y sin prueba: lo que puedes comprobar antes de pagar es el ahorro MEDIDO de aquí arriba, con su intervalo al lado. Te suscribes y lo ejecutas en tu app. Precio por asiento, en EUR.

4 € / asiento / mes

PRO — facturado por asiento. O 39 € / asiento / año (ahorra ~19%). Enterprise, con funciones empaquetadas, llegará más adelante.

IVA no incluido. Si su empresa tiene NIF-IVA intracomunitario, se aplica la inversión del sujeto pasivo.

Un asiento es una máquina o identidad de servicio activa, no una persona — facturado solo si está activo 3 o más días en un mes. CI y ejecutores efímeros no cuentan.

  • Cada optimización de BV‑SALA, sin límite
  • Caché semántica gestionada y umbrales aprendidos
  • Paneles de ahorro y analíticas de equipo
  • Tus prompts nunca salen de tu infraestructura
Comenzar →

¿Y cuánto nos pagarías tú?

Estimación

Juega con tus números: elige proveedor y modelo, y mira tu ahorro, nuestro extra y lo que te queda — con los precios reales del catálogo y la tarifa real.

Cargando el catálogo de precios…

Cómo se calcula lo que nos pagas

  • Tu primer mes: solo 4 € por asiento. Lo medimos todo y no cobramos comisión — al cierre verás el extracto exacto de lo que habría costado.
  • Después, comisión solo sobre el ahorro medido: el que puedes contrastar con la factura de tu proveedor. Lo estimado nunca se factura.
  • Y siempre te quedas con el 90% o más de cada euro ahorrado: la comisión solo existe cuando existe tu ahorro medido.
  • Por tramos, y cada tramo a su tipo — 10% ≤ 1000 € · 8% ≤ 5000 € · 6% ≤ 20.000 € · 4% +. Cuanto más ahorras, menor es nuestro porcentaje.
  • ¿Un mes sin ahorro? Comisión: 0 €. Sin permanencia — y tu primera factura variable solo contiene números que ya viste en tu extracto.