Tu factura de LLM, medida y recortada.
BV‑SALA se sitúa delante de tu proveedor y, en cada petición, elige la ejecución más barata que aún cumple tu contrato de calidad. Cada cifra de ahorro que publicamos está medida contra el contador del propio proveedor, con su intervalo de confianza al lado — nunca una estimación.
gpt-4o-miniclaude-sonnet-4-5Cada paso cae en UN libro contable distinto, así que estas cifras no se suman entre sí. Un paso cuyo libro no despeja el cero no aparece aquí: la restricción de salida se midió y no ahorra, así que no se anuncia.
Ambos brazos medidos por el tokenizador del propio proveedor — sin línea base modelada.
Este es el resultado del benchmark A/B (pnpm ab): para cada escenario envía una solicitud ingenua y la solicitud de BV‑SALA al mismo modelo, cotiza ambas a partir del propio uso de tokens del proveedor e informa el límite inferior del intervalo de confianza del 95% — nunca la estimación puntual halagadora. Nada está modelado.
Cuatro libros, nunca sumados: cada uno es una palanca medida por separado, así que un dólar no se puede contar dos veces. El residual de conciliación ≈ 0 lo demuestra. Estas son palancas de referencia: tu vía en vivo mide otras cuatro (provider-cached reemplaza a output-restriction), así que nunca las equiparamos entre sí.
| escenario | tipo | A ent/sal | B ent/sal | costo A | costo B | ahorro ▾ | qa |
|---|---|---|---|---|---|---|---|
| Local arithmetic | resolver | 19/77 | 0/0 | $0.000049 | $0.00 | 100.0% | 4/4 |
| Forwarded support thread (compression) | ran | 3,838/368 | 1,861/194 | $0.000703 | $0.000354 | 49.7% | 24/24 |
| Large uniform table | ran | 1,212/319 | 781/116 | $0.000356 | $0.000187 | 47.6% | 9/9 |
| Big tool catalogue (schema-on-demand) | ran | 3,091/216 | 1,062/263 | $0.000575 | $0.000317 | 44.9% | 12/12 |
| Tool-heavy request | ran | 300/30 | 121/36 | $0.000063 | $0.000039 | 37.3% | 11/11 |
| Stable-prefix agent turn | ran | 5,307/58 | 5,307/58 | $0.000655 | $0.000623 | 4.9% | 24/24 |
| Constrained structured answer | ran | 60/71 | 60/70 | $0.000052 | $0.000051 | 1.0% | 24/24 |
| FAQ (first ask) | ran | 72/19 | 72/19 | $0.000022 | $0.000022 | 0.7% | 11/11 |
| Triage decision (output codebook) | ran | 184/72 | 184/72 | $0.000071 | $0.000071 | 0.0% | 8/8 |
| Summarize provided text | ran | 66/25 | 66/25 | $0.000025 | $0.000025 | −0.3% | 8/8 |
| FAQ (repeat ask) | cache | 72/18 | 72/19 | $0.000022 | $0.000022 | −2.8% | 6/6 |
claude-sonnet-4-5Anthropic no cachea sola. Tu integración no se lo pide; la nuestra sí.
OpenAI aplica su caché de prefijo automáticamente: ese descuento ya lo tienes con nosotros o sin nosotros. Anthropic no. Exige marcar el punto de corte en cada petición, y quien no lo marca paga la entrada entera, siempre.
Lo que se midió
Turno de agente con contexto de sistema largo y repetido — un asistente de soporte, un extractor documental. Ocho pares, mismo modelo en los dos brazos, tarifados con el contador del propio Anthropic.
- Sin la capa
- 0 tokens servidos desde caché
- Con la capa
- 58 624 tokens servidos desde caché
Qué NO dice esta cifra
Es el ahorro de esa palanca sobre ese tráfico, no el de tu factura entera. Sale del escenario de prefijo estable, donde vive el dinero de la caché; en tráfico sin contexto repetido esta palanca vale cero. El titular de la tirada completa se mide aparte, y lo publicamos con su intervalo, arriba.
Y no hace falta que nos creas
Es comprobable en tu propia factura sin instalar nada: mira si tus llamadas a Claude traen cache_read_input_tokens. Si salen a cero, ese descuento lo estás dejando en la mesa hoy.
gpt-4o-miniCuatro libros contables separados. Nunca sumados en una sola cifra de vanidad.
Un acierto de caché elimina una llamada entera. BV‑SALA recodifica los datos estructurados de forma más compacta. La compresión descarta palabras redundantes. Una caché de prefijo del proveedor abarata los tokens sin eliminarlos. Mezclarlos te miente — así que no lo hacemos.
Cuatro libros medidos contra la API de OpenAI. Un porcentaje sin su modelo al lado no significa nada: la misma palanca puede ahorrar en un modelo y costar en otro.
avoided_calls
Llamadas a LLM, recuperación y herramientas que nunca se ejecutaron.
eliminated_tokens
Información descartada porque simplemente no era necesaria.
compressed_tokens
Información conservada, pero codificada con menos tokens.
Ejecútalo en tu propia app. Tus prompts nunca tocan nuestros servidores.
Coloca el SDK delante de tu proveedor. Cada respuesta lleva un SavingsReport completo que puedes graficar — las mismas cifras que lee el panel.
# 1 · el paquete pnpm add @bivelio/savings-layer # 2 · la licencia (de tu dashboard) export BIVELIO_LICENSE_KEY=… # 3 · envolver la llamada — esto es todo el cambio de código const layer = createSavingsLayer({ provider, licenseKey, … }); const { text, report } = await layer.generate({ model, messages }); console.log(report.cost.netSavings) // ← el ahorro, medido
Donde ya viven tus automatizaciones. Si llama a la API de OpenAI o Anthropic con tu clave, se mide — el SDK envuelve la llamada; el gateway se pone delante.
¿Claude Code con API key? Mira su gasto real, token a token.
Un solo comando pone un medidor local delante de tu terminal. Sin tocar código y sin configurar nada — y tus prompts jamás salen de tu máquina: a este panel solo llegan conteos y coste.
npm i -g @bivelio/savings-layer export BIVELIO_SERVICE_KEY=bvk_… bvsala claude
Hoy mide; todavía no optimiza ahí. Funciona también con Codex CLI, Goose y Qwen Code — y bvsala doctor imprime la configuración exacta del resto. Ver cómo funciona →
Céntimos para ejecutar. Múltiplos para ahorrar.
Sin plan gratuito y sin prueba: lo que puedes comprobar antes de pagar es el ahorro MEDIDO de aquí arriba, con su intervalo al lado. Te suscribes y lo ejecutas en tu app. Precio por asiento, en EUR.
PRO — facturado por asiento. O 39 € / asiento / año (ahorra ~19%). Enterprise, con funciones empaquetadas, llegará más adelante.
IVA no incluido. Si su empresa tiene NIF-IVA intracomunitario, se aplica la inversión del sujeto pasivo.
Un asiento es una máquina o identidad de servicio activa, no una persona — facturado solo si está activo 3 o más días en un mes. CI y ejecutores efímeros no cuentan.
- Cada optimización de BV‑SALA, sin límite
- Caché semántica gestionada y umbrales aprendidos
- Paneles de ahorro y analíticas de equipo
- Tus prompts nunca salen de tu infraestructura
¿Y cuánto nos pagarías tú?
EstimaciónJuega con tus números: elige proveedor y modelo, y mira tu ahorro, nuestro extra y lo que te queda — con los precios reales del catálogo y la tarifa real.
Cargando el catálogo de precios…
Cómo se calcula lo que nos pagas
- Tu primer mes: solo 4 € por asiento. Lo medimos todo y no cobramos comisión — al cierre verás el extracto exacto de lo que habría costado.
- Después, comisión solo sobre el ahorro medido: el que puedes contrastar con la factura de tu proveedor. Lo estimado nunca se factura.
- Y siempre te quedas con el 90% o más de cada euro ahorrado: la comisión solo existe cuando existe tu ahorro medido.
- Por tramos, y cada tramo a su tipo — 10% ≤ 1000 € · 8% ≤ 5000 € · 6% ≤ 20.000 € · 4% +. Cuanto más ahorras, menor es nuestro porcentaje.
- ¿Un mes sin ahorro? Comisión: 0 €. Sin permanencia — y tu primera factura variable solo contiene números que ya viste en tu extracto.