Demuestra el ahorro con tus propios datos.
BV‑SALA se sitúa delante de cualquier proveedor de LLM y, en cada solicitud, elige la ejecución más barata que aún cumple tu umbral de calidad. No nos creas sin más: pega tus datos abajo y observa cómo se mueve el medidor.
Prueba tú mismo el optimizador. Nada sale de esta página.
Estos dos instrumentos ejecutan el optimizador real localmente para que puedas comprobar el mecanismo antes de tocar un proveedor. El panel izquierdo ejecuta el optimizador real de BV‑SALA sobre los datos que pegues — contabilidad real de tokens, el mismo código que envía el SDK. El panel derecho estima una factura mensual ejecutando el optimizador sobre una carga de trabajo de muestra contra un modelo simulado. Para dólares medidos de forma demostrable, consulta el Paso 2 más abajo.
Ya es óptimo aquí — BV‑SALA nunca lo empeora.
Ambos brazos medidos por el tokenizador del propio proveedor — sin línea base modelada.
Este es el resultado del benchmark A/B (pnpm ab): para cada escenario envía una solicitud ingenua y la solicitud de BV‑SALA al mismo modelo, cotiza ambas a partir del propio uso de tokens del proveedor e informa el límite inferior del intervalo de confianza del 95% — nunca la estimación puntual halagadora. Nada está modelado.
Cuatro libros, nunca sumados: cada uno es una palanca medida por separado, así que un dólar no se puede contar dos veces. El residual de conciliación ≈ 0 lo demuestra. Estas son palancas de referencia: tu vía en vivo mide otras cuatro (provider-cached reemplaza a output-restriction), así que nunca las equiparamos entre sí.
| escenario | tipo | A ent/sal | B ent/sal | costo A | costo B | ahorro ▾ | qa |
|---|---|---|---|---|---|---|---|
| Local arithmetic | resolver | 10/15 | 0/0 | $0.000010 | $0.00 | 100.0% | 2/2 |
| Tool-heavy request | ran | 815/15 | 190/20 | $0.000131 | $0.000040 | 69.1% | 4/4 |
| Large uniform table | ran | 2,182/15 | 877/20 | $0.000336 | $0.000144 | 57.3% | 4/4 |
| Summarize provided text | ran | 31/15 | 31/20 | $0.000014 | $0.000017 | −22.0% | 4/4 |
| Constrained structured answer | ran | 20/15 | 20/20 | $0.000012 | $0.000015 | −25.0% | 4/4 |
| FAQ (first ask) | ran | 12/15 | 12/20 | $0.000011 | $0.000014 | −27.8% | 4/4 |
| FAQ (repeat ask) | cache | 12/15 | 12/20 | $0.000011 | $0.000014 | −27.8% | 2/2 |
Cuatro libros contables separados. Nunca sumados en una sola cifra de vanidad.
Un acierto de caché elimina una llamada entera. BV‑SALA recodifica los datos estructurados de forma más compacta. La compresión descarta palabras redundantes. Una caché de prefijo del proveedor abarata los tokens sin eliminarlos. Mezclarlos te miente — así que no lo hacemos.
avoided_calls
Llamadas a LLM, recuperación y herramientas que nunca se ejecutaron.
eliminated_tokens
Información descartada porque simplemente no era necesaria.
compressed_tokens
Información conservada, pero codificada con menos tokens.
provider_cached_tokens
Todavía en el prompt, pero facturada o procesada de forma más barata.
Ejecútalo en tu propia app. Tus prompts nunca tocan nuestros servidores.
Coloca el SDK delante de tu proveedor. Cada respuesta lleva un SavingsReport completo que puedes graficar — las mismas cifras que lee el panel.
// your app — the data plane. LLM traffic goes straight to your provider. import { createSavingsLayer } from "@bivelio/savings-layer"; const layer = createSavingsLayer({ provider: yourProvider, licenseKey: process.env.BIVELIO_LICENSE_KEY, // from your dashboard licenseServerUrl: "https://savings.bivelio.com", // license check + kill-switch }); const { data, report } = await layer.generate({ model: "openai/gpt-4o-mini", messages, response: { contractId: "answer:v1", schema, maxOutputTokens: 220 }, }); report.cost.netSavings; // → your net savings on this request report.calls.avoidedLlm; // → whole calls you never paid for
Céntimos para ejecutar. Múltiplos para ahorrar.
Sin plan gratuito, sin prueba — prueba BV‑SALA aquí mismo en tu navegador y luego suscríbete para ejecutarlo en tu app. Precio por asiento, en USD.
PRO — facturado por asiento. O $39 / asiento / año (ahorra ~19%). Enterprise, con funciones empaquetadas, llegará más adelante.
Un asiento es una máquina o identidad de servicio activa, no una persona — facturado solo si está activo 3 o más días en un mes. CI y ejecutores efímeros no cuentan.
- Cada optimización de BV‑SALA, sin límite
- Caché semántica gestionada y umbrales aprendidos
- Paneles de ahorro y analíticas de equipo
- Tus prompts nunca salen de tu infraestructura
Por qué el precio puede ser tan bajo
- No movemos tokens. Tu tráfico de LLM va directo a tu proveedor — solo vemos recuentos, nunca contenido.
- Tú mismo alojas la parte pesada. El optimizador se ejecuta en tu proceso; nuestros servidores solo licencian, aprenden e informan.
- La infraestructura escala con los ingresos. Empieza en un servidor pequeño y solo crece cuando los clientes de pago cubren el siguiente nivel.
- El reporte es el medidor. La facturación lee el mismo SavingsReport que verificas arriba — sin caja negra.