Savings Layer forma parte de la plataforma BiVelio
La capa de coste de LLM que cualquiera puede instalar — con licencia para ejecutar

Demuestra el ahorro con tus propios datos.

BV‑SALA se sitúa delante de cualquier proveedor de LLM y, en cada solicitud, elige la ejecución más barata que aún cumple tu umbral de calidad. No nos creas sin más: pega tus datos abajo y observa cómo se mueve el medidor.

Se ejecuta por completo en tu navegador. Sin registro, nada sale de esta página.
Gana la ejecución más baratapor solicitud
01Evita la llamada por completoresolutores · caché exacta y semántica0 llamadas
02Evita recuperación y herramientasruta: ninguna / única / múltiple / herramientamenos llamadas
03Elimina el contexto innecesariodeduplicar · reordenar · k‑adaptativa−tokens
04Comprime lo que quedacodificación más ligera · solo si es neta positiva−tokens
05Restringe la salidaesquema · contrato mínimo−salida
Paso 1 · Pruebas preliminares — en tu navegador

Prueba tú mismo el optimizador. Nada sale de esta página.

Estos dos instrumentos ejecutan el optimizador real localmente para que puedas comprobar el mecanismo antes de tocar un proveedor. El panel izquierdo ejecuta el optimizador real de BV‑SALA sobre los datos que pegues — contabilidad real de tokens, el mismo código que envía el SDK. El panel derecho estima una factura mensual ejecutando el optimizador sobre una carga de trabajo de muestra contra un modelo simulado. Para dólares medidos de forma demostrable, consulta el Paso 2 más abajo.

Verificador de ahorroESTIMACIÓN — heurística, no medida por el proveedor
Tus datos0
BV-SALA0

Ya es óptimo aquí — BV‑SALA nunca lo empeora.

Proyector de facturaESTIMACIÓN
ahorro proyectado / mes · a precios de gpt-4o-mini
$170
$330 → $160 · 52% menos
Paso 2 · Cómo se miden los ahorros — reproducible

Ambos brazos medidos por el tokenizador del propio proveedor — sin línea base modelada.

Este es el resultado del benchmark A/B (pnpm ab): para cada escenario envía una solicitud ingenua y la solicitud de BV‑SALA al mismo modelo, cotiza ambas a partir del propio uso de tokens del proveedor e informa el límite inferior del intervalo de confianza del 95% — nunca la estimación puntual halagadora. Nada está modelado.

MOCK · referenciaESTIMADO · proveedor simulado: esto demuestra que el mecanismo funciona, no tu factura. Una ejecución LIVE confirmada reemplaza cada número aquí.
44.5%
ahorro neto, límite inferior del IC del 95%. Estimación puntual 54.1%, superior 58.4%: destacamos el piso (carga de trabajo de referencia, proveedor simulado).
−5.0%0%63.4%
avoided_calls
35.2%
95% ≥ −27.8% · Δ $0.000015
estimado (simulado)
eliminated_tokens
60.6%
95% ≥ 30.8% · Δ $0.000351
estimado (simulado)
compressed_tokens
57.3%
95% ≥ 57.3% · Δ $0.000771
estimado (simulado)
output_restriction
−25.0%
95% ≥ −25.0% · Δ $-0.000012
estimado (simulado)

Cuatro libros, nunca sumados: cada uno es una palanca medida por separado, así que un dólar no se puede contar dos veces. El residual de conciliación ≈ 0 lo demuestra. Estas son palancas de referencia: tu vía en vivo mide otras cuatro (provider-cached reemplaza a output-restriction), así que nunca las equiparamos entre sí.

Control de calidad 100% superadoLos libros cuadranHuella del modelo establePunto de equilibrio de caché K=2sin comprobar (simulado)Una respuesta que empeora anula su ahorro
escenariotipoA ent/salB ent/salcosto Acosto Bahorroqa
Local arithmeticresolver10/150/0$0.000010$0.00100.0%2/2
Tool-heavy requestran815/15190/20$0.000131$0.00004069.1%4/4
Large uniform tableran2,182/15877/20$0.000336$0.00014457.3%4/4
Summarize provided textran31/1531/20$0.000014$0.000017−22.0%4/4
Constrained structured answerran20/1520/20$0.000012$0.000015−25.0%4/4
FAQ (first ask)ran12/1512/20$0.000011$0.000014−27.8%4/4
FAQ (repeat ask)cache12/1512/20$0.000011$0.000014−27.8%2/2
caché · amortizadoFAQ (repeat ask): fallo en frío $0.000014 → acierto $0.00. Alcanza el equilibrio con K=2 repeticiones: el ahorro de caché es de tráfico repetido, no una cifra de una sola llamada, por lo que una llamada en frío honestamente marca ≈0%.
Contabilidad honesta

Cuatro libros contables separados. Nunca sumados en una sola cifra de vanidad.

Un acierto de caché elimina una llamada entera. BV‑SALA recodifica los datos estructurados de forma más compacta. La compresión descarta palabras redundantes. Una caché de prefijo del proveedor abarata los tokens sin eliminarlos. Mezclarlos te miente — así que no lo hacemos.

01

avoided_calls

Llamadas a LLM, recuperación y herramientas que nunca se ejecutaron.

ejecuta el optimizador para medir
02

eliminated_tokens

Información descartada porque simplemente no era necesaria.

ejecuta el optimizador para medir
03

compressed_tokens

Información conservada, pero codificada con menos tokens.

ejecuta el optimizador para medir
04

provider_cached_tokens

Todavía en el prompt, pero facturada o procesada de forma más barata.

ejecuta el optimizador para medir
Cinco líneas para empezar

Ejecútalo en tu propia app. Tus prompts nunca tocan nuestros servidores.

Coloca el SDK delante de tu proveedor. Cada respuesta lleva un SavingsReport completo que puedes graficar — las mismas cifras que lee el panel.

// your app — the data plane. LLM traffic goes straight to your provider.
import { createSavingsLayer } from "@bivelio/savings-layer";

const layer = createSavingsLayer({
  provider: yourProvider,
  licenseKey: process.env.BIVELIO_LICENSE_KEY,       // from your dashboard
  licenseServerUrl: "https://savings.bivelio.com",   // license check + kill-switch
});

const { data, report } = await layer.generate({
  model: "openai/gpt-4o-mini",
  messages,
  response: { contractId: "answer:v1", schema, maxOutputTokens: 220 },
});

report.cost.netSavings;   // → your net savings on this request
report.calls.avoidedLlm;  // → whole calls you never paid for
Un solo plan, con precio por asiento

Céntimos para ejecutar. Múltiplos para ahorrar.

Sin plan gratuito, sin prueba — prueba BV‑SALA aquí mismo en tu navegador y luego suscríbete para ejecutarlo en tu app. Precio por asiento, en USD.

$4 / asiento / mes

PRO — facturado por asiento. O $39 / asiento / año (ahorra ~19%). Enterprise, con funciones empaquetadas, llegará más adelante.

Un asiento es una máquina o identidad de servicio activa, no una persona — facturado solo si está activo 3 o más días en un mes. CI y ejecutores efímeros no cuentan.

  • Cada optimización de BV‑SALA, sin límite
  • Caché semántica gestionada y umbrales aprendidos
  • Paneles de ahorro y analíticas de equipo
  • Tus prompts nunca salen de tu infraestructura
Comenzar →

Por qué el precio puede ser tan bajo

  • No movemos tokens. Tu tráfico de LLM va directo a tu proveedor — solo vemos recuentos, nunca contenido.
  • Tú mismo alojas la parte pesada. El optimizador se ejecuta en tu proceso; nuestros servidores solo licencian, aprenden e informan.
  • La infraestructura escala con los ingresos. Empieza en un servidor pequeño y solo crece cuando los clientes de pago cubren el siguiente nivel.
  • El reporte es el medidor. La facturación lee el mismo SavingsReport que verificas arriba — sin caja negra.
BiVelio — Verifica tu ahorro en LLM