Savings Layer fait partie de la plateforme BiVelio
La couche de coût LLM que tout le monde peut installer — sous licence pour s'exécuter

Prouvez les économies sur vos propres données.

BV‑SALA se place devant n'importe quel fournisseur de LLM et, pour chaque requête, choisit l'exécution la moins chère qui respecte encore votre exigence de qualité. Ne nous croyez pas sur parole — collez vos données ci-dessous et regardez le compteur bouger.

S'exécute entièrement dans votre navigateur. Sans inscription, rien ne quitte cette page.
L'exécution la moins chère l'emportepar requête
01Éviter complètement l'appelrésolveurs · cache exact et sémantique0 appel
02Éviter la récupération et les outilsroute : aucune / unique / multiple / outilmoins d'appels
03Éliminer le contexte superfludédupliquer · reclasser · k‑adaptatif−tokens
04Comprimer ce qui resteencodage plus léger · uniquement si net positif−tokens
05Contraindre la sortieschéma · contrat minimal−sortie
Étape 1 · Tests préliminaires — dans votre navigateur

Essayez l'optimiseur vous-même. Rien ne quitte cette page.

Ces deux instruments exécutent le véritable optimiseur localement pour que vous puissiez vérifier le mécanisme avant de toucher à un fournisseur. Le panneau de gauche exécute le véritable optimiseur BV‑SALA sur les données que vous collez — comptabilité réelle des tokens, le même code que celui livré par le SDK. Le panneau de droite estime une facture mensuelle en exécutant l'optimiseur sur une charge de travail échantillon face à un modèle simulé. Pour des dollars mesurés de façon démontrable, consultez l<link>Étape 2</link> ci-dessous.

Vérificateur d'économiesESTIMATION — heuristique, non mesurée par le fournisseur
Vos données0
BV-SALA0

Déjà optimal ici — BV‑SALA n'aggrave jamais les choses.

Projecteur de factureESTIMATION
économies projetées / mois · aux prix de gpt-4o-mini
$170
$330 → $160 · 52% de moins
Étape 2 · Comment les économies sont mesurées — reproductible

Les deux bras mesurés par le tokenizer du fournisseur lui-même — sans référence modélisée.

Voici le résultat du benchmark A/B (pnpm ab) : pour chaque scénario, il envoie une requête naïve et la requête BV‑SALA au même modèle, tarife les deux à partir de l'utilisation de tokens du fournisseur, et rapporte la borne inférieure de confiance à 95% — jamais l'estimation ponctuelle flatteuse. Rien n'est modélisé.

MOCK · référenceESTIMÉ · fournisseur simulé — cela prouve que le mécanisme fonctionne, pas votre facture. Une exécution LIVE confirmée remplace chaque chiffre ici.
44.5%
économies nettes, borne inférieure de l'IC à 95%. Estimation ponctuelle 54.1%, supérieure 58.4% — nous mettons en avant le plancher (charge de travail de référence, fournisseur simulé).
−5.0%0%63.4%
avoided_calls
35.2%
95% ≥ −27.8% · Δ $0.000015
estimé (simulé)
eliminated_tokens
60.6%
95% ≥ 30.8% · Δ $0.000351
estimé (simulé)
compressed_tokens
57.3%
95% ≥ 57.3% · Δ $0.000771
estimé (simulé)
output_restriction
−25.0%
95% ≥ −25.0% · Δ $-0.000012
estimé (simulé)

Quatre registres, jamais additionnés — chacun est un levier mesuré séparément, un dollar ne peut donc pas être compté deux fois. Le résidu de réconciliation ≈ 0 le prouve. Ce sont des leviers de référence : votre rail en direct en mesure quatre autres — provider-cached remplace output-restriction — nous ne faisons donc jamais correspondre l'un à l'autre.

Contrôle qualité 100% réussiLes registres concordentEmpreinte du modèle stableSeuil de rentabilité du cache K=2non prouvé (simulé)Une réponse dégradée annule son économie
scénariotypeA ent/sortB ent/sortcoût Acoût Béconomiesqa
Local arithmeticresolver10/150/0$0.000010$0.00100.0%2/2
Tool-heavy requestran815/15190/20$0.000131$0.00004069.1%4/4
Large uniform tableran2,182/15877/20$0.000336$0.00014457.3%4/4
Summarize provided textran31/1531/20$0.000014$0.000017−22.0%4/4
Constrained structured answerran20/1520/20$0.000012$0.000015−25.0%4/4
FAQ (first ask)ran12/1512/20$0.000011$0.000014−27.8%4/4
FAQ (repeat ask)cache12/1512/20$0.000011$0.000014−27.8%2/2
cache · amortiFAQ (repeat ask) : échec à froid $0.000014 → succès $0.00. Rentabilisé à K=2 répétitions — les économies de cache proviennent du trafic répété, pas d'un chiffre sur un seul appel, un appel à froid affiche donc honnêtement ≈0%.
Comptabilité honnête

Quatre registres distincts. Jamais additionnés en un seul chiffre de vanité.

Un succès de cache supprime un appel entier. BV‑SALA réencode les données structurées de façon plus compacte. La compression élimine les mots redondants. Un cache de préfixe du fournisseur rend les tokens moins chers sans les supprimer. Les mélanger vous ment — nous ne le faisons donc pas.

01

avoided_calls

Appels LLM, de récupération et d'outil qui n'ont jamais été exécutés du tout.

exécutez l'optimiseur pour mesurer
02

eliminated_tokens

Information supprimée parce qu'elle n'était tout simplement pas nécessaire.

exécutez l'optimiseur pour mesurer
03

compressed_tokens

Information conservée, mais encodée avec moins de tokens.

exécutez l'optimiseur pour mesurer
04

provider_cached_tokens

Toujours dans le prompt, mais facturée ou traitée à moindre coût.

exécutez l'optimiseur pour mesurer
Cinq lignes pour commencer

Exécutez-le dans votre propre application. Vos prompts ne touchent jamais nos serveurs.

Placez le SDK devant votre fournisseur. Chaque réponse contient un SavingsReport complet que vous pouvez représenter graphiquement — les mêmes chiffres que lit le tableau de bord.

// your app — the data plane. LLM traffic goes straight to your provider.
import { createSavingsLayer } from "@bivelio/savings-layer";

const layer = createSavingsLayer({
  provider: yourProvider,
  licenseKey: process.env.BIVELIO_LICENSE_KEY,       // from your dashboard
  licenseServerUrl: "https://savings.bivelio.com",   // license check + kill-switch
});

const { data, report } = await layer.generate({
  model: "openai/gpt-4o-mini",
  messages,
  response: { contractId: "answer:v1", schema, maxOutputTokens: 220 },
});

report.cost.netSavings;   // → your net savings on this request
report.calls.avoidedLlm;  // → whole calls you never paid for
Un seul forfait, facturé par siège

Des centimes pour l'exécuter. Des multiples d'économies.

Pas de version gratuite, pas d'essai — testez BV‑SALA ici même dans votre navigateur, puis abonnez-vous pour l'exécuter dans votre application. Facturé par siège, en USD.

$4 / siège / mois

PRO — facturé par siège. Ou $39 / siège / an (économisez ~19%). Enterprise, avec des fonctionnalités groupées, arrivera plus tard.

Un siège est une machine ou identité de service active, pas une personne — facturé uniquement s'il est actif 3 jours ou plus dans un mois. Les exécuteurs CI et éphémères ne comptent pas.

  • Chaque optimisation BV‑SALA, sans plafond
  • Cache sémantique géré et seuils appris
  • Tableaux de bord d'économies et analyses d'équipe
  • Vos prompts ne quittent jamais votre infrastructure
Commencer →

Pourquoi le prix peut être aussi bas

  • Nous ne déplaçons aucun token. Votre trafic LLM va directement à votre fournisseur — nous ne voyons que des décomptes, jamais le contenu.
  • Vous hébergez vous-même la partie lourde. L'optimiseur s'exécute dans votre processus ; nos serveurs se contentent de gérer la licence, d'apprendre et de rapporter.
  • L'infrastructure évolue avec les revenus. Elle démarre sur un petit serveur et ne grandit que lorsque les clients payants couvrent le palier suivant.
  • Le rapport est le compteur. La facturation lit le même SavingsReport que celui que vous vérifiez ci-dessus — aucune boîte noire.
BiVelio — Vérifiez vos économies LLM