Savings Layer fait partie de la plateforme BiVelio
Pour les équipes qui paient l'API LLM au token

Un SDK qui s'installe dans votre code, ne laisse passer que ce qui doit être payé et renvoie un SavingsReport par appel : mesuré et estimé séparés, comptés avec le compteur de votre fournisseur. Nous ne publions que ce que nous avons mesuré.

Installé en quelques minutes. Vos messages ne passent jamais par nos serveurs.
Compatible avec
OpenAIAnthropicGeminiMistralLlamaDeepSeekPerplexityHugging FaceNVIDIA NIMAzure OpenAIBedrockOllamavLLM

Tout endpoint compatible avec l'API OpenAI, plus l'adaptateur natif Anthropic. Avec un chiffre publié, aujourd'hui, seulement OpenAI gpt-4o-mini.

SavingsReport · série publiéeLIVE
23,2 %
modèle
gpt-4o-mini
paires mesurées
193
qualité
100 %
estimation ponctuelle
24,6 %

Le titre est le plancher de l'intervalle à 95 %, jamais le point.

par registre
Éviter l'appel entièrementavoided_calls22 %
Retirer ce qu'il ne fallait pas envoyereliminated_tokens43,2 %
Compresser ce qui restecompressed_tokens20,1 %

Chaque registre est publié avec son propre intervalle ; ceux qui ne dépassent pas zéro ne sont pas annoncés.série 12 sept. 2026 · d1c8233

Book 15-min callOn vous dit ce que vous économiseriez sur votre trafic, sans rien installer.
Conçu pour les développeurs

Moins de maux de tête avec la facture. Sans changer de fournisseur.

Trois faits sur le paquet. Aucun n'est une promesse.

dependencies: {}

Zéro dépendance à l'exécution

Un seul bundle ESM. Rien ne s'installe à côté de votre code que nous n'ayons écrit ; le tokenizer exact est un peer optionnel.

report.cost.basis

Un SavingsReport par appel

Quatre registres jamais additionnés, le coût avec sa base (mesuré ou estimé) et des traces par étape. C'est exactement ce que lit votre tableau de bord.

app → provider api

Votre trafic reste direct

Le SDK encapsule l'appel dans votre processus. Vos prompts ne passent jamais par BiVelio : nous ne recevons que des comptages et des coûts.

En mots simples

Que fait Savings, exactement ?

Quatre idées, quatre animations de huit secondes. C'est tout le produit.

01

L'IA se facture au mot

Chaque requête à une IA se paie au texte qui entre et qui sort. Savings se met au milieu du chemin et ne laisse passer que le nécessaire : ce qu'il ne fallait pas payer tombe dans votre bocal.

02

Vous ne payez pas deux fois la même chose

L'IA relit à chaque tour tout ce que vous lui aviez déjà envoyé — et le fournisseur le facture à nouveau. Savings prépare chaque requête pour que le fournisseur applique son tarif réduit aux répétitions. La remise vient du fournisseur ; notre rôle est de la demander correctement.

03

Un reçu que vous pouvez vérifier

Nous ne demandons pas la foi. Chaque économie est mesurée avec le compteur officiel du fournisseur — le même qui vous facture — et figure sur votre reçu. Ce qui ne peut pas être confronté à la facture n'est jamais annoncé.

04

Nous ne gagnons que si vous économisez

Notre commission sort de l'économie mesurée, jamais de votre poche : l'essentiel de ce que vous économisez reste toujours chez vous. Un mois sans économie ? Commission zéro.

Les animations illustrent l'idée. Les vrais chiffres — mesurés contre de vrais fournisseurs — sont juste en dessous.

Pas de promesses : des mesures

Comment savons-nous que ça économise ? Nous le mesurons — et nous publions chaque essai, un par un.

Chaque scénario s'exécute deux fois contre le vrai fournisseur : tel quel, puis avec Savings devant. Les deux résultats sont comptés avec le compteur du fournisseur lui-même — celui qui fixe le prix de votre facture. Voici ce qui en est sorti, marge d'erreur comprise :

Mesuré contre un fournisseur réel
OpenAIgpt-4o-mini
≥ 15,0 %de facture en moins, vérifié à 95 % · face à une intégration non optimisée, sans streaming

Chaque étape tombe dans UN registre différent, donc ces chiffres ne s'additionnent pas entre eux. Une étape dont le registre ne dépasse pas zéro n'apparaît pas ici : la restriction de sortie a été mesurée et ne fait pas économiser, donc elle n'est pas annoncée. Tous les chiffres de cette série viennent de gpt-4o-mini : le même levier peut coûter de l'argent sur un autre modèle, et cela se publie aussi.

Le test est une expérience équitable : la même tâche deux fois — sans Savings et avec Savings — avec le même compteur du fournisseur qui mesure les deux.

Traduction, sans jargon

Dans ce test, la facture a baissé avec une quasi-certitude d'au moins 23,2%. Le plus probable est qu'elle ait baissé de 24,6%.

Quand il y a une fourchette, nous annonçons toujours le petit chiffre — celui que la statistique garantit —, jamais le plus flatteur.

LIVE · votre organisationLIVE — mesuré face à un vrai fournisseur, avec contrôle qualité.
23.2%
économies nettes, borne inférieure de l'IC à 95%. Estimation ponctuelle 24.6%, supérieure 26.0% — nous mettons en avant le plancher.
−5.0%0%60.0%
avoided_calls
43.4%
95% ≥ 22.0% · Δ $0.000139
prouvé
eliminated_tokens
46.3%
95% ≥ 43.2% · Δ $0.004724
prouvé
compressed_tokens
24.4%
95% ≥ 20.1% · Δ $0.004586
prouvé
provider_cached
0.0%
95% ≥ 0.0% · Δ $0.00
non prouvé
output_restriction
1.1%
95% ≥ −1.0% · Δ $0.000008
non prouvé
output_codebook
1.6%
95% ≥ 0.1% · Δ $0.000019
prouvé

Quatre registres, jamais additionnés — chacun est un levier mesuré séparément, un dollar ne peut donc pas être compté deux fois. Le résidu de réconciliation ≈ 0 le prouve. Ce sont des leviers de référence : votre rail en direct en mesure quatre autres — provider-cached remplace output-restriction — nous ne faisons donc jamais correspondre l'un à l'autre.

Si l'envoi porte du rembourrage…

…le portique le retire avant de payer : le colis arrive au nuage bien plus petit et la différence tombe dans votre bocal.

S'il est déjà maigre…

…il passe intact. Il n'y a rien à retirer — et nous ne promettons pas d'économies là où il n'y en a pas.

Tous les envois ne portent pas le même rembourrage : dans cette série, la coupe mesurée par scénario est allée de -0,2% à 100%. Ceux qui n'économisent rien sont publiés aussi.

OpenAIgpt-4o-mini
Comptabilité honnête

Chaque type d'économie, compté à part — pour qu'aucun chiffre ne soit gonflé.

Savings économise de plusieurs façons : il évite des appels entiers, retire le texte superflu, emballe mieux ce qui est envoyé et active les remises du fournisseur. Chaque façon tient son propre registre avec son propre chiffre mesuré — et nous ne les additionnons jamais en un gros chiffre marketing.

Chaque registre est mesuré et publié séparément contre l'API d'OpenAI ; ceux qui ne dépassent pas zéro n'apparaissent pas. Un pourcentage sans son modèle à côté ne veut rien dire : le même levier peut faire économiser sur un modèle et coûter sur un autre.

01

avoided_calls

Appels LLM, de récupération et d'outil qui n'ont jamais été exécutés du tout.

22.0%
mesuré · plancher à 95 %
02

eliminated_tokens

Information supprimée parce qu'elle n'était tout simplement pas nécessaire.

43.2%
mesuré · plancher à 95 %
03

compressed_tokens

Information conservée, mais encodée avec moins de tokens.

20.1%
mesuré · plancher à 95 %
Cinq lignes pour commencer

Exécutez-le dans votre propre application. Vos prompts ne touchent jamais nos serveurs.

Placez le SDK devant votre fournisseur. Chaque réponse contient un SavingsReport complet que vous pouvez représenter graphiquement — les mêmes chiffres que lit le tableau de bord.

# 1 · le paquet
pnpm add @bivelio/savings-layer

# 2 · la licence (depuis votre tableau de bord)
export BIVELIO_LICENSE_KEY=…

# 3 · envelopper l'appel — c'est tout le changement de code
const layer = createSavingsLayer({ provider, licenseKey, … });
const { text, report } = await layer.generate({ model, messages });

console.log(report.cost.netSavings)  // ← l'économie, mesurée
Salesforce HubSpot Odoo Zapier n8n UiPath

Là où vivent déjà vos automatisations. Si ça appelle l'API de votre fournisseur avec votre clé, c'est mesuré — le SDK enveloppe l'appel ; la passerelle se place devant.

Nouveau · terminaux de code

Claude Code avec une clé d'API ? Voyez la dépense réelle, token par token.

Une seule commande place un compteur local devant votre terminal. Aucun code à toucher, rien à configurer — et vos prompts ne quittent jamais votre machine : seuls les comptages et le coût arrivent dans ce panneau.

npm i -g @bivelio/savings-layer
export BIVELIO_SERVICE_KEY=bvk_…

bvsala claude

La passerelle mesure chaque requête. Avec une licence PRO, elle applique aussi un levier par défaut : elle raccourcit le TTL d'écriture du cache tant que votre session reste chaude — cela change le prix, jamais le contenu que lit le modèle. Les autres leviers restent éteints tant que vous ne les activez pas. Le skill savings-mode est disponible pour vos plafonds, son effet restant à mesurer. Il fonctionne aussi avec Codex CLI, Goose et Qwen Code — et bvsala doctor imprime la configuration exacte des autres. Voir comment ça marche →

savings-mode · skill gratuit

Le skill qui étire vos plafonds d'abonnement

Pas de facture ne veut pas dire pas de douleur : la fenêtre de cinq heures et le plafond hebdomadaire. savings-mode est un skill d'instructions pures — sans proxy, votre trafic intact — qui coupe les deux masses qui brûlent vraiment le plafond : la sortie du modèle et les résultats d'outils. Il est gratuit ; ce que l'on paie avec Savings, c'est savoir combien il vous économise.

01

lectures de cache

Tout le contexte est relu à chaque tour — d'où l'importance de le garder maigre.

68,2%
de la dépense mesurée
02

écriture de cache (une heure)

Chaque résultat d'outil est écrit en cache avec surcoût avant d'être relu.

19,6%
de la dépense mesurée
03

sortie du modèle

Moins d'un pour cent des tokens ; le skill l'attaque directement.

11,6%
de la dépense mesurée

Mesuré avec le compteur sur 959 requêtes réelles de Claude Code, contre les compteurs du fournisseur (2026-09-01). L'effet du skill lui-même sera publié une fois mesuré en A/B — jamais avant.

npx -y @bivelio/savings-layer skill

Une seule commande : s'installe dans ~/.claude/skills et s'active seul quand la conversation parle de limites ou d'économiser des tokens.

Un seul forfait, facturé par siège

Un petit forfait par siège. Et une commission uniquement sur ce que vous économisez.

Pas d'offre gratuite ni d'essai : ce que vous pouvez vérifier avant de payer, ce sont les mesures publiques de cette page. Le forfait est par siège, en EUR, et la commission sort de l'économie mesurée — jamais de votre poche.

4 € / siège / mois

PRO — facturé par siège. Ou 39 € / siège / an (économisez ~19%). Enterprise, avec des fonctionnalités groupées, arrivera plus tard.

TVA non comprise. Si votre entreprise a un numéro de TVA intracommunautaire, l'autoliquidation s'applique.

Un siège est une machine ou identité de service active, pas une personne — facturé uniquement s'il est actif 3 jours ou plus dans un mois. Les exécuteurs CI et éphémères ne comptent pas.

  • Chaque optimisation BV‑SALA, sans plafond
  • Un reçu par requête : SavingsReport avec quatre registres, mesuré et estimé séparés
  • Tableaux de bord d'économies et analyses d'équipe
  • Vos prompts ne quittent jamais votre infrastructure
Commencer →

Et combien nous paieriez-vous ?

Estimation

Jouez avec vos chiffres : choisissez fournisseur et modèle, et voyez votre économie, notre extra et ce qui vous reste — avec les vrais prix du catalogue et le vrai tarif.

Chargement du catalogue de prix…

Comment se calcule ce que vous nous payez

  • Votre premier mois : seulement 4 € par siège. Nous mesurons tout et ne facturons aucune commission — à la clôture vous verrez le relevé exact de ce que cela aurait coûté.
  • Ensuite, commission uniquement sur l<b>économie mesurée</b> : celle que vous pouvez rapprocher de la facture de votre fournisseur. Lestimé n'est jamais facturé.
  • Et vous gardez toujours 90% ou plus de chaque euro économisé : la commission n'existe que si votre économie mesurée existe.
  • Par tranches, chacune à son taux — 10% ≤ 1 000 € · 8% ≤ 5 000 € · 6% ≤ 20 000 € · 4% +. Plus vous économisez, plus notre pourcentage baisse.
  • Un mois sans économie ? Commission : 0 €. Sans engagement — et votre première facture variable ne contient que des chiffres déjà vus sur votre relevé.
Entreprise et écosystème

BiVelio est membre du NVIDIA Inception Program.

Le programme de NVIDIA pour les startups qui construisent avec l'IA.

Découvrir le programme
NVIDIA Inception Program