Prouvez les économies sur vos propres données.
BV‑SALA se place devant n'importe quel fournisseur de LLM et, pour chaque requête, choisit l'exécution la moins chère qui respecte encore votre exigence de qualité. Ne nous croyez pas sur parole — collez vos données ci-dessous et regardez le compteur bouger.
Essayez l'optimiseur vous-même. Rien ne quitte cette page.
Ces deux instruments exécutent le véritable optimiseur localement pour que vous puissiez vérifier le mécanisme avant de toucher à un fournisseur. Le panneau de gauche exécute le véritable optimiseur BV‑SALA sur les données que vous collez — comptabilité réelle des tokens, le même code que celui livré par le SDK. Le panneau de droite estime une facture mensuelle en exécutant l'optimiseur sur une charge de travail échantillon face à un modèle simulé. Pour des dollars mesurés de façon démontrable, consultez l<link>Étape 2</link> ci-dessous.
Déjà optimal ici — BV‑SALA n'aggrave jamais les choses.
Les deux bras mesurés par le tokenizer du fournisseur lui-même — sans référence modélisée.
Voici le résultat du benchmark A/B (pnpm ab) : pour chaque scénario, il envoie une requête naïve et la requête BV‑SALA au même modèle, tarife les deux à partir de l'utilisation de tokens du fournisseur, et rapporte la borne inférieure de confiance à 95% — jamais l'estimation ponctuelle flatteuse. Rien n'est modélisé.
Quatre registres, jamais additionnés — chacun est un levier mesuré séparément, un dollar ne peut donc pas être compté deux fois. Le résidu de réconciliation ≈ 0 le prouve. Ce sont des leviers de référence : votre rail en direct en mesure quatre autres — provider-cached remplace output-restriction — nous ne faisons donc jamais correspondre l'un à l'autre.
| scénario | type | A ent/sort | B ent/sort | coût A | coût B | économies ▾ | qa |
|---|---|---|---|---|---|---|---|
| Local arithmetic | resolver | 10/15 | 0/0 | $0.000010 | $0.00 | 100.0% | 2/2 |
| Tool-heavy request | ran | 815/15 | 190/20 | $0.000131 | $0.000040 | 69.1% | 4/4 |
| Large uniform table | ran | 2,182/15 | 877/20 | $0.000336 | $0.000144 | 57.3% | 4/4 |
| Summarize provided text | ran | 31/15 | 31/20 | $0.000014 | $0.000017 | −22.0% | 4/4 |
| Constrained structured answer | ran | 20/15 | 20/20 | $0.000012 | $0.000015 | −25.0% | 4/4 |
| FAQ (first ask) | ran | 12/15 | 12/20 | $0.000011 | $0.000014 | −27.8% | 4/4 |
| FAQ (repeat ask) | cache | 12/15 | 12/20 | $0.000011 | $0.000014 | −27.8% | 2/2 |
Quatre registres distincts. Jamais additionnés en un seul chiffre de vanité.
Un succès de cache supprime un appel entier. BV‑SALA réencode les données structurées de façon plus compacte. La compression élimine les mots redondants. Un cache de préfixe du fournisseur rend les tokens moins chers sans les supprimer. Les mélanger vous ment — nous ne le faisons donc pas.
avoided_calls
Appels LLM, de récupération et d'outil qui n'ont jamais été exécutés du tout.
eliminated_tokens
Information supprimée parce qu'elle n'était tout simplement pas nécessaire.
compressed_tokens
Information conservée, mais encodée avec moins de tokens.
provider_cached_tokens
Toujours dans le prompt, mais facturée ou traitée à moindre coût.
Exécutez-le dans votre propre application. Vos prompts ne touchent jamais nos serveurs.
Placez le SDK devant votre fournisseur. Chaque réponse contient un SavingsReport complet que vous pouvez représenter graphiquement — les mêmes chiffres que lit le tableau de bord.
// your app — the data plane. LLM traffic goes straight to your provider. import { createSavingsLayer } from "@bivelio/savings-layer"; const layer = createSavingsLayer({ provider: yourProvider, licenseKey: process.env.BIVELIO_LICENSE_KEY, // from your dashboard licenseServerUrl: "https://savings.bivelio.com", // license check + kill-switch }); const { data, report } = await layer.generate({ model: "openai/gpt-4o-mini", messages, response: { contractId: "answer:v1", schema, maxOutputTokens: 220 }, }); report.cost.netSavings; // → your net savings on this request report.calls.avoidedLlm; // → whole calls you never paid for
Des centimes pour l'exécuter. Des multiples d'économies.
Pas de version gratuite, pas d'essai — testez BV‑SALA ici même dans votre navigateur, puis abonnez-vous pour l'exécuter dans votre application. Facturé par siège, en USD.
PRO — facturé par siège. Ou $39 / siège / an (économisez ~19%). Enterprise, avec des fonctionnalités groupées, arrivera plus tard.
Un siège est une machine ou identité de service active, pas une personne — facturé uniquement s'il est actif 3 jours ou plus dans un mois. Les exécuteurs CI et éphémères ne comptent pas.
- Chaque optimisation BV‑SALA, sans plafond
- Cache sémantique géré et seuils appris
- Tableaux de bord d'économies et analyses d'équipe
- Vos prompts ne quittent jamais votre infrastructure
Pourquoi le prix peut être aussi bas
- Nous ne déplaçons aucun token. Votre trafic LLM va directement à votre fournisseur — nous ne voyons que des décomptes, jamais le contenu.
- Vous hébergez vous-même la partie lourde. L'optimiseur s'exécute dans votre processus ; nos serveurs se contentent de gérer la licence, d'apprendre et de rapporter.
- L'infrastructure évolue avec les revenus. Elle démarre sur un petit serveur et ne grandit que lorsque les clients payants couvrent le palier suivant.
- Le rapport est le compteur. La facturation lit le même SavingsReport que celui que vous vérifiez ci-dessus — aucune boîte noire.