Data engineering SaaS : du tableur à la BI en libre-service
Data stack moderne en 7 semaines : 56 heures de reporting manuel en moins par mois, clôture mensuelle en 2 jours au lieu de 5, 186 000 $ d’ARR préservés.
L’entreprise, un SaaS de gestion de projet utilisé par plus de 1 200 entreprises et en croissance de 40 % par an, produisait des données dans 7 systèmes : HubSpot, Stripe, une base de production PostgreSQL, Intercom, Google Analytics, QuickBooks et Gusto. Répondre à une question métier simple demandait des jours de tableur à 2 analystes.
Pour calculer la rétention nette des revenus (NRR), il fallait exporter les données de Stripe, de HubSpot et de la base produit, rapprocher des identifiants clients discordants à coups de RECHERCHEV, et aboutir à un chiffre auquel personne ne se fiait tout à fait. Le CEO voulait, le lundi matin, un tableau de bord montrant l’ARR (revenu annuel récurrent), la NRR, l’attrition (churn), l’expansion et les tendances d’usage, sans intervention d’un analyste. La direction financière perdait 5 jours sur la clôture mensuelle, parce que le reporting financier exigeait d’agréger à la main les données de 4 systèmes.
Un diagnostic des données d’une semaine, à 4 000 $, a passé en revue les 7 sources et hiérarchisé les besoins de reporting. À lui seul, le tableau de bord ARR/MRR coûtait 4 heures de travail manuel par semaine, la NRR 8 heures par mois et le dossier de clôture financière 20 heures par mois. Le plan : tout charger dans Snowflake, modéliser les indicateurs dans dbt et proposer des tableaux de bord en libre-service dans Metabase.
Les semaines 2 et 3 ont servi à monter l’infrastructure. Fivetran a connecté les 7 sources, avec des fréquences de synchronisation adaptées au besoin : toutes les heures pour l’usage du produit, toutes les 6 heures pour Stripe et HubSpot, une fois par jour pour GA et QuickBooks. Snowflake suit une architecture en trois couches : une couche brute immuable qui sert de piste d’audit, une couche de staging où les identifiants clients sont unifiés entre les systèmes, et des data marts prêts à l’emploi pour la finance, les clients, le produit et le support.
Les semaines 4 et 5 ont produit 34 modèles dbt : MRR par client avec gestion du prorata, cascade d’ARR (waterfall), NRR par cohorte, score de santé client composite et modèles d’adoption des fonctionnalités. Chacun est protégé par des tests de qualité des données : si une source est corrompue, le pipeline échoue de façon visible au lieu de produire des indicateurs faux. Les semaines 6 et 7 ont livré 6 tableaux de bord Metabase (direction, clôture financière, santé client, analyse produit, support, marketing) et formé les équipes en une session de 2 heures.
Le reporting manuel est passé de plus de 56 heures par mois à 4 heures de relecture (−93 %). La clôture mensuelle est passée de 5 jours à 2 (−60 %). Répondre à une question métier prenait 4 à 8 heures d’analyse manuelle. Il faut maintenant 30 secondes sur un tableau de bord. Les 7 sources de données sont réunies dans Snowflake, qui sert de source unique de vérité, avec un score de santé en temps réel pour l’ensemble des 1 200 clients.
Le tableau de bord du score de santé a permis d’agir avant la résiliation : l’équipe customer success a repéré 47 comptes qui s’orientaient vers la résiliation et en a conservé 31, soit 66 % de comptes sauvés, ce qui a préservé environ 186 000 $ d’ARR. L’analyse produit a montré que le suivi du temps, une fonctionnalité peu utilisée, était corrélé à la rétention 2,4 fois plus fortement que toute autre fonctionnalité. Le cycle de développement suivant a été réorienté en conséquence.
L’investissement de la première année s’est élevé à 78 200 $ (44 000 $ de développement, 850 $ par mois de coûts de plateforme, 2 000 $ par mois de forfait de support), pour plus de 270 000 $ de valeur la première année, tirée du temps d’analyste économisé et des résiliations évitées.
Avant Gigabit, chaque lundi commençait par “quelqu’un a les derniers chiffres ?”. Aujourd’hui, chaque lundi commence par “voici ce que les chiffres nous disent”. Ce passage, de la collecte des données à l’action fondée sur les données, vaut plus que le seul temps gagné.
Nos études de cas publiées sont majoritairement nord-américaines. Tous les montants sont en dollars US. Le client est anonymisé.


