Prévention et dépistage, B2B
Construire la fonction data d'une startup santé
Contexte
Une webapp de prévention du cancer commercialisée auprès d'entreprises
et d'assureurs. Équipe de six personnes, aucun profil data, une base de
production jamais pensée pour l'analytique.
La question posée
Comment démontrer la valeur du produit à des clients qui paient une
licence, alors que personne ne sait encore quel effet le produit
produit réellement ?
Méthode
Rétro-ingénierie complète du schéma de production et rédaction de trois
documents de référence. Formalisation des règles analytiques transverses,
désormais appliquées par toute l'équipe. Identification d'une dizaine
d'anomalies de données, chacune arbitrée entre correction technique,
correction analytique et remontée produit. Puis construction des tableaux
de bord de pilotage, des restitutions clients en marque blanche et d'un
modèle médico-économique chiffrant les coûts évités grâce au dépistage
précoce.
La décision permise
L'équipe commerciale peut chiffrer la valeur d'une licence avant
signature, avec une méthode traçable. J'ai également posé un blocage sur
l'usage commercial d'une hypothèse potentiellement sous-évaluée d'un
facteur 3 à 8, tant qu'elle n'était pas tranchée. Un modèle vendu comme
certain aurait été un risque de réputation.
- MySQL
- SQL avancé
- Metabase
- Python
- D3.js
- RGPD santé
Lire le détail de la mission
Certification cosmétique, international
Automatiser un reporting multi sources non standardisées
Contexte
Un standard international de certification pour les cosmétiques
biologiques. Le suivi des produits certifiés reposait sur des fichiers
Excel transmis chaque mois par une douzaine d'organismes certificateurs,
consolidés à la main.
La question posée
Comment supprimer le traitement manuel récurrent sans perdre la fiabilité
du chiffre, alors que chaque source arrive avec ses propres conventions
de nommage ?
Méthode
Le blocage principal n'était pas technique mais sémantique : un même
organisme apparaissait sous plusieurs libellés selon le fichier source,
ce qui faussait silencieusement toute agrégation. Traitement à deux
niveaux, correction rétroactive de l'historique et normalisation au
moment du cast dans le pipeline. Puis modélisation en vues autoportantes,
une par page de tableau de bord, et publication automatisée du rapport
mensuel.
La décision permise
Le reporting mensuel est automatisé de bout en bout, de l'ingestion des
fichiers à la publication. Un indicateur de suivi renvoyait un résultat
plausible mais faux, dû à un ordre d'exécution entre filtre et fonction
fenêtre. Nous avons choisi de retirer temporairement la segmentation
plutôt que d'afficher une distinction non fondée.
- BigQuery
- Python
- Looker Studio
- GCP
- API REST
Lire le détail de la mission