Decathlon : Comment le CDO structure sa stratégie data & IA (stack, gouvernance, agentique)
#159 - Le zoom, le podcast avec Didier, sa ressource préférée et comment construire sa stack autour d'Airflow
Hello,
Bienvenue dans l’édition #159 de la newsletter DataGen ! 👋
L’agenda de la semaine :
🔍 Zoom sur les chantiers data & IA chez Decathlon
🎙 Le podcast avec Didier, Chief Data & AI Officer chez Decathlon
📚 La ressource recommandée par Didier
🎙 Comment Astronomer a construit sa stack autour d’Airflow
C’est parti !
🔍 Zoom sur les chantiers data & IA chez Decathlon - 5 min
Ce zoom est tiré de mon échange avec Didier, Chief Data & AI Officer chez Decathlon (102 000 collaborateurs, 17 milliards d’euros de CA, 54 pays et entre 800 et 900 personnes en Data).
Les 2 chantiers fondateurs : Lakehouse & Gouvernance
1) Lakehouse
Quand Didier arrive chez Decathlon il y a six ans, la stack data est déjà sur le cloud (Redshift), mais pensée principalement pour la BI. Avec l’arrivée de la Data Science, du Machine Learning et la multiplication des usages, l’équipe décide de migrer vers un Lakehouse, en s’appuyant sur Databricks, Python et Spark.
“On a aussi repensé toute l’architecture de données avec des business domains qui contiennent des data domains qui contiennent eux-mêmes des data products. On l’a rendue plus business-oriented pour qu’elle soit compréhensible par le business.”
2) Gouvernance
Dans toutes ses expériences, Didier avait observé une déconnexion entre la partie théorique (politiques de Data Gouvernance, frameworks…) et l’éxecution. Chez Decathlon, il a donc poussé pour que la Data Gouvernance soit réellement intégrée “by design” sur toute la chaîne.
La première étape a été de mettre en place des Data Contracts qui caractérisent les données (source, format, descriptions…).
L’autre point crucial a été d’intégrer l’entité Data Gouvernance dans l’équipe Plateforme Data & IA afin qu’elle puisse réellement traduire les besoins business dans les outils (ex : tests, changements de calculs, conformité…).
“L’entité Data Gouvernance ne doit pas être une sorte de Cour des Comptes qui fait des audits et des analyses sans qu’il ne se passe jamais rien derrière.”
Par ailleurs, la Data Gouvernance et la Data Quality sont encore plus importants avec l’arrivée des agents IA.
“Ce ne sont plus des humains qui vont consommer les données, ce sont des robots, des agents. Et ils n'ont pas le discernement d'un humain qui dirait “je n'ai pas confiance dans cette data”. Ils vont prendre la donnée telle quelle et exécuter la tâche sans contrôle, à une vitesse et avec des volumes très importants.”
Le chantier agentique : les 3 risques principaux
Les LLMs sont devenus très performants, la qualité des données a augmenté, et le déploiement a été facilité avec le no-code et le vibe coding. Résultat : tout le monde veut lancer des agents pour gagner en productivité.
Didier identifie 3 risques et sous-chantiers associés :
“Chaque technologie vient créer son lot de problèmes.”
1) La gouvernance des agents
Les agents vont agir de manière automatisée et à grande échelle sans qu’un humain puisse valider ses décisions.
“Tu dois te poser les mêmes questions quand tu crées un agent que quand tu recrutes un employé : quelle mission je lui donne ? Comment je l’accompagne ? Comment je suis ses performances ?”
2) Le contrôle des coûts
Les hyperscalers ont opacifié leur offre avec les tokens, c’est difficile d’anticiper ce que va réellement coûter un agent en production.
“Il faut estimer le coût et la valeur des agents dès le départ puis analyser le coût, l’usage et la création de valeur une fois les agents déployés. C’est ça qui est le plus dur.”
3) La priorisation des sujets stratégiques
Le vrai piège, c’est d’utiliser les agents pour améliorer à la marge des process qui devraient être repensés totalement. On se retrouve à augmenter les coûts et à renforcer le legacy pour gagner quelques pourcents de productivité.
“L’équipe Data & IA doit comprendre les enjeux des métiers et les accompagner à repenser leurs process grâce à l’IA. C’est ça la clé. Si je repense un process et que je l’automatise, je peux gagner 20 à 30% de productivité et créer de l’avantage concurrentiel.”
Une organisation qui oscille en permanence
Chez Decathlon, l’équipe Data & IA est continuellement en train de se réorganiser. Chez eux, l’oscillation permanente est considérée comme un état sain, à condition de ne pas basculer dans la “fluctuation”.
“L’état d’équilibre, c’est un état instable. Le leader, son rôle, c’est de mettre assez de contrainte pour faire osciller l’organisation de manière régulière. Parce que sinon, on entre dans la routine.”
🎙 Le podcast avec Didier, Chief Data & AI Officer chez Decathlon
On aborde :
Le parcours de Didier : physique, industrie... jusqu’à Decathlon
Le contexte data chez Decathlon
Le passage du Data Warehouse au Lakehouse (cf. zoom)
Data Mesh vs Business Domains
La gouvernance et le chanter Data Quality (cf. zoom)
Le chantier agentique : les 3 risques (cf. zool)
Le framework 3-3-3 pour déployer les agents
Pourquoi leur organisation oscille en permanence
La plus grosse difficulté et le rôle du CDO
“La data, c'est un révélateur. Notre rôle, c'est de dire : ici, le process n’est pas cohérent. Les bons Chief Data Officers de demain devront apporter cette valeur-là.”
Liens vers l’épisode : Apple Podcasts | YouTube | Spotify
📚 La ressource recommandée par Didier
"Changements : Paradoxes et psychothérapie" de Paul Watzlawick de l'école de Palo Alto
“J’ai lu ce livre des centaines de fois ! Il explique les différents types de changements : ceux de type 1 qui modifient quelques éléments sans vrai changement et ceux de type 2 qui provoquent des disruptions. Ca permet de bien analyser les décisions que l’on doit prendre.”
🎙 Comment Astronomer a construit sa stack autour d’Airflow
Marion Azoulai est Staff Data Scientist chez Astronomer, l’éditeur d’Astro, la plateforme managée d’Airflow qui est aussi l’un des principaux contributeurs de la solution open source.
Créé en 2018, Astronomer a levé plus de 370 millions de dollars et accompagne des centaines d’organisations dans le monde, parmi lesquelles la Société Générale, Booking.com, Autodesk ou encore WeWork.
Marion va nous raconter comment ils ont lancé l’équipe Data & IA et comment ils ont construit leur stack autour d’Airflow.
On aborde :
Chantier #1 : La construsction d’une stack data moderne (Snowflake, Sigma et Airflow comme colonne vertébrale)
Chantier #2 : Le déploiement des dashboards et la diffusion d’une culture data-driven dans toute l’entreprise
Chantier #3 : L’industrialisation des cas d’usage de Machine Learning et leur accélération sur l’AI Analytics
Leurs plus gros challenges : gagner la confiance des équipes et faire face aux transformations liées à l’IA
“Il y a eu un switch à partir duquel tout le monde s’est mis à utiliser les dashboards et à se reposer sur la donnée pour prendre des décisions. Ensuite, ils se sont mis à poser des questions de plus en plus complexes, à vouloir être prédictifs et prescriptifs.”
Liens vers l’épisode : Apple Podcasts | YouTube | Spotify
Tester gratuitement Astro pendant 2 semaines : ici
Demander une démo : ici

