Vous voluez au sein de l’quipe Data, organise en trois ples de comptences (Data Engineering, Data Analytics, Data Science & IA) autour d’une plateforme Data sur le cloud (GCP) accessible pour l’analyse et la modlisation.Le poste s’inscrit dans un environnement multi-pays et multi-entits, soumis au RGPD, aux cadres prudentiels de la microfinance et au rglement europen sur l’IA. La qualit, la traabilit et le cloisonnement des donnes sont les conditions d’existence de ces produits, pas des contraintes annexes. En tant que pure player en analyse et modlisation de donnes, vous jouerez un rle cl dans la construction de plusieurs modles de la plateforme.
Rpartition de l’activit
Le poste combine deux volets dans une proportion indicative de 70 / 30, revue annuellement :
70 % – Socle donnes. Ingestion, modlisation, transformation, qualit, exposition. C’est le cur du poste et la base de son valuation.
30 % – Donnes pour l’IA et agents. Prparation du contexte consomm par les modles, dveloppement et mise en production d’agents sur les primtres confis.
Responsabilits Socle donnes
Concevoir, construire et maintenir des modles de donnes volutifs et des pipelines de transformation rpondant aux besoins mtier.
Concevoir, automatiser et industrialiser les flux d’ingestion depuis diverses sources
(bases de donnes, Google Sheets, API)
Dvelopper et maintenir les transformations avec dbt : modles propres, tests, documents.
Possder et optimiser les flux ELT/ETL via Cloud Workflow/Scheduler et les outils d’orchestration.
Grer et optimiser le stockage et la performance des requtes sur BigQuery.
Travailler avec les parties prenantes des domaines oprations, finance, risque et IT pour comprendre leurs besoins et dvelopper les solutions appropries.
Veiller l’application des bonnes pratiques de qualit, de gouvernance et de scurit des donnes sur l’ensemble des jeux de donnes.
Construire ou aider les analystes construire les tableaux de bord et rapports dans Looker et les autres outils de self-service BI.
Analyser les flux existants, identifier les causes racines des incidents, tudier les optimisations et conseiller sur les choix d’outils et de plateformes.
Assurer la maintenance de la chane de donnes jusqu’ l’utilisateur final.
Donnes pour l’IA et agents
Construire et maintenir la couche smantique : dfinitions mtier partages, mtriques certifies, rfrentiels, de faon qu’une mme question pose par un humain ou par un agent renvoie la mme rponse.
Documenter et cataloguer les jeux de donnes (mtadonnes, lineage, glossaire) pour que les agents et leurs utilisateurs identifient la bonne source sans passer par l’quipe.
Concevoir les pipelines de prparation pour la recherche documentaire : dcoupage, vectorisation, indexation, rafrachissement.
Exposer les donnes sous forme d’interfaces consommables par les agents plutt que par accs direct aux tables.
Mettre en uvre les rgles d’accs au niveau ligne et colonne, le cloisonnement entre entits et le masquage des donnes personnelles dans tout ce qui est expos un modle.
Dvelopper et mettre en production des agents sur les primtres confis : orchestration des tapes, outillage, gestion des cas d’chec, gnration de requtes sur l’entrept.
Constituer les jeux de questions-rponses de rfrence et mesurer l’exactitude des agents. Aucune mise en production sans mesure documente.
Instrumenter les traces, la latence et le cot par requte.
Prendre en compte les risques propres aux systmes base de modles : injection d’instructions, exfiltration, fuite entre entits.
Contribuer la documentation de conformit au rglement europen sur l’IA, en lien avec la fonction
Gouvernance Data & IA.
Profil recherch
Requis
Diplme d’cole d’ingnieur ou Master en informatique, 3 6 ans d’exprience
Expertise SQL et dbt.
Solide matrise de Python en contexte applicatif : code structur, typ, test. Pas uniquement des notebooks.
Exprience confirme des architectures d’entrept (BigQuery, Redshift ou Snowflake) et d’un environnement cloud (GCP, AWS ou Azure).
Intgration de donnes via Fivetran, Airbyte, Matillion ou Talend.
Construction de tableaux de bord sur Looker, Power BI, Superset, Metabase ou quivalent.
Au moins une ralisation base de modles de langage mise entre les mains d’utilisateurs rels, avec capacit dcrire le volume trait, le taux d’erreur observ et la mthode de mesure. Un prototype ou une dmonstration ne suffit pas.
Pratique des API de modles (Gemini/Vertex AI, Anthropic, OpenAI) et comprhension des arbitrages cot, latence, qualit.
Vision claire des principes de scurit et de conformit des donnes.
Anglais professionnel, capacit travailler sur des projets de dimension internationale.
Autonomie, force de proposition, capacit faire grandir ses collgues.
Souhaitable
Framework d’orchestration d’agents (LangGraph, ADK ou quivalent).
Recherche vectorielle et rcupration documentaire : vectorisation, indexation, recherche hybride, rordonnancement.
Outils d’observabilit et d’valuation des systmes LLM.
Protocoles d’outillage des agents (MCP ou quivalent).
Traitement de donnes grande chelle (Apache Airflow, Spark).
Connaissance des donnes bancaires et du modle T24 (Temenos).
Notions du rglement europen sur l’IA, en particulier le classement des usages de scoring crdit.
Problem-solving
Diagnostiquer et rsoudre les problmes de manire efficace.
Communication
Signaler les problmes et collaborer avec les membres de l’quipe.
Expliquer au mtier une limite technique sans le braquer .
Matrise de l’anglais l’crit et l’oral
Aise avec le non-dterminisme
Savoir travailler sur des systmes dont la sortie varie et concevoir les garde-fous correspondants
Rigueur
Sens des responsabilits, souci du dtail, persvrance
Si vous avez envie de contribuer notre projet d’entreprise et d’accompagner notre croissance, envoyez votre CV et lettre de motivation candidaturebbs@baobab.com en mentionnant dans le titre de votre email la rfrence : DAT_AI_ENG 09 2026
Please use the job title as the subject line of your email.