Description du poste
Vous évoluez au sein de l’équipe Data, organisée en trois pôles de compétences (Data Engineering, Data Analytics, Data Science & IA) autour d’une plateforme Data sur le cloud (GCP) accessible pour l’analyse et la modélisation. Le poste s’inscrit dans un environnement multi-pays et multi-entités, soumis au RGPD, aux cadres prudentiels de la microfinance et au règlement européen sur l’IA. La qualité, la traçabilité et le cloisonnement des données sont les conditions d’existence de ces produits, pas des contraintes annexes. En tant que pure player en analyse et modélisation de données, vous jouerez un rôle clé dans la construction de plusieurs modèles de la plateforme.
Répartition de l’activité
Le poste combine deux volets dans une proportion indicative de 70 / 30, revue annuellement :
- 70 % – Socle données. Ingestion, modélisation, transformation, qualité, exposition. C’est le cœur du poste et la base de son évaluation.
- 30 % – Données pour l’IA et agents. Préparation du contexte consommé par les modèles, développement et mise en production d’agents sur les périmètres confiés.
Responsabilités – Socle données
- Concevoir, construire et maintenir des modèles de données évolutifs et des pipelines de transformation répondant aux besoins métier.
- Concevoir, automatiser et industrialiser les flux d’ingestion depuis diverses sources (bases de données, Google Sheets, API).
- Développer et maintenir les transformations avec dbt : modèles propres, testés, documentés.
- Posséder et optimiser les flux ELT/ETL via Cloud Workflow/Scheduler et les outils d’orchestration.
- Gérer et optimiser le stockage et la performance des requêtes sur BigQuery.
- Travailler avec les parties prenantes des domaines opérations, finance, risque et IT pour comprendre leurs besoins et développer les solutions appropriées.
- Veiller à l’application des bonnes pratiques de qualité, de gouvernance et de sécurité des données sur l’ensemble des jeux de données.
- Construire ou aider les analystes à construire les tableaux de bord et rapports dans Looker et les autres outils de self-service BI.
- Analyser les flux existants, identifier les causes racines des incidents, étudier les optimisations et conseiller sur les choix d’outils et de plateformes.
- Assurer la maintenance de la chaîne de données jusqu’à l’utilisateur final.
Données pour l’IA et agents
- Construire et maintenir la couche sémantique : définitions métier partagées, métriques certifiées, référentiels, de façon qu’une même question posée par un humain ou par un agent renvoie la même réponse.
- Documenter et cataloguer les jeux de données (métadonnées, lineage, glossaire) pour que les agents et leurs utilisateurs identifient la bonne source sans passer par l’équipe.
- Concevoir les pipelines de préparation pour la recherche documentaire : découpage, vectorisation, indexation, rafraîchissement.
- Exposer les données sous forme d’interfaces consommables par les agents plutôt que par accès direct aux tables.
- Mettre en œuvre les règles d’accès au niveau ligne et colonne, le cloisonnement entre entités et le masquage des données personnelles dans tout ce qui est exposé à un modèle.
- Développer et mettre en production des agents sur les périmètres confiés : orchestration des étapes, outillage, gestion des cas d’échec, génération de requêtes sur l’entrepôt.
- Constituer les jeux de questions-réponses de référence et mesurer l’exactitude des agents. Aucune mise en production sans mesure documentée.
- Instrumenter les traces, la latence et le coût par requête.
- Prendre en compte les risques propres aux systèmes à base de modèles : injection d’instructions, exfiltration, fuite entre entités.
- Contribuer à la documentation de conformité au règlement européen sur l’IA, en lien avec la fonction Gouvernance Data & IA.
Profil recherché
Requis
- Diplôme d’école d’ingénieur ou Master en informatique, 3 à 6 ans d’expérience.
- Expertise SQL et dbt.
- Solide maîtrise de Python en contexte applicatif : code structuré, typé, testé. Pas uniquement des notebooks.
- Expérience confirmée des architectures d’entrepôt (BigQuery, Redshift ou Snowflake) et d’un environnement cloud (GCP, AWS ou Azure).
- Intégration de données via Fivetran, Airbyte, Matillion ou Talend.
- Construction de tableaux de bord sur Looker, Power BI, Superset, Metabase ou équivalent.
- Au moins une réalisation à base de modèles de langage mise entre les mains d’utilisateurs réels, avec capacité à décrire le volume traité, le taux d’erreur observé et la méthode de mesure. Un prototype ou une démonstration ne suffit pas.
- Pratique des API de modèles (Gemini/Vertex AI, Anthropic, OpenAI) et compréhension des arbitrages coût, latence, qualité.
- Vision claire des principes de sécurité et de conformité des données.
- Anglais professionnel, capacité à travailler sur des projets de dimension internationale.
- Autonomie, force de proposition, capacité à faire grandir ses collègues.
Souhaitable
- Framework d’orchestration d’agents (LangGraph, ADK ou équivalent).
- Recherche vectorielle et récupération documentaire : vectorisation, indexation, recherche hybride, réordonnancement.
- Outils d’observabilité et d’évaluation des systèmes LLM.
- Protocoles d’outillage des agents (MCP ou équivalent).
- Traitement de données à grande échelle (Apache Airflow, Spark).
- Connaissance des données bancaires et du modèle T24 (Temenos).
- Notions du règlement européen sur l’IA, en particulier le classement des usages de scoring crédit.
Qualités attendues
- Problem-solving : diagnostiquer et résoudre les problèmes de manière efficace.
- Communication : signaler les problèmes et collaborer avec les membres de l’équipe ; expliquer au métier une limite technique sans le braquer.
- Maîtrise de l’anglais à l’écrit et à l’oral.
- Aise avec le non-déterminisme : savoir travailler sur des systèmes dont la sortie varie et concevoir les garde-fous correspondants.
- Rigueur : sens des responsabilités, souci du détail, persévérance.
Si vous avez envie de contribuer à notre projet d’entreprise et d’accompagner notre croissance, envoyez votre CV et lettre de motivation en mentionnant dans le titre de votre email la référence : DAT_AI_ENG 09 2026.
Postuler à cette offre
La candidature se fait directement auprès de Baobab Groupe. Date limite : 17 octobre 2026.