Tech, data & cybersécuritéIA & Data

IA & data. Les modèles se réentraînent, l'expertise data non.

Choix de features, biais connus, subtilités des jeux de données : le savoir qui fait tenir un système d'IA vit dans quelques experts.

Équipes data et IA, de 5 à 100 personnes.

Le problème

Ce qu'une équipe data perd quand celui qui a branché les sources part.

Les pipelines tournent, les tableaux de bord sont à jour, le code est versionné. Ce qui part, c'est la justification des choix faits en amont, et c'est précisément ce que la réglementation va vous demander.

Sources

La cartographie que personne n'a écrite

Quelle source rejette quoi, pourquoi, et depuis quelle migration. Le taux de rejet est un indicateur de performance officiel du data engineer, mais l'explication de chaque rejet vit dans la tête de celui qui a branché la source.

Conception

Les compromis techniques et leurs raisons

Pourquoi cette architecture plutôt qu'une autre, quelle latence ou quel coût a tranché. L'annexe IV du règlement européen sur l'intelligence artificielle exige explicitement de consigner les décisions relatives aux compromis effectués. Aucune équipe ne les écrit spontanément.

Annotation

Les conventions qui définissent un cas limite

Ce que l'équipe a décidé de considérer comme ambigu, comment elle a tranché. La CNIL en a fait une fiche dédiée en juillet 2025, au motif que cette phase détermine la qualité du modèle. Les conventions, elles, se transmettent oralement.

Conformité

Une documentation exigible pendant dix ans

Le fournisseur d'un système à haut risque doit tenir sa documentation technique à disposition des autorités pendant dix ans après la mise sur le marché. Sur cette durée, l'équipe qui l'a conçu aura entièrement changé.

Le recrutement, chiffré

59 %

Des entreprises ayant cherché à recruter un spécialiste des technologies de l'information déclarent des difficultés, et 73 % dans le secteur de l'information et la communication.

Insee, enquête TIC entreprises 2024

Ces quatre pertes n'exposent ni au même risque ni dans le même délai. Voici comment les hiérarchiser.

Le diagnostic

Quels savoirs sont les plus exposés dans votre équipe.

Ce tableau se remplit en une réunion d'équipe. Vous en sortez avec la liste des pipelines et des modèles dont personne ne saurait justifier les choix, dans l'ordre. Il vous appartient, même si nous n'allons pas plus loin ensemble.

CritèrePorté parDocumentéCoût si la personne part
Provenance et limites des jeux de donnéesUn data scientistPartiellementModèles entraînés sur des données qu'on ne peut plus justifier
Choix d'architecture et alternatives écartéesUne à deux personnesNotebooksOn refait les mêmes essais
Comportements connus du modèle en productionL'équipe MLOpsMétriques, sans l'interprétationDérive non détectée

Provenance et limites des jeux de données

Porté par
Un data scientist
Documenté
Partiellement
Coût si la personne part
Modèles entraînés sur des données qu'on ne peut plus justifier

Choix d'architecture et alternatives écartées

Porté par
Une à deux personnes
Documenté
Notebooks
Coût si la personne part
On refait les mêmes essais

Comportements connus du modèle en production

Porté par
L'équipe MLOps
Documenté
Métriques, sans l'interprétation
Coût si la personne part
Dérive non détectée
10 ansLa durée pendant laquelle la documentation technique d'un système d'IA à haut risque doit rester à disposition des autorités après sa mise sur le marché. Source : Règlement (UE) 2024/1689, article 18.
Le déroulé d'une mission

De la première visite à la mise en service.

Les entretiens sont menés par quelqu'un qui a construit des chaînes de traitement. C'est ce qui permet de relancer sur un compromis qu'un data engineer juge trop évident pour l'expliquer, et de recueillir une dette technique sans que la personne se sente mise en cause.

  1. Avant

    Une demi-journée sur site pour cadrer

    Nous listons avec vous les personnes à interroger et les sujets à écarter : les jeux de données personnelles, les poids de modèles sous licence restrictive, ce que la personne refuse de voir figurer. Vous validez ce périmètre avant le premier entretien.

  2. Pendant

    Les entretiens se tiennent devant les pipelines

    Écran partagé, sur la chaîne réelle plutôt que sur un schéma d'intention, sur plusieurs séances. La personne montre autant qu'elle explique, et l'expert relance sur ce qu'elle a sauté parce que cela lui paraissait évident.

  3. Ensuite

    Vos documents sont rattachés aux réponses

    Vos schémas de données et vos fiches de modèle existent déjà, mais personne ne sait lequel s'applique à quel cas. Ils sont rattachés aux explications qui leur donnent leur sens, au lieu de rester rangés à côté.

  4. À la fin

    La personne interrogée relit et valide

    Rien n'est mis à disposition de vos équipes sans son accord. C'est la condition pour qu'elle parle librement pendant les entretiens, et c'est ce qui sépare un recueil d'un contrôle.

Une fois les entretiens terminés, voici ce qu'un data engineer qui arrive a devant lui.

Le produit, dans vos données

Les flux réels, enfin documentés.

Le patrimoine, c'est l'outil interne qui contient leurs réponses et vos documents techniques, et que vos équipes interrogent en français.

Patrimoine cognitif · data

Comment fonctionne réellement la synchronisation CRM-ERP ?

Voix du prestataire d'intégration

Pas les API temps réel du schéma officiel : un script Python hérité (sync_crm_v2.py) tourne chaque nuit , extrait les comptes modifiés en CSV et les pousse en SFTP vers l'AS/400. En cas de panne réseau, il s'arrête en silence ; réconciliation manuelle le lendemain.

Sources

Entretien de fin de mission du prestataire d'intégration · janv. 2024

1 source · validé par l'auteur · mise à jour janv. 2024

Interface illustrative

Ce qu'on peut lui demander

Le type de questions auxquelles le patrimoine répond.

  1. 01D'où viennent les données de ce modèle, et qui les a validées ?
  2. 02Pourquoi a-t-on abandonné cette approche en 2023 ?
  3. 03Sur quelles populations le modèle est-il connu pour se tromper ?
  4. 04Quel seuil de dérive déclenche un réentraînement ?

Ce sont aussi, presque mot pour mot, les questions qu'un auditeur posera au titre de l'annexe IV du règlement européen.

Le périmètre du recueil

Ce qui entre dans le patrimoine, et ce qui n'y entre jamais.

Le règlement européen sur l'intelligence artificielle impose, pour les systèmes à haut risque, une documentation qui couvre les données d'entraînement, les choix de conception et les limites connues. C'est exactement ce qu'un recueil produit, et exactement ce que les équipes n'écrivent pas.

Recueilli et consultable

  • La provenance des jeux de données et qui les a validés
  • Les compromis de conception, et la mesure qui a tranché
  • Les conventions d'annotation et les cas limites
  • Les comportements connus du modèle en production

Exclu, sans exception

  • Les jeux de données personnelles
  • Les poids de modèles sous licence restrictive
  • Ce que la personne refuse de voir figurer

Le cadre juridique

AI Act et documentation technique

Le règlement européen sur l'intelligence artificielle impose, pour les systèmes à haut risque, une documentation technique qui couvre les données d'entraînement, les choix de conception et les limites connues. C'est très exactement ce qu'un recueil produit, et c'est très exactement ce que les équipes n'écrivent pas. Les échéances d'application s'étalent jusqu'en 2027 : le patrimoine constitué aujourd'hui sert de base à la conformité de demain.

Les questions fréquentes

Les questions que se posent les équipes techniques.

Notre documentation technique est déjà à jour.
Elle décrit l'architecture en place. L'annexe IV du règlement européen demande autre chose : la provenance des données, la façon dont elles ont été obtenues et sélectionnées, les procédures d'étiquetage, et les décisions relatives aux compromis effectués. Cette dernière ligne est celle que personne n'écrit, et c'est celle qui disparaît avec la personne.
Nos notebooks et nos commits gardent la trace de tout.
Ils gardent la trace de ce qui a été fait, pas des essais abandonnés. Le savoir le plus coûteux d'une équipe data, ce sont les approches écartées après trois semaines de travail : elles ne laissent aucune trace, et l'équipe suivante les refait.
On a déjà un wiki. Pourquoi ne suffit-il pas ?
Le wiki documente le quoi et le comment, et vieillit plus vite que le code. Il ne contient jamais les impasses, les échecs de conception ni les vulnérabilités tolérées : personne ne consigne de lui-même les fragilités d'un système dont il est responsable. C'est l'entretien par un pair qui libère cette parole.
L'IA générative ne peut-elle pas documenter le code elle-même ?
Elle explique la logique locale. Elle ne peut pas deviner qu'un module contourne la faiblesse d'un partenaire, ni qu'une API a été dégradée pour un client. Le code est la traduction finale d'une décision humaine ; la décision n'y est pas.
Où sont hébergées nos sources et notre patrimoine ?
En France, dans un espace isolé de ceux des autres clients, en circuit fermé : aucune réutilisation pour entraînement de modèles publics. Le patrimoine reste votre propriété exclusive.
En quoi est-ce un enjeu de valorisation ?
En due diligence, une société dont l'exploitation repose sur son fondateur technique se paie en décote et en earn-out rallongé. Un socle où le raisonnement d'architecture est consultable et sourcé défend le multiple.

Vos pipelines tournent.
Qui sait encore pourquoi ils tiennent ?

Évaluer mon risque