
Préparer des données fiables avant un projet IA
Un modèle ne répare ni une définition floue ni une source mal comprise. Avant de choisir un outil, il faut savoir quelle décision ou tâche sera aidée, quelles données la décrivent, ce qu’elles omettent et comment constater une erreur. Cette préparation sert aussi aux tableaux de bord et aux automatisations ordinaires.
Commencez par l’usage, puis la donnée.
- Définissez une tâche et une mesure de réussite avant de collecter davantage.
- Documentez origine, droits, fraîcheur, lacunes et responsables de chaque source.
- Évaluez les erreurs et la possibilité de contrôle humain sur des cas représentatifs.
Décrivez la décision ou la tâche à améliorer
Évitez « faire de l’IA avec nos données ». Formulez une question opérationnelle : retrouver un document applicable, classer une demande entrante ou détecter une incohérence dans un catalogue. Précisez qui utilisera le résultat, à quel moment, et quelle erreur serait coûteuse.
Comparez cette tâche avec une règle simple, une recherche améliorée ou une meilleure documentation. Si ces solutions répondent au besoin, un modèle plus complexe ajoute peu de valeur. Conservez un exemple concret d’entrée, de résultat attendu et de décision finale.
Inventoriez les sources et leurs responsables
Pour chaque fichier, base ou API, notez le producteur, le propriétaire opérationnel, la période couverte, le format, la fréquence de mise à jour, les droits de réutilisation et la personne capable d’expliquer les champs. Une source non documentée peut sembler complète tout en excluant une partie du public.
Reliez les champs aux définitions métier. « Client actif » ou « dossier clos » peut changer de sens selon les équipes. Sans définition commune, deux tableaux de bord et un système d’IA peuvent produire des réponses incompatibles à partir des mêmes enregistrements.
Mesurez les défauts qui changent le résultat
Contrôlez exactitude, complétude, cohérence, unicité et fraîcheur en fonction de l’usage. Un champ manquant est parfois acceptable pour une tendance globale, mais bloquant pour une décision individuelle. Segmentez les contrôles par date, canal, territoire ou type de dossier pour ne pas masquer les écarts dans une moyenne.
Conservez des exemples de doublons, valeurs aberrantes et modifications tardives. Corrigez d’abord la cause à la source lorsque c’est possible ; une transformation silencieuse dans le pipeline peut donner l’illusion d’une base propre tout en reproduisant le défaut à chaque import.
Clarifiez accès, licence et données personnelles
Une donnée disponible en ligne n’est pas automatiquement libre pour tout usage. Lisez la licence, les conditions d’accès et la finalité de collecte avant d’importer un jeu externe. Pour les données personnelles, vérifiez le fondement du traitement, la nécessité des champs et les personnes habilitées à y accéder.
Évitez de copier dans un outil expérimental des documents confidentiels ou des données de production sans cadre défini. Préparez un jeu d’essai adapté et contrôlez les exports, journaux et accès des prestataires. La pseudonymisation réduit certains risques mais ne transforme pas nécessairement les données en données anonymes.
Préparez une chaîne de traitement reproductible
Décrivez les étapes de nettoyage, rapprochement, suppression de doublons et transformation. Versionnez les définitions et gardez la provenance d’un résultat. Un changement de schéma ou de source doit déclencher un contrôle, pas seulement une correction manuelle oubliée dans un fichier.
Séparez les données utilisées pour concevoir la solution de celles réservées à l’évaluation. Vérifiez les fuites possibles : si un champ révèle indirectement la réponse, un test peut paraître excellent sans prédire la situation réelle. Une petite base bien documentée est souvent plus utile qu’un grand assemblage opaque.
Testez les cas difficiles et les erreurs concrètes
Constituez un jeu d’évaluation qui reflète les usages, y compris les dossiers incomplets, cas rares, formulations ambiguës et changements récents. Définissez les critères avant de regarder les résultats : justesse, taux d’erreur, coût de revue, temps gagné ou qualité de la décision.
Examinez les faux positifs et faux négatifs séparément. Demandez à des personnes compétentes de relire les résultats qui auront un effet réel. Lorsque le système ne sait pas répondre, une abstention ou une escalade vers un humain peut être préférable à une réponse assurée mais fausse.
Attribuez l’entretien et la possibilité d’arrêt
Décidez qui surveille la qualité des nouvelles données, révise les critères d’évaluation, traite les signalements et autorise une évolution. Notez les dépendances à une API, un fournisseur ou une licence. Un projet pilote doit prévoir ce qui se passe si la source disparaît ou si les résultats se dégradent.
Avant de généraliser, comparez le bénéfice avec le coût complet : préparation, infrastructure, contrôle humain, maintenance et correction des erreurs. Une solution utile reste compréhensible et réversible pour l’organisation qui l’exploite.