Les projets d’IA appliqués aux documents et aux données ne reposent pas seulement sur les modèles : leur qualité dépend fortement des sources utilisées. Documents mal structurés, métadonnées pauvres, formats hétérogènes, doublons, erreurs OCR, droits mal identifiés ou corpus mal sélectionnés peuvent fortement limiter la pertinence des résultats.
Cette formation permet de comprendre comment préparer, structurer, nettoyer, qualifier et enrichir des documents ou données pour les rendre exploitables dans des usages IA : recherche augmentée, assistant documentaire, analyse de corpus, extraction d’informations, RAG ou entraînement de modèles lorsque cela est pertinent.