Fin d’année d’audit : les résumés d’entraînement de l’AI Act mutiques sur les domaines

Un an après l'échéance d'août 2026, les résumés d'entraînement exigés par l'AI Act restent muets sur les noms de domaine. Analyse et implications pour les éditeurs.

Temps de lecture : 4 min

Points clés à retenir

  • Rubrique inutilisée : sur 24 résumés analysés en septembre 2026, 21 comportent la section sur les domaines et aucun ne nomme un site.
  • Des formulations génériques : les fournisseurs décrivent des catégories de sources (académiques, techniques, gouvernementales) sans citer de domaines identifiables.
  • Un contournement partiel par DeepSeek : trois résumés omettent purement et simplement la section sur la collecte en ligne.

Les éditeurs de presse et les détenteurs de fonds documentaires attendaient un outil simple : consulter le résumé public des contenus d’entraînement pour savoir si leur site avait servi à nourrir un grand modèle de langage. Un an après l’entrée en application, en août 2026, des pouvoirs de sanction de la Commission européenne, force est de constater que cet outil ne joue pas son rôle. Je décrypte ici ce que cela change vraiment pour les professionnels de la formation et de l’apprentissage digital.

Des résumés muets sur l’essentiel

Le constat est sans ambiguïté. Sur 24 résumés accessibles au 25 septembre 2026, 21 comportent bien la section dédiée aux principaux noms de domaine moissonnés. Aucun n’y nomme un site. Concrètement, les fournisseurs décrivent des catégories de sources — « plateformes web », « dépôts académiques », « ressources gouvernementales » — ou des extensions comme .com, .org, .net. Les trois documents restants, publiés par DeepSeek, vont plus loin : ils ne reprennent même pas la rubrique.

A lire également :  Du pilotage de la formation à l’influence stratégique : les indicateurs utiles

Le formulaire de la Commission impose pourtant une liste

L’article 53, paragraphe 1, point d), de l’AI Act contraint les fournisseurs de modèles d’IA à usage général à publier un résumé suffisamment détaillé de leurs contenus d’entraînement. Le formulaire officiel distingue trois catégories : les jeux de données publics, les données obtenues auprès de tiers et les contenus collectés directement sur internet. C’est cette dernière catégorie qui pose problème.

La section 2.3 du formulaire demande en effet une liste de domaines de premier et deuxième niveaux — par exemple exemple.com — correspondant aux 10 % les plus importants des domaines collectés, classés par volume de contenu extrait. Un seuil adapté est prévu pour les PME. La liste peut être fournie dans un fichier téléchargeable ou via un lien. La notice évoque une « forme descriptive et synthétisée » pour tenir compte des secrets d’affaires, mais rappelle dans sa note 16 l’exigence d’une liste de noms de domaine. La FAQ de la Commission présente elle aussi cette liste comme un moyen pour les titulaires de droits d’identifier l’origine des contenus.

Ce que les fournisseurs répondent à la place

Les onze documents d’Ant Group — pour les familles Ling, Ring et Ming — suivent tous la même approche. Ils décrivent un ensemble de plateformes web, de services d’hébergement de code, de dépôts académiques, de plateformes encyclopédiques et de portails régionaux. Sept réponses reprennent mot pour mot le même texte. Aucune ne fournit un seul nom de site.

Le constat se répète chez OpenAI. Les résumés de GPT-6 Astra et GPT-5.5 énumèrent des catégories : ressources académiques, techniques, juridiques ou gouvernementales, services de partage de documents, sites communautaires et portails régionaux. MiniMax adopte la même formulation pour M3, tandis que H3 se contente d’indiquer que les sources couvrent « un large éventail de domaines et de contenus ».

A lire également :  Pétronille : l'IA qui révolutionne la gestion des organismes de formation

Mistral Large 3 mentionne des sites généralistes, des ressources spécialisées et des domaines gouvernementaux, administratifs ou juridiques. Z.AI, pour la famille GLM-5, ajoute des extensions (.com, .org, .net) à des catégories comme l’hébergement de code et les ressources scientifiques. Une extension seule ne permet pas d’identifier un site. Les quatre résumés de ByteDance examinés — Seed 2.0 Pro, Seedance 2.0, Seedance 2.5 et Seedream 5.0 Pro — évoquent soit des secteurs comme l’éducation et la recherche, soit les sujets représentés dans les contenus. Là encore, aucun domaine identifiable.

DeepSeek fait l’impasse sur la section dédiée

Les résumés de DeepSeek-V3.1, V3.2 et V4 présentent une particularité encore plus problématique. Après les données obtenues auprès de tiers, ils passent directement aux données d’utilisateurs. La section consacrée au moissonnage du web et son champ sur les noms de domaine sont tout simplement absents. Ces documents décrivent pourtant, dans la partie relative aux réserves de droits, un robot de collecte conçu pour respecter les instructions robots.txt et les autres protocoles applicables, sans contourner les captchas, les paywalls ou les protections par mot de passe. Ils donnent donc des informations sur les règles déclarées de collecte, sans fournir la liste des domaines concernés.

Ce que ces résumés apportent malgré tout

Ces documents ne sont pas vides d’informations exploitables. Le document d’Ant sur Ling-2.0 nomme Ant Spider, précise une période de collecte et cite Common Crawl parmi les jeux de données publics. Les résumés de DeepSeek mentionnent également Stack Exchange. L’absence relevée ici concerne la rubrique des domaines collectés directement, et non toute référence à une source dans l’ensemble des documents.

A lire également :  Top formations IA pour managers en 2026 : comparatif, prix et avis

Pour un éditeur ou un organisme de formation, la conséquence est précise. Une catégorie telle que « ressources de connaissance générale » ne permet pas de retrouver son propre domaine, ni de conclure que celui-ci a été utilisé ou que la collecte était illicite. La notice prévoit bien un mécanisme complémentaire : les fournisseurs sont invités à répondre, sur une base volontaire, aux titulaires de droits qui souhaitent savoir si des contenus de leurs domaines ont été collectés. C’est justement ce recours au fournisseur que la liste devait rendre inutile en première intention.

À retenir : une conformité en trompe-l’œil

Savoir si ces rubriques satisfont à l’article 53 relève de la Commission, dont les pouvoirs de contrôle sur les modèles à usage général sont applicables depuis le 2 août 2026. Ce n’est pas anodin : l’obligation s’appliquait déjà depuis le 2 août 2025 aux modèles nouvellement mis sur le marché européen, et les modèles commercialisés avant cette date ont jusqu’au 2 août 2027 pour s’y conformer. Autrement dit, le temps presse. Pour les professionnels de la formation, l’enjeu est double. D’une part, la transparence sur les données d’entraînement conditionne la confiance dans les outils d’IA éducative. D’autre part, la possibilité de vérifier si ses propres contenus ont été utilisés est un prérequis à toute stratégie de création de ressources numériques. Allons plus loin : sans liste de domaines, c’est toute la chaîne de valeur de l’édition et de la formation qui reste dans le flou.

ILT — Innovative Learning Technologies
Résumé de la politique de confidentialité

Ce site utilise des cookies afin que nous puissions vous fournir la meilleure expérience utilisateur possible. Les informations sur les cookies sont stockées dans votre navigateur et remplissent des fonctions telles que vous reconnaître lorsque vous revenez sur notre site Web et aider notre équipe à comprendre les sections du site que vous trouvez les plus intéressantes et utiles.