Points clés
- Le système textGrain d’OpenAI insère un filigrane statistique invisible dans les textes de ChatGPT et de Codex pour les utilisateurs européens, avec un déploiement au cours des prochaines semaines, tandis que les clients de l’API partout dans le monde peuvent l’activer pour certains modèles. Il reste désactivé par défaut hors de l’UE. Le détecteur n’est offert qu’à des chercheurs et à des organisations expertes agréés, au cas par cas.
- Le mécanisme est un échantillonnage étalonné par entropie : une clé secrète et les mots précédents orientent le choix des jetons au moyen d’un couplage de transport optimal, en dépensant un « budget d’entropie » plafonné pour que le texte se lise de la même façon et que les scores aux bancs d’essai bougent à peine. Le détecteur n’a besoin que du texte et de la clé.
- OpenAI a publié ses propres modes de défaillance avec le lancement. Avec un taux de faux positifs cible de 1 % : environ 80 % de détection sur des passages de 200 jetons, 95 % sur 400 jetons, nettement moins en mathématiques. Remplacer 10 % des mots par des synonymes a fait passer la détection sur 400 jetons d’environ 92 % à 66 %; 25 % l’a fait tomber à 17 %.
- Un filigrane est une preuve quand on le trouve, et rien quand on ne le trouve pas. La phrase d’OpenAI elle-même : l’absence de filigrane détecté ne prouve pas la paternité humaine. Si votre plan de conformité traite la marque comme un journal de provenance, une étiquette de paternité ou un contrôle de vérité, réécrivez le plan.
Le 5 octobre, OpenAI a publié un billet à la forme inhabituelle pour une annonce de produit : une nouvelle capacité, suivie aussitôt des mesures de ses propres points de rupture. La capacité, c’est textGrain, un système de filigrane pour les textes de ChatGPT et de Codex. La raison, c’est la Loi européenne sur l’IA. La rupture, c’est la partie intéressante, et OpenAI l’a imprimée dans le même billet.
Le paragraphe 50(2) de la Loi oblige les fournisseurs de systèmes d’IA générative à marquer les textes, sons, images et vidéos synthétiques « dans un format lisible par machine », de façon détectable comme contenus générés artificiellement. Les obligations de transparence s’appliquent depuis le 2 août 2026. Les systèmes déjà sur le marché européen avant cette date ont jusqu’au 2 décembre 2026 pour ajouter le marquage. ChatGPT et Codex y étaient bien avant août, d’où le « au cours des prochaines semaines » plutôt qu’une date ferme.
C’est la première fois qu’une règle européenne sur l’IA produit une version différente d’un produit d’IA grand public pour les utilisateurs européens. Cela seul mérite qu’on s’y attarde, même si vous ne servez aucun utilisateur européen. Le mécanisme est astucieux, les limites sont réelles, et l’écart entre les deux contient tout le devoir de conformité.
Ce qu’OpenAI a vraiment livré
Trois volets, annoncés ensemble.
D’abord, le réglage par défaut européen. Au cours des prochaines semaines, les textes admissibles de ChatGPT et de Codex recevront un filigrane invisible pour les utilisateurs de l’Union européenne, sur tous les forfaits. OpenAI précise qu’elle n’en fait pas un réglage mondial par défaut au lancement : « Cette approche régionale nous laisse le temps d’apprendre de l’usage réel et des retours. »
Ensuite, l’activation volontaire pour l’API. Depuis le 5 octobre, les clients de l’API partout dans le monde peuvent activer les textes filigranés pour certains modèles. Cela reste désactivé par défaut, c’est un paramètre plutôt qu’une option par requête (paramètres de l’organisation ou du projet), et OpenAI dit travailler avec ses partenaires infonuagiques pour que les modèles servis par leur intermédiaire puissent aussi être filigranés.
Enfin, le détecteur restreint. Les chercheurs et les organisations expertes agréés peuvent demander l’accès, accordé au cas par cas. L’outil indique seulement s’il détecte un filigrane OpenAI. Il n’identifie pas l’utilisateur et ne révèle ni les invites ni les conversations. OpenAI prévoit aussi de publier la technologie en source ouverte pour que d’autres laboratoires s’en inspirent, sans s’engager sur une date.
Notez ce qui manque à l’annonce : un vérificateur public. Vous ne pouvez coller un paragraphe nulle part pour poser la question. À moins que votre équipe ne soit un organisme de recherche ou d’expertise agréé, personne chez vous ne peut vérifier un filigrane dans un sens ou dans l’autre. Gardez cela en tête pour tout ce qui suit.
Comment fonctionne textGrain, en termes simples
Un modèle de langage écrit un jeton à la fois, un mot ou une partie de mot. À chaque étape, il tient une distribution de probabilités sur la suite possible, puis lance les dés. Un filigrane de texte remplace une partie de ce lancer par des nombres pseudoaléatoires dérivés d’une clé secrète et des mots qui précèdent.
La version textGrain, détaillée dans un rapport technique qui expose les mathématiques du couplage, corédigé avec des chercheurs de l’Université de Pennsylvanie et de Yale, fonctionne ainsi. La clé secrète et une fenêtre de jetons précédents divisent le vocabulaire en blocs. Un couplage de transport optimal oriente ensuite l’échantillonneur vers le bloc favorisé par la clé à cette position. Il dépense un « budget d’entropie » : un plafond sur la part du hasard naturel du modèle qu’on peut échanger contre du signal de filigrane. À l’intérieur du bloc choisi, les jetons gardent leurs probabilités relatives d’origine, et le modèle choisit donc toujours un mot sensé.
L’exemple du rapport rend cela concret. Après « The morning was », le modèle pourrait donner « warm » 30 %, « cold » 25 %, « mild » 15 %, et « calm », « sunny » et « bright » 10 % chacun. Toutes ces suites conviennent. textGrain utilise la clé pour favoriser un bloc de candidats plutôt qu’un autre. Sur des centaines de ces inflexions, un motif statistique s’accumule. Le détecteur, muni de la même clé, le teste. Le détecteur n’a besoin que du texte et de la clé. Ni modèle, ni invite, ni journal de génération.
Deux choix de conception comptent. D’abord, le filigrane est sans biais : en moyenne sur toutes les clés possibles, les choix de mots du modèle sont inchangés. Seule la source du hasard a changé, pas la distribution. Voilà pourquoi OpenAI ne constate pas de variation notable aux bancs d’essai avec le filigrane activé. Ensuite, le budget d’entropie corrige un vrai défaut des méthodes antérieures. Le filigrane classique de type Gumbel-max choisissait toujours le même jeton pour un même contexte et une même clé, si bien que poser deux fois la même question pouvait produire des réponses identiques à l’octet près. Ne dépenser qu’une partie du hasard garde les réponses répétées différentes, ce qui compte quand une application doit produire plusieurs réponses distinctes à une même invite.
L’idée n’est pas neuve, et le rapport ne prétend pas le contraire. Il cite les travaux de 2023 qui ont fondé le domaine, dont le filigrane à liste verte de Kirchenbauer et ses collègues, qui biaise l’échantillonnage vers un sous-ensemble pseudoaléatoire de jetons et détecte le surplus par un test statistique. textGrain est un instrument plus soigneux de la même famille : étalonné, budgété, et honnête sur ses limites.
Détruisez-le vous-même
Lire sur un filigrane statistique, c’est une chose. Le voir mourir sous vos propres modifications, c’en est une autre. Le laboratoire ci-dessous fait tourner un modèle pédagogique de cette famille de filigranes sur un passage fixe. Remplacez des synonymes, faites un aller-retour de traduction, ou passez à un texte mathématique contraint, et regardez la valeur p du détecteur bouger. Puis lisez ce que le verdict permet, et ne permet pas, de conclure.
Interactif : le laboratoire d'attaque
Ceci est un modèle pédagogique de la famille de filigranes à laquelle appartient textGrain, pas textGrain lui-même. Un passage fixe ci-dessous porte un filigrane statistique à clé, généré comme le détecteur de démonstration s'y attend. Remplacez des synonymes, faites un aller-retour de traduction, ou passez à un texte mathématique contraint, et regardez la valeur p du détecteur s'effondrer. La dégradation suit la forme des chiffres publiés par OpenAI.
Étalonnage : selon les propres tests d'OpenAI, avec un taux de faux positifs cible de 1 %, le détecteur a repéré le filigrane dans environ 80 % des passages de 200 jetons et 95 % des passages de 400 jetons en prose de psychologie. Remplacer 10 % des mots par des synonymes a fait passer la détection sur 400 jetons d'environ 92 % à 66 %; 25 % l'a fait tomber à 17 %. Ce jouet reproduit cet effondrement sur un court passage.
word mot remplacé
Valeur p du détecteur: -
Seuil de détection 0,01 : en dessous, le détecteur déclare le filigrane présent.
- mots évalués
Trois choses à remarquer si vous l’avez essayé. D’abord, l’effondrement n’est pas linéaire. Quelques remplacements affaiblissent le signal; vers un dixième des mots réécrits, le détecteur commence à faillir; passé le quart, il est parti. Cela reflète la courbe publiée par OpenAI, et c’est pourquoi « légèrement modifié » est l’expression la plus dangereuse de toute politique de filigrane. Ensuite, le passage mathématique échoue avant même que vous le touchiez. Une formulation contrainte ne laisse presque aucune liberté à l’échantillonneur, donc presque aucun signal à trouver. Le code, les formules, les noms et les dates racontent la même histoire. Enfin, raccourcir le passage affaiblit la détection même sans aucune modification. Le signal s’accumule par jeton; un texte court en contient simplement moins.
Les chiffres, honnêtement
Tous les chiffres ci-dessous viennent d’OpenAI, avec un taux de faux positifs cible de 1 %, ce qui signifie qu’environ un passage non filigrané sur cent peut revenir positif par construction.
| Condition | Taux de détection |
|---|---|
| Passage de 200 jetons, prose souple (psychologie) | Environ 80 % |
| Passage de 400 jetons, prose souple | Environ 95 % |
| Passage de 400 jetons, mathématiques | Nettement plus bas |
| Passage de 400 jetons, 10 % des mots remplacés par des synonymes | D’environ 92 % à 66 % |
| Passage de 400 jetons, 25 % des mots remplacés | Environ 17 % |
Sur la qualité des sorties, le tableau des bancs d’essai d’OpenAI pour Astra, son dernier modèle de pointe, bouge dans les deux sens avec le filigrane activé :
| Banc d’essai | Sans filigrane | Avec filigrane |
|---|---|---|
| Artificial Analysis Intelligence Index | 49,57 | 49,76 |
| AutomationBench | 34,09 % | 34,86 % |
| GPQA Diamond | 94,44 % | 93,94 % |
| Terminal-Bench 4.0 | 53,90 % | 56,06 % |
| Terminal-Bench Science 0.1 | 56,90 % | 60,00 % |
| BrowseComp | 87,92 % | 87,35 % |
| DeepSWE v1.1 | 72,80 % | 71,68 % |
| HealthBench Professional | 64,27 % | 64,60 % |
Aucune baisse systématique, ce que la propriété de non-biais prédit. Les praticiens sur Reddit restent sceptiques sur l’absence d’effet sur la qualité, certains craignant une version « contrainte » des réponses; les chiffres publiés sont le contrepoids, et ce sont les propres tests d’OpenAI, pas des tests indépendants.
Deux autres détails honnêtes. Le filigrane n’ajoute ni caractères cachés, ni espaces invisibles, ni ponctuation inhabituelle : le signal vit entièrement dans le choix des mots, donc un nettoyeur de caractères n’a rien à nettoyer. Et la marque voyage avec le copier-coller, parce qu’elle est la formulation, pas une métadonnée. Voilà la bonne nouvelle pour la durabilité. La mauvaise, c’est tout le tableau ci-dessus.
Cinq choses que le filigrane ne peut pas vous dire
OpenAI consacre une section entière du billet à ce sujet, et on dirait qu’elle a été écrite par quelqu’un qui a déjà vu des résultats de détection mal utilisés. Voici ces cinq points, reformulés :
- Il ne mesure pas la contribution humaine. Il peut indiquer qu’un système d’OpenAI a généré ou traité une partie d’un passage, mais pas la part de jugement, de révision ou de créativité humains.
- Il n’établit ni propriété ni responsabilité. Il ne dit rien sur le propriétaire du texte, la licéité de son usage, ni qui en répond.
- Il n’identifie pas l’utilisateur. Aucune personne, organisation, compte, invite ou conversation n’est associée à la marque.
- Il ne vérifie pas l’exactitude. Il ne dit rien sur la véracité du passage, son caractère trompeur ou nocif.
- Son absence ne prouve rien. Un texte peut être trop court, modifié, traduit, issu d’un modèle non pris en charge, antérieur au filigrane, ou produit par les outils d’une autre entreprise.
Le point 5 est celui à imprimer. Les discussions de praticiens depuis l’annonce tournent autour des mêmes objections : la marque est fragile face à la paraphrase et à la traduction, le déploiement limité à l’UE ressemble à une conformité au moindre effort, seul le fournisseur détient la clé de détection, et une marque absente sera inévitablement lue comme une preuve de paternité humaine par des gens qui devraient savoir. Les trois premiers sont des faits d’ingénierie et de politique. Le quatrième est un échec de communication en puissance, et c’est celui que votre documentation interne peut réellement prévenir. Écrivez la phrase « un résultat négatif ne prouve pas qu’un humain a écrit ce texte » dans chaque politique qui mentionne le filigrane, parce que quelqu’un devra la relire à un dirigeant.
Il y a aussi un angle de confidentialité plus tranchant à nommer. La détection est asymétrique par construction : seul le détenteur de la clé peut vérifier. Si un tiers offre un jour un filtrage « écrit par une IA ou non » bâti sur le détecteur d’un fournisseur, chaque vérification enverra le texte sur ses serveurs. Une détection centralisée de textes décentralisés est un problème de protection des données déguisé en transparence. Traitez tout vendeur de ce type en conséquence.
Les devoirs de conformité
Le paragraphe 2 de l’article 50 lie le fournisseur du système d’IA générative, pas la personne qui l’utilise. Si vous mettez sur le marché sous votre nom un produit qui rédige des textes, c’est très probablement vous : selon les définitions de la Loi, l’entreprise qui met le système sur le marché en est le fournisseur, même quand le modèle sous-jacent vient d’un autre. Un interrupteur que personne n’a activé n’est pas une solution de marquage.
Les mécanismes qui comptent pour les devoirs :
- Le calendrier. Les obligations de transparence s’appliquent depuis le 2 août 2026. Les systèmes sur le marché européen avant cette date ont jusqu’au 2 décembre 2026 pour ajouter le marquage du 50(2). Si votre produit sert des utilisateurs européens, cette date est votre échéance, pas celle d’OpenAI.
- Le plancher. Le code de bonnes pratiques ne requiert aucun filigrane sous 200 jetons, environ 150 mots anglais. Les sorties courtes sont exclues par construction.
- Les exemptions. Le code source est exclu : les lignes directrices excluent le code écrit pour être interprété, compilé ou exécuté. Sont aussi exclus les sorties courtes comme les mots isolés et les étiquettes d’interface, le trafic d’agent à agent qu’aucun humain ne voit, et l’édition standard comme la correction grammaticale. Les résumés générés par l’IA, en revanche, comptent comme contenu à marquer.
- Les sanctions. Les manquements aux obligations de transparence peuvent entraîner des amendes jusqu’à 15 millions d’euros ou 3 % du chiffre d’affaires annuel mondial, le montant le plus élevé étant retenu.
Quoi faire lundi, si une partie des textes de votre produit parvient à des utilisateurs européens :
- Recensez chaque endroit où votre produit renvoie du texte généré à un utilisateur. Pour chacun, notez le fournisseur, le modèle, la longueur typique et le genre de sortie. La prose longue et librement générée est la cible de la règle.
- Prenez une décision explicite sur l’interrupteur Provenance des textes d’OpenAI par projet, avec une date. Désactivé par défaut n’est pas une décision; c’est l’absence de décision. Si vous répartissez entre fournisseurs ou modèles, rappelez-vous que le marquage est une propriété de l’acheminement : la même invite peut produire un texte marqué sur un modèle et non marqué sur un autre ou sur une version antérieure.
- Journalisez quel modèle a produit chaque sortie. Votre propre journal ne remplace pas le marquage, mais c’est le seul dossier de provenance que vous pouvez réellement interroger vous-même.
- Ne bâtissez rien qui dépende de la détection. Ni contrôle anti-plagiat, ni filtre d’attribution. Vous ne pouvez pas obtenir le détecteur, et un résultat négatif ne prouve rien.
Deux fournisseurs, deux théories
Le contraste avec Anthropic est instructif. Anthropic a signé le même code de bonnes pratiques et livre le filigrane comme réglage mondial par défaut : chaque modèle Claude pris en charge, chaque surface, partout où Claude est offert, avec des métadonnées C2PA signées sur les fichiers d’image générés pris en charge et une API de détection prévue. OpenAI livre un réglage européen par défaut et une activation volontaire ailleurs. Un fournisseur traite la marque comme une propriété du produit; l’autre comme un contrôle de conformité régional.
La théorie qui l’emportera montrera jusqu’où va l’effet Bruxelles dans l’IA. Si les autres laboratoires suivent Anthropic, le marquage lisible par machine deviendra la texture par défaut des textes d’IA dans le monde, et la règle européenne aura fixé un standard mondial comme sa loi sur la protection des données l’a fait. S’ils suivent OpenAI, le marquage restera une surcouche régionale, et la question intéressante deviendra celle de la frontière : comment on détermine un « utilisateur européen », ce qu’un VPN y change, et si les clients de l’API hors UE activeront un jour un interrupteur qui reste désactivé par défaut.
Pour les équipes canadiennes, la note juridictionnelle est courte. La Loi sur l’IA s’applique aux fournisseurs qui mettent des systèmes sur le marché européen quel que soit leur lieu d’établissement, et aux sorties utilisées dans l’UE. Une entreprise de Toronto qui sert des utilisateurs européens est visée comme fournisseur en aval. Le Canada n’a pas de règle équivalente : la consultation fédérale sur la transparence de l’IA s’est terminée le 23 septembre 2026, et la suite suivra son propre chemin. Les devoirs ci-dessus s’appliquent dès que vos textes traversent l’Atlantique, qu’Ottawa écrive ou non sa propre version un jour.
Mesure concrète : OpenAI a offert à l’industrie une rareté : un fournisseur qui publie sa propre courbe de défaillance de détection avec le lancement. Servez-vous-en. Recensez vos sorties de texte exposées à l’Europe, prenez une décision explicite et datée sur l’interrupteur Provenance des textes pour chaque route, et journalisez quel modèle a produit quoi. La marque est un signal pour un expert muni d’une clé, sur une longue prose que personne n’a modifiée. Tout le reste, vous devez l’enregistrer vous-même.
Sources principales
- Our approach to EU text provenance rules (OpenAI)
- textGrain: Entropy-Calibrated Watermarking for Language Model Text (OpenAI)
- Provenance signals in OpenAI-generated content (OpenAI)
- Article 50: Transparency obligations for providers and deployers of certain AI systems (EU AI Act Service Desk)
- A Watermark for Large Language Models (arXiv)
- How Claude marks AI-generated content (Anthropic)
- OpenAI explains how it will watermark ChatGPT (discussion de praticiens) (Reddit)
- How AI text watermarking works (discussion de praticiens) (Reddit)