Skip to main content
CIPP/CCIPP/CPrivacyCanadaPIPEDA

Enquêtes conjointes et moissonnage par l'IA générative : public ne veut pas dire permis

Enquêtes conjointes canadiennes : le web public n'égale pas des données gratuites. Provenance, filtrage et contrats avant moissonnage ou affinage d'IA.

Lecture de 4 min
ShareLinkedIn

Points clés

  • Les grands modèles de langage sont entraînés sur des océans de textes et de médias qui comprennent des renseignements personnels — noms, coordonnées, allégations biographiques, données d’enfants et inférences sensibles.
  • « Le jeu de données était gros » n’est pas un principe de vie privée sous la LPRPDE ni sous les lois provinciales plus strictes.
  • Les données du web public peuvent encore être des renseignements personnels quand elles sont utilisées commercialement.

L’IA générative a redonné de la voix à un vieil argument de vie privée : si quelque chose paraît sur l’internet public, une entreprise peut-elle l’aspirer pour l’entraînement?

Les régulateurs canadiens répondent à des variantes de cette question depuis des années. La version courte, c’est non — pas sans un cadre juridique valable, et pas comme un droit acquis décontracté de l’industrie.

Le schéma de précédent : Clearview

L’enquête conjointe sur Clearview AI demeure le cas pédagogique le plus limpide. Les commissaires fédéraux et provinciaux ont examiné la collecte massive d’images pour un système biométrique et rejeté l’idée que « accessible au public » égale « disponible pour réutilisation industrielle ». Les conclusions sont publiques dans le rapport de conclusions 2021-001 du Commissariat à la protection de la vie privée sur la LPRPDE.

Ce dossier compte au-delà de la reconnaissance faciale. Il a établi une force d’application coopérative entre les juridictions et un rejet substantiel de l’exceptionnalisme des données publiques pour l’IA commerciale.

Le renforcement en appel de la portée extraterritoriale dans la filière contentieuse Clearview, y compris la décision de 2026 de la Cour d’appel de la Colombie-Britannique, ajoute du poids judiciaire au même récit d’écosystème : le droit canadien de la vie privée peut suivre les modèles d’affaires de moissonnage qui touchent les gens ici.

L’IA générative, même conflit à plus grande échelle

Les grands modèles de langage sont entraînés sur des océans de textes et de médias qui comprennent des renseignements personnels — noms, coordonnées, allégations biographiques, données d’enfants et inférences sensibles. L’industrie répond souvent par des arguments d’échelle : le corpus est trop vaste pour être nettoyé; le modèle ne « stocke » pas de dossiers; les sorties sont génératives, pas de la récupération.

Les régulateurs se soucient de la collecte et de l’utilisation en amont, des devoirs d’exactitude et de conservation au milieu, et des droits individuels en aval. « Le jeu de données était gros » n’est pas un principe de vie privée sous la LPRPDE ni sous les lois provinciales plus strictes.

En 2025-2026, l’examen multiautorité des développeurs d’IA générative a suivi le schéma Clearview : pression conjointe ou coordonnée, focus sur le moissonnage trop large, consentement faible ou inexistant, et traitement inadéquat des renseignements sensibles et des enfants. Considérez les conclusions détaillées propres aux entreprises comme un récit d’application en évolution ancré dans cette approche établie, et non comme une excuse pour inventer des raccourcis de citation bien rangés. La leçon de conformité n’exige pas de drame. Elle exige de la provenance.

Ce que j’exige avant l’entraînement ou l’affinage d’un modèle

Inventaire des sources. D’où vient chaque corpus — données sous licence, données de clients, données d’employés, moissonnage web, flux de fournisseur?

Évaluation des renseignements personnels. Quelqu’un a-t-il vraiment vérifié, ou l’équipe a-t-elle supposé qu’il n’y avait que du code et des billets de blogue?

Fondement juridique et avis. Surtout pour le contenu des clients et les détails personnels publiés publiquement et réutilisés hors de leur contexte d’origine.

Filtrage et minimisation. Pouvez-vous exclure les identifiants privés, les justificatifs d’identité et les données de catégorie spéciale avant l’entraînement?

Règles de conservation et de réutilisation. Les résidus de clavardage retournent-ils dans les poids sans autorisation?

Contrôles d’exactitude. Les faits personnels hallucinés ne sont pas un gentil bogue de démonstration sous les régimes qui exigent l’exactitude des renseignements personnels.

Plan de sortie. Si un régulateur conteste un corpus, pouvez-vous cesser l’utilisation, réentraîner ou retirer une voie de modèle? Le coût irrécupérable algorithmique n’est pas une défense juridique.

Les acheteurs d’entreprise sont dans le rayon d’impact

Même si vous n’entraînez pas de modèles de fondation, vous les déployez. Vous collez des données confidentielles dans les invites. Vous achetez des outils d’intégration (embeddings). Vous affinez sur des journaux de soutien.

Les questions d’approvisionnement que je traite désormais comme obligatoires :

  • Sommaire de la provenance des données d’entraînement
  • Réalités du retrait et de la suppression pour le contenu des utilisateurs
  • Si les données d’affaires servent à améliorer des modèles partagés
  • Traitement de l’âge et des données sensibles
  • Historique d’incidents avec les régulateurs de la vie privée
  • Libellé contractuel sur le droit canadien et la coopération avec les régulateurs

Si un fournisseur ne peut répondre sans brouillard marketing, chiffrez cela comme un risque.

Relier le risque de moissonnage au programme canadien plus large

Cet enjeu se situe à l’intersection de l’obligation de rendre compte actuelle sous la LPRPDE, des lois provinciales comme la Loi 25 du Québec, de la pression de réforme après la mort du projet de loi C-27 et de référentiels mondiaux comme le Règlement européen sur l’IA. Vous n’avez pas besoin d’une harmonie parfaite entre ces instruments pour justifier des contrôles internes. Il vous faut de l’humilité face aux renseignements personnels dans les chaînes d’approvisionnement de l’apprentissage automatique.

Je le dis crûment aux fondateurs : si votre fossé concurrentiel, c’est « nous avons moissonné plus fort », votre fossé est un passif. Les données sous licence, les relations de première main et les données synthétiques à lignée claire sont plus lentes au départ et plus solides sous enquête. Les organisations qui souffriront le plus sont celles qui ont produit de l’ambiguïté — publications publiques, images publiques, profils publics — sans jamais se demander si la réutilisation commerciale correspondait au contexte d’origine de la publication.

Tenez un registre vivant des systèmes d’IA, des corpus et de l’incertitude résiduelle. L’incertitude est permise un temps. L’incertitude non documentée en production, c’est ainsi que des enquêtes conjointes deviennent des problèmes existentiels de produit.

Un récit de niveau conseil qui fonctionne

Les conseils n’ont pas besoin d’un séminaire sur les transformeurs. Il leur faut trois phrases :

  1. Les données du web public peuvent encore être des renseignements personnels quand elles sont utilisées commercialement.
  2. Les autorités canadiennes ont déjà rejeté le « public égale gratuit » pour la collecte à l’échelle de l’IA.
  3. Notre risque résiduel, c’est tout ce que nous ne pouvons ni tracer, ni filtrer, ni contrôler contractuellement.

Montrez ensuite le registre. Les dirigeants financent ce qu’ils peuvent voir. Les moissonnages cachés ne restent pas cachés une fois qu’une enquête coordonnée commence.

Mesure concrète à retenir

Commandez un examen de 45 jours de la provenance des données d’entraînement pour chaque système d’IA qui touche matériellement les clients ou les employés. Classez chaque source de données comme sous licence, autorisée de première main, ou moissonnée/incertaine. Bannissez les sources incertaines de l’entraînement en production jusqu’à ce que les équipes juridique et de vie privée approuvent par écrit un fondement — ou remplacez-les. Ancrez l’examen dans les conclusions conjointes Clearview et vos obligations en vigueur sous la LPRPDE et, le cas échéant, les lignes directrices de la Commission d’accès à l’information (CAI) du Québec. Cette seule pratique d’hygiène prévient plus de douleurs futures qu’une énième déclaration abstraite d’« IA responsable ».

Related services

Practical consulting aligned to this article’s focus—program design, controls, and operational delivery.

Browse all services