le Lundi 28 septembre 2026
le Lundi 28 septembre 2026 9:00 Lettre à l'éditeur

La langue coupée par une lame cybernétique

Pourquoi faire confiance à Le Courrier

Une brève théorie sur l’emplacement sociolinguistique de l’IA dans la domaine des langues et variétés de langues en situations minoritaires

La langue coupée par une lame cybernétique
00:00 00:00

Type de contenu: Opinion

Au Canada dans l’année 2026, c’est rare qu’une journée passe sans qu’on entend parler des intelligences artificielles génératives (connues également comme de grands modèles de langage (GMLs), des IAs génératives, ou simplement des IAs) — mais une histoire particulièrement marquante pour moi c’est l’histoire de Thélyson Orélien, l’auteur québécois d’origine haïtienne de l’ouvrage acclamé : « C’était ça ou mourir ». Paru en mars de 2026 au Québec (août de 2026, en France), « C’était ça ou mourir », un livre écrit d’une perspective d’un immigrant et réfugié haïtien en quête de l’asile au Canada, avait été critiqué pour des suspicions autour d’une utilisation potentielle (et potentiellement intensive) de l’IA générative lors de son écriture.

Dans ses écrits, que l’IA ait été utilisée ou non n’a, franchement, pas d’impact sur le fait que l’IA nous pose une menace existentielle — une profonde menace aux orateurs, lecteurs et écrivains du français haïtien, de l’acadjonne, du brayon, du mitchif, du chiac, du québécois, du franglais ou d’autre. L’IA risque les lectes en situation minoritaire, et les variétés linguistiques qui sont simplement moins communes et donc, je trouve que cette histoire, même si un peu décourageante, porte avec elle un certain humour ironique.

Je vous pose donc la suite : « Par manière de son fonctionnement fondamental, l’intelligence artificielle générative risque d’accélérer  l’assimilation sociolinguistique des groupes en situations minoritaires. »

J’explique.

Considérons, à titre de fondement analytique, la vérité des trois propositions suivantes :

« Prémisse un : Tout grand modèle de langage (GML) fonctionne par la prédiction probabiliste de la séquence textuelle subséquente, conditionnée par le contexte antérieur et instruite par un apprentissage automatisé mais supervisé à partir d’un corpus d’entraînement donné. »

« Prémisse deux : Pour toute langue sur la Terre, il existe nécessairement une ou plusieurs variétés de cette langue. »

« Prémisse trois: La quantité de contenu textuel, auditif ou autre, disponible au sein d’un corpus global est directement proportionnelle à la fréquence d’usage de la langue ou de la variété linguistique considérée. »

De l’articulation de ces trois principes découle une démonstration explicite :

Puisqu’un GML s’entraîne sur l’ensemble du contenu accessible et que ce contenu favorise statistiquement les langues et variétés dominantes, le modèle intègre et renforce une distribution dissymétrique, potentiellement radicale, de ces lectes dans son ensemble de données (d’après les prémisses un, deux et trois).

Lorsqu’il est sollicité sans contrainte spécifique à ce sujet, le modèle calcule le choix du terme suivant en maximisant la probabilité statistique de sa survenue — il effectue ces calculs en se basant sur ses données analysées (d’après la prémisse un). 

Par conséquent, l’algorithme privilégiera systématiquement les structures grammaticales, le lexique et les registres appartenant aux variétés les plus représentées dans ses données. Autrement dit, les variétés minoritaires d’une langue, ainsi que des langues qui sont simplement moins communes, seront moins représentées dans le contenu généré par l’IA générative et le contenu qui est généré sera ainsi d’une moindre qualité (en raison du fait que moins de données s’associe avec une plus petite fiabilité probabiliste et donc, des prédictions plus faibles).

Déjà, cette réalité devrait inquiéter tout le monde faisant partie d’une minorité linguistique — et peut-être vous vous demandez pourquoi que c’est une réalité inquiétante, mais selon un sondage de KPMG Canada, en août de 2025, environ 61% des employés canadiens utilisent de l’IA générative intentionnellement au travail. D’après un autre sondage de KPMG, 75% des étudiants secondaires, postsecondaires et vocationnels au Canada l’utilisent pour leurs travaux scolaires. En appliquant ces numéros aux groupes linguistiques en situations minoritaires au Canada, nous pouvons à travers le principe glottodidactique de l’immersion langagière, déterminer qu’un taux utilisation très haut d’un IA avec un langage naturellement biaisé pourrait renforcer davantage les normes linguistiques et contribuer à l’assimilation culturelle, la suppression identitaire et le trépas de la diversité linguistique.

L’action doit être prise : nous ne pouvons pas laisser faire taillées nos langues et nos identités, simplement à cause de l’essor d’une nouvelle technologie. Il faut arrêter la lame avant que nous ne devions étancher le sang qui suivra la coupure.

Type: Opinion

Opinion: Fait la promotion d’idées et tire des conclusions à partir de l’interprétation des faits et des données.

Pour consulter nos pratiques exemplaires et politiques journalistiques, cliquez ici.

Contactez la rédaction - Proposer une correction - Faire une suggestion - Contactez l'équipe