
Vous écrivez une consigne en français, la réponse arrive en français, et quelque chose cloche sans que vous puissiez dire quoi. Une tournure qui sonne traduite, un mot employé dans son sens anglais, un vouvoiement qui glisse au troisième paragraphe, un terme administratif remplacé par un équivalent qui n'existe pas en France.
Les sources ouvertes consultées ne permettent pas de classer globalement le français face à l'anglais. Elles montrent quelque chose de plus limité : certains éditeurs déclarent le français parmi les langues prises en charge et, sur un test de connaissances d'un modèle précis, son score est proche de ceux de l'espagnol et de l'italien.
Cela ne mesure ni le naturel d'un texte, ni tous les usages, ni tous les modèles. L'écart chiffré entre le français et l'anglais sur ce même test n'est pas publié dans la source utilisée ici.
Sommaire
- D'où vient le déséquilibre
- Ce qui se voit quand même à l'usage
- Ce que vous pouvez faire quand vous écrivez en français
- Ce que cet article ne prétend pas
- Questions fréquentes
D'où vient le déséquilibre
Trois indicateurs publics peuvent éclairer le sujet : les langues du web archivé, les langues qu'un éditeur déclare prendre en charge et les scores par langue sur un test donné. Aucun ne mesure à lui seul la qualité d'un système en français.
Ce que pèse le français dans le corpus web
Common Crawl archive de grandes quantités de pages web et publie la langue principale détectée sur ses pages HTML. Dans le crawl CC-MAIN-2026-34, l'anglais représente 40,45 % des documents et le français 4,85 %, soit un rapport d'environ huit pour un. Cette mesure décrit une archive du web, pas les données d'entraînement d'un modèle : elle ne tient pas compte de la sélection, du nettoyage, des données sous licence, des traductions ni des corpus ajoutés par l'éditeur. Elle montre un déséquilibre du web collecté ; elle ne permet pas d'en déduire un écart de performance.
Ce que les éditeurs déclarent eux-mêmes
La carte modèle de Llama 3.1 publiée par Meta liste huit langues prises en charge, anglais, allemand, français, italien, portugais, hindi, espagnol et thaï, et précise que le modèle peut produire du texte dans d'autres langues sans que celles-ci atteignent les seuils retenus en matière de sûreté et d'utilité ; l'éditeur décourage fortement son usage conversationnel dans ces langues sans réglage complémentaire ni contrôles adaptés. Deux enseignements : le français figure dans le premier cercle, et une hiérarchie des langues est explicitement assumée par l'éditeur.
Ce que les scores publiés montrent, et ce qu'ils ne montrent pas
OpenAI publie les résultats d'un test de connaissances générales traduit dans 14 langues par des traducteurs professionnels humains. Pour gpt-4.1 dans sa version d'avril 2025, le français obtient 0,870, l'espagnol 0,876, l'italien 0,869 et le yoruba 0,647. Sur ce modèle et ce test seulement, l'écart entre le français et le yoruba est de 0,223 point. Le tableau ne comporte pas de colonne anglaise et n'évalue ni le style, ni le dialogue, ni l'exactitude institutionnelle. Il ne justifie donc ni un classement général des langues ni une conclusion sur tous les outils.
Ce qui se voit quand même à l'usage
Les sources ci-dessus ne mesurent pas les défauts de style en français. Les points suivants sont donc une grille de relecture, pas un palmarès mesuré des erreurs. Ils ciblent ce qu'une phrase grammaticalement correcte peut tout de même manquer : l'usage d'un mot, le registre ou une dénomination locale.
Les calques de traduction
Cherchez un verbe employé dans son sens anglais : « supporter » pour prendre en charge, « adresser » un problème pour le traiter, « délivrer » un résultat pour le fournir. Ces exemples sont des points de vigilance, pas la preuve que le système traduit depuis l'anglais à cet instant.
Le registre qui dérape
Vérifiez que le vouvoiement, le niveau de formalité et les formules de politesse restent cohérents. Une amabilité continue peut convenir à un contexte et sonner fausse dans un autre. Le problème n'est pas une supposée manière américaine d'écrire, mais l'absence d'un registre français explicitement demandé.
Le vocabulaire institutionnel, et la francophonie
Les noms d'organismes, les dispositifs et les seuils sont propres à un pays et parfois à une année. Un terme plausible peut désigner un dispositif d'un autre pays ou un dispositif supprimé. Les usages belges, suisses, québécois, africains ou ultramarins ne se réduisent pas à ceux de la France hexagonale. Précisez donc le pays et vérifiez chaque dénomination à sa source.
| Ce qui cloche | Ce que c'est réellement | Comment le repérer | Ce que vous faites |
|---|---|---|---|
| Un mot juste qui sonne faux | Calque de sens depuis l'anglais | Le mot existe, mais dans un autre emploi | Donner le terme attendu dans la consigne |
| Une amabilité continue | Registre calqué sur l'usage américain | Le ton ne varie pas entre deux messages très différents | Indiquer le registre, pas seulement la langue |
| Un organisme au nom plausible | Terme institutionnel reconstruit | Le nom existe ailleurs, ou n'existe plus | Vérifier à la source, systématiquement |
| Une tournure lourde | Structure de phrase anglaise | Participe présent en tête, adjectif antéposé | Réécrire, la retouche ponctuelle ne suffit pas |
| Un usage non hexagonal absent | Recoin peu représenté du corpus | Le terme local devient l'équivalent de France | Préciser le pays dès la consigne |
Ce que vous pouvez faire quand vous écrivez en français
Aucune de ces habitudes ne suppose de connaître le fonctionnement interne du modèle : elles rendent le résultat attendu plus explicite et la vérification plus ciblée.
Étape 1 : commencer dans la langue du résultat attendu. Pour un texte français, une consigne française évite d'ajouter volontairement une étape de traduction. Si la tâche porte sur des documents anglais, comparez les deux approches sur quelques cas au lieu d'appliquer une règle universelle.
Étape 2 : fournir le vocabulaire plutôt que le corriger après. Donnez les termes du domaine, les noms exacts des organismes et les libellés utilisés par votre organisation. Vous réduisez ainsi les ambiguïtés sans promettre un taux de correction invérifiable.
Étape 3 : préciser le registre et le pays. Vouvoiement ou tutoiement, professionnel ou grand public, France ou autre pays francophone : ces choix doivent être explicites plutôt que laissés à une valeur par défaut inconnue.
Étape 4 : relire ce qui est spécifique. Concentrez la vérification sur les noms propres, les chiffres et les dénominations. Notre article sur comment utiliser l'intelligence artificielle détaille cette hiérarchie de contrôle.
Ce que cet article ne prétend pas
Les trois sources répondent à trois questions différentes. Les réunir ne crée pas une mesure globale de la qualité du français.
Aucun classement général des langues
La carte de Llama déclare des langues prises en charge ; Common Crawl décrit des pages archivées ; MMLU teste des connaissances à choix multiple sur un modèle. Aucun de ces documents ne mesure seul le style, la fidélité d'une traduction ou l'exactitude d'un texte administratif.
Aucun classement des éditeurs
Nous ne classons pas les outils. Il faudrait des tâches identiques, des versions datées, une méthode publique et des critères adaptés à l'usage. Cet article fournit une méthode de lecture et de vérification, pas un banc d'essai.
La position de l'association
IA Innovateurs ne conduit pas d'évaluation linguistique et ne peut pas transformer des impressions de rencontre en mesure. Nous défendons donc une pratique simple : vérifier à la source les noms, les dispositifs, les dates et les chiffres, puis juger le style dans le contexte où le texte sera lu. Cette prudence vaut en français comme dans toute autre langue.
Elle permet aussi de séparer deux questions souvent confondues : le système peut-il produire une phrase française compréhensible, et cette phrase est-elle juste pour votre pays, votre métier et votre lecteur ? La première se teste rapidement ; la seconde exige des sources et une relecture située.
Questions fréquentes
Vaut-il mieux écrire sa demande en anglais pour obtenir un meilleur résultat ?
Il n'existe pas de règle valable pour tous les modèles et toutes les tâches. Si le résultat attendu est en français, commencez en français afin de ne pas imposer une traduction supplémentaire. Pour un domaine dont la terminologie ou les documents de référence sont anglais, comparez quelques cas et relisez le résultat français. Le test doit porter sur votre tâche, pas sur une réputation générale du modèle.
Pourquoi l'IA invente-t-elle des noms d'organismes français qui n'existent pas ?
Parce que le système peut produire un nom plausible sans vérifier qu'il correspond à une institution réelle. Le phénomène n'est pas propre au français. Les sources de cet article ne mesurent pas sa fréquence par langue ; il serait donc abusif d'affirmer qu'il survient davantage en français. Le mécanisme général est expliqué dans notre article sur comment fonctionne l'intelligence artificielle.
Comment repérer un texte français produit par un système ?
Il n'existe pas de signe certain, et les détecteurs se trompent. On remarque plutôt un registre uniforme, des transitions régulières ou des exemples plausibles mais jamais situés ; aucun de ces indices ne prouve quoi que ce soit seul. La question utile porte moins sur l'origine du texte que sur sa vérifiabilité : un texte sourcé se juge sur ses sources.
Une tournure qui vous intrigue, ou un cas à nous soumettre ? Consultez les prochaines rencontres, découvrez qui nous sommes, ou écrivez-nous. Trois articles complètent celui-ci : le vocabulaire de l'IA expliqué sans jargon, IA et accessibilité et comprendre une annonce produit « propulsé par l'IA ». Les conférences et ateliers sont gratuits et ouverts à tous les niveaux. L'adhésion est distincte et facultative, à 25 € par an, avec un tarif solidaire à 10 €. Adhérer maintenant