La langue compte pour les IA, mais pas comme on le croit. Les LLM répondent dans la langue de la requête, et leur RAG cible en priorité du contenu dans cette langue. Pour une marque B2B française qui vend en France : prioriser le FR à 80 % du contenu et garder un sous-domaine ou /en/ pour les 20 % anglophones (acheteurs internationaux, presse tech US). Pour un SaaS qui vend EU-wide : faire 50/50 avec hreflang propre. Le pire choix : traduire mécaniquement son site FR en EN sans contexte, les IA détectent et déclassent les contenus de basse qualité traductive.
L’anglais domine les corpus LLM, pourquoi le FR compte quand même
Selon les statistiques Common Crawl 2025, l’anglais représente environ 41 % des pages du corpus, contre ~5 % pour le français (cinquième langue mondiale dans l’index). Les recherches sur les corpus d’entraînement des LLM (Stanford CRFM 2021) confirment cette prédominance anglophone, qui ne signifie pas pour autant qu’il faille tout publier en anglais.
La phase d’entraînement n’est qu’une partie du jeu : le RAG en production interroge un index web plus récent et plus localisé, et le modèle privilégie fortement la langue de la requête utilisateur. Quand un acheteur français demande à ChatGPT « quel ERP français pour PME industrielle ? », l’IA va chercher d’abord dans le contenu francophone.
L’IA répond dans la langue de la requête, et cite en conséquence
Les IA génératives citent en priorité des sources écrites dans la langue de la question : une question posée en français fait surtout remonter des sources francophones, la même question en anglais surtout des sources anglophones. Si votre marché parle français à l’IA, votre contenu doit donc être prioritairement en français.
Le piège de la traduction automatique. Traduire son site FR en EN via DeepL sans relecture est contre-productif. Les LLM détectent les patterns de traduction machine et ont tendance à déclasser ces contenus au profit de textes rédigés nativement. Si vous voulez exister en EN, il faut produire en EN avec un natif ou un copywriter senior, ou ne pas le faire du tout.
3 buyer personas B2B FR, 3 stratégies différentes
Persona A. Le directeur PME 100 % France
Achète en France, parle français, interroge ChatGPT en français. Stratégie : 90-100 % du contenu en FR. Pas besoin de version anglaise sauf pour la presse internationale.
Persona B. Le head of revenue SaaS EU
Vend dans 4-8 pays européens, navigue en anglais entre partenaires. Interroge l’IA en anglais le matin pour la veille concurrentielle, en français l’après-midi pour les ops FR. Stratégie : 50/50 FR/EN avec hreflang strict, contenu sur-mesure par langue (pas de traduction).
Persona C. Le founder tech mondial
Vend SaaS B2B à des clients globaux, basé en France mais marché US/UK dominant. Stratégie : 80 % EN, 20 % FR (pour le marché domestique + presse FR + recrutement). Voir Mistral, HuggingFace, Datadog (cas extrême).
Patterns hreflang qui fonctionnent en 2026
- Sous-dossiers (/fr/, /en/) : préféré par Google et les LLM, simple à gérer, pas de duplication de domaine.
- Sous-domaines (fr.site.com, en.site.com) : OK mais demande une gestion DNS et SSL plus lourde, pas d’avantage GEO réel.
- ccTLD (site.fr + site.com) : excellent pour le SEO local, mais double les coûts et l’entretien, non recommandé sauf gros budget.
- Pas de hreflang du tout : à éviter, l’IA peut servir la mauvaise version selon la géo de la requête.
Pattern recommandé en 2026 : sous-dossiers /fr/ et /en/ sur le même domaine, balises hreflang complètes (FR+EN+x-default), llms.txt distinct pour chaque langue, schema Organization unique (pas dupliqué). La documentation officielle Google hreflang reste la référence technique pour l’implémentation.
Plan d’action 90 jours selon votre cas
| Si vous êtes... | Jours 1-30 | Jours 31-60 | Jours 61-90 |
|---|---|---|---|
| Persona A (PME FR) | Audit GEO FR + llms.txt | Articles longs FR + FAQ + schema | Mesure citations FR multi-modèles |
| Persona B (SaaS EU) | Audit bilingue + hreflang | Refonte 10 pages clés en FR ET EN natif | llms.txt FR + EN, mesure 30 prompts par langue |
| Persona C (founder global) | Audit EN + Reddit/HN strat | Pile 80 % articles EN, 20 % FR | Suivi citations EN globales + FR FR |
Ressources NEXUS GEO. Voir notre audit checklist 47 critères, guide llms.txt 2026 et la méthodologie complète.
FAQ
Sources
- Common Crawl : Statistiques de composition linguistique 2025 (cc-crawl-statistics, anglais ~41 %, français ~5 %).
- Stanford CRFM : « On the Opportunities and Risks of Foundation Models », 2021 (arxiv.org/abs/2108.07258).
- Google Search Central : Documentation hreflang (managing-multi-regional-sites).
Pour aller plus loin que la théorie, notre audit GEO applique cette grille à votre site, en 10 jours, sans engagement.
Audit GEO
Stratégie multilingue à clarifier ?
L’audit GEO NEXUS à 1 750 € inclut un diagnostic linguistique de votre marché cible et une recommandation de ratio FR/EN. Livré en 10 jours.





