Deux langues officielles, ce sont deux adresses pour chaque idée, et un moteur applique une seule allocation d'exploration aux deux. Voici l'étape dont personne ne rend compte : comment une adresse devient connue, ce qui épuise l'allocation dans un organisme lourd en documents, et ce que l'Indexing Hub de Semalt permet d'observer.
Demandez à une équipe des communications de la capitale nationale combien de pages compte son site : le CMS répond au chiffre près. Demandez ce qu'un moteur en retient : plus de réponse. Le second nombre reste loin derrière le premier, sans que rien n'ait sonné l'alarme.
La cause est structurelle. Tout ce que publie une association, un fournisseur de l'État, une faculté ou un cabinet professionnel existe deux fois avant qu'une page nouvelle soit commandée. Ajoutez une bibliothèque de PDF, un répertoire de membres, des pages de programmes et d'appels d'offres calées sur le cycle d'avril à mars, des archives jamais élaguées depuis 2011 : le compte d'adresses dépasse le plan éditorial de plusieurs longueurs.
Publié et trouvé ne sont pas le même état
Entre la publication et un résultat s'intercalent trois étapes, dont chacune échoue à sa manière. Le moteur doit apprendre que l'adresse existe. Un robot doit la demander et recevoir quelque chose d'exploitable. Le moteur juge enfin s'il conserve ce qui lui revient. Ramener les trois au seul mot « indexation » coûte des trimestres : retoucher une page ne sert à rien tant qu'aucun robot ne l'a réclamée, et la réannoncer ne sert à rien une fois qu'elle a été écartée sur le fond.
- La découverte est affaire de signalement. Si la version française d'un mémoire dépend d'un sélecteur qu'aucun robot n'actionne, elle n'a jamais été annoncée.
- L'exploration est affaire de capacité. Un robot consacre chaque jour un effort limité à votre domaine, et les filtres d'un répertoire l'absorbent en entier.
- La conservation est affaire de jugement. Une page de programme de deux lignes, ou une coquille HTML avec un seul lien de téléchargement, perd ce jugement.
- Chaque étape laisse ses traces. Un journal vide désigne le signalement ; une visite consignée, une réponse propre et rien dans les résultats désignent autre chose.
Un exemple fixe la distinction. Une association déplace sa bibliothèque bilingue : 1 600 documents changent d'adresse. Dix semaines plus tard, 500 se retrouvent. Si aucun robot n'est passé sur les 1 100 autres, l'échec tient au signalement et une soumission le règle. Sinon, soumettre ne changera rien.
L'allocation d'exploration, et ce qui la vide
Une allocation d'exploration ne s'attribue pas, ne se demande pas, ne se conteste pas. Elle découle de deux mesures continues : la rapidité et la constance de votre serveur, et la demande apparente que le domaine a méritée. Un dépôt qui s'essouffle sous la charge fin mars sera ensuite traité avec prudence des semaines durant : un robot se bride plutôt que de faire tomber un hôte fragile.
La majorité des requêtes atterrissent sur des adresses qu'aucun rédacteur n'a demandées. Les logiciels les fabriquent — répertoire, visionneuse, sélecteur de langue, calendrier — et ici chaque générateur produit sa sortie en double.
| Origine des adresses | Ce que cela donne ici | Ordre de grandeur | À qui revient le correctif |
|---|---|---|---|
| L'arborescence de la seconde langue | Chaque avis, programme et notice sous /fr/ | Double le compte dès le départ | Personne : on la contourne, on ne la retire pas |
| Les visionneuses de documents | Un PDF en page, en fichier, en fragment | Trois à cinq par document | Développement : une seule route canonique |
| Les répertoires de membres | Filtres par province, secteur, catégorie, langue | Des dizaines de milliers d'états | Développement : règles robots, canoniques |
| Pages datées, archives non élaguées | Appels d'offres clos, congrès passés, pagination | Une nouvelle cohorte chaque avril | Communications : retirer et regrouper |
Chiffrez, et la forme saute aux yeux. Neuf mille pages réelles deviennent dix-huit mille adresses dès que le français existe, quatre mille documents derrière une visionneuse pèsent un multiple de leur nombre, et la consultation de mardi attend derrière tout cela.
Volumineux par obligation, pas par production
Membres, positions, délibérations
Un répertoire de milliers de membres, une bibliothèque de prises de position, dix ans de comptes rendus, dans les deux langues.
- Plus d'états de filtres que de membres
- Microsites de congrès jamais retirés
Capacités au rythme des appels d'offres
Les firmes qui soumissionnent au fédéral tiennent des fiches de capacités et de réalisations qui ne comptent qu'en version française crédible.
- Du contenu qui expire avec l'exercice
- Des occasions closes toujours en ligne
Facultés et dépôts institutionnels
Programmes, profils du personnel, résultats de recherche, un dépôt, chaque faculté à son rythme, aucune ne supprimant rien.
- Archives de cours gardées pour l'agrément
- Contenus repris d'une faculté à l'autre
Domaines de pratique et commentaires
Domaines de pratique bilingues, notices des associés et des années de commentaires visant les évaluateurs de l'approvisionnement.
- Chaque notice existe en double
- Le commentaire vieillit mais reste en ligne
Chaque profil échoue dans le même sens. Ce qui compte ce trimestre-ci — un appel d'offres ouvert, un nouveau programme, un mémoire sur un projet de loi en comité — est la page la plus récente et la moins liée du site, quand ce qui a cessé de compter en 2014 remplit toutes les archives.
Le calendrier complique l'affaire. La demande suivant l'exercice financier, comparer un mois au précédent n'apprend rien. La seule référence défendable est le même point du cycle précédent : quelle part du matériel d'avril dernier était reprise fin mai.
Un sitemap est une déclaration, pas une formalité
Sur la plupart des sites, le sitemap est un fichier qu'une extension écrit et que personne n'ouvre. Sur un site bilingue à bibliothèque documentaire, c'est le seul moyen fiable de déclarer ce qui existe et ce qui a bougé ; sa construction décide de la lisibilité de la réponse.
Le Hub l'accepte en téléversement ou par adresse, puis le parcourt récursivement sur trois niveaux : un index qui pointe vers d'autres index, lesquels pointent vers les fichiers d'adresses. Une tâche avale 1 000 sitemaps : le découpage est réaliste à cette échelle.
Une arborescence qui tient un exercice complet
Découpée par langue d'abord, par rythme de changement ensuite, pour qu'une branche bloquée se dénonce.
- Un seul fichier au sommet. Un index unique vers lequel on pointe le moteur et le Hub, nommant les index de section.
- La langue décide du deuxième niveau. L'anglais et le français ont chacun leur index : « le site est-il indexé » devient deux réponses, pas une moyenne.
- Le rythme de changement décide du troisième. Pages stables, publications, contenu daté et archives, séparés.
- Les dates doivent être honnêtes. Un lastmod qui bouge à chaque reconstruction nocturne apprend au robot à ignorer vos dates — un risque réel là où une correction de comité et un déploiement se ressemblent pour le CMS.
- Seules les adresses canoniques vivantes y figurent. Rien de redirigé, rien d'absent, aucun noindex, aucune canonique qui désigne ailleurs.
Monté ainsi, le fichier devient un instrument. Si l'index des publications françaises annonce quatre-vingts adresses et n'en fait atteindre que vingt quand son jumeau anglais en atteint soixante-quatorze, le défaut tient à une branche.
Rarement modifié
Mandat, gouvernance, coordonnées, programmes et fiches de capacités permanentes.
- Des dates qui ne bougent pas
- Réannoncé après un vrai changement
Écrit pour expirer
Appels d'offres ouverts, programmes du cycle en cours, consultations et congrès.
- Régénéré à partir du registre vivant
- Retiré à la date de clôture
Quatre nombres qui délimitent le module
Dans le panneau, ce module voisine les sections campagne, analytique et suivi de positions, et couvre tout ce qui précède un classement ; la visite guidée de l'espace de travail Semalt reconstruit l'y place délibérément. Quatre chiffres bornent ce qu'il accepte, et aucun ne se négocie.
Débit quotidien, taille de lot, profondeur, simultanéité
Tout plan de soumission pour un grand site bilingue tient dans ces quatre contraintes.
- Mille URL par jour, par compte. Le débit de travail du tracker ; la capacité inutilisée ne s'accumule pas.
- Dix mille URL dans un seul lot. Cela régit ce que vous remettez d'un coup, pas la vitesse d'écoulement : un lot plein vaut dix jours de traitement.
- Sitemaps analysés sur trois niveaux. Fournissez un fichier ou une adresse ; les index imbriqués sont suivis, jusqu'à 1 000 par tâche.
- Deux tâches actives, vingt en file. La simultanéité ne varie pas : une migration bilingue s'exécute en séquence, dans l'ordre fixé.
Les annonces passent par IndexNow, qui prévient les robots participants — GoogleBot et BingBot notamment — qu'un contenu a paru ou changé à telle adresse. Plutôt que d'attendre qu'un robot repasse dans un recoin du dépôt vu en février, vous levez la main le jour même : décisif pour l'éphémère, une consultation ouverte six semaines.
L'étape du milieu, elle, devient démontrable. Chaque adresse garde une entrée : quel robot, quand, quel statut, et le détail derrière chaque échec. Trois compteurs surplombent ce journal — soumises, atteintes, en échec.
Ce qu'un lot terminé vous dit
Un lot terminé laisse trois totaux et une entrée par adresse. Les totaux ne valent que les uns par rapport aux autres ; le journal tranche à qui revient le problème : développement, serveur ou rédaction.
| Configuration des totaux | Explication la plus probable | Où regarder |
|---|---|---|
| Beaucoup de soumises, peu d'atteintes, peu d'échecs | L'annonce est passée, aucun robot n'est venu | Les liens internes ; les orphelines attendent |
| Atteintes presque égales aux soumises, résultats plats | La récupération va bien ; les pages ont été écartées | Pages minces, pages d'atterrissage de PDF |
| Échecs concentrés dans la branche française | Un défaut de routage ou de gabarit d'un côté | Le texte d'erreur, puis le fichier de cette branche |
| Échecs dispersés et peu nombreux | Le serveur a manqué de souffle en exploration | Les temps de réponse à ces moments-là |
| Réponses propres sur des documents jamais sortis | Le moteur a regardé, puis a décliné | Rien ici : la question devient éditoriale |
C'est cette ligne qui justifie le journal adresse par adresse. Une réponse normale consignée prouve que le robot est venu et que le serveur a tenu ; sur la conservation, rien. Séparer les deux transforme « le trafic a baissé » en une tâche munie d'un responsable.
Le doublon bilingue qu'on ne peut pas regrouper
Le français n'est pas ici un second marché facultatif. Pour une association aux membres répartis dans tout le pays, pour quiconque soumissionne au fédéral, pour tout organisme qui dessert Gatineau, c'est une condition d'exercice. Les conseils habituels sur le contenu dupliqué ne valent donc rien — une obligation ne se fusionne pas — et il reste à rendre les deux arborescences lisibles comme telles.
| Montage | Ce qu'un moteur en comprend | Le prix | Correctif praticable |
|---|---|---|---|
| Français de traduction automatique | Un doublon plus faible de tout le reste | La moitié du débit sur des pages sans lendemain | Réécrire ce qui porte la demande, supprimer le reste |
| Langue choisie par paramètre ou témoin | Une adresse qui répond autrement à chaque visite | La version française reste invisible | Chemins distincts par langue, déclarés l'un vers l'autre |
| Un PDF qui concurrence sa page d'atterrissage | Deux adresses pour une seule question | Les requêtes se divisent, aucune ne se consolide | Trancher : la page HTML le mérite en général |
| Pages datées laissées en ligne après la clôture | Un corpus périmé mais valide | L'allocation part dans l'exercice précédent | Retrait automatique à la date de clôture |
Choisir ce qui passe en premier est affaire de preuves. Les vues Search Console du même panneau disent quelles pages récoltent clics et impressions, et une vue de dynamique des mots-clés suit les entrées et sorties du top 10. Les deux langues pesant ici le même poids, c'est la répartition linguistique qui fait l'analyse, jamais le filtre par pays. Les exports vont à 10 000 lignes en CSV ou JSON, et Stream, l'assistant rattaché à My SEO, accepte une liste d'URL par lots.
Reste la contrainte qu'aucun logiciel ne lève : comité, révision en langues officielles et, dans tout ce qui touche à l'État, validation juridique. Un conseil qui suppose qu'une page se corrige le jour même ne vaut rien ici : mettez les travaux de structure en file très tôt.
Ce qui avance pendant que la validation attend
Les paramètres et les règles de retrait exigent du développement. Le travail sur les mots-clés et les liens, non.
- La campagne avance en parallèle. AutoSEO, à 149 USD par mois pour un domaine, couvre la découverte des mots-clés, leur priorisation et la création de liens hors du processus de mise en ligne.
- Contrôle manuel là où la culture de révision l'exige. FullSEO, à 500 USD, ajoute la sélection manuelle des mots-clés avec repli automatique, un placement ciblé selon la notation du domaine, une révision humaine avant toute modification.
- Quatre à huit semaines avant que quoi que ce soit paraisse. L'intervalle habituel jusqu'au premier mouvement mesurable, et une raison d'amorcer tôt.
Questions qui reviennent
Pousser une URL dans le module la fait-elle entrer dans l'index ?
Non, et le fournisseur qui prétend le contraire en met trop. La soumission informe les robots participants qu'un contenu est nouveau ou modifié à cette adresse. La récupération, et la décision de le garder, restent au moteur seul.
Faut-il traiter le français comme une tâche distincte ?
Oui, pour le diagnostic plus que pour la technique. Avec un index par langue, les compteurs traitent chaque branche séparément : un blocage se voit dans les totaux, et non six mois plus tard par la plainte d'un membre de Gatineau.
Les PDF ont-ils leur place dans un sitemap ?
Les documents qui répondent seuls à une question — une norme, une ligne directrice, un rapport annuel cherché par son nom — peuvent y figurer. Ceux qui ont une vraie page d'atterrissage, non : inscrivez la page, sinon un robot voit deux adresses pour un contenu.
Pourquoi mille par jour si l'on peut en remettre dix mille ?
Les deux nombres décrivent des choses différentes : l'un est la taille d'une remise, l'autre le débit. Un lot plein programme dix jours de travail ; le calendrier se bâtit sur le chiffre quotidien.
Nos appels d'offres ferment dans six semaines. Faut-il les annoncer ?
Annoncez-les le jour de leur publication : six semaines, c'est court à côté d'un intervalle d'exploration spontanée. La valeur durable est au-dessus, dans les pages de capacités et de secteurs qui traversent les cycles.
Le calcul final, et une première semaine
Prenons un cas plausible. Une association change de plateforme : 9 000 pages par langue, 4 000 documents, un répertoire de membres, quinze ans de comptes rendus. Tout déménage : environ 40 000 adresses à redécouvrir.
À mille par jour, cela fait quarante jours — de l'arithmétique, pas un défaut de l'outil, et mieux vaut le dire avant qu'on promette au conseil un rétablissement en un mois. Quatre lots contiennent le volume ; le débit quotidien commande le calendrier.
Quarante jours ne font mal que si ce qui compte arrive le trente-huitième : ordonnancé selon la valeur mesurée dans les deux langues, tout ce qui rapporte passe en deux semaines.
| Jours | Contenu | Volume | Pourquoi à cette place |
|---|---|---|---|
| 1–4 | Mandat, adhésion, capacités, coordonnées, deux langues | 3 600 | Cherché par son nom ; la porte d'entrée |
| 5–10 | Programmes du cycle, consultations, appels d'offres ouverts | 5 400 | Daté ; une semaine perdue ne se rattrape pas |
| 11–22 | Publications à impressions enregistrées, et leurs pages | 11 000 | La demande prouvée avant le spéculatif |
| 23–40 | États de répertoire, listes par étiquette, comptes rendus d'avant 2015 | 20 000 | Presque aucune valeur mesurée ; la plupart à regrouper |
Cette dernière ligne mérite un examen avant d'avaler trois semaines de capacité : là où vingt mille adresses n'ont récolté aucune impression de l'année, dans une langue comme dans l'autre, la réponse est le regroupement ou la suppression, pas l'annonce.
Commencez petit, et cette semaine. Ramenez le sitemap aux adresses canoniques vivantes, découpez-le par langue puis par rythme de changement, exportez les pages qui récoltent déjà des impressions, et travaillez la liste au rythme du module. Pour réunir indexation, analytique et campagne au même endroit, ouvrez le tableau de bord Semalt et ajoutez votre propriété. Ce qu'une équipe externe prend en charge figure sur notre page services, et d'autres lectures sur le blogue.