Deux langues officielles, ce sont deux adresses pour chaque idée, et un moteur applique une seule allocation d'exploration aux deux. Voici l'étape dont personne ne rend compte : comment une adresse devient connue, ce qui épuise l'allocation dans un organisme lourd en documents, et ce que l'Indexing Hub de Semalt permet d'observer.

Demandez à une équipe des communications de la capitale nationale combien de pages compte son site : le CMS répond au chiffre près. Demandez ce qu'un moteur en retient : plus de réponse. Le second nombre reste loin derrière le premier, sans que rien n'ait sonné l'alarme.

La cause est structurelle. Tout ce que publie une association, un fournisseur de l'État, une faculté ou un cabinet professionnel existe deux fois avant qu'une page nouvelle soit commandée. Ajoutez une bibliothèque de PDF, un répertoire de membres, des pages de programmes et d'appels d'offres calées sur le cycle d'avril à mars, des archives jamais élaguées depuis 2011 : le compte d'adresses dépasse le plan éditorial de plusieurs longueurs.

Ce dont il est question. Le classement et la qualité rédactionnelle relèvent d'un autre texte. Le sujet est en amont : un robot entend-il parler d'une adresse, y consacre-t-il une requête, et comment surveiller les deux ?
Point de départ · Trois étapes, un seul mot

Publié et trouvé ne sont pas le même état

Entre la publication et un résultat s'intercalent trois étapes, dont chacune échoue à sa manière. Le moteur doit apprendre que l'adresse existe. Un robot doit la demander et recevoir quelque chose d'exploitable. Le moteur juge enfin s'il conserve ce qui lui revient. Ramener les trois au seul mot « indexation » coûte des trimestres : retoucher une page ne sert à rien tant qu'aucun robot ne l'a réclamée, et la réannoncer ne sert à rien une fois qu'elle a été écartée sur le fond.

  • La découverte est affaire de signalement. Si la version française d'un mémoire dépend d'un sélecteur qu'aucun robot n'actionne, elle n'a jamais été annoncée.
  • L'exploration est affaire de capacité. Un robot consacre chaque jour un effort limité à votre domaine, et les filtres d'un répertoire l'absorbent en entier.
  • La conservation est affaire de jugement. Une page de programme de deux lignes, ou une coquille HTML avec un seul lien de téléchargement, perd ce jugement.
  • Chaque étape laisse ses traces. Un journal vide désigne le signalement ; une visite consignée, une réponse propre et rien dans les résultats désignent autre chose.

Un exemple fixe la distinction. Une association déplace sa bibliothèque bilingue : 1 600 documents changent d'adresse. Dix semaines plus tard, 500 se retrouvent. Si aucun robot n'est passé sur les 1 100 autres, l'échec tient au signalement et une soumission le règle. Sinon, soumettre ne changera rien.

Situez d'abord l'étape. La question n'est pas comment faire indexer des pages, mais à quelle étape elles se sont arrêtées — un point de fait, pas d'opinion.
Mécanique · Où partent les requêtes

L'allocation d'exploration, et ce qui la vide

Une allocation d'exploration ne s'attribue pas, ne se demande pas, ne se conteste pas. Elle découle de deux mesures continues : la rapidité et la constance de votre serveur, et la demande apparente que le domaine a méritée. Un dépôt qui s'essouffle sous la charge fin mars sera ensuite traité avec prudence des semaines durant : un robot se bride plutôt que de faire tomber un hôte fragile.

La majorité des requêtes atterrissent sur des adresses qu'aucun rédacteur n'a demandées. Les logiciels les fabriquent — répertoire, visionneuse, sélecteur de langue, calendrier — et ici chaque générateur produit sa sortie en double.

Origine des adresses Ce que cela donne ici Ordre de grandeur À qui revient le correctif
L'arborescence de la seconde langue Chaque avis, programme et notice sous /fr/ Double le compte dès le départ Personne : on la contourne, on ne la retire pas
Les visionneuses de documents Un PDF en page, en fichier, en fragment Trois à cinq par document Développement : une seule route canonique
Les répertoires de membres Filtres par province, secteur, catégorie, langue Des dizaines de milliers d'états Développement : règles robots, canoniques
Pages datées, archives non élaguées Appels d'offres clos, congrès passés, pagination Une nouvelle cohorte chaque avril Communications : retirer et regrouper

Chiffrez, et la forme saute aux yeux. Neuf mille pages réelles deviennent dix-huit mille adresses dès que le français existe, quatre mille documents derrière une visionneuse pèsent un multiple de leur nombre, et la consultation de mardi attend derrière tout cela.

9 000
pages de contenu réelles
18 000
une fois le français en ligne
60 000+
états de répertoire accessibles
400
pages à demande avérée
Retirer vaut mieux que soumettre. Écarter cinquante mille adresses sans intérêt du chemin d'un robot rapporte plus que tout volume d'annonces, et coûte du temps de configuration, pas une ligne au prochain budget.
Profils · Quatre silhouettes d'ici

Volumineux par obligation, pas par production

Associations

Membres, positions, délibérations

Un répertoire de milliers de membres, une bibliothèque de prises de position, dix ans de comptes rendus, dans les deux langues.

  • Plus d'états de filtres que de membres
  • Microsites de congrès jamais retirés
Fournisseurs

Capacités au rythme des appels d'offres

Les firmes qui soumissionnent au fédéral tiennent des fiches de capacités et de réalisations qui ne comptent qu'en version française crédible.

  • Du contenu qui expire avec l'exercice
  • Des occasions closes toujours en ligne
Universités

Facultés et dépôts institutionnels

Programmes, profils du personnel, résultats de recherche, un dépôt, chaque faculté à son rythme, aucune ne supprimant rien.

  • Archives de cours gardées pour l'agrément
  • Contenus repris d'une faculté à l'autre
Services professionnels

Domaines de pratique et commentaires

Domaines de pratique bilingues, notices des associés et des années de commentaires visant les évaluateurs de l'approvisionnement.

  • Chaque notice existe en double
  • Le commentaire vieillit mais reste en ligne

Chaque profil échoue dans le même sens. Ce qui compte ce trimestre-ci — un appel d'offres ouvert, un nouveau programme, un mémoire sur un projet de loi en comité — est la page la plus récente et la moins liée du site, quand ce qui a cessé de compter en 2014 remplit toutes les archives.

Le calendrier complique l'affaire. La demande suivant l'exercice financier, comparer un mois au précédent n'apprend rien. La seule référence défendable est le même point du cycle précédent : quelle part du matériel d'avril dernier était reprise fin mai.

Signalement · Le sitemap comme instrument

Un sitemap est une déclaration, pas une formalité

Sur la plupart des sites, le sitemap est un fichier qu'une extension écrit et que personne n'ouvre. Sur un site bilingue à bibliothèque documentaire, c'est le seul moyen fiable de déclarer ce qui existe et ce qui a bougé ; sa construction décide de la lisibilité de la réponse.

Le Hub l'accepte en téléversement ou par adresse, puis le parcourt récursivement sur trois niveaux : un index qui pointe vers d'autres index, lesquels pointent vers les fichiers d'adresses. Une tâche avale 1 000 sitemaps : le découpage est réaliste à cette échelle.

Structure · Trois niveaux

Une arborescence qui tient un exercice complet

Découpée par langue d'abord, par rythme de changement ensuite, pour qu'une branche bloquée se dénonce.

sans supplément
  • Un seul fichier au sommet. Un index unique vers lequel on pointe le moteur et le Hub, nommant les index de section.
  • La langue décide du deuxième niveau. L'anglais et le français ont chacun leur index : « le site est-il indexé » devient deux réponses, pas une moyenne.
  • Le rythme de changement décide du troisième. Pages stables, publications, contenu daté et archives, séparés.
  • Les dates doivent être honnêtes. Un lastmod qui bouge à chaque reconstruction nocturne apprend au robot à ignorer vos dates — un risque réel là où une correction de comité et un déploiement se ressemblent pour le CMS.
  • Seules les adresses canoniques vivantes y figurent. Rien de redirigé, rien d'absent, aucun noindex, aucune canonique qui désigne ailleurs.

Monté ainsi, le fichier devient un instrument. Si l'index des publications françaises annonce quatre-vingts adresses et n'en fait atteindre que vingt quand son jumeau anglais en atteint soixante-quatorze, le défaut tient à une branche.

Stable

Rarement modifié

Mandat, gouvernance, coordonnées, programmes et fiches de capacités permanentes.

  • Des dates qui ne bougent pas
  • Réannoncé après un vrai changement
Daté

Écrit pour expirer

Appels d'offres ouverts, programmes du cycle en cours, consultations et congrès.

  • Régénéré à partir du registre vivant
  • Retiré à la date de clôture
Deux en marche, vingt en attente. Le module traite deux tâches de sitemap et en garde vingt en file. Rien n'est jeté, mais une migration lancée en quarante soumissions ne se suit plus.
Instrument · Indexing Hub

Quatre nombres qui délimitent le module

Dans le panneau, ce module voisine les sections campagne, analytique et suivi de positions, et couvre tout ce qui précède un classement ; la visite guidée de l'espace de travail Semalt reconstruit l'y place délibérément. Quatre chiffres bornent ce qu'il accepte, et aucun ne se négocie.

Capacité · Bâtissez le calendrier là-dessus

Débit quotidien, taille de lot, profondeur, simultanéité

Tout plan de soumission pour un grand site bilingue tient dans ces quatre contraintes.

compris dans le panneau
  • Mille URL par jour, par compte. Le débit de travail du tracker ; la capacité inutilisée ne s'accumule pas.
  • Dix mille URL dans un seul lot. Cela régit ce que vous remettez d'un coup, pas la vitesse d'écoulement : un lot plein vaut dix jours de traitement.
  • Sitemaps analysés sur trois niveaux. Fournissez un fichier ou une adresse ; les index imbriqués sont suivis, jusqu'à 1 000 par tâche.
  • Deux tâches actives, vingt en file. La simultanéité ne varie pas : une migration bilingue s'exécute en séquence, dans l'ordre fixé.
1 000
URL par jour
10 000
URL dans un lot
3
niveaux analysés
1 000
sitemaps par tâche

Les annonces passent par IndexNow, qui prévient les robots participants — GoogleBot et BingBot notamment — qu'un contenu a paru ou changé à telle adresse. Plutôt que d'attendre qu'un robot repasse dans un recoin du dépôt vu en février, vous levez la main le jour même : décisif pour l'éphémère, une consultation ouverte six semaines.

À dire avant que quiconque bâtisse là-dessus. Soumettre une URL n'équivaut pas à la faire indexer. Une annonce transmet un seul fait : quelque chose a changé à cet endroit. Qu'une récupération suive, et qu'on en conserve quoi que ce soit, relève du moteur et du contenu de la page. Aucun fournisseur, Semalt compris, ne vend de l'indexation ; celui qui la propose promet un résultat qu'il ne gouverne pas.

L'étape du milieu, elle, devient démontrable. Chaque adresse garde une entrée : quel robot, quand, quel statut, et le détail derrière chaque échec. Trois compteurs surplombent ce journal — soumises, atteintes, en échec.

2
tâches de sitemap simultanées
20
tâches de plus en file
3
compteurs en direct
Lecture · Interpréter le résultat

Ce qu'un lot terminé vous dit

Un lot terminé laisse trois totaux et une entrée par adresse. Les totaux ne valent que les uns par rapport aux autres ; le journal tranche à qui revient le problème : développement, serveur ou rédaction.

Configuration des totaux Explication la plus probable Où regarder
Beaucoup de soumises, peu d'atteintes, peu d'échecs L'annonce est passée, aucun robot n'est venu Les liens internes ; les orphelines attendent
Atteintes presque égales aux soumises, résultats plats La récupération va bien ; les pages ont été écartées Pages minces, pages d'atterrissage de PDF
Échecs concentrés dans la branche française Un défaut de routage ou de gabarit d'un côté Le texte d'erreur, puis le fichier de cette branche
Échecs dispersés et peu nombreux Le serveur a manqué de souffle en exploration Les temps de réponse à ces moments-là
Réponses propres sur des documents jamais sortis Le moteur a regardé, puis a décliné Rien ici : la question devient éditoriale

C'est cette ligne qui justifie le journal adresse par adresse. Une réponse normale consignée prouve que le robot est venu et que le serveur a tenu ; sur la conservation, rien. Séparer les deux transforme « le trafic a baissé » en une tâche munie d'un responsable.

Prenez une mesure avant de commencer. Notez combien d'adresses de chaque branche affichent déjà une visite consignée. Tout ce que vous affirmerez ensuite se mesure de là ; sans cela, deux mois de travail sont indéfendables.
Complication · Deux arborescences, un calendrier

Le doublon bilingue qu'on ne peut pas regrouper

Le français n'est pas ici un second marché facultatif. Pour une association aux membres répartis dans tout le pays, pour quiconque soumissionne au fédéral, pour tout organisme qui dessert Gatineau, c'est une condition d'exercice. Les conseils habituels sur le contenu dupliqué ne valent donc rien — une obligation ne se fusionne pas — et il reste à rendre les deux arborescences lisibles comme telles.

Montage Ce qu'un moteur en comprend Le prix Correctif praticable
Français de traduction automatique Un doublon plus faible de tout le reste La moitié du débit sur des pages sans lendemain Réécrire ce qui porte la demande, supprimer le reste
Langue choisie par paramètre ou témoin Une adresse qui répond autrement à chaque visite La version française reste invisible Chemins distincts par langue, déclarés l'un vers l'autre
Un PDF qui concurrence sa page d'atterrissage Deux adresses pour une seule question Les requêtes se divisent, aucune ne se consolide Trancher : la page HTML le mérite en général
Pages datées laissées en ligne après la clôture Un corpus périmé mais valide L'allocation part dans l'exercice précédent Retrait automatique à la date de clôture

Choisir ce qui passe en premier est affaire de preuves. Les vues Search Console du même panneau disent quelles pages récoltent clics et impressions, et une vue de dynamique des mots-clés suit les entrées et sorties du top 10. Les deux langues pesant ici le même poids, c'est la répartition linguistique qui fait l'analyse, jamais le filtre par pays. Les exports vont à 10 000 lignes en CSV ou JSON, et Stream, l'assistant rattaché à My SEO, accepte une liste d'URL par lots.

Reste la contrainte qu'aucun logiciel ne lève : comité, révision en langues officielles et, dans tout ce qui touche à l'État, validation juridique. Un conseil qui suppose qu'une page se corrige le jour même ne vaut rien ici : mettez les travaux de structure en file très tôt.

My SEO · Autour de la file d'approbation

Ce qui avance pendant que la validation attend

Les paramètres et les règles de retrait exigent du développement. Le travail sur les mots-clés et les liens, non.

149 / 500 USD par mois · par domaine
  • La campagne avance en parallèle. AutoSEO, à 149 USD par mois pour un domaine, couvre la découverte des mots-clés, leur priorisation et la création de liens hors du processus de mise en ligne.
  • Contrôle manuel là où la culture de révision l'exige. FullSEO, à 500 USD, ajoute la sélection manuelle des mots-clés avec repli automatique, un placement ciblé selon la notation du domaine, une révision humaine avant toute modification.
  • Quatre à huit semaines avant que quoi que ce soit paraisse. L'intervalle habituel jusqu'au premier mouvement mesurable, et une raison d'amorcer tôt.

Questions qui reviennent

Pousser une URL dans le module la fait-elle entrer dans l'index ?

Non, et le fournisseur qui prétend le contraire en met trop. La soumission informe les robots participants qu'un contenu est nouveau ou modifié à cette adresse. La récupération, et la décision de le garder, restent au moteur seul.

Faut-il traiter le français comme une tâche distincte ?

Oui, pour le diagnostic plus que pour la technique. Avec un index par langue, les compteurs traitent chaque branche séparément : un blocage se voit dans les totaux, et non six mois plus tard par la plainte d'un membre de Gatineau.

Les PDF ont-ils leur place dans un sitemap ?

Les documents qui répondent seuls à une question — une norme, une ligne directrice, un rapport annuel cherché par son nom — peuvent y figurer. Ceux qui ont une vraie page d'atterrissage, non : inscrivez la page, sinon un robot voit deux adresses pour un contenu.

Pourquoi mille par jour si l'on peut en remettre dix mille ?

Les deux nombres décrivent des choses différentes : l'un est la taille d'une remise, l'autre le débit. Un lot plein programme dix jours de travail ; le calendrier se bâtit sur le chiffre quotidien.

Nos appels d'offres ferment dans six semaines. Faut-il les annoncer ?

Annoncez-les le jour de leur publication : six semaines, c'est court à côté d'un intervalle d'exploration spontanée. La valeur durable est au-dessus, dans les pages de capacités et de secteurs qui traversent les cycles.

Arithmétique · Quarante mille adresses

Le calcul final, et une première semaine

Prenons un cas plausible. Une association change de plateforme : 9 000 pages par langue, 4 000 documents, un répertoire de membres, quinze ans de comptes rendus. Tout déménage : environ 40 000 adresses à redécouvrir.

À mille par jour, cela fait quarante jours — de l'arithmétique, pas un défaut de l'outil, et mieux vaut le dire avant qu'on promette au conseil un rétablissement en un mois. Quatre lots contiennent le volume ; le débit quotidien commande le calendrier.

40 000
adresses après le déménagement
40
jours au débit quotidien
4
lots de dix mille
10
jours pour ce qui rapporte

Quarante jours ne font mal que si ce qui compte arrive le trente-huitième : ordonnancé selon la valeur mesurée dans les deux langues, tout ce qui rapporte passe en deux semaines.

Jours Contenu Volume Pourquoi à cette place
1–4 Mandat, adhésion, capacités, coordonnées, deux langues 3 600 Cherché par son nom ; la porte d'entrée
5–10 Programmes du cycle, consultations, appels d'offres ouverts 5 400 Daté ; une semaine perdue ne se rattrape pas
11–22 Publications à impressions enregistrées, et leurs pages 11 000 La demande prouvée avant le spéculatif
23–40 États de répertoire, listes par étiquette, comptes rendus d'avant 2015 20 000 Presque aucune valeur mesurée ; la plupart à regrouper

Cette dernière ligne mérite un examen avant d'avaler trois semaines de capacité : là où vingt mille adresses n'ont récolté aucune impression de l'année, dans une langue comme dans l'autre, la réponse est le regroupement ou la suppression, pas l'annonce.

Commencez petit, et cette semaine. Ramenez le sitemap aux adresses canoniques vivantes, découpez-le par langue puis par rythme de changement, exportez les pages qui récoltent déjà des impressions, et travaillez la liste au rythme du module. Pour réunir indexation, analytique et campagne au même endroit, ouvrez le tableau de bord Semalt et ajoutez votre propriété. Ce qu'une équipe externe prend en charge figure sur notre page services, et d'autres lectures sur le blogue.

Le rappel, une dernière fois. Rien de tout cela n'oblige un moteur à conserver une page. Sitemaps, lots et annonces suppriment toute excuse pour qu'une adresse passe inaperçue, dans les deux langues. La conservation se décide sur la page, et cette décision n'est ni la vôtre ni la nôtre.