Crawl

Aussi appelé : Exploration, Crawling

  • Concept
  • Intermédiaire
  • Transversal
  • Toujours utilisé

En bref

Le crawl est l'action, pour un robot de moteur de recherche, de parcourir automatiquement les pages d'un site en suivant ses liens.

Définition complète

Le crawl (ou exploration) désigne l’action par laquelle un robot de moteur de recherche parcourt automatiquement les pages d’un site, en suivant les liens qu’il trouve, pour découvrir du contenu nouveau ou mis à jour. C’est la toute première étape du parcours d’une page, avant l’indexation puis le classement dans les résultats de recherche.

On appelle souvent la quantité de pages qu’un moteur accepte d’explorer sur un site son « budget de crawl » : plus un site est gros ou lent, plus ce budget doit être utilisé intelligemment, en évitant de gaspiller l’exploration sur des pages sans intérêt.

Attention : un crawl réussi ne garantit jamais une indexation. Une page peut être explorée régulièrement par les robots sans jamais être jugée assez utile pour être enregistrée dans l’index du moteur.

À quoi ça sert

Suivre le crawl d’un site permet de vérifier que les robots des moteurs de recherche accèdent bien aux pages importantes, et pas seulement à des pages secondaires ou en double.

Cette notion aide à repérer des problèmes techniques invisibles à l’œil nu : des liens cassés, des pages orphelines que personne ne relie, ou des zones du site que les robots explorent trop rarement pour espérer un bon classement.

Sur les grands sites, optimiser le crawl en supprimant les pages inutiles et en clarifiant la structure des liens permet de concentrer l’attention des robots sur les pages qui génèrent réellement du trafic ou des ventes.

Cas d'usage typiques

– Diagnostiquer : certaines pages importantes ne sont jamais visitées par les robots ? / Vérifier la structure des liens internes qui y mènent.
– Prioriser : un site de plusieurs milliers de pages gaspille son budget de crawl ? / Réduire l’exploration des pages sans valeur, comme les doublons.
– Surveiller : un site vient de changer d’adresse ou de structure ? / Vérifier dans les journaux serveur que les robots suivent bien les nouvelles pages.
– Corriger : des pages génèrent des erreurs techniques repérées lors du crawl ? / Les corriger pour ne pas gaspiller l’attention des robots.
– Expliquer : un client demande pourquoi certaines pages sont ignorées par Google ? / Montrer que le crawl n’a peut-être jamais atteint ces pages.

Ce que tu sauras faire

Analyser le comportement d'exploration des robots sur un site, repérer les pages mal explorées et prioriser les corrections techniques utiles.

Mises en situation

Situation 1 : un site vitrine avec des pages orphelines

Contexte : Un artisan menuisier a créé dix pages pour présenter ses réalisations, mais aucune n’est reliée depuis le menu principal du site.

Application : Un consultant SEO analyse le crawl du site et remarque que ces pages ne sont jamais explorées, car aucun lien n’y mène.

Résultat attendu : En ajoutant des liens depuis la page d’accueil, les robots découvrent enfin ces pages et peuvent les explorer régulièrement.

Situation 2 : un site e-commerce qui gaspille son budget de crawl

Contexte : Une boutique en ligne génère automatiquement des milliers de pages de filtres (couleur, taille, prix) qui n’ont aucun intérêt pour les visiteurs.

Application : L’équipe technique bloque l’exploration de ces pages de filtres pour concentrer l’attention des robots sur les fiches produits principales.

Résultat attendu : Les robots explorent plus souvent les pages qui comptent réellement pour les ventes, ce qui améliore leur fraîcheur dans l’index.

Situation 3 : une refonte de site mal préparée

Contexte : Une mairie refait son site internet et change l’adresse de toutes ses pages sans prévenir personne.

Application : Après la mise en ligne, le webmestre surveille le crawl du nouveau site pour vérifier que les robots retrouvent bien toutes les anciennes pages à leur nouvelle adresse.

Résultat attendu : Grâce à des redirections mises en place à temps, les robots suivent la transition sans perdre le fil, et le site conserve sa visibilité.

Application guidée : lire des journaux de serveur

Contexte : Un site affiche dans ses journaux serveur que le robot de Google est passé 500 fois en une semaine, mais seulement sur 30 pages différentes, toujours les mêmes.

Question : Que peut-on en conclure sur le reste du site ?

Résultat attendu : On en conclut que le robot concentre son exploration sur une petite partie du site seulement : il faut vérifier si les autres pages sont bien reliées, utiles, et pas accidentellement bloquées.

Application guidée : comparer deux périodes de crawl

Contexte : Le nombre de pages explorées par les robots est passé de 2 000 par mois à 500 par mois après une mise à jour du site.

Question : Quelles hypothèses faut-il vérifier en priorité ?

Résultat attendu : Il faut vérifier si la mise à jour a introduit un blocage technique, ralenti le temps de chargement des pages, ou supprimé des liens internes qui menaient auparavant vers de nombreuses pages.

Pour bien le retenir

L'analogie

Le crawl, c’est la tournée d’un inspecteur qui visite chaque pièce d’un grand bâtiment pour noter ce qu’il y trouve. S’il ne peut entrer dans une pièce parce que la porte est fermée à clé, ou si personne ne lui indique où se trouve cette pièce, il ne pourra jamais l’inspecter, même si elle est parfaitement rangée à l’intérieur.

« Sans chemin pour y aller, même la plus belle page reste invisible aux robots. »

Pièges à éviter

À ne pas confondre avec

Une confusion très répandue consiste à croire que crawl et indexation sont la même chose. Le crawl est le passage du robot sur une page ; l'indexation est la décision, prise ensuite, de conserver cette page dans la base de données du moteur. Une page peut être explorée sans jamais être indexée.

Un autre piège consiste à penser qu'il faut maximiser le crawl à tout prix. Sur un petit site, ce n'est presque jamais un problème ; sur un très grand site, en revanche, un crawl mal dirigé, avec trop de pages inutiles explorées, peut retarder la découverte des pages qui comptent vraiment.

Évolution historique

Apparition : Depuis les années 1990

Quels changements depuis l’arrivée de l’IA ?

Le principe du crawl reste globalement le même avec l’arrivée de l’intelligence artificielle : un robot suit des liens pour découvrir du contenu. Ce qui change, c’est la multiplication des robots qui explorent désormais le web, notamment ceux des assistants conversationnels, ce qui pousse certains sites à revoir leur stratégie d’ouverture ou de fermeture à ces nouveaux visiteurs automatisés.

Évolution historique

Années 1990 : apparition des premiers robots capables de suivre des liens d’une page à l’autre sur le web naissant.

Années 2000 : le crawl devient un sujet technique à part entière, à mesure que les sites grossissent et que les moteurs affinent leurs méthodes d’exploration.

Années 2010 : apparition de la notion de budget de crawl pour les grands sites, et amélioration de la capacité des robots à lire des pages plus complexes.

Années 2020 : de nouveaux robots liés à l’intelligence artificielle explorent aussi le web, aux côtés des robots historiques des moteurs de recherche.