← Glossaire

Qu'est-ce que le budget de crawl ? Pourquoi c'est important pour le SEO

Définition

Le budget de crawl désigne le nombre de pages qu'un robot de moteur de recherche (comme Googlebot) va demander à votre site dans un laps de temps donné. Il est déterminé par deux facteurs : la limite de taux de crawl (la vitesse à laquelle le robot peut aller sans surcharger votre serveur) et la demande de crawl (à quel point Google souhaite explorer votre site en fonction de sa popularité et de sa fraîcheur).

Pour la plupart des sites petits à moyens, le budget de crawl n'est pas un souci — Google explorera tout. Mais pour les grands sites (dizaines de milliers de pages ou plus), la gestion du budget de crawl devient essentielle pour s'assurer que vos pages importantes sont indexées.

Comment les liens cassés gaspillent le budget de crawl

Chaque fois qu'un robot de moteur de recherche suit un lien vers une page qui renvoie une erreur 404, c'est un crawl gaspillé. Le robot a dépensé du temps et des ressources pour demander une page sans valeur. Sur un grand site avec des centaines de liens cassés, cela s'accumule vite.

Le problème est aggravé par les chaînes de redirection. Une chaîne de trois redirections signifie que le robot fait trois requêtes juste pour atteindre une page — triplant le coût de crawl. Si la chaîne se termine par une 404, les trois requêtes sont gaspillées.

Pourquoi le budget de crawl est important

  • Découverte de nouveau contenu — si le budget de crawl est gaspillé sur des liens cassés et des redirections, les nouvelles pages peuvent mettre plus de temps à être découvertes et indexées.
  • Fraîcheur du contenu — les pages explorées moins fréquemment peuvent afficher des informations obsolètes dans les résultats de recherche.
  • Gestion des grands sites — les sites e-commerce, les sites d'actualités et les plateformes avec des pages générées dynamiquement ont besoin que chaque crawl compte.

Optimiser le budget de crawl

  1. Corriger les liens cassés — lancez un scan de liens cassés pour identifier et résoudre toutes les erreurs 404 et les liens internes cassés.
  2. Éliminer les chaînes de redirection — assurez-vous que les redirections pointent directement vers la destination finale, pas via des URL intermédiaires.
  3. Utiliser robots.txt judicieusement — bloquez l'accès des robots aux pages de faible valeur (zones admin, pages de résultats de recherche, contenu dupliqué).
  4. Soumettre un sitemap XML — aidez les moteurs de recherche à trouver directement vos pages importantes.
  5. Améliorer le temps de réponse du serveur — des serveurs plus rapides permettent aux robots de demander plus de pages dans leur temps imparti.
  6. Éviter les soft 404 — assurez-vous que les pages inexistantes renvoient un vrai code 404, pas un 200 avec du contenu vide.

Vérifier votre budget de crawl

Le rapport « Statistiques d'exploration » de Google Search Console montre combien de pages Googlebot explore par jour, le temps de réponse moyen et les erreurs d'exploration. Ces données vous aident à comprendre si votre budget de crawl est utilisé efficacement.

Pour le volet des liens cassés, Broken Link Scan vous donne une vue complète de chaque URL de votre site qui gaspille du budget de crawl. La surveillance régulière garantit que les liens cassés sont détectés tôt, avant qu'ils n'impactent votre efficacité d'exploration.

On crawle tout le site, puis on continue de surveiller

Commencez à scanner gratuitement

Trouvez et corrigez les liens cassés avant qu'ils n'affectent votre SEO. Sans inscription, sans carte bancaire.

Vérifier les liens cassés