Technique11 min de lecture

Crawl budget Google — quand ça compte

Mythes et réalité du crawl budget. Quand vraiment s'en soucier (spoiler : pas si vous avez 200 pages).

TL;DR

Le crawl budget = nombre de pages crawlées par Googlebot sur une période. Limité par capacité serveur + intérêt Google. Devient critique au-delà de quelques milliers de pages. Pour un site < 1 000 pages : non sujet. Surveillez via GSC > Statistiques exploration. Optimisations : réparer 5xx, bloquer les URL inutiles, consolider les redirections.

Par Mattis Bétourné, fondateur d'Yvarn

Cet article s'adresse aux SEO managers de sites volumineux (e-commerce, éditoriaux, marketplaces) qui veulent savoir si le crawl budget est vraiment leur problème.

1. Crawl budget en bref

Le crawl budget est le nombre de pages que Googlebot crawle sur votre site sur une période donnée. Limité par deux facteurs :

  • Crawl rate limit : la fréquence maximale à laquelle Googlebot peut crawler sans surcharger votre serveur. Si votre serveur retourne des erreurs 5xx, Google ralentit. Si tout va bien, il peut augmenter.
  • Crawl demand : combien Google souhaite crawler. Influencé par la popularité du site (backlinks, mentions), la fraîcheur (mises à jour fréquentes), et la qualité perçue.

Le crawl budget se mesure en URL crawlées par jour. Pour un site moyen, Google crawle quelques centaines d'URL/jour. Pour un site très autoritaire, plusieurs millions/jour.

2. À qui ça parle vraiment

Google a clarifié sa position : le crawl budget devient un sujet à partir de quelques milliers de pages, et critique au-delà de 1 million.

Taille siteCrawl budget
< 1 000 pagesNon-sujet. Ignorez.
1 000 - 10 000 pagesSurveiller, pas paniquer.
10 000 - 100 000 pagesOptimisation active.
> 100 000 pagesCritique. Dédié.

3. Mesurer dans Search Console

Google Search Console > Paramètres > Statistiques sur l'exploration. Rapport mensuel avec :

  • Demandes d'exploration totales : nombre de requêtes Googlebot sur 90 jours.
  • Taille moyenne de la réponse : poids moyen des pages crawlées (en KB).
  • Temps moyen de réponse : TTFB serveur. Cible < 200 ms.
  • Statut hôte : disponibilité du serveur, codes HTTP retournés.
  • Répartition par type de fichier : HTML, images, JS, CSS, autres.

Signaux d'alerte : chute brutale des requêtes (problème serveur ou robots.txt), temps de réponse qui s'allonge (serveur saturé), forte proportion de 5xx (instabilité).

4. 5 leviers d'optimisation

  1. Réparer les erreurs 5xx. Chaque 5xx fait baisser le crawl rate limit. Logs serveur + monitoring (Sentry, Uptime Robot).
  2. Bloquer les URL inutiles via robots.txt. Pages admin, filtres infinis, pages de recherche internes, paramètres de tri. Diminue la surface à crawler.
  3. Consolider les redirections. Chaînes 301 → 301 → 301 multiplient les requêtes. Toujours redirection directe ancienne URL → URL finale.
  4. Supprimer/noindex les pages thin et dupliquées. Si Google crawle 50 % de pages inutiles, c'est 50 % de crawl budget gaspillé.
  5. Améliorer la performance serveur. TTFB < 200 ms ouvre la porte à un crawl rate limit plus élevé. CDN edge + cache approprié.
Pour aller plus loin

FAQ — Crawl budget

01C'est quoi le crawl budget ?
Le crawl budget est le nombre de pages que Googlebot crawle sur votre site sur une période donnée. Limité par deux facteurs : la capacité de votre serveur (crawl rate limit) et l'intérêt de Google pour vos pages (crawl demand). Pour la majorité des sites < 10 000 pages, le crawl budget n'est pas un problème.
02À partir de combien de pages faut-il s'inquiéter ?
Google a officiellement déclaré que le crawl budget devient un sujet à partir de quelques milliers de pages, et critique au-delà de 1 million. Pour un site de 100-1 000 pages, ignorez. Pour 1 000-10 000, surveillez sans paniquer. Au-delà : optimisation active nécessaire.
03Comment voir mon crawl budget dans GSC ?
Google Search Console > Paramètres > Statistiques sur l'exploration. Rapport mensuel montrant : nombre de requêtes Googlebot, taille moyenne réponse, temps moyen de réponse, codes HTTP. Indique les tendances et anomalies. Pour 95 % des sites, c'est suffisant pour piloter.
04Comment optimiser le crawl budget ?
Cinq leviers : (1) réparer les erreurs serveur 5xx, (2) bloquer les pages inutiles via robots.txt (admin, filtres infinis), (3) consolider les redirections (pas de chaînes), (4) supprimer ou noindex les pages thin/dupliquées, (5) améliorer la performance serveur (TTFB < 200ms cible).
05Les paramètres URL gaspillent-ils le crawl budget ?
Oui, parfois massivement. Un e-commerce avec filtres (?couleur=rouge&taille=M&sort=prix) peut générer des millions d'URL pour 1 000 produits. Solutions : robots.txt Disallow sur les paramètres non-SEO, canonical vers URL nues, ou rel="nofollow" sur les liens de filtres internes.
06Le crawl budget influence-t-il les Core Web Vitals ?
Pas directement. CWV mesure l'expérience utilisateur, pas le crawl. Mais un serveur lent dégrade les deux : TTFB élevé = LCP mauvais ET crawl rate limit qui baisse. L'optimisation serveur sert les deux.

En résumé

Le crawl budget est un sujet survendu en SEO. Pour 90 % des sites (TPE, PME, B2B service), c'est un non-sujet. Pour les 10 % concernés (e-commerce gros catalogue, marketplace, presse haut volume), c'est critique.

Avant de parler de crawl budget, vérifier que les bases sont solides : zéro 5xx, robots.txt propre, redirections directes, pages thin nettoyées. C'est souvent ce qui résout le "problème de crawl" sans avoir à toucher au crawl budget directement.

· audit technique gros sites

Audit étendu pour gros sites

Pour les sites > 5 000 SKU e-commerce ou > 100 articles éditoriaux, l'audit Yvarn étendu (60-120 pages) inclut l'analyse crawl budget complète à partir de 3 500 €.

Découvrir l'audit Yvarn
Mattis Bétourné, fondateur d'Yvarn
Mattis Bétourné

Fondateur d'Yvarn, agence SEO à Bordeaux. À propos.