1. Crawl budget en bref
Le crawl budget est le nombre de pages que Googlebot crawle sur votre site sur une période donnée. Limité par deux facteurs :
- Crawl rate limit : la fréquence maximale à laquelle Googlebot peut crawler sans surcharger votre serveur. Si votre serveur retourne des erreurs 5xx, Google ralentit. Si tout va bien, il peut augmenter.
- Crawl demand : combien Google souhaite crawler. Influencé par la popularité du site (backlinks, mentions), la fraîcheur (mises à jour fréquentes), et la qualité perçue.
Le crawl budget se mesure en URL crawlées par jour. Pour un site moyen, Google crawle quelques centaines d'URL/jour. Pour un site très autoritaire, plusieurs millions/jour.
2. À qui ça parle vraiment
Google a clarifié sa position : le crawl budget devient un sujet à partir de quelques milliers de pages, et critique au-delà de 1 million.
| Taille site | Crawl budget |
|---|---|
| < 1 000 pages | Non-sujet. Ignorez. |
| 1 000 - 10 000 pages | Surveiller, pas paniquer. |
| 10 000 - 100 000 pages | Optimisation active. |
| > 100 000 pages | Critique. Dédié. |
3. Mesurer dans Search Console
Google Search Console > Paramètres > Statistiques sur l'exploration. Rapport mensuel avec :
- Demandes d'exploration totales : nombre de requêtes Googlebot sur 90 jours.
- Taille moyenne de la réponse : poids moyen des pages crawlées (en KB).
- Temps moyen de réponse : TTFB serveur. Cible < 200 ms.
- Statut hôte : disponibilité du serveur, codes HTTP retournés.
- Répartition par type de fichier : HTML, images, JS, CSS, autres.
Signaux d'alerte : chute brutale des requêtes (problème serveur ou robots.txt), temps de réponse qui s'allonge (serveur saturé), forte proportion de 5xx (instabilité).
4. 5 leviers d'optimisation
- Réparer les erreurs 5xx. Chaque 5xx fait baisser le crawl rate limit. Logs serveur + monitoring (Sentry, Uptime Robot).
- Bloquer les URL inutiles via robots.txt. Pages admin, filtres infinis, pages de recherche internes, paramètres de tri. Diminue la surface à crawler.
- Consolider les redirections. Chaînes 301 → 301 → 301 multiplient les requêtes. Toujours redirection directe ancienne URL → URL finale.
- Supprimer/noindex les pages thin et dupliquées. Si Google crawle 50 % de pages inutiles, c'est 50 % de crawl budget gaspillé.
- Améliorer la performance serveur. TTFB < 200 ms ouvre la porte à un crawl rate limit plus élevé. CDN edge + cache approprié.
Lectures et services connexes
FAQ — Crawl budget
01C'est quoi le crawl budget ?
02À partir de combien de pages faut-il s'inquiéter ?
03Comment voir mon crawl budget dans GSC ?
04Comment optimiser le crawl budget ?
05Les paramètres URL gaspillent-ils le crawl budget ?
06Le crawl budget influence-t-il les Core Web Vitals ?
En résumé
Le crawl budget est un sujet survendu en SEO. Pour 90 % des sites (TPE, PME, B2B service), c'est un non-sujet. Pour les 10 % concernés (e-commerce gros catalogue, marketplace, presse haut volume), c'est critique.
Avant de parler de crawl budget, vérifier que les bases sont solides : zéro 5xx, robots.txt propre, redirections directes, pages thin nettoyées. C'est souvent ce qui résout le "problème de crawl" sans avoir à toucher au crawl budget directement.
Audit étendu pour gros sites
Pour les sites > 5 000 SKU e-commerce ou > 100 articles éditoriaux, l'audit Yvarn étendu (60-120 pages) inclut l'analyse crawl budget complète à partir de 3 500 €.
Découvrir l'audit Yvarn
Fondateur d'Yvarn, agence SEO à Bordeaux. À propos.