← Retour aux articles

août 22, 2026

Screaming Frog : crawler son site pas à pas

Screaming Frog est l’un des outils les plus utilisés par les consultants SEO, les agences et les éditeurs de sites pour auditer une architecture web. Ce crawler simule le passage d’un robot de moteur de recherche : il explore les URL accessibles, collecte leurs données techniques et les présente dans une interface exploitable. Titres, meta

Screaming Frog : crawler son site pas à pas

Screaming Frog est l’un des outils les plus utilisés par les consultants SEO, les agences et les éditeurs de sites pour auditer une architecture web. Ce crawler simule le passage d’un robot de moteur de recherche : il explore les URL accessibles, collecte leurs données techniques et les présente dans une interface exploitable. Titres, meta descriptions, codes HTTP, balises canoniques, liens internes, images, directives d’indexation ou encore profondeur de clic deviennent ainsi visibles en quelques minutes. Pour un site de quelques centaines de pages comme pour une boutique comptant plusieurs dizaines de milliers de fiches produits, l’outil permet de détecter rapidement les freins qui limitent la visibilité organique.

Mais obtenir un export ne suffit pas. Savoir utiliser Screaming Frog implique de préparer son crawl, d’adapter les réglages au contexte du site et de prioriser les anomalies selon leur impact SEO réel. Dans ce guide pas à pas, découvrez comment crawler votre site avec méthode, lire les principaux rapports et transformer les données collectées en actions concrètes. L’objectif n’est pas de corriger chaque ligne signalée par le logiciel, mais de construire un diagnostic utile, fiable et adapté à vos objectifs de référencement naturel.

Préparer son audit avant de crawler son site avec Screaming Frog

Un crawl pertinent commence avant même de coller une URL dans le logiciel. Sans périmètre défini, vous risquez de produire un rapport très volumineux, difficile à interpréter, ou d’analyser des pages qui ne sont pas stratégiques. La première étape consiste donc à préciser ce que vous cherchez : réaliser un audit technique global, contrôler une migration, repérer des pages non indexables, identifier les contenus dupliqués ou vérifier la qualité du maillage interne.

Installer l’outil et choisir la bonne version

Screaming Frog SEO Spider est disponible sur Windows, macOS et Ubuntu. La version gratuite est très utile pour prendre en main l’outil, mais elle limite l’exploration à 500 URL. Cette limite peut convenir à un site vitrine, à un blog récent ou à une vérification ciblée. Dès que votre site possède un catalogue, des archives, des filtres ou plusieurs langues, la licence payante devient généralement nécessaire. Elle permet notamment de crawler un nombre d’URL beaucoup plus important, de sauvegarder les configurations, d’utiliser certaines intégrations et de planifier des audits réguliers.

Avant le premier audit, vérifiez aussi les ressources disponibles sur votre ordinateur. Un crawl de 50 000 URL peut solliciter fortement la mémoire vive, surtout si vous récupérez le rendu JavaScript, les données de liens et des extractions personnalisées. Dans les préférences, l’option de stockage en base de données peut être préférable pour les projets volumineux. Fermez les logiciels inutiles et évitez de lancer simultanément plusieurs explorations lourdes.

Définir le périmètre et collecter les données de référence

Notez l’URL de départ, le protocole à analyser et la version de domaine attendue. Par exemple, si la version canonique est https://www.exemple.fr/, il faut contrôler que les variantes HTTP, sans www ou avec slash final redirigent correctement vers cette adresse. Préparez également vos accès à Google Search Console et Google Analytics 4. Le croisement des données de crawl avec les impressions, clics ou sessions permet de distinguer une erreur théorique d’un problème affectant réellement les pages qui génèrent du trafic.

  • Définissez l’objectif principal du crawl : audit complet, contrôle de mise en ligne, migration ou recherche de contenus dupliqués.
  • Identifiez les environnements à exclure : préproduction, espace client, panier, recherche interne ou pages de test.
  • Récupérez le sitemap XML, car il servira de point de comparaison avec les URL réellement explorées.
  • Consignez la date du crawl, le nombre d’URL attendu et les changements récents sur le site.
  • Vérifiez que vous avez l’autorisation de crawler un site qui ne vous appartient pas.

Cette phase de cadrage facilite la restitution. Un audit SEO devient plus convaincant lorsque vous pouvez répondre à des questions simples : combien de pages indexables le site devrait-il présenter ? Les URL stratégiques sont-elles accessibles en moins de trois clics ? Les pages à fort potentiel reçoivent-elles des liens internes ? Un bon crawler fournit les données ; votre méthode donne du sens à ces données.

Configurer Screaming Frog avant de lancer l’exploration

La configuration par défaut est adaptée à une première découverte, mais elle n’est pas toujours appropriée à la réalité d’un site. Les menus Configuration, Mode et Configuration > Spider permettent d’ajuster l’exploration. Prenez quelques minutes pour choisir les ressources à analyser, la vitesse de crawl et les règles d’inclusion. Cette précaution réduit le bruit dans vos résultats et protège les performances du serveur audité.

Choisir entre le mode Spider et le mode List

Le mode Spider est le plus courant. Vous saisissez l’URL d’accueil et Screaming Frog suit les liens internes qu’il découvre, comme le ferait un robot. C’est le mode idéal pour comprendre l’architecture, identifier les pages orphelines de liens internes ou repérer les erreurs de navigation. En revanche, le mode List sert à analyser une liste précise d’URL importées depuis un fichier CSV, un sitemap XML, Google Search Console ou un tableur. Il est particulièrement utile pour vérifier une sélection de pages stratégiques, des anciennes URL après migration ou des fiches produit issues d’un export.

ModeUsage recommandéAvantage principalLimite à connaître
SpiderAudit global d’un domaineAnalyse le maillage et la profondeurNe découvre pas forcément les pages orphelines
ListContrôle d’URL sélectionnéesRapide et cibléNe reconstitue pas l’architecture complète
Analyse de sitemapValidation des URL déclarées aux moteursCompare facilement les pages attenduesNe révèle pas toutes les URL accessibles

Dans une démarche complète, utilisez souvent plusieurs modes. Lancez un crawl Spider pour la structure, importez ensuite le sitemap en mode List et comparez les écarts. Une URL présente dans le sitemap mais absente du crawl peut être orpheline, mal liée ou bloquée. À l’inverse, une URL crawlée qui ne figure pas dans le sitemap n’est pas automatiquement problématique, mais elle mérite d’être qualifiée : page utilitaire, pagination, filtre, ancienne page ou contenu oubliée.

Régler la vitesse et respecter le serveur

La vitesse d’exploration se paramètre dans Configuration > Speed. Un petit site hébergé sur une infrastructure robuste peut supporter plusieurs URL par seconde. En revanche, un site mutualisé, un serveur ancien ou une boutique en période de forte activité doit être crawlé avec prudence. Commencez par une vitesse modérée, par exemple 1 à 2 URL par seconde, puis surveillez les temps de réponse et les erreurs 5xx. Il serait contre-productif de provoquer une saturation qui fausserait les résultats ou nuirait aux internautes.

Activez le respect du fichier robots.txt si vous souhaitez reproduire au plus près le comportement d’un moteur. Pour un audit technique autorisé, vous pouvez aussi tester ponctuellement les URL bloquées, afin de comprendre ce que le robot ne peut pas explorer. Documentez toujours ce choix dans votre rapport : une donnée obtenue en ignorant robots.txt n’a pas la même signification qu’une donnée obtenue dans des conditions normales d’exploration.

Configurer le JavaScript, les paramètres et les exclusions

De nombreux sites modernes génèrent une partie de leur contenu avec JavaScript. Dans Configuration > Spider > Rendering, choisissez le rendu HTML traditionnel ou le rendu JavaScript. Le premier est plus rapide et suffit pour les sites dont le contenu est présent dans le code source. Le second reproduit davantage le comportement d’un navigateur, mais consomme plus de ressources et rallonge le crawl. Comparez les deux rendus si vous suspectez un problème d’indexation lié à une application JavaScript.

Les paramètres d’URL constituent une autre source de pollution fréquente : ?utm_source, identifiants de session, tris, filtres ou recherche interne peuvent générer des milliers de variantes. Servez-vous des fonctions d’exclusion ou des règles de réécriture pour éviter que le crawler ne perde du temps sur ces URL. N’excluez cependant pas les facettes sans vérification : elles peuvent révéler une duplication massive, une mauvaise canonicalisation ou une consommation excessive du budget crawl.

Lire l’interface et interpréter les résultats de crawl

Une fois l’exploration terminée, Screaming Frog affiche des onglets par type de ressource : Internal, External, Response Codes, Page Titles, Meta Description, H1, Images, Canonicals, Directives ou encore Hreflang. Chaque ligne correspond à une URL, tandis que les colonnes présentent ses attributs. L’erreur classique consiste à parcourir l’ensemble des onglets sans ordre. Une analyse efficace suit plutôt une logique : accessibilité, indexabilité, pertinence sémantique, maillage et performance.

Commencer par les codes de réponse HTTP

L’onglet Response Codes est un excellent point de départ. Filtrez les réponses par statut et examinez particulièrement les codes 4xx et 5xx. Une erreur 404 indique qu’une ressource est introuvable ; elle peut être acceptable pour une ancienne URL sans lien ni trafic, mais elle devient prioritaire si elle est liée depuis des pages internes, un sitemap ou des backlinks. Une erreur 500, 502 ou 503 révèle souvent un problème serveur, une extension défaillante ou une surcharge à investiguer rapidement.

Les redirections 301 et 302 méritent aussi une attention particulière. Une 301 signale en principe un déplacement permanent, tandis qu’une 302 reste temporaire. Vérifiez les chaînes de redirections, c’est-à-dire les parcours du type URL A vers URL B puis URL C. Elles ralentissent l’expérience, diluent parfois le signal SEO et compliquent le travail des robots. Dans le rapport de redirections, repérez les chaînes de deux sauts ou plus et remplacez-les, lorsque c’est possible, par un lien direct vers l’URL finale.

  • 200 : la page répond correctement ; vérifiez ensuite son indexabilité et son contenu.
  • 301 : redirection permanente généralement recommandée lors d’un changement d’URL.
  • 302 : redirection temporaire à valider selon le contexte métier et SEO.
  • 404 : page introuvable ; recherchez ses liens internes, son trafic et ses backlinks.
  • 410 : contenu supprimé volontairement ; utile quand aucune redirection pertinente n’existe.
  • 5xx : erreur serveur prioritaire, car elle nuit aux utilisateurs comme aux robots.

Comprendre les colonnes essentielles

Dans l’onglet Internal, les colonnes Indexability et Indexability Status sont fondamentales. Une URL peut répondre en 200 tout en étant non indexable parce qu’elle porte une directive noindex, une balise canonique vers une autre page ou un blocage robots. Cela ne constitue pas nécessairement une erreur. Par exemple, une page de remerciement après formulaire ou le panier d’une boutique n’a pas vocation à apparaître dans Google. En revanche, une catégorie stratégique en noindex est un problème majeur.

Utilisez aussi les colonnes de profondeur, souvent nommées Crawl Depth. Elles indiquent le nombre de clics nécessaires depuis l’URL de départ pour atteindre une page. Une page importante située à une profondeur de 5 ou 6 peut être moins fréquemment explorée et recevoir moins de popularité interne qu’une page accessible en deux clics. La profondeur seule ne suffit pas : une URL peut être profonde mais bénéficier de liens contextuels puissants. Elle reste néanmoins un indicateur très utile pour revoir une architecture.

Utiliser les onglets Overview, Site Structure et Crawl Tree Graph

Le panneau Overview synthétise les volumes d’URL par catégorie : indexables, redirigées, bloquées, contenant des titres manquants ou des images lourdes. Il sert à identifier les priorités sans ouvrir chaque rapport. Le graphique de structure et la visualisation en arborescence aident, eux, à repérer les silos déséquilibrés. Une catégorie contenant 80 % des pages ou une branche très profonde peut signaler un problème de navigation.

Ne confondez pas volume d’alertes et gravité. Dix erreurs 5xx sur des pages actives peuvent être beaucoup plus urgentes que 2 000 meta descriptions trop courtes. Pour hiérarchiser, croisez quatre critères : l’impact sur l’indexation, le volume d’URL touchées, le niveau de trafic concerné et le coût de correction. Cette approche évite de passer des heures sur des optimisations marginales alors qu’une mauvaise redirection bloque une rubrique entière.

Auditer les balises SEO, les contenus dupliqués et les médias

Après l’accessibilité technique, analysez les éléments qui aident les moteurs à comprendre et présenter vos pages. Screaming Frog ne remplace pas une stratégie éditoriale ni une analyse d’intention de recherche, mais il détecte efficacement les défauts de balisage répétés. Les onglets Page Titles, Meta Description, H1, H2 et Content permettent de filtrer les valeurs manquantes, dupliquées, trop longues ou trop courtes.

Contrôler les titles, meta descriptions et titres de page

Le title reste un signal de pertinence important et influence souvent l’affichage dans les résultats de recherche. Dans l’onglet dédié, filtrez les titres manquants, dupliqués et ceux qui dépassent la largeur recommandée. Un titre identique sur 200 fiches produit peut indiquer un modèle de génération insuffisant. Sur un site e-commerce, une structure telle que « Chaussures [marque] [modèle] [couleur] » est souvent plus utile qu’un simple nom de catégorie répété.

Les meta descriptions ne sont pas un facteur de classement direct, mais elles participent à l’attractivité de l’extrait affiché. Une description absente n’est pas toujours grave, car Google peut en générer une automatiquement. En revanche, des descriptions identiques sur des pages concurrentes réduisent votre capacité à différencier l’offre. Cherchez les pages stratégiques dépourvues de texte descriptif ou utilisant des formulations génériques telles que « Découvrez nos produits et services ».

Les H1 et H2 doivent être interprétés avec nuance. L’absence de H1 sur une page éditoriale peut compliquer la compréhension du sujet, mais la présence de plusieurs H1 n’est pas forcément un désastre sur un site HTML5 moderne. Le plus important est la cohérence : le titre principal doit exprimer clairement le sujet de la page et correspondre à l’intention visée. Utilisez les exports pour repérer les modèles de pages où le H1 est vide, générique ou identique à des centaines d’autres URL.

Identifier réellement les contenus dupliqués

Le filtre de contenu dupliqué de Screaming Frog s’appuie notamment sur des signatures de contenu. Il aide à détecter des pages très proches, mais l’interprétation humaine reste indispensable. Deux URL de pagination peuvent partager une grande partie de leur structure sans être problématiques. À l’inverse, deux pages de service proposant exactement la même promesse dans deux villes différentes risquent de se concurrencer si seuls le nom de la ville et quelques lignes changent.

Analysez les duplications avec les balises canoniques. Une page filtrée peut être dupliquée par nature, mais être correctement canonisée vers la catégorie principale. Dans ce cas, le problème est peut-être maîtrisé. En revanche, si plusieurs pages dupliquées possèdent chacune une canonique autoréférente et sont indexables, elles peuvent diluer les signaux. Vérifiez également que la canonique cible répond en 200, est indexable et ne redirige pas.

Optimiser les images et les ressources

L’onglet Images liste les fichiers détectés, leur taille, leur texte alternatif et les pages qui les utilisent. Filtrez les images dépassant, par exemple, 100 Ko ou 200 Ko selon leur usage. Une image héro très large peut justifier un poids supérieur, mais une miniature de 800 Ko est rarement acceptable. Les images sans attribut alt doivent être examinées selon leur fonction : un visuel décoratif peut avoir un alt vide, tandis qu’une photo de produit ou une infographie informative nécessite une description utile.

Pour chaque anomalie, créez une recommandation opérationnelle : compression WebP ou AVIF, redimensionnement, chargement différé, nom de fichier descriptif ou amélioration du texte alternatif. Évitez toutefois le bourrage de mots-clés. Un bon alt décrit l’image pour l’accessibilité et apporte éventuellement un contexte sémantique naturel.

Analyser le maillage interne, les canonicals et l’indexabilité

Le maillage interne détermine la façon dont les pages sont découvertes, hiérarchisées et valorisées au sein d’un site. Grâce à Screaming Frog, vous pouvez identifier les URL qui reçoivent peu de liens, celles qui sont trop profondes, les ancres utilisées et les pages qui transmettent des liens vers des destinations en erreur. Cette analyse est particulièrement précieuse après une refonte éditoriale ou l’ajout massif de contenus.

Repérer les pages orphelines et les pages peu liées

Une page orpheline est une URL existante qui ne reçoit aucun lien interne depuis les pages crawlées. Elle peut être indexée grâce au sitemap, à un backlink ou à une ancienne découverte par Google, mais elle reste difficile à trouver pour les internautes et les robots. Pour les détecter, connectez votre sitemap XML ou vos données Search Console, puis comparez les URL connues avec celles trouvées par le crawl. Les pages présentes dans les données externes mais absentes du crawl doivent être qualifiées une par une.

Toutes les pages orphelines ne doivent pas être reliées. Une landing page publicitaire temporaire ou un document légal peut avoir un statut particulier. En revanche, un guide métier, une catégorie commerciale ou une page locale générant des impressions mérite généralement une intégration au maillage. Ajoutez des liens depuis une catégorie, un article connexe, un fil d’Ariane ou un bloc de contenus associés.

Examiner les liens entrants et les ancres

Sélectionnez une URL puis consultez l’onglet Inlinks pour voir les pages qui pointent vers elle. Contrôlez le nombre de liens, leur emplacement et leurs ancres. Une page stratégique qui ne reçoit qu’un lien depuis le footer peut manquer de visibilité interne. À l’inverse, un lien contextuel inséré dans un article thématique fort peut être beaucoup plus pertinent. L’objectif n’est pas de maximiser mécaniquement le nombre de liens, mais de rendre les parcours utiles et compréhensibles.

Vérifiez aussi les liens vers des URL redirigées, 404 ou noindex. Chaque lien interne devrait idéalement pointer directement vers une page canonique en 200 et indexable, sauf besoin fonctionnel spécifique. Après une migration, ce contrôle est capital : des milliers de liens internes conservant l’ancienne structure créent des chaînes inutiles et ralentissent le crawl des moteurs.

Valider les directives robots, noindex et canonicals

Les directives d’indexation demandent une lecture croisée. Une page en noindex peut être parfaitement volontaire ; une page bloquée dans robots.txt mais présente dans un sitemap est plus ambiguë. Les moteurs ne peuvent pas explorer son contenu, mais peuvent parfois connaître l’URL. Pour les pages importantes, recherchez une configuration cohérente : réponse 200, indexabilité autorisée, balise canonique autoréférente ou orientée vers une URL pertinente, absence de blocage robots et présence dans le sitemap si elle doit être indexée.

Les erreurs de canonicalisation sont fréquentes lors des changements de domaine, de protocole ou de langue. Une canonique qui pointe vers une URL HTTP, une page 404 ou une version de test constitue un signal contradictoire. Exportez les canonicals, filtrez les cibles non indexables et contrôlez les modèles de pages. Une correction dans un template peut résoudre plusieurs milliers d’URL, ce qui en fait souvent une action à forte rentabilité SEO.

Utiliser Screaming Frog pour une migration, un suivi et un plan d’action

Screaming Frog est particulièrement puissant lorsqu’il est utilisé avant, pendant et après une migration. Un changement de CMS, de nom de domaine, de structure d’URL ou de catégories peut faire perdre du trafic si les redirections et les signaux d’indexation ne sont pas maîtrisés. Le crawler permet de constituer un état des lieux, de tester les correspondances et de vérifier la recette après mise en production.

Créer un inventaire avant une refonte

Avant toute migration, crawlez l’ancien site et exportez au minimum les URL, titles, H1, meta descriptions, codes de réponse, canonicals, liens entrants, profondeur et données analytiques. Cet inventaire devient votre fichier de référence. Ajoutez une colonne pour indiquer le statut de chaque ancienne page : conservation à l’identique, nouvelle URL, redirection 301, suppression avec 410 ou absence de reprise justifiée.

Ne redirigez pas systématiquement toutes les URL supprimées vers la page d’accueil. Cette pratique est souvent peu pertinente pour l’utilisateur et peut être interprétée comme une soft 404. Cherchez la destination la plus proche sémantiquement. Une ancienne fiche produit hors catalogue peut rediriger vers son remplaçant, une sous-catégorie ou une catégorie parente si celle-ci répond réellement au besoin. Lorsqu’aucune alternative pertinente n’existe, un code 410 peut être préférable.

Recetter les redirections après la mise en ligne

Importez la liste des anciennes URL dans Screaming Frog en mode List, puis lancez le crawl sur le nouveau site. Contrôlez que chaque ancienne URL renvoie en une seule étape vers la bonne destination. Vérifiez les codes 200 des pages finales, les balises canonicals, les liens internes et le sitemap. Une migration réussie ne se limite pas à l’absence de 404 : les contenus importants doivent conserver une logique de ciblage, un maillage cohérent et une capacité d’indexation.

Surveillez également les variations dans Search Console pendant les semaines suivantes : couverture, erreurs d’exploration, impressions, pages exclues et évolution des requêtes. Une baisse temporaire peut survenir, mais une chute durable exige une investigation. Comparez les exports avant/après pour localiser les pages disparues, les changements de balises ou les redirections incorrectes.

Automatiser les contrôles récurrents

Pour un site actif, un audit ponctuel ne suffit pas. Planifiez un crawl mensuel ou hebdomadaire selon le volume de publication. Surveillez les nouveaux 404, les erreurs serveur, les pages sans title, les images trop lourdes et les redirections ajoutées par erreur. Les exports CSV peuvent être intégrés à un tableau de bord ou comparés à des crawls précédents afin de mesurer l’évolution.

Voici une méthode de priorisation simple pour transformer l’audit en plan d’action :

  • Priorité 1 : erreurs 5xx, pages stratégiques en noindex, canonicals erronées, migrations cassées et pages importantes en 404.
  • Priorité 2 : chaînes de redirections, liens internes vers des erreurs, pages orphelines à potentiel et duplication massive indexable.
  • Priorité 3 : optimisation des titles, meta descriptions, H1, attributs alt et amélioration de la profondeur de clic.
  • Priorité 4 : nettoyage des alertes mineures et optimisations de confort sans impact démontré.

Documentez chaque recommandation avec une URL exemple, une règle de correction, le responsable attendu et un critère de validation. Au lieu d’écrire « corriger les meta descriptions », indiquez par exemple : « réécrire les meta descriptions des 45 catégories générant plus de 100 impressions mensuelles, avec une promesse spécifique et une longueur adaptée ». Cette précision facilite l’exécution par les équipes éditoriales, techniques ou e-commerce.

À retenir

  • Configurez le périmètre, la vitesse et le rendu avant chaque crawl afin d’obtenir des données fiables sans surcharger le serveur.
  • Priorisez les erreurs qui affectent l’exploration et l’indexation, notamment les 5xx, les 404 liées, les redirections en chaîne et les canonicals incohérentes.
  • Comparez le crawl, le sitemap et les données Search Console pour détecter les pages orphelines, les écarts d’indexation et les opportunités de maillage interne.

Bien utilisé, Screaming Frog transforme un site web complexe en une cartographie précise de ses URL, de ses liens et de ses signaux techniques. L’outil ne doit toutefois pas être considéré comme un juge automatique : ses alertes sont des pistes d’analyse, pas des corrections à appliquer aveuglément. Une page en noindex, une redirection ou un contenu similaire peut être parfaitement légitime selon le contexte commercial, éditorial ou légal. La valeur de l’audit repose donc sur votre capacité à relier les données techniques aux objectifs du site.

Commencez par un crawl raisonnable, analysez les problèmes les plus critiques, puis mettez en place des contrôles récurrents. En croisant les exports de Screaming Frog avec les performances issues de Search Console et de votre outil analytics, vous pourrez concentrer vos efforts sur les URL qui comptent réellement. Cette démarche progressive permet d’améliorer l’indexation, l’expérience de navigation et la qualité du maillage interne sans se perdre dans une liste interminable d’anomalies. Pour un référencement durable, le crawler devient alors un véritable outil de pilotage SEO.

CONTINUER LA LECTURE

Decouvrez d'autres articles

Voir tous les articles →