Scraping web : parcours et outils sélectionnés
Parcours utile
- Apify Academy — Scraping basics JS ou Python : HTTP, HTML, extraction et premiers crawls.
- Puppeteer and Playwright : navigateur seulement lorsque le contenu ou le parcours le justifie.
- API scraping : observer les échanges réseau et exploiter une API autorisée plutôt que reconstruire le DOM.
- Anti-scraping protections : comprendre limitations, sessions et blocages ; appliquer uniquement dans un cadre autorisé.
- Advanced web scraping : files, parallélisme, fiabilité et exploitation.
Boîte à outils raisonnée
- Crawlee — interface commune HTTP/navigateur, files persistantes, routing, stockage, sessions, retries, autoscaling et hooks. Fonctionne localement ou sur toute infrastructure compatible.
- Playwright — navigateur multi-moteur, interactions et tests ; coût supérieur à un client HTTP.
- Cheerio — parsing HTML rapide côté Node.js lorsque le rendu JavaScript est inutile.
- Scrapy — framework Python mature pour crawl, pipelines, throttling et extensions.
- selectolax — parseur HTML Python rapide pour extraction ciblée.
- extruct — extraction de données structurées (JSON-LD, microdata, RDFa).
- trafilatura — extraction de texte principal et métadonnées de documents web.
Ce que fournit réellement Crawlee
RequestQueuepour une file persistante et dédupliquée ;enqueueLinkspour la découverte.CheerioCrawler/clients HTTP pour la voie légère ;PlaywrightCrawlerouPuppeteerCrawlerpour le rendu réel.Routerpour séparer les handlers par type de page.Dataset/key-value store pour résultats et état.- gestion de session/proxy, hooks de cycle de vie, erreurs/retries et ajustement de concurrence selon les ressources.
Ces briques ne remplacent ni le contrat de données, ni les tests de sélecteurs, ni les règles juridiques de la source.
Évaluation de l'agrégateur
awesome-web-scraping indexe des listes par langage, des navigateurs headless, outils CLI et manuels. C'est un bon point de découverte, mais sa page principale contient aussi des marketplaces de proxies et services CAPTCHA sans évaluation : ne pas importer ces liens comme recommandations. Vérifier maintenance, licence, sécurité et conformité de chaque outil avant adoption.
Lien KC
- [[KNOW-PAT-240]] — architecture de scraping prête pour la production
- [[KNOW-PAT-233]] — ingestion, transformation et qualité analytique