Explorer
KNOW-REF-061

Scraping web : parcours d'apprentissage et outils sélectionnés

Domaine
dev-general
Type
reference
Priorité
P2

Scraping web : parcours et outils sélectionnés

Parcours utile

  1. Apify Academy — Scraping basics JS ou Python : HTTP, HTML, extraction et premiers crawls.
  2. Puppeteer and Playwright : navigateur seulement lorsque le contenu ou le parcours le justifie.
  3. API scraping : observer les échanges réseau et exploiter une API autorisée plutôt que reconstruire le DOM.
  4. Anti-scraping protections : comprendre limitations, sessions et blocages ; appliquer uniquement dans un cadre autorisé.
  5. Advanced web scraping : files, parallélisme, fiabilité et exploitation.

Boîte à outils raisonnée

  • Crawlee — interface commune HTTP/navigateur, files persistantes, routing, stockage, sessions, retries, autoscaling et hooks. Fonctionne localement ou sur toute infrastructure compatible.
  • Playwright — navigateur multi-moteur, interactions et tests ; coût supérieur à un client HTTP.
  • Cheerio — parsing HTML rapide côté Node.js lorsque le rendu JavaScript est inutile.
  • Scrapy — framework Python mature pour crawl, pipelines, throttling et extensions.
  • selectolax — parseur HTML Python rapide pour extraction ciblée.
  • extruct — extraction de données structurées (JSON-LD, microdata, RDFa).
  • trafilatura — extraction de texte principal et métadonnées de documents web.

Ce que fournit réellement Crawlee

  • RequestQueue pour une file persistante et dédupliquée ; enqueueLinks pour la découverte.
  • CheerioCrawler/clients HTTP pour la voie légère ; PlaywrightCrawler ou PuppeteerCrawler pour le rendu réel.
  • Router pour séparer les handlers par type de page.
  • Dataset/key-value store pour résultats et état.
  • gestion de session/proxy, hooks de cycle de vie, erreurs/retries et ajustement de concurrence selon les ressources.

Ces briques ne remplacent ni le contrat de données, ni les tests de sélecteurs, ni les règles juridiques de la source.

Évaluation de l'agrégateur

awesome-web-scraping indexe des listes par langage, des navigateurs headless, outils CLI et manuels. C'est un bon point de découverte, mais sa page principale contient aussi des marketplaces de proxies et services CAPTCHA sans évaluation : ne pas importer ces liens comme recommandations. Vérifier maintenance, licence, sécurité et conformité de chaque outil avant adoption.

Lien KC

  • [[KNOW-PAT-240]] — architecture de scraping prête pour la production
  • [[KNOW-PAT-233]] — ingestion, transformation et qualité analytique