Aller au contenu principal
Piloterr
Retour au blog
8 août 2025

Scraping web : Crawler vs Rendering vs WebUnlocker

Piloterr propose trois produits web complémentaires. Ce guide explique leurs différences et quand utiliser chacun.

Introduction rapide au web scraping

Le web scraping est la récupération programmatique de contenu web (HTML/JSON) afin d'en extraire des informations structurées. Deux approches pratiques existent :

  • Mode requête : émettre des requêtes HTTP avec des en-têtes, une empreinte TLS et un comportement réseau réalistes pour récupérer directement les réponses du serveur.
  • Mode navigateur : piloter des navigateurs headless qui exécutent JavaScript, chargent les ressources et rendent le DOM final.

Les défis courants incluent le rendu côté client, les redirections, la pagination, les limites de débit, les variations géographiques/locales et les systèmes anti-bot d'entreprise. Utilisez le scraping de manière responsable et conformément aux lois applicables et aux conditions d'utilisation des sites cibles.

Produits Piloterr

  • Website Crawler : mode requête HTTP avec fingerprinting avancé. Le plus rapide et le moins coûteux (1 crédit), idéal pour le HTML statique et les endpoints API/JSON. Pas d'exécution JavaScript.
  • Website Rendering : navigateurs headless réalistes qui exécutent JavaScript intégralement. Prend en charge les attentes et sélecteurs pour garantir la disponibilité du DOM. Coût plus élevé (2 crédits). Peut échouer occasionnellement sur des pages lourdes/lentes ou des configurations anti-bot strictes.
  • Website WebUnlocker : mode requête HTTP avec contournement anti-bot d'entreprise (Cloudflare, DataDome, PerimeterX, Akamai, etc.). Liste blanche requise. 3 crédits. Taux de réussite de 100 % sur les domaines autorisés. Pas d'exécution JavaScript.

Comment fonctionnent-ils ?

Crawler (mode requête)

  • Effectue des requêtes HTTP(S) directes avec un fingerprinting intelligent des en-têtes et TLS.
  • N'exécute pas JavaScript ; renvoie rapidement le HTML brut ou le corps de la réponse.
  • Des options comme allow_redirects et return_page_source contrôlent le comportement.

Rendering (mode navigateur)

  • Lance des navigateurs réalistes pour récupérer et rendre les pages côté client.
  • Exécute JavaScript, charge les ressources et peut attendre la stabilité du DOM avec wait_in_seconds ou des sélecteurs wait_for ; prend en charge timeout, block_ads et les instructions navigateur.
  • Plus gourmand en ressources, mais indispensable pour les applications lourdes en JavaScript.

WebUnlocker (anti-bot)

  • Effectue des requêtes HTTP(S) directes avec contournement anti-bot avancé, proche du Crawler mais calibré pour les cibles durcies.
  • N'exécute pas JavaScript ; renvoie le HTML brut ou le corps de la réponse après passage des challenges anti-bot.
  • Les options allow_redirects et return_page_source fonctionnent comme sur le Crawler.
  • Calibré pour passer les défis anti-bot avancés sur les domaines en liste blanche, avec une réussite quasi instantanée et une stabilité sur les propriétés durcies.

Quand utiliser lequel ?

  • Choisir Crawler : lorsque les pages sont majoritairement statiques, que vous appelez des endpoints API, que vous avez besoin d'un débit maximal/d'une latence minimale, ou que vous souhaitez l'option la plus économique.
  • Choisir Rendering : lorsque le contenu est rendu côté client, que vous avez besoin d'une disponibilité DOM précise, ou que vous exigez un comportement de type interaction (exécution JS).
  • Choisir WebUnlocker : lorsque vous affrontez des défenses anti-bot de niveau entreprise (Cloudflare, DataDome, PerimeterX, Akamai, etc.) sur des pages statiques ou rendues côté serveur, et que vous exigez un taux de réussite de 100 % sur les domaines autorisés. Pour du JavaScript côté client, préférez Rendering.

Quand prendre le WebUnlocker ?

Privilégiez WebUnlocker lorsque le sujet est critique : vous avez un besoin réel de données en temps réel (prix, stock, annonces, conformité réglementaire…) et vous ne pouvez pas absorber une latence de 10 à 20 secondes par requête, fréquente avec Rendering sur des cibles protégées. WebUnlocker reste en mode requête HTTP (sans exécution JS) avec un contournement anti-bot calibré pour livrer des réponses en quelques secondes, avec un taux de réussite de 100 % sur les domaines autorisés.

Différences clés en un coup d'œil

FonctionnalitéCrawlerRenderingWebUnlocker
Exécution JavaScript
Résilience anti-botBasique (fingerprinting)MoyenneTrès élevée (contournement anti-bot entreprise)
Latence typiqueLa plus faibleMoyenne/élevéeTrès faible ; conçu pour 100 % de réussite sur les domaines autorisés
Coût par requête1 crédit2 crédits3 crédits

Explorer la documentation

Conclusion

Utilisez le Crawler lorsque vous avez besoin de vitesse, d'échelle et du coût le plus bas pour les pages statiques ou rendues côté serveur et les API. Choisissez Rendering lorsque le site repose sur JavaScript côté client et que vous avez besoin d'attentes sensibles au DOM. Optez pour WebUnlocker pour les pages statiques ou rendues côté serveur protégées par des systèmes anti-bot d'entreprise sur les domaines autorisés : il offre une latence très faible avec un taux de réussite de 100 %, sans exécuter de JavaScript.

À lire aussi

Guides et actualités sur le scraping web, les proxies et l'extraction de données.

Actualités

Le MCP Piloterr passe sur la spec 2026-07-28

Notre serveur MCP hébergé sur mcp.piloterr.com suit désormais MCP 2026-07-28 : cœur stateless en request/response, même URL Streamable HTTP, même x-api-key.

Josselin Liebe
Josselin Liebe
Lire
Actualités

Comprendre les métriques de latence p50, p75, p90, p95 et p99

Les percentiles de latence décrivent la performance réelle de votre API ou pipeline de scraping pour la majorité des requêtes et pour la queue lente. Découvrez ce que signifient p50 à p99, pourquoi la moyenne trompe, et comment fixer des SLA réalistes.

Josselin Liebe
Josselin Liebe
Lire
Actualités

Cloudflare, Chrome, Firefox et Edge s'allient sur PACT, un protocole anti-bot respectueux de la vie privée

Cloudflare s''associe à Mozilla, Google, Microsoft et Shopify pour développer PACT (Private Access Control Tokens), un standard qui vise à authentifier le trafic humain et les agents autorisés sans CAPTCHA ni pistage invasif.

Josselin Liebe
Josselin Liebe
Lire

Prêt à commencer ?

Votre API de scraping web est à un clic. Commencez avec +500 crédits, sans infrastructure à gérer, sans proxies à configurer, et sans carte bancaire.

  • +500 crédits
  • Aucune carte bancaire requise
  • Tous les endpoints inclus