Aller au contenu principal
Piloterr
Retour à la bibliothèque

API Website Crawler

Récupérez des pages publiques en crawl HTTP rapide (sans JavaScript). Premier choix pour le HTML statique ou SSR ; passez à Rendering ou WebUnlocker si le JS ou l'anti-bot bloque.

Actif1 crédit = 1 requêteGET/v2/website/crawler

Vue d'ensemble de l'endpoint

Documentation détaillée, tarifs et exemples d'utilisation.

Choisir le bon endpointLink to Choisir le bon endpoint

Trois moteurs complémentaires permettent de récupérer une page publique. Prenez le plus léger qui fonctionne sur votre cible.

Endpoint Moteur Crédits Quand l'utiliser
Website Crawler Requête HTTP (sans JavaScript) 1 Le HTML utile est déjà dans la première réponse : blogs, docs, pages catalogue SSR, sitemaps.
Website Rendering Navigateur headless (JavaScript exécuté) 2 Le contenu n'apparaît qu'après JS : SPA React/Vue/Angular, listes lazy-load, besoin de wait_for ou de browser_instructions (POST).
Website WebUnlocker Navigateur + stack unlock 3 Website Rendering ou Website Crawler se heurtent à un anti-bot (Cloudflare, DataDome, Akamai, PerimeterX) et le domaine est sur Piloterr's approved whitelist.

Arbre de décision

  1. Commencez par Crawler si vous n'avez pas besoin de rendu client. C'est le plus rapide et le moins cher.
  2. Passez à Rendering si le DOM est vide, si les prix chargent en AJAX, ou si vous devez attendre un sélecteur / exécuter des actions navigateur.
  3. N'utilisez WebUnlocker que pour les domaines retail/marketplace verrouillés qui bloquent un navigateur classique. Whitelist obligatoire avant la prod.

Voir aussi : Website Scraping guide.

Vue d'ensembleLink to Vue d'ensemble

Website Crawler envoie un GET HTTP direct vers une URL publique et renvoie le HTML. Aucun navigateur headless : pas d'exécution JavaScript, pas de rendu DOM, pas de couche anti-bot.

Crawler est donc idéal pour le volume et la vitesse lorsque le HTML utile est déjà présent dans la première réponse. SPA, contenu chargé au scroll ou protection bot avancée : passez à Website Rendering ou Website WebUnlocker (tableau ci-dessus).

Coût : 1 crédit par appel réussi.

Démarrage rapideLink to Démarrage rapide

GET https://api.piloterr.com/v2/website/crawler?query=https://example.com

ParamètresLink to Paramètres

Paramètre Type Requis Description
query string oui URL publique avec http:// ou https://
allow_redirects boolean non Suit les redirections si true (défaut). false pour inspecter la chaîne
return_page_source boolean non HTML brut si true. Défaut false

RéponseLink to Réponse

Champ Description
Corps de réponse HTML de la page

Endpoints liésLink to Endpoints liés

Besoin Endpoint
Contenu rendu en JavaScript Website Rendering
Anti-bot fort sur domaine whitelisté Website WebUnlocker
Détecter une protection avant scrape Website Antibot

NotesLink to Notes

  • Seules les réponses HTTP réussies sont facturées.
  • Pages authentifiées ou payantes hors scope.
  • HTML vide ou squelette : essayez Website Rendering.

Cas d'usageLink to Cas d'usage

  • Récupérer en masse des fiches produit SSR
  • Surveiller des pages concurrentes statiques
  • Agréger blogs, annuaires et documentation
  • Capturer une chaîne de redirections avec allow_redirects=false

API associées

Étendez vos capacités data avec ces outils complémentaires.

Website Antibot/v2/website/antibot

Détectez quelle protection anti-bot protège un site avant de scraper. Obtenez le vendor, le niveau de confiance et les indices détectés en une requête.

GET1 crédit = 1 requêteActif
Website Crawler (POST)/v2/website/crawler

Explorez sites web et endpoints API par URL et obtenez des réponses JSON structurées via POST.

POST1 crédit = 1 requêteActif
Website Email Phone Extractor/v2/website/email_phone_extractor

Extrayez les e-mails et numéros de téléphone de n'importe quel site web pour obtenir des informations de contact complètes, y compris les profils sur 12+ plateformes sociales.

GET1 crédit = 1 requêteActif
Website Rendering/v2/website/rendering

Rendez les pages JavaScript dans un navigateur headless et récupérez le HTML post-rendu. À utiliser quand Crawler renvoie un DOM vide ; passez à WebUnlocker si l'anti-bot bloque la session.

GET2 crédits = 1 requêteActif
Website Rendering Instructions (POST)/v2/website/rendering

Exécutez des instructions d'automatisation navigateur (scroll, scroll_to_bottom) pendant le rendu headless pour déclencher le contenu en lazy loading, contourner la détection de bots et données des pages chargées dynamiquement.

POST2 crédits = 1 requêteActif
Website Screenshot/v2/website/screenshot

Extrayez des données Website Screenshot pour intégration en temps réel, analyse de marché et automatisation.

GET2 crédits = 1 requêteActif
Website Technology/v2/website/technology

Identifiez les technologies derrière n'importe quel site web CMS, frameworks, analytics, CDN, hébergement: pour une analyse de marché concurrentielle.

GET1 crédit = 1 requêteActif
Website WebUnlocker/v2/website/webunlocker

Contournez les anti-bots avancés (Cloudflare, DataDome, Akamai, PerimeterX) sur domaines whitelistés. Combine rendu navigateur et unlock ; à utiliser après échec de Crawler et Rendering.

GET3 crédits = 1 requêteActif
Website WebUnlocker (POST)/v2/website/webunlocker

Envoyez des requêtes POST vers des sites ou APIs whitelistés via WebUnlocker pour contourner les protections anti-bot avancées et récupérer la réponse amont.

POST3 crédits = 1 requêteActif

Prêt à commencer ?

Votre API de scraping web est à un clic. Commencez avec +500 crédits, sans infrastructure à gérer, sans proxies à configurer, et sans carte bancaire.

  • +500 crédits
  • Aucune carte bancaire requise
  • Tous les endpoints inclus