Saltar al contenido principal
Piloterr
Volver al blog
28 de julio de 2026

Web scraping para brand protection: cazar falsificaciones en AliExpress, Alibaba y Amazon

La falsificación no es un problema de nicho. La OCDE estima el comercio de productos falsificados en cientos de miles de millones de dólares al año, y la mayor parte fluye hoy por los mismos canales que sus clientes usan a diario: AliExpress, Alibaba, Amazon, eBay, Temu y el social commerce. Para una marca, cada anuncio falsificado es ingreso perdido, un riesgo de seguridad y la dilución de una marca construida durante años.

Los equipos que combaten esto (departamentos internos de PI y plataformas especializadas de brand protection) enfrentan el mismo problema operativo: los anuncios infractores aparecen más rápido de lo que los humanos pueden encontrarlos, y los vendedores vuelven a publicar a los pocos días de un takedown. La respuesta no es sumar analistas pegando URLs en hojas de cálculo. Es un pipeline de detección automatizado construido sobre datos de marketplace fiables.

Este artículo muestra cómo funciona ese pipeline en la práctica, a partir de un patrón real de producción de uno de nuestros clientes (una plataforma de brand protection que no nombraremos), con llamadas de API concretas a AliExpress, Alibaba y Amazon.

El caso de uso: una plataforma de brand protection a gran escala

Uno de nuestros clientes opera un servicio de brand protection para empresas y creadores de contenido. Su promesa es fácil de enunciar y difícil de cumplir:

  1. Escanear continuamente: vigilar más de 100.000 sitios web, marketplaces, motores de búsqueda y plataformas sociales las 24 horas, en busca de falsificaciones, suplantaciones y vendedores no autorizados.
  2. Eliminar infracciones: enviar avisos legales a los editores, presentar quejas de PI en los marketplaces, desindexar páginas fraudulentas de los buscadores y dar de baja cuentas sociales falsas.
  3. Documentarlo todo: dar a cada cliente un dashboard con evidencias en tiempo real, estado del enforcement y tendencias de los infractores.

Los pasos 2 y 3 son trabajo legal y de producto. El paso 1 es un problema de ingeniería de datos, y ahí es donde la infraestructura de scraping decide el éxito o el fracaso del negocio. Su plataforma ejecuta barridos recurrentes por palabras clave de marca en los marketplaces a través de las APIs de Piloterr, en lugar de mantener internamente una flota de navegadores headless, proxies y parsers por sitio.

Vale la pena detallar por qué externalizan la capa de scraping, porque aplica a cualquier equipo que construya herramientas de brand protection:

  • Los marketplaces son objetivos hostiles. Las páginas de búsqueda de AliExpress son single-page applications en JavaScript detrás de sistemas anti-bot. Amazon rota sus layouts y limita el tráfico agresivamente. Mantener lógica de bypass para una docena de sitios equivale a un equipo de ingeniería a tiempo completo.
  • La cobertura debe estar localizada. Los vendedores de falsificaciones apuntan deliberadamente a mercados donde la marca vigila menos. Un barrido que solo revisa alibaba.com en inglés pierde los anuncios mostrados a compradores franceses o polacos.
  • Las evidencias deben ser estructuradas. Un aviso de takedown necesita la identidad del vendedor, el precio, la URL del anuncio y una marca de tiempo: campos JSON, no capturas de pantalla de HTML crudo.

Anatomía de un pipeline de detección de falsificaciones

El pipeline tiene cuatro etapas, y cada una corresponde a llamadas de API específicas.

Texto plano
Descubrir         Calificar         Documentar        Enforcement y monitoreo
(APIs search)     (scoring)         (APIs product)    (takedown + re-scan)
     │                 │                  │                  │
barridos por  →  heurísticas   →  identidad del   →  queja de PI,
marca            precio/vendedor   vendedor, imágenes  vigilancia de republicaciones

Etapa 1: descubrir anuncios con los endpoints de búsqueda

Todo empieza con barridos por palabras clave de marca. Para cada marca protegida, la plataforma consulta el endpoint de búsqueda de cada marketplace cubierto con el nombre de la marca, errores ortográficos comunes (variantes tipo «nlke», «addidas») y palabras clave de las líneas de producto.

En AliExpress, una sola llamada devuelve anuncios estructurados con precio, vendedor y volumen de ventas:

Bash
curl -G "https://api.piloterr.com/v2/aliexpress/search" \
  -H "x-api-key: YOUR-API-KEY" \
  --data-urlencode "query=acme headphones"

Cada resultado incluye product_id, title, listing_url, price, currency y, cuando se muestran, sold_count, seller_name y seller_id. Los campos de paginación (total_results, total_pages, next) permiten agotar el conjunto de resultados: añada ?page=N a una URL wholesale para paginar.

En Alibaba, el lado B2B importa aún más: es donde las falsificaciones se abastecen aguas arriba, al por mayor, antes de llegar a los marketplaces de consumo. La API Alibaba Search expone el MOQ y la identidad del proveedor directamente en la tarjeta de resultado, y soporta 17 subdominios localizados:

Bash
# Escaparate en inglés
curl -G "https://api.piloterr.com/v2/alibaba/search" \
  -H "x-api-key: YOUR-API-KEY" \
  --data-urlencode "query=acme headphones"

# El mismo barrido en el escaparate francés: aparecen otros vendedores
curl -G "https://api.piloterr.com/v2/alibaba/search" \
  -H "x-api-key: YOUR-API-KEY" \
  --data-urlencode "query=acme headphones" \
  --data-urlencode "subdomain=french"

Ejecutar la misma palabra clave en los subdominios french, german, spanish o polish hace aflorar con regularidad proveedores que nunca aparecen en el escaparate en inglés. Para un barrido de brand protection, cada locale es un mercado distinto que limpiar.

En Amazon, la API Search cubre todos los grandes marketplaces mediante el parámetro domain:

Bash
curl -G "https://api.piloterr.com/v2/amazon/search" \
  -H "x-api-key: YOUR-API-KEY" \
  --data-urlencode "query=acme headphones" \
  --data-urlencode "domain=de"

Los resultados incluyen asin, title, price, real_price, rating y reviews_count, tanto de anuncios orgánicos como patrocinados. Los patrocinados importan: los falsificadores compran anuncios sobre las palabras clave de la propia marca.

El mismo patrón se extiende a eBay, Temu, Etsy, Allegro, Cdiscount y el resto de la colección e-commerce. Una sola integración, un solo esquema de autenticación (x-api-key), JSON consistente.

Etapa 2: calificar sospechosos con heurísticas de scoring

Un barrido por palabra clave de marca devuelve mayoritariamente anuncios legítimos. La capa de calificación separa los sospechosos del ruido usando los campos estructurados que devuelven las APIs de búsqueda:

SeñalCampo(s)Por qué importa
Precio muy por debajo del PVPprice, currencyUn producto de 300 € listado a 24 € es el indicador de falsificación más fuerte
Vendedor desconocidoseller_name, seller_idNo figura en la lista de distribuidores autorizados de la marca
Alto volumen en un anuncio nuevosold_countLas falsificaciones que rotan rápido causan el mayor daño
Disponibilidad B2B al por mayormin_order, price_min (Alibaba)«MOQ de 500 piezas» de un producto de marca en una fábrica desconocida
Marca en el título, campo brand incorrectotitle vs brandPatrón de keyword-stuffing típico de los infractores

Ninguna de estas señales prueba por sí sola la infracción. Combinadas, producen una cola priorizada donde un analista humano (o, cada vez más, un modelo de comparación de imágenes que contrasta image_url con los recursos oficiales de la marca) confirma el caso en segundos en lugar de buscarlo durante horas.

Etapa 3: documentar con los endpoints product

Los programas de quejas de PI de los marketplaces (el IPP de Alibaba, el Brand Registry de Amazon, el VeRO de eBay) exigen evidencias específicas y verificables. Eso es lo que proporcionan los endpoints product.

Una vez marcado un anuncio, recupere su ficha de producto completa. En AliExpress, la API Product siempre devuelve la identidad del vendedor, que las tarjetas de búsqueda solo exponen a veces:

Bash
curl -G "https://api.piloterr.com/v2/aliexpress/product" \
  -H "x-api-key: YOUR-API-KEY" \
  --data-urlencode "query=https://www.aliexpress.com/item/1005001234567890.html"

La respuesta le da el expediente de evidencias completo: título, todas las imágenes del producto, seller_id, seller_name, precios, especificaciones y detalles de envío, como JSON estructurado que puede archivar con marca de tiempo. Lo mismo aplica a Alibaba Product (tramos de cantidad, perfil del proveedor, plazos de entrega: la prueba de una fabricación de falsificaciones al por mayor) y Amazon Product.

En Amazon, un endpoint más resulta decisivo para las marcas que también venden allí: Amazon Product Offer lista los vendedores terceros en un ASIN dado. Los falsificadores muchas veces no crean anuncios nuevos: adjuntan stock falso a la propia ficha legítima de la marca. Monitorear la lista de ofertas de sus propios ASIN detecta exactamente eso.

Etapa 4: enforcement, y luego vigilar las republicaciones

El takedown en sí ocurre en el programa de PI del marketplace: fuera de la capa de scraping. Pero el enforcement sin monitoreo es una rueda de hámster. Los vendedores infractores, de forma rutinaria:

  • vuelven a publicar el mismo producto bajo un nuevo product_id a los pocos días,
  • clonan el anuncio en una tienda hermana (mismo seller_id, anuncio nuevo),
  • se mueven a otro subdominio localizado o directamente a otro marketplace.

Por eso el pipeline es un bucle, no un one-shot. La plataforma relanza los barridos según un calendario, compara los resultados con la base de anuncios conocidos y asocia los anuncios nuevos a vendedores ya sancionados mediante el seller_id. Un vendedor con tres takedowns previos que reaparece con un cuarto anuncio pasa directo al principio de la cola: y se convierte en evidencia documentada de reincidencia, que la mayoría de los programas de marketplace escalan hasta el cierre de la tienda.

Un barrido funcional en Python

El script siguiente ejecuta una palabra clave de marca en tres marketplaces e imprime una lista priorizada de anuncios sospechosos, marcando todo lo que se venda por debajo del 40 % del PVP. Es deliberadamente mínimo: en producción persistiría los snapshots, deduplicaría contra los anuncios conocidos y alimentaría una cola de revisión.

Python
import requests

PILOTERR_API_KEY = "YOUR-API-KEY"
BRAND_KEYWORD = "acme headphones"
MSRP_EUR = 299.0
SUSPECT_THRESHOLD = 0.40  # marcar anuncios por debajo del 40 % del PVP

BASE = "https://api.piloterr.com/v2"
HEADERS = {"x-api-key": PILOTERR_API_KEY}

def sweep_aliexpress(keyword: str) -> list[dict]:
    r = requests.get(f"{BASE}/aliexpress/search",
                     headers=HEADERS, params={"query": keyword}, timeout=60)
    r.raise_for_status()
    return [
        {
            "marketplace": "aliexpress",
            "title": item["title"],
            "url": item["listing_url"],
            "price": item.get("price"),
            "currency": item.get("currency"),
            "seller": item.get("seller_name"),
            "sold_count": item.get("sold_count"),
        }
        for item in r.json().get("results", [])
    ]

def sweep_alibaba(keyword: str, subdomain: str = "www") -> list[dict]:
    r = requests.get(f"{BASE}/alibaba/search", headers=HEADERS,
                     params={"query": keyword, "subdomain": subdomain}, timeout=60)
    r.raise_for_status()
    return [
        {
            "marketplace": f"alibaba/{subdomain}",
            "title": item["title"],
            "url": item["listing_url"],
            "price": item.get("price_min"),
            "currency": "USD",
            "seller": item.get("seller_name"),
            "min_order": item.get("min_order"),
        }
        for item in r.json().get("results", [])
    ]

def sweep_amazon(keyword: str, domain: str = "com") -> list[dict]:
    r = requests.get(f"{BASE}/amazon/search", headers=HEADERS,
                     params={"query": keyword, "domain": domain}, timeout=60)
    r.raise_for_status()
    return [
        {
            "marketplace": f"amazon.{domain}",
            "title": item["title"],
            "url": item["url"],
            "price": item.get("real_price") or item.get("price"),
            "currency": "EUR" if domain in ("fr", "de", "es", "it") else "USD",
            "asin": item["asin"],
        }
        for item in r.json()
    ]

def main():
    listings = (
        sweep_aliexpress(BRAND_KEYWORD)
        + sweep_alibaba(BRAND_KEYWORD)
        + sweep_alibaba(BRAND_KEYWORD, subdomain="french")
        + sweep_amazon(BRAND_KEYWORD, domain="de")
    )

    suspects = [
        item for item in listings
        if item["price"] is not None
        and item["price"] < MSRP_EUR * SUSPECT_THRESHOLD
    ]
    suspects.sort(key=lambda item: item["price"])

    print(f"{len(listings)} anuncios recopilados, {len(suspects)} sospechosos\n")
    for item in suspects:
        seller = item.get("seller") or "vendedor desconocido"
        print(f"[{item['marketplace']}] {item['price']} {item['currency']} "
              f"| {seller}\n  {item['title'][:80]}\n  {item['url']}\n")

if __name__ == "__main__":
    main()

Desde aquí, la url de cada sospechoso va al endpoint product correspondiente para el snapshot de evidencias completo, y cada caso confirmado entra en la cola de enforcement.

Más allá de los marketplaces: sitios fraudulentos y suplantación

Los anuncios de marketplace son la superficie más grande, pero el abuso de marca no termina ahí. El mismo enfoque API-first cubre el resto del panorama de amenazas:

  • Sitios e-commerce fraudulentos: barra Google Search y Google Images con los términos de la marca, y luego perfile los dominios sospechosos con Domain Whois (registrador, fecha de creación, titular) y Website Technology: un dominio de dos semanas con un tema de Shopify clonado y sus fotos de producto es candidato a takedown.
  • Suplantación en redes sociales: vigile cuentas falsas y promoción de falsificaciones con Instagram User Info y X Profile Info.
  • Segunda mano y mercado gris: los barridos de Vinted, StockX y Leboncoin atrapan falsificaciones vendidas como «auténtico, usado una vez».

La brand protection es uno de los casos de uso de scraping más defendibles que existen: usted recopila ofertas comerciales mostradas públicamente para hacer valer derechos de propiedad intelectual, y los programas de takedown gestionados por los propios marketplaces dependen de que los titulares de derechos encuentren las infracciones. Los principios habituales siguen aplicando: recopilar solo datos públicos, respetar los límites de velocidad y no almacenar más datos personales de los que la acción de enforcement requiera. Para el marco general, consulte nuestra guía sobre la legalidad del web scraping.

En resumen

La brand protection a gran escala es un pipeline de datos: descubrir con APIs de búsqueda de marketplaces, calificar con heurísticas de precio y vendedor, documentar con endpoints product, hacer enforcement y re-escanear en bucle. Las plataformas que lo hacen bien no son las que tienen los mayores equipos legales: son aquellas cuya capa de detección nunca duerme.

Piloterr proporciona esa capa de detección como API: AliExpress, Alibaba, Amazon, eBay, Temu y el resto de la biblioteca de 500 endpoints, con bypass anti-bot y renderizado de navegador gestionados por nosotros. Si está construyendo herramientas de brand protection y quiere evaluar la calidad de los datos con sus propias marcas, cree una cuenta gratuita (+500 créditos, sin tarjeta de crédito) o hable con nosotros sobre precios por volumen y endpoints que podemos añadir para su caso de uso.

Más para leer

Guías y noticias sobre web scraping, proxies y extracción de datos.

Web Scraping

Web scraping para automoción: seguir precios de coches y piezas en AutoScout24, Mobile.de, Leboncoin y Autodoc

Cómo las plataformas de pricing automovilístico usan APIs de scraping para vigilar anuncios de coches de ocasión en AutoScout24, Mobile.de y Leboncoin, y precios de piezas en las más de 30 tiendas nacionales de Autodoc. Diseño del pipeline, ejemplos de API y un script en Python.

Josselin Liebe
Josselin Liebe
Leer
Web Scraping

Migración desde NetNut: qué hacer tras el cierre de la red

Google tomó medidas contra la red de proxies NetNut/Popa junto al FBI y Lumen. Cómo replantear tu stack de scraping sin gestionar proxies por tu cuenta.

Josselin Liebe
Josselin Liebe
Leer
Web Scraping

€17.99 en Francia, €29.99 en Alemania: monitoreo de precios por país

Misma referencia en el ERP, diferentes precios por país: promociones, monedas y surtido varían de una tienda a otra. Modelo de datos, ejemplos de API y un script en Python para un monitoreo de precios confiable.

Josselin Liebe
Josselin Liebe
Leer

¿Listo para empezar?

Tu API de web scraping está a un clic. Comienza con +500 créditos, sin infraestructura que configurar, sin proxies que gestionar y sin necesidad de tarjeta de crédito.

  • +500 créditos
  • Sin tarjeta de crédito
  • Todos los endpoints incluidos