La falsificación no es un problema de nicho. La OCDE estima el comercio de productos falsificados en cientos de miles de millones de dólares al año, y la mayor parte fluye hoy por los mismos canales que sus clientes usan a diario: AliExpress, Alibaba, Amazon, eBay, Temu y el social commerce. Para una marca, cada anuncio falsificado es ingreso perdido, un riesgo de seguridad y la dilución de una marca construida durante años.
Los equipos que combaten esto (departamentos internos de PI y plataformas especializadas de brand protection) enfrentan el mismo problema operativo: los anuncios infractores aparecen más rápido de lo que los humanos pueden encontrarlos, y los vendedores vuelven a publicar a los pocos días de un takedown. La respuesta no es sumar analistas pegando URLs en hojas de cálculo. Es un pipeline de detección automatizado construido sobre datos de marketplace fiables.
Este artículo muestra cómo funciona ese pipeline en la práctica, a partir de un patrón real de producción de uno de nuestros clientes (una plataforma de brand protection que no nombraremos), con llamadas de API concretas a AliExpress, Alibaba y Amazon.
El caso de uso: una plataforma de brand protection a gran escala
Uno de nuestros clientes opera un servicio de brand protection para empresas y creadores de contenido. Su promesa es fácil de enunciar y difícil de cumplir:
- Escanear continuamente: vigilar más de 100.000 sitios web, marketplaces, motores de búsqueda y plataformas sociales las 24 horas, en busca de falsificaciones, suplantaciones y vendedores no autorizados.
- Eliminar infracciones: enviar avisos legales a los editores, presentar quejas de PI en los marketplaces, desindexar páginas fraudulentas de los buscadores y dar de baja cuentas sociales falsas.
- Documentarlo todo: dar a cada cliente un dashboard con evidencias en tiempo real, estado del enforcement y tendencias de los infractores.
Los pasos 2 y 3 son trabajo legal y de producto. El paso 1 es un problema de ingeniería de datos, y ahí es donde la infraestructura de scraping decide el éxito o el fracaso del negocio. Su plataforma ejecuta barridos recurrentes por palabras clave de marca en los marketplaces a través de las APIs de Piloterr, en lugar de mantener internamente una flota de navegadores headless, proxies y parsers por sitio.
Vale la pena detallar por qué externalizan la capa de scraping, porque aplica a cualquier equipo que construya herramientas de brand protection:
- Los marketplaces son objetivos hostiles. Las páginas de búsqueda de AliExpress son single-page applications en JavaScript detrás de sistemas anti-bot. Amazon rota sus layouts y limita el tráfico agresivamente. Mantener lógica de bypass para una docena de sitios equivale a un equipo de ingeniería a tiempo completo.
- La cobertura debe estar localizada. Los vendedores de falsificaciones apuntan deliberadamente a mercados donde la marca vigila menos. Un barrido que solo revisa
alibaba.comen inglés pierde los anuncios mostrados a compradores franceses o polacos. - Las evidencias deben ser estructuradas. Un aviso de takedown necesita la identidad del vendedor, el precio, la URL del anuncio y una marca de tiempo: campos JSON, no capturas de pantalla de HTML crudo.
Anatomía de un pipeline de detección de falsificaciones
El pipeline tiene cuatro etapas, y cada una corresponde a llamadas de API específicas.
Descubrir Calificar Documentar Enforcement y monitoreo
(APIs search) (scoring) (APIs product) (takedown + re-scan)
│ │ │ │
barridos por → heurísticas → identidad del → queja de PI,
marca precio/vendedor vendedor, imágenes vigilancia de republicaciones
Etapa 1: descubrir anuncios con los endpoints de búsqueda
Todo empieza con barridos por palabras clave de marca. Para cada marca protegida, la plataforma consulta el endpoint de búsqueda de cada marketplace cubierto con el nombre de la marca, errores ortográficos comunes (variantes tipo «nlke», «addidas») y palabras clave de las líneas de producto.
En AliExpress, una sola llamada devuelve anuncios estructurados con precio, vendedor y volumen de ventas:
curl -G "https://api.piloterr.com/v2/aliexpress/search" \
-H "x-api-key: YOUR-API-KEY" \
--data-urlencode "query=acme headphones"
Cada resultado incluye product_id, title, listing_url, price, currency y, cuando se muestran, sold_count, seller_name y seller_id. Los campos de paginación (total_results, total_pages, next) permiten agotar el conjunto de resultados: añada ?page=N a una URL wholesale para paginar.
En Alibaba, el lado B2B importa aún más: es donde las falsificaciones se abastecen aguas arriba, al por mayor, antes de llegar a los marketplaces de consumo. La API Alibaba Search expone el MOQ y la identidad del proveedor directamente en la tarjeta de resultado, y soporta 17 subdominios localizados:
# Escaparate en inglés
curl -G "https://api.piloterr.com/v2/alibaba/search" \
-H "x-api-key: YOUR-API-KEY" \
--data-urlencode "query=acme headphones"
# El mismo barrido en el escaparate francés: aparecen otros vendedores
curl -G "https://api.piloterr.com/v2/alibaba/search" \
-H "x-api-key: YOUR-API-KEY" \
--data-urlencode "query=acme headphones" \
--data-urlencode "subdomain=french"
Ejecutar la misma palabra clave en los subdominios french, german, spanish o polish hace aflorar con regularidad proveedores que nunca aparecen en el escaparate en inglés. Para un barrido de brand protection, cada locale es un mercado distinto que limpiar.
En Amazon, la API Search cubre todos los grandes marketplaces mediante el parámetro domain:
curl -G "https://api.piloterr.com/v2/amazon/search" \
-H "x-api-key: YOUR-API-KEY" \
--data-urlencode "query=acme headphones" \
--data-urlencode "domain=de"
Los resultados incluyen asin, title, price, real_price, rating y reviews_count, tanto de anuncios orgánicos como patrocinados. Los patrocinados importan: los falsificadores compran anuncios sobre las palabras clave de la propia marca.
El mismo patrón se extiende a eBay, Temu, Etsy, Allegro, Cdiscount y el resto de la colección e-commerce. Una sola integración, un solo esquema de autenticación (x-api-key), JSON consistente.
Etapa 2: calificar sospechosos con heurísticas de scoring
Un barrido por palabra clave de marca devuelve mayoritariamente anuncios legítimos. La capa de calificación separa los sospechosos del ruido usando los campos estructurados que devuelven las APIs de búsqueda:
| Señal | Campo(s) | Por qué importa |
|---|---|---|
| Precio muy por debajo del PVP | price, currency | Un producto de 300 € listado a 24 € es el indicador de falsificación más fuerte |
| Vendedor desconocido | seller_name, seller_id | No figura en la lista de distribuidores autorizados de la marca |
| Alto volumen en un anuncio nuevo | sold_count | Las falsificaciones que rotan rápido causan el mayor daño |
| Disponibilidad B2B al por mayor | min_order, price_min (Alibaba) | «MOQ de 500 piezas» de un producto de marca en una fábrica desconocida |
| Marca en el título, campo brand incorrecto | title vs brand | Patrón de keyword-stuffing típico de los infractores |
Ninguna de estas señales prueba por sí sola la infracción. Combinadas, producen una cola priorizada donde un analista humano (o, cada vez más, un modelo de comparación de imágenes que contrasta image_url con los recursos oficiales de la marca) confirma el caso en segundos en lugar de buscarlo durante horas.
Etapa 3: documentar con los endpoints product
Los programas de quejas de PI de los marketplaces (el IPP de Alibaba, el Brand Registry de Amazon, el VeRO de eBay) exigen evidencias específicas y verificables. Eso es lo que proporcionan los endpoints product.
Una vez marcado un anuncio, recupere su ficha de producto completa. En AliExpress, la API Product siempre devuelve la identidad del vendedor, que las tarjetas de búsqueda solo exponen a veces:
curl -G "https://api.piloterr.com/v2/aliexpress/product" \
-H "x-api-key: YOUR-API-KEY" \
--data-urlencode "query=https://www.aliexpress.com/item/1005001234567890.html"
La respuesta le da el expediente de evidencias completo: título, todas las imágenes del producto, seller_id, seller_name, precios, especificaciones y detalles de envío, como JSON estructurado que puede archivar con marca de tiempo. Lo mismo aplica a Alibaba Product (tramos de cantidad, perfil del proveedor, plazos de entrega: la prueba de una fabricación de falsificaciones al por mayor) y Amazon Product.
En Amazon, un endpoint más resulta decisivo para las marcas que también venden allí: Amazon Product Offer lista los vendedores terceros en un ASIN dado. Los falsificadores muchas veces no crean anuncios nuevos: adjuntan stock falso a la propia ficha legítima de la marca. Monitorear la lista de ofertas de sus propios ASIN detecta exactamente eso.
Etapa 4: enforcement, y luego vigilar las republicaciones
El takedown en sí ocurre en el programa de PI del marketplace: fuera de la capa de scraping. Pero el enforcement sin monitoreo es una rueda de hámster. Los vendedores infractores, de forma rutinaria:
- vuelven a publicar el mismo producto bajo un nuevo
product_ida los pocos días, - clonan el anuncio en una tienda hermana (mismo
seller_id, anuncio nuevo), - se mueven a otro subdominio localizado o directamente a otro marketplace.
Por eso el pipeline es un bucle, no un one-shot. La plataforma relanza los barridos según un calendario, compara los resultados con la base de anuncios conocidos y asocia los anuncios nuevos a vendedores ya sancionados mediante el seller_id. Un vendedor con tres takedowns previos que reaparece con un cuarto anuncio pasa directo al principio de la cola: y se convierte en evidencia documentada de reincidencia, que la mayoría de los programas de marketplace escalan hasta el cierre de la tienda.
Un barrido funcional en Python
El script siguiente ejecuta una palabra clave de marca en tres marketplaces e imprime una lista priorizada de anuncios sospechosos, marcando todo lo que se venda por debajo del 40 % del PVP. Es deliberadamente mínimo: en producción persistiría los snapshots, deduplicaría contra los anuncios conocidos y alimentaría una cola de revisión.
import requests
PILOTERR_API_KEY = "YOUR-API-KEY"
BRAND_KEYWORD = "acme headphones"
MSRP_EUR = 299.0
SUSPECT_THRESHOLD = 0.40 # marcar anuncios por debajo del 40 % del PVP
BASE = "https://api.piloterr.com/v2"
HEADERS = {"x-api-key": PILOTERR_API_KEY}
def sweep_aliexpress(keyword: str) -> list[dict]:
r = requests.get(f"{BASE}/aliexpress/search",
headers=HEADERS, params={"query": keyword}, timeout=60)
r.raise_for_status()
return [
{
"marketplace": "aliexpress",
"title": item["title"],
"url": item["listing_url"],
"price": item.get("price"),
"currency": item.get("currency"),
"seller": item.get("seller_name"),
"sold_count": item.get("sold_count"),
}
for item in r.json().get("results", [])
]
def sweep_alibaba(keyword: str, subdomain: str = "www") -> list[dict]:
r = requests.get(f"{BASE}/alibaba/search", headers=HEADERS,
params={"query": keyword, "subdomain": subdomain}, timeout=60)
r.raise_for_status()
return [
{
"marketplace": f"alibaba/{subdomain}",
"title": item["title"],
"url": item["listing_url"],
"price": item.get("price_min"),
"currency": "USD",
"seller": item.get("seller_name"),
"min_order": item.get("min_order"),
}
for item in r.json().get("results", [])
]
def sweep_amazon(keyword: str, domain: str = "com") -> list[dict]:
r = requests.get(f"{BASE}/amazon/search", headers=HEADERS,
params={"query": keyword, "domain": domain}, timeout=60)
r.raise_for_status()
return [
{
"marketplace": f"amazon.{domain}",
"title": item["title"],
"url": item["url"],
"price": item.get("real_price") or item.get("price"),
"currency": "EUR" if domain in ("fr", "de", "es", "it") else "USD",
"asin": item["asin"],
}
for item in r.json()
]
def main():
listings = (
sweep_aliexpress(BRAND_KEYWORD)
+ sweep_alibaba(BRAND_KEYWORD)
+ sweep_alibaba(BRAND_KEYWORD, subdomain="french")
+ sweep_amazon(BRAND_KEYWORD, domain="de")
)
suspects = [
item for item in listings
if item["price"] is not None
and item["price"] < MSRP_EUR * SUSPECT_THRESHOLD
]
suspects.sort(key=lambda item: item["price"])
print(f"{len(listings)} anuncios recopilados, {len(suspects)} sospechosos\n")
for item in suspects:
seller = item.get("seller") or "vendedor desconocido"
print(f"[{item['marketplace']}] {item['price']} {item['currency']} "
f"| {seller}\n {item['title'][:80]}\n {item['url']}\n")
if __name__ == "__main__":
main()
Desde aquí, la url de cada sospechoso va al endpoint product correspondiente para el snapshot de evidencias completo, y cada caso confirmado entra en la cola de enforcement.
Más allá de los marketplaces: sitios fraudulentos y suplantación
Los anuncios de marketplace son la superficie más grande, pero el abuso de marca no termina ahí. El mismo enfoque API-first cubre el resto del panorama de amenazas:
- Sitios e-commerce fraudulentos: barra Google Search y Google Images con los términos de la marca, y luego perfile los dominios sospechosos con Domain Whois (registrador, fecha de creación, titular) y Website Technology: un dominio de dos semanas con un tema de Shopify clonado y sus fotos de producto es candidato a takedown.
- Suplantación en redes sociales: vigile cuentas falsas y promoción de falsificaciones con Instagram User Info y X Profile Info.
- Segunda mano y mercado gris: los barridos de Vinted, StockX y Leboncoin atrapan falsificaciones vendidas como «auténtico, usado una vez».
¿Es legal scrapear marketplaces para brand protection?
La brand protection es uno de los casos de uso de scraping más defendibles que existen: usted recopila ofertas comerciales mostradas públicamente para hacer valer derechos de propiedad intelectual, y los programas de takedown gestionados por los propios marketplaces dependen de que los titulares de derechos encuentren las infracciones. Los principios habituales siguen aplicando: recopilar solo datos públicos, respetar los límites de velocidad y no almacenar más datos personales de los que la acción de enforcement requiera. Para el marco general, consulte nuestra guía sobre la legalidad del web scraping.
En resumen
La brand protection a gran escala es un pipeline de datos: descubrir con APIs de búsqueda de marketplaces, calificar con heurísticas de precio y vendedor, documentar con endpoints product, hacer enforcement y re-escanear en bucle. Las plataformas que lo hacen bien no son las que tienen los mayores equipos legales: son aquellas cuya capa de detección nunca duerme.
Piloterr proporciona esa capa de detección como API: AliExpress, Alibaba, Amazon, eBay, Temu y el resto de la biblioteca de 500 endpoints, con bypass anti-bot y renderizado de navegador gestionados por nosotros. Si está construyendo herramientas de brand protection y quiere evaluar la calidad de los datos con sus propias marcas, cree una cuenta gratuita (+500 créditos, sin tarjeta de crédito) o hable con nosotros sobre precios por volumen y endpoints que podemos añadir para su caso de uso.