Saltar al contenido

Blog

Perspectivas e ingeniería

Análisis en profundidad de la infraestructura de datos web, las técnicas de extracción y el futuro de los datos estructurados a gran escala.

Últimos artículos

181 artículos

Cómo utilizar un proxy en Node-Fetch: Guía práctica
Guías

Cómo utilizar un proxy en Node-Fetch: Guía práctica

TL;DR: Node-Fetch no tiene un interruptor de proxy incorporado, por lo que debe conectar un agente HTTP, HTTPS o SOCKS5 a la solicitud a través de su opción de agente. Esta guía explica cómo usar un proxy en Node-Fetch de principio a fin: proxies HTTP y HTTPS autenticados, SOCKS5, rotación, reintentos, casos extremos de TLS, resolución de problemas y la ruta moderna undici para Node 18+ native fetch.

Mihnea-Octavian Manolache13 min read
Leer artículo
Web Scraping Tablas JavaScript en Python: De las API ocultas a Playwright
Guías

Web Scraping Tablas JavaScript en Python: De las API ocultas a Playwright

TL;DR: Web scraping JavaScript tables in Python raramente necesita un navegador headless. Abra DevTools, encuentre el punto final JSON que hidrata la cuadrícula, reprodúzcala con solicitudes, pagínela y vuelva a Playwright solo cuando la llamada de red esté firmada, cifrada o sellada de alguna otra forma.

Andrei Ogiolan13 min read
Leer artículo
Cómo raspar tablas HTML en Golang con Colly: Guía de principio a fin
Guías

Cómo raspar tablas HTML en Golang con Colly: Guía de principio a fin

TL;DR: Esta guía muestra cómo raspar tablas HTML en Golang de principio a fin: elegir entre Colly, goquery y golang.org/x/net/html, apuntar al <tbody> correcto, modelar filas como una estructura tipada y exportar JSON y CSV limpios. También obtendrá patrones de paginación, antibloqueo y tablas renderizadas en JavaScript.

Andrei Ogiolan12 min read
Leer artículo
Playwright Web Scraping: La guía completa para Python y Node.js
Guías

Playwright Web Scraping: La guía completa para Python y Node.js

TL;DR: Playwright te ofrece una automatización completa del navegador para el scraping de sitios con mucho JavaScript, con soporte de primera clase tanto para Python como para Node.js. Esta guía le guiará a través de la instalación, extracción de elementos, configuración de proxy, antidetección, paginación, descarga de imágenes y exportación de datos a CSV o JSON, todo ello con ejemplos de código en ambos lenguajes.

Mihnea-Octavian Manolache17 min read
Leer artículo
Cómo buscar reseñas en Google Maps: Una guía práctica en Python
Guías

Cómo buscar reseñas en Google Maps: Una guía práctica en Python

TL;DR: Averiguar cómo raspar Google Maps para las revisiones se reduce a tres vías de método: un raspador de Selenium DIY detrás de un proxy giratorio, una API de raspado con instrucciones de renderizado, o una API de revisiones de Maps estructurada que devuelve JSON analizado. Esta guía recorre las tres vías en Python con código copiable y pegable, patrones de paginación, tácticas antibloqueo y un paso final de limpieza que convierte las reseñas sin procesar en algo que una empresa puede utilizar realmente.

Andrei Ogiolan18 min read
Leer artículo
Descarga páginas web y archivos sin esfuerzo con Python y wget
Guías

Descarga páginas web y archivos sin esfuerzo con Python y wget

Automatiza la extracción de datos web y la descarga de archivos con Python y wget. Aprende a utilizar estas herramientas para recopilar datos y ahorrar tiempo.

Gabriel Cioci8 min read
Leer artículo

Empieza a crear

¿Estás listo para ampliar tu recopilación de datos?

Únete a más de 2000 empresas que utilizan WebScrapingAPI para extraer datos de la web a escala empresarial sin ningún gasto de infraestructura.