Saltar al contenido

API de scraping

API de scraping para fiables
Recuperación de datos de la web.

Envía una URL y recibe el cuerpo de la página, una respuesta JSON o campos seleccionados mientras WebScrapingAPI opera enrutamiento por proxy, manejo de acceso, renderización JavaScript opcional y retemplazos internos target.

  • api_key + urlSolicitud válida más pequeña
  • Enrutamiento administradoRotación por representación y manejo de acceso
  • Render_js opcionalRenderado del navegador cuando sea necesario
  • Cuerpo · JSON · selectoresLas opciones de respuesta documentadas

Una solicitud gestionada

API de scraping mantiene la infraestructura de recuperación
de su solicitud.

Proporcione el target y las opciones de solicitud documentadas. WebScrapingAPI opera la capa de acceso y devuelve una respuesta que su tubería existente puede inspeccionar.

01 · conectar

Integración simple del lado del servidor

Begin with api_key and a URL-encoded url. Add method, location, rendering, response, or asynchronous options only when the workload requires them.

View code examples
02 · recuperar

Manejo de acceso gestionado

WebScrapingAPI operates proxy routing, rotation, access-handling strategies, and internal target retries behind the API request.

Review managed features
03 · recibir

Las opciones de respuesta documentadas

Return the page body, a JSON envelope, a JSON DOM, customer-defined selected fields, or an explicit documented error state.

Review response formats
Your application providesTarget URL + request context
WebScrapingAPI operatesRouting + access handling + rendering
Your application receivesBody + JSON + selected fields

Características de acceso automatizado

Mover el trabajo de recuperación repetible detrás de una solicitud API de scraping.

Configure el contexto que necesita su flujo de trabajo. WebScrapingAPI opera la infraestructura de acceso de soporte mientras mantiene los estados fallidos visibles para su cliente.

01

Enrutamiento y rotación por proxy

El servicio selecciona y opera la ruta de proxy detrás de cada contexto de solicitud soportado.

02

Manejo y retensos de acceso

Las estrategias de acceso automatizadas y los intentos internos target reducen la infraestructura que su aplicación tiene que ejecutar.

03

Resultados de acceso observables

Los errores de validación, acceso, tarifa y servicio siguen siendo explícitos para que su aplicación pueda manejar deliberadamente las solicitudes fallidas.

04

Rendering de JavaScript opcional

Se ha establecidorender_js=1Cuando el target necesita ejecución del lado del cliente antes de que se devuelva la respuesta de la página.

05

Contexto de la solicitud geográfica

Solicitar un país documentado y un contexto de ciudad, estado o ASN apoyado cuando la ubicación afecte a la respuesta.

06

Control de solicitud y salida

Utilice métodos soportados, un cuerpo opcional, tiempo de espera, recuperación asincrona, modos JSON o reglas de extracción.

Diseño de respuesta

Retorna el nivel de respuesta que puede utilizar tu flujo de trabajo.

Mantenga el cuerpo de la página, envuélvelo con metadatos de solicitud, ejecute selectores en el límite de la API o obtenga un resultado en cola más tarde.

body

Respuesta de la página en bruto

Utilice el cuerpo de página predeterminado con un parser existente.

json_response=1

Envase de JSON

Organismo de inspección, target encabezados, estado inicial, tipo, costo y metadatos.

extract_rules

Los campos seleccionados

Ejecutar CSS o XPath selectores de propiedad del cliente para texto, HTML, atributos, tablas o registros anidados.

async + snapshot_id

Recuperación en fila

Envía el trabajo de forma asíncrona y recupera la respuesta completada utilizando su identificador.

Límites de extracción:WebScrapingAPI ejecuta las reglas proporcionadas. Su equipo posee el esquema, selectores, validación de campo de negocio y mantenimiento de cambio de fuente. Elige API de datos o Datos gestionados cuando esas obligaciones se trasladen a WebScrapingAPI.

Cómo funciona

From target URL to application-ready response in three steps.

Su aplicación define la solicitud. WebScrapingAPI maneja la recuperación. Su cliente recibe la salida solicitada o un estado explícito en el que puede actuar.

  1. 01Envía la solicitud

    Proporcione la clave de API, target URL, y solo el contexto documentado o las opciones de salida que la carga de trabajo necesita.

  2. 02WebScrapingAPI recupera la página

    El servicio valida la solicitud, opera el enrutamiento proxy, aplica el manejo de acceso y los intentos internos, y hace renderizar JavaScript cuando se lo solicita.

  3. 03Recibir la respuesta

    Utilice el cuerpo de la página devuelta, el sobre JSON, los campos seleccionados o el error documentado dentro de su aplicación existente.

Metadatos de la solicitud
Las URL resueltas y los encabezados de respuesta desglosados están disponibles a través de encabezados de respuesta documentados.
Contexto de uso
El uso del crédito por llamada y el uso actual se pueden inspeccionar a través de los encabezados documentados prefijados por la WSA.
Contrato de error
Los errores de validación, acceso, tasa y servicio siguen siendo entradas explícitas para el manejo del lado del cliente.

Integración de desarrolladores

Llame a un punto final del idioma
ya está ejecutando su pipeline de datos.

Mantenga la clave API en el lado del servidor, codifique la URL target, comience con una solicitud básica y añada renderización, geografía o extracción solo cuando la carga de trabajo lo requiera.

01 · resumen de integración

Comience con la petición más pequeña válida.

Envíaapi_keyy una URL codificadaurl- Añadir .render_js=1, contexto geográfico, modo de respuesta o reglas de extracción sólo cuando las target y el flujo de trabajo aguas abajo lo requieren.

Los secretos
Mantenga .WSA_API_KEY server-side
Target
Encuentra la dirección de cada URL target
Respuesta
Inspeccionar el estado y el tipo antes de analizar
Los fracasos
Utilice el backkoff limitado para estados retriebibles
curl --get --fail-with-body --max-time 120 \ "https://api.webscrapingapi.com/v2" \ --data-urlencode "api_key=$WSA_API_KEY" \ --data-urlencode "url=https://example.com/public-page" \ --data-urlencode "json_response=1"

Se ha establecidoWSA_API_KEYEn este caso, el sistema de control de la información de los datos de los usuarios puede ser utilizado en un entorno protegido./v2Ruta HTTP con un envase de respuesta JSON.

Propiedad operativa

WebScrapingAPI opera la recuperación. Su equipo es dueño del producto de datos.

WebScrapingAPI opera el enrutamiento, la representación opcional y los intentos internos target. Su equipo posee target elegibilidad, la especificación de la solicitud, extracción, almacenamiento y uso en aguas posteriores.

WebScrapingAPI

Infraestructura de solicitudes gestionadas

  • Validación y ejecución de las solicitudes de API
  • Enrutamiento y rotación por proxy
  • Manejo automático de acceso y retensos internos target
  • Rendering opcional respaldado por el navegador
  • Respuesta documentada y entrega de errores

Su equipo

Decisiones sobre la fuente y el producto de los datos

  • Target Política de elegibilidad, uso previsto y solicitud
  • URL, método, contexto, tiempo de espera y opciones de salida
  • Manejo de fallos a nivel de API y validación de la empresa
  • Extracción aguas abajo, mantenimiento y almacenamiento del selector
  • Programación, linaje, retención y uso a continuación
Fuente y finalidadCustomer defines eligible sources and intended use.
Contrato de solicitudCustomer configures the documented request; WebScrapingAPI validates and executes it.
Capas de accesoWebScrapingAPI operates proxy routing, access handling, internal retries, and optional rendering.
RespuestaWebScrapingAPI returns the requested output or documented error; the customer validates content for its application.
ExtracciónWebScrapingAPI executes supplied rules; the customer owns selectors, schema, and change maintenance.
Operaciones en aguas subidasCustomer owns scheduling, storage, monitoring, retention, and decisions.

Use the service only for eligible public webpages. Review source terms, applicable requirements, and the Acuerdo de servicio, then apply appropriate request, retention, and data-use policies.

Selección de producto

Elige el producto por la parte del flujo de trabajo que tu equipo quiere mantener.

Comienza con la propiedad operativa, no se superponen las características. API de scraping se ajusta a una solicitud de página gestionada; los productos adyacentes mueven un límite diferente.

Orientación de precios

Evaluar con el representante targets antes de dimensionar un plan.

El precio actual sigue siendo la fuente de la verdad. Utilice una muestra realista de solicitud para comprender las opciones y el comportamiento operativo que utilizará su carga de trabajo de producción.

Evaluación de los servicios propios

Mover una solicitud representativa en la API.

Comience con la ruta HTTP básica, luego prueba sólo los controles que su mezcla de producción target requiere.

  • Las direcciones URL representativas y los métodos target
  • Mix de solicitudes estáticas versus renderizados por el navegador
  • Requisitos geográficos, de tiempo de espera y de respuesta
  • Los estados de error observados y la política de retemplaje del cliente

FAQ

API de scraping preguntas para una evaluación fundamentada.

Utilice estas respuestas para elegir el producto y solicitar el camino, luego revise la documentación actual para obtener detalles de parámetros y errores.

Read Scraper API docs

¿Qué es API de scraping?

API de scraping es un punto final de solicitud del lado del servidor que recupera una página web pública elegible mientras que WebScrapingAPI opera la infraestructura de acceso detrás de la solicitud. Su aplicación proporciona la URL y las opciones documentadas, luego recibe la respuesta de la página solicitada.

¿Qué es lo que devuelve API de scraping?

La respuesta predeterminada es el cuerpo de la página recuperada. Las opciones documentadas pueden devolver un sobre JSON, una representación JSON DOM, campos seleccionados con reglas de extracción o un resultado asíncrono que su aplicación recupera más tarde.

¿El API de scraping hace traducir JavaScript?

Sí. Establezca render_js=1 cuando una página requiere ejecución JavaScript del lado del cliente antes de devolver la respuesta. Utilice API de navegador cuando el flujo de trabajo necesita una secuencia documentada de interacciones del navegador, espera del estado de la página, clics o pasos de navegación.

¿Qué trabajo de acceso gestiona el API de scraping?

WebScrapingAPI opera enrutamiento por proxy, rotación, estrategias de manejo de acceso y intentos internos target dentro del servicio.

¿Qué métodos HTTP son compatibles?

API de scraping soporta las solicitudes GET, POST, PUT y PATCH. Incluya un cuerpo de solicitud cuando el método seleccionado y el flujo de trabajo target requieren uno.

¿Puedo solicitar contenido específico de ubicación?

Los controles documentados incluyen el país y el contexto de ciudad, estado o ASN compatibles. La disponibilidad exacta puede depender del plan, la geografía y la ruta actuales, así que confirme las ubicaciones requeridas por su carga de trabajo.

¿Puede API de scraping devolver los campos seleccionados?

Sí. Las reglas de extracción de CSS o XPath proporcionadas por el cliente pueden devolver texto seleccionado, HTML, atributos, tablas, listas o registros anidados. Su equipo es dueño de los selectores, esquema, validación y mantenimiento de cambio de fuente para esas reglas.

¿Pueden ejecutarse las solicitudes de manera asíncrona?

Sí. Requiere una solicitud con la opción documentada asincrona, retenga el identificador devuelto y obtenga el resultado completado más tarde pasando ese identificador como snapshot_id.

¿Cómo debería manejar mi solicitud si no se cumplen?

Inspeccione el estado y el cuerpo de errores HTTP documentados, use retry y backoff limitados cuando sea apropiado, y distingue un fallo de API de contenido que esté presente pero incompleto para su esquema de negocio.

¿En qué es diferente el API de scraping de los Proxies, API de navegador, y API de datos?

API de scraping administra la recuperación de una página. Los proxies dejan el cliente HTTP y la lógica de recogida con su equipo, API de navegador ejecuta interacciones de navegador documentadas dentro de una solicitud REST del lado del servidor y API de datos devuelve registros estructurados mantenidos para fuentes compatibles.

Su primera petición

Mover una página representativa en la API.

Comience a servido por sí mismo, o traiganos la mezcla target, respuesta requerida, geografía y perfil de solicitud esperado para una revisión de producción.