Saltar al contenido

Datos y feeds

Archivo web para instantáneas históricas de páginas públicas.

Busque capturas pasadas por dominio, patrón de URL, rango de fecha, idioma y tipo de contenido. Reciba páginas correspondientes con metadatos instantáneos para investigación, retroalimentación, datos de IA y análisis de cambios.

  • El alcance de la consultaModelo de dominio y URL
  • Contexto temporalIntervalo de fecha y tiempo de captura
  • paquete de instantáneasPágina almacenada con metadatos
  • Caminos de entregaS3 o webhook

Diseño de la consulta

Comience con la pequeña rebanada histórica que responde a la pregunta.

Definir lo que pertenece a la búsqueda antes de recuperar páginas. Un resumen enfocado mantiene el conjunto correspondiente relevante, más fácil de estimar y más sencillo de procesar en el torrente inferior.

  1. 01 · fuente

    Dominio · patrón de URL

    Elige dominios y familias de URL.

    Nombre de los dominios públicos y patrones de trayectoria que contienen las páginas de su investigación, índice o corpus necesita.

  2. 02 · tiempo

    Fecha de inicio · Fecha de finalización

    Establezca la ventana histórica.

    Utilice un rango de fechas preciso para que cada captura coincida pertenezca al período que desea analizar o completar.

  3. 03 · contenido

    Lenguaje · tipo de contenido

    Mantenga los tipos de páginas pertinentes.

    Estricto por idioma y tipo de contenido cuando el flujo de trabajo receptor espera un tipo particular de material fuente.

  4. 04 · destino

    S3 · webhook

    Diseño para el oleoducto receptor.

    Elija cómo debe llegar el paquete de archivo y guarde el contenido de la página junto a sus metadatos de captura desde la primera entrega.

Contexto histórico

Lea una página como una secuencia, no un solo estado actual.

Las capturas coincidentes crean un historial datado para cada URL o familia de URL. Mantenga la página almacenada y captura el contexto juntos para que los equipos de aguas abajo puedan comparar versiones con un eje de tiempo claro.

Illustrative snapshot historyOne URL · three captures
  1. Antes de eso
    Captura de línea de base

    Mantenga la página tal como apareció en el momento de la captura.

    snapshot 01
  2. Revisión
    Modificación de la página

    Guarde otra captura para la comparación de campos, texto, enlace o diseño río abajo.

    snapshot 02
  3. Más tarde
    Estado archivado posteriormente

    Complete la ventana solicitada con la última captura de coincidencia en el conjunto de resultados.

    snapshot 03
Hacer inspectables las cobertura

Revise el alcance correspondiente con los dominios, caminos, fechas, idiomas y tipos de contenido seleccionados. Refinar la consulta hasta que el resultado represente la parte histórica que puede usar su flujo de trabajo.

Recuperación y entrega

Mover de un conjunto de coincidencia de alcance a un paquete de archivo utilizable.

El proceso de producción es deliberado: definir filtros, revisar el alcance y la estimación correspondientes, preparar las páginas históricas seleccionadas y luego entregar contenido y metadatos juntos.

  1. 01 · definir

    Envía el informe de consulta.

    Dominio, patrones de URL, rango de fechas, idioma, tipo de contenido y destino.

  2. 02 · revisión

    Inspeccione el alcance correspondiente.

    Compruebe si la forma del resultado se alinea con la pregunta histórica antes de la recuperación.

  3. 03 · preparar

    Mantenga las instantáneas y el contexto juntos.

    Package stored pages with URL, capture time, language, type, and collection metadata.

  4. 04 · entregar

    Envía el paquete río abajo.

    Seleccione S3 o entrega webhook para el flujo de trabajo de datos de recepción.

WebScrapingAPI opera

Buscar archivos, recuperar, empacar y entregar.

  • Apply the selected archive filters
  • Prepare the matched snapshot set
  • Keep snapshot metadata with stored pages
  • Deliver through the selected archive path
Su equipo define

La pregunta, el alcance utilizable y el producto de datos a continuación.

  • Approved domains, paths, and historical window
  • Language and content requirements
  • Parsing, comparison, indexing, or model workflow
  • Storage, retention, access, and downstream decisions
¿Necesitas una salida estructurada?

Mover la extracción, normalización, monitoreo de calidad y entrega recurrente a Datos gestionados.

Archivo web proporciona páginas históricas y contexto. Datos gestionados es el camino operado cuando la salida terminada debe ser un conjunto de datos estructurado mantenido.

Explore Managed Data

Aplicación del producto

Elija el historial, la recopilación en vivo, los registros estructurados o la entrega operada.

Archivo web comienza con capturas ya presentes en una ventana histórica.

Productos

Mejor punto de partida

Lo que recibes

Aplicación para el funcionamiento

Archivo web

Un dominio histórico, familia de URL y ventana de fecha

Páginas públicas almacenadas con metadatos instantáneos

Descubrimiento histórico, análisis de cambios y retroalimentación

Mercado de datos

Un dominio de datos y esquema disponibles

Detalles y muestras representativas de los conjuntos de datos preparados

Descubra una colección existente antes de elegir la entrega

Fuentes de datos

Una colección estructurada definida, cadencia y destino

Entrega estructurada programada recurrente

Mantener un alcance de datos conocido fluyendo a los sistemas en aguas subidas

API de rastreo

Una nueva colección de múltiples páginas

Resultados de recogida alineados durante la evaluación

Recoger páginas elegibles relacionadas en los puntos de entrada aprobados

API de datos

Fuente de apoyo target

Registros estructurados mantenidos a petición

Acceso a la fuente dirigida por la aplicación a través de un esquema conocido

Datos gestionados

Una fuente personalizada, esquema, cadencia y destino

Una entrega estructurada totalmente operativa

Recogida, extracción, calidad y mantenimiento

Orientación de precios

Precio de la parte histórica que su equipo realmente utilizará.

La información sobre los precios actuales es la fuente de la verdad. Una revisión útil comienza con el alcance de la consulta, el volumen esperado, el paquete de contenido, el destino y los requisitos de soporte.

FAQ

Archivo web preguntas para una evaluación enfocada.

Utilice estas respuestas para dar forma a la primera consulta de archivo, comprender el registro entregado y elegir el límite de producto correcto.

Alcance de una consulta de archivo

¿Qué es Archivo web?

Archivo web ayuda a los equipos a encontrar instantáneas históricas de páginas públicas ya presentes en el archivo. Define los dominios relevantes, patrones de URL, rango de fecha, idioma y tipo de contenido, luego recibe las páginas correspondientes con contexto de captura.

¿Qué incluye una instantánea de archivo?

Una instantánea entregada empareja la página almacenada con metadatos de instantánea como la URL de origen, el tiempo de captura, el idioma, el tipo de contenido y el contexto de recopilación necesarios para organizarla o compararla en el río abajo.

¿Cómo puedo restringir una consulta de archivo?

La búsqueda se puede realizar con un dominio o conjunto de dominios, patrones de URL, un rango de fechas, idioma y tipo de contenido. Los filtros más ajustados hacen que el conjunto coincidente sea más fácil de revisar y mantener la entrega enfocada en la parte histórica de su flujo de trabajo.

¿Puedo revisar el alcance coincidente antes de la entrega?

Sí. El flujo de evaluación está diseñado en torno a revisar el alcance y la estimación coincidentes antes de que se prepare el paquete de instantáneas.

¿Cómo se entregan los datos de archivo?

El paquete de archivo se puede entregar a S3 o webhook, con páginas almacenadas y sus metadatos instantáneos mantenidos juntos. Elige el camino que mejor se adapte a tu ingestión, almacenamiento y flujo de trabajo de procesamiento.

¿En qué es diferente el Archivo web del API de rastreo?

Archivo web busca capturas históricas ya presentes en una ventana de tiempo elegida. API de rastreo es el mejor ajuste cuando necesita planificar una nueva colección limitada en páginas públicas elegibles relacionadas.

¿En qué se diferencia el Archivo web del Mercado de datos, el Fuentes de datos, y el API de datos?

Archivo web ofrece páginas históricas con metadatos capturados.Mercado de datosayuda a los equipos a descubrir y a tomar muestras de conjuntos de datos preparados,Fuentes de datosproporciona una entrega estructurada programada recurrente, y API de datos Registros estructurados mantenidos para la fuente de apoyo target S.

¿Puede Archivo web apoyar el análisis de la historia de los cambios?

Recupera capturas para la misma familia de URL o URL a través de un rango de fechas definido, retenga cada tiempo de captura y compare las versiones en su flujo de trabajo de investigación, indexación, monitoreo o extracción.

¿Qué debo proporcionar para el precio?

Trae los dominios, patrones de URL, rango de fecha, filtros de idioma y tipo de contenido, alcance esperado, preferencias de entrega y requisitos de soporte.

Breve información histórica

Convierta una pregunta histórica en un paquete de archivos enfocado.

Compartir los dominios, caminos, fechas, filtros de contenido y destino.