Saltar al contenido

Datos de empleo y talento

Datos de publicación de trabajo con ciclo de vida, contexto y límites intactos.

Recoger las observaciones documentadas de búsqueda y lista de Google Jobs, o cubrir un feed de trabajos públicos mantenido que separe a los empleadores, publicaciones, roles, ubicaciones, compensación, contexto de origen y eventos del ciclo de vida.

  1. 01
    Define el objeto

    Empleador, puesto, rol, ubicación, compensación o evento.

  2. 02
    Bloquear el contexto de origen

    Encuesta, geografía, lenguaje, fuente y tiempo de observación.

  3. 03
    De acuerdo en el significado del ciclo de vida

    Observado, cambiado, desaparecido, inactivo y desconocido.

Modelo de registro de empleo

Una página de lista contiene varios objetos y ninguno demuestra una contratación.

Mantenga las entidades estables aparte del texto de publicación específico de la fuente y las observaciones limitadas a tiempo. El modelo se vuelve útil para la búsqueda, comparación, historial y análisis sin exagerar lo que significa una página pública.

01 · Primary objectDocumentado

Encargo de trabajo

Una lista pública específica de la fuente con su propio identificador, URL, título, descripción y estado de observación.

  • posting_id & URL
  • title & description
  • source dates & state
02 · EntityDocumentado

Empleador

La identidad pública de empleador indicada por la fuente, retenida por separado de cualquier organización normalizada.

  • source name
  • employer link
  • organization cues
03 · ClassificationPilot primero

El papel

Función, antigüedad, habilidades y tipo de empleo normalizados derivados de las reglas acordadas.

  • function & level
  • skills
  • employment type
04 · ContextDocumentado

Localización y modo de trabajo

Textos de origen y señales estructuradas para el contexto local, remoto, híbrido o in situ.

  • location text
  • remote cue
  • normalized place
05 · ObservationPilot primero

Compensación

Salario o tasa, moneda, período, rango y procedencia mostradosno son un índice de referencia de mercado inferido por defecto.

  • min & max
  • currency & period
  • source or derived
06 · EventPilot primero

Evento del ciclo de vida

Una observación de primera vista, cambio de contenido, última vista, eliminación o reaparición vinculada a una fuente.

  • event type
  • event time
  • source evidence
Fronteras de interpretaciónNot assumed

Una solicitud de empleo no es una vacante verificada.

Una fuente puede exponer contenido obsoleto, duplicado, sindicado, eliminado o repostado.

Breve cobertura

Conozca qué puestos de trabajo se encuentran, los aportes y el ciclo de vida que está comprando.

Los resultados de búsqueda, las listas individuales, las páginas de carreras de empleadores y los feeds normalizados de la junta son productos diferentes.

Source or page familyIngresoDelivered objectEstado de la Unión
API de trabajo de GoogleQuery + locationJob-search result observationsDocumentado
API de listaje de trabajos de GoogleListing identifierIndividual public listing detailsDocumentado
Páginas de empleo públicas elegiblesURL or source briefSource-specific posting recordPilot primero
Alimentos normalizados, enriquecimiento y historiaSources + rule setLinked and versioned recordsPilot primero
Los solicitantes, currículos y ATS privadosPrivate people dataExcludedNo estándar

Esquema de publicación

Mantenga los hechos de la fuente separados de la interpretación normalizada.

Un registro de empleos confiable muestra lo que dijo la fuente, qué regla normalizó, cuándo se observó, y si la página estaba presente, cambiada o no disponible.

01 · Aplicación

Identidad de la fuente y contenido

posting_id
Identificación de origen o entrega de la lista.
title_raw
Título del trabajo exactamente como expuso la fuente.
description
Textos de listación pública cuando el punto final o el alcance lo apoyen.
02 · Empleador y papel

Entidad y clasificación

employer_raw
Nombre del empleador indicado por la fuente.
role_normalized
Clasificación de funciones o títulos contratados, cuando se incluya.
employment_type
Valor de origen y estado normalizado cuando se admite.
03 · Contexto

Lugar, modo de trabajo y compensación

location_raw
Texto de ubicación mostrado con la publicación.
work_mode
Distante, híbrido, en el lugar, desconocido o definido por la fuente.
compensation
Valor, rango, moneda, período y estado de derivación.
04 · Ciclo de vida

Estado de observación y cambio

observed_at
El tiempo que la fuente pública produjo la observación.
first_seen / last_seen
La historia se limita dentro del programa de vigilancia contratado.
collection_state
Observado, cambiado, perdido, fallido o revisado.
Illustrative job posting record—not customer dataJSON
{
  "posting_id": "job_042",
  "source": {
    "listing_id": "source_818",
    "url": "https://jobs.example/818"
  },
  "employer": { "name_raw": "Example Labs" },
  "role": {
    "title_raw": "Data Engineer",
    "work_mode": "hybrid"
  },
  "location": { "text_raw": "Bucharest" },
  "compensation": { "state": "source_absent" },
  "lifecycle": {
    "first_seen": "YYYY-MM-DDThh:mm:ssZ",
    "last_seen": "YYYY-MM-DDThh:mm:ssZ",
    "state": "observed"
  },
  "schema_version": "jobs.v1"
}

Identidad y coincidencia

Preserva todas las publicaciones antes de vincular duplicados o reposts.

La resolución del empleador, la normalización de los roles y las relaciones de publicación entre fuentes son conjuntos de reglas separados y explicables.

  1. 01

    Clave de origen

    Identificación de lista + URL

    Se conserva con su fuente y tiempo de observación.
  2. 02

    Indicaciones del empleador

    Nombre + dominio + ubicación

    Solo se utilizará bajo la regla de entidad acordada.
  3. 03

    Las señales de publicación

    Título + texto + lugar + tiempo

    Comparado para relaciones exactas, candidatos o repost.
  4. 04

    Relaciones

    • Revisar las informaciones de las fuentes

    Ningún candidato se derrumba silenciosamente.

Fresqueza y ciclo de vida

Una instantánea actual y un historial de publicación responden a diferentes preguntas.

Mantenga las fechas publicadas por la fuente aparte de los tiempos de observación. para la entrega recurrente, registren cambios y desapariciones sin adivinar el resultado de la contratación.

  1. Publishedpublished_at

    La fecha indicada por la fuente, cuando se expone.

  2. Observadoobserved_at

    La página o el resultado se recogieron en el contexto solicitado.

  3. Cambiadochanged_at

    Cambió un campo contratado o una firma de contenido.

  4. Ciclo de vidafirst_seen / last_seen

    La publicación entró y apareció más recientemente en la historia de seguimiento.

Calidad y falta

Hacer que la ausencia y la incertidumbre sean útiles.

No convierta un salario perdido en cero, un modo de trabajo no especificado en el sitio, o una página no disponible en un puesto lleno.

Observado

Presencia de la estructura de desplazamiento requerida

El registro público ha superado las verificaciones de origen y de campo contratadas.

Cambiado

Cambios en los campos de origen del material

Las observaciones anteriores y actuales conservan una razón de cambio o diferencia de campo.

Revisar

La identidad o normalización es ambigua

El candidato sigue siendo inspectable en lugar de ser aceptado en silencio.

No está disponible

No se ha realizado ninguna observación

La fuente ausente, eliminada, el acceso fallido y fuera de alcance siguen siendo estados diferentes.

Control estructural

Identificadores requeridos, forma de URL, estado de origen, sellos de tiempo, tipos de campos y versión de esquema.

Verificación semántica

Unidades de compensación, modo de trabajo, geografía, señales del empleador, presencia de descripción y transiciones del ciclo de vida cuando se haya contratado.

Acceptación del cliente

El cliente aprueba la elegibilidad de la fuente, la taxonomía, las reglas de coincidencia, los umbrales de integridad y el uso de la decisión.

Modelo de operación

Elige quién es el dueño de la operación de datos de empleos públicos.

Compare the same posting lifecycle across infrastructure, documented APIs, scheduled feeds, and a managed program.

El control máximo

Construye sus coleccionistas y publique el modelo al Infraestructura de proxies.

Su equipo posee el descubrimiento de fuentes, extracción, esquema, normalización, reglas del ciclo de vida, monitoreo, mantenimiento, almacenamiento e interpretación.
ResponsabilidadPropietario
Source, object, and field briefCliente
Network access infrastructureWSA
Extraction and source schemaCliente
Identity, lifecycle, and maintenanceCliente
Storage, interpretation, and decisionsCliente

Aplicaciones

Utilice una base de publicación gobernada en los flujos de trabajo de talento.

Los datos apoyan la observación del mercado y las experiencias de los productos; los clientes son los propios analistas, las obligaciones legales del empleo y todas las decisiones que involucran a las personas.

01

Investigación del mercado laboral

Observe el volumen de publicaciones, roles, habilidades, empleadores y ubicaciones en un conjunto definido de fuentes públicas.

posting · role · employer · place · observed_at
02

Análisis de la demanda de competencias

Requisito de la fuente de la información en una taxonomía aprobada con el texto en bruto retenido.

description · skill cue · taxonomy · rule version
03

Observación de la compensación

Comparar los rangos mostrados en la fuente con la moneda, el período, la ubicación y la falta adjunta.

compensation · unit · place · provenance
04

Productos de búsqueda de empleo

Flujos de trabajo de detección de potencia y alerta a partir de registros documentados de tiempo de solicitud o de una alimentación con alcance.

query · result · posting · source context
05

Las señales de contratación de empleadores

Seguir las observaciones publicadas a lo largo del tiempo sin equipararlas con el número de empleados verificado o las contrataciones.

employer · posting · first_seen · last_seen
06

Localización y tendencias remotas

El modo de trabajo y la geografía expuestos a la fuente de estudio con estado de normalización se mantuvieron visibles.

location_raw · normalized place · work mode · time

Pilotante representativo

Prueba el ciclo de vida de publicación antes de escalar la lista de fuentes.

Utilice búsquedas y listas representativas para verificar la presencia en el campo, las reglas del empleador y el papel, la falta de compensación, los estados duplicados, la cadencia y el ajuste a la corriente baja.

Scope a jobs data pilot
  1. 01

    Definición

    Nombre de consultas, fuentes, geografías, objetos, campos requeridos, cadencia y datos de personas excluidas.

  2. 02

    Muestra

    Incluye copias, reposts, funciones de múltiples ubicaciones, salarios faltantes, páginas eliminadas y contenido cambiado.

  3. 03

    Inspección

    Revise los campos crudos y normalizados, coincida con la evidencia, los eventos del ciclo de vida, las estampillas de tiempo y los estados de calidad.

  4. 04

    Acceptad

    Acordar esquemas, taxonomías, reglas de identidad, cadencia, umbrales de calidad, propiedad y entrega.

Pregunta frecuente sobre la evaluación

Resolver lo que una publicación pública puede y no puede decirle.

Estas respuestas separan las observaciones de las fuentes de las solicitudes de vacantes, los datos de personas y las decisiones de empleo.

¿Qué datos de empleo pueden proporcionar WebScrapingAPI?

La API de Google Jobs documentación admite las observaciones de resultados de búsqueda de trabajo, y la API de lista de trabajos de Google admite detalles de listación pública individuales. También se pueden evaluar páginas de trabajo públicas elegibles.

¿Una publicación de trabajo demuestra que todavía hay un puesto abierto?

No. Una publicación de trabajo no es una vacante verificada, es una observación de fuente pública en un momento determinado. Una fuente puede ser obsoleta, duplicada, eliminada, repostada o cambiada, por lo que la interpretación de vacante pertenece al cliente.

¿Cuál es la diferencia entre un puesto de trabajo y un papel?

Una publicación es un objeto publicado específico de la fuente con su propia URL, identificador, texto y ciclo de vida observado. Una función es un concepto normalizado como título, función, antigüedad o habilidades.

¿Se pueden rastrear los trabajos desde el primer momento hasta el cierre?

El historial del ciclo de vida es piloto primero. Un programa recurrente puede conservar los eventos de cambio de contenido, las observaciones de eliminación y un estado inactivo derivado. Una página eliminada es evidencia de que la fuente ya no expuso la publicación, no prueba de que el empleador llenó o cancelaron el papel.

¿Pueden normalizarse los datos de compensación y de empresa?

La compensación expuesta por la fuente, los nombres de los empleadores, las ubicaciones y el texto del modo de trabajo se pueden conservar. La normalización de las fuentes cruciales, la conversión de moneda o período, la inferencia salarial, la resolución del empleador y el enriquecimiento de la empresa son reglas piloto con procedencia explícita y estados faltantes.

¿Se incluyen en esto los datos o currículos de los solicitantes?

No. Los datos de los solicitantes, currículos, registros privados de ATS, perfiles de candidatos, notas de gerente de contratación y sistemas de contratación solo para iniciar sesión no son el alcance estándar.

¿Pueden utilizarse los datos para tomar decisiones de selección de empleo?

WebScrapingAPI no proporciona la FCRA ni decisiones de selección de empleo, juicios de elegibilidad de candidatos o recomendaciones de contratación. Los clientes siguen siendo responsables del uso legal, la validación, la gobernanza y las decisiones tomadas con datos de empleos públicos.

¿Cómo se manejan los copias y los reposts?

Los identificadores de origen y las URL se conservan primero. Un piloto puede evaluar el empleador, el título, la ubicación, la descripción y las señales de tiempo para etiquetar relaciones exactas, candidatos, repostadas, ambigüas o exclusivas de origen.

¿Qué significa que falta salario, ubicación o fecha de cierre?

El esquema distingue un campo no mostrado por la fuente, un valor fuera del objeto solicitado, una página no disponible en el contexto de la solicitud, un fallo de recogida y una normalización que necesita revisión.

¿Quién mantiene la recaudación cuando cambia la fuente de trabajo?

Los clientes de proxy mantienen sus propios coleccionistas, parseres y monitoreo. WebScrapingAPI mantiene el comportamiento documentado de API dentro de los límites del producto. Los programas programados y administrados pueden incluir extracción contratada, normalización, monitoreo de calidad, mantenimiento de cambio de fuente, historial de ciclo de vida y entrega.

Datos de empleo y talento

Comience con una API de Jobs documentada o un resumen de fuente representativo.

Traiga las búsquedas, listas, campos, geografías, reglas del ciclo de vida, cadencia y entrega de su flujo de trabajo.