Saltar al contenido

Noticias y artículos

Rastrear cada historia desde el descubrimiento hasta la página que realmente observaste.

Descubre los resultados de noticias públicas a través de la verticale de noticias de Google Search API documentada, acceda a las páginas de artículos públicos elegibles o alcance un feed mantenido que mantenga registros de publicación, artículo, revisión y procedencia distintos.

  1. 01
    Nombre del objeto

    Resultado de descubrimiento, publicación, artículo, autor, revisión o tema.

  2. 02
    Mantenga la evidencia

    Contexto de consulta, URL de origen, campos de origen y tiempo de observación.

  3. 03
    Establezca el límite

    Metadatos, campos de cuerpos elegibles, historial de cambios y propiedad de entrega.

Modelo de registro de historias

Una noticia puede aparecer como varios registros diferentes.

Modelo de descubrimiento, publicación, contenido, personas, revisiones y temas por separado para que un fragmento de resultado nunca se disfrace como un artículo completo.

01 · DescubrimientoDocumentado

Resultado de las noticias

Un resultado vinculado a la consulta se muestra en la vertical de Noticias de Google.

  • Headline and destination
  • Source and snippet
  • Query and request context
02 · SourceDocumentado

Publicación

La identidad pública del editor y la página fuente asociada con una observación.

  • Source name and URL
  • Section or channel
  • Language and locale
03 · ContentPilot primero

Artículo

Título, guión, cuerpo, metadatos y referencias de medios vinculados a la fuente donde la página elegible los expone.

  • Canonical URL
  • Visible article fields
  • Author or byline
04 · ChangePilot primero

Edición o revisión

Una observación sucesiva de campos de artículos seleccionados, nunca una intención editorial inferida.

  • Content hash
  • First and last seen
  • Changed field set
05 · MeaningPilot primero

Tema o entidad

Una capa de enriquecimiento producida bajo modelos o reglas acordadas y mantenida separada de los hechos de origen.

  • Named entity cue
  • Topic label
  • Rule or model version
Object boundaryNot assumed

Un resultado del descubrimiento no es un artículo completo.

El descubrimiento no es lo mismo que la extracción de artículos completos. Un fragmento, página de artículo, guión del autor, editor, revisión y tema tienen cada uno un límite de evidencia diferente.

Contrato de cobertura

Separar el acceso documentado de la normalización específica de la fuente.

La cobertura se confirma por la superficie de descubrimiento, la fuente del artículo, la familia de páginas, la localización, los campos requeridos y el límite de uso responsable.

Engine or familyIngresoContextoEstado de la Unión
Noticias de Google a través de la API de búsqueda de GoogleQuery with tbm=nws and supported request contextVisible discovery resultsDocumentado
Páginas de artículos públicos elegiblesURL submitted to Scraper API or Browser APIHTML or rendered page for your extraction workflowDocumentado
Los alimentos normalizados para artículosApproved source list and field contractSource-agnostic schema, dedupe, topics, publisher feedsPilot primero
Contenido restringido y reposición generalPaywall, login, membership, or unrestricted body reuseOutside standard public-web scopeNo estándar

Esquema de registro

Hacer que las afirmaciones de la fuente, los campos derivados y la semántica del tiempo sean inspectables.

Mantenga lo que la fuente expuso separado de lo que la colección observó y lo que un enriquecimiento en aguas posteriores inferido.

01 · Descubrimiento

Contexto de resultados

query
La consulta de descubrimiento presentada.
rank
Posición en esta página de resultados y contexto de la solicitud.
result_url
El destino expuesto por el resultado.
02 · Artículo

Campos visibles en la fuente

headline
Título expuesto en la página elegible.
byline
La cadena de autor público, no automáticamente una persona resuelta.
body_state
Presente, ausente, excluido, fallido, cambiado o revisado.
03 · Tiempo

Publicación y observación

published_at
Tiempo atribuido por la fuente, cuando se expone.
observed_at
El tiempo de la colección produjo esta observación.
first_seen_at
Primera aparición dentro de la ventana de vigilancia contratada.
04 · Providencia

Trazabilidad y estado

source_url
Página pública asociada con el registro.
content_hash
Impresión digital opcional para observaciones sucesivas.
schema_version
Versión de la forma de salida acordada.
Illustrative article record—not customer dataJSON
{
  "record_id": "story_0042",
  "object_type": "article_observation",
  "discovery": {
    "query": "energy outlook",
    "surface": "google_news",
    "rank": 3
  },
  "article": {
    "headline": "Grid investment accelerates",
    "publication": "Example Daily",
    "body_state": "observed"
  },
  "published_at": "YYYY-MM-DDT06:10:00Z",
  "observed_at": "YYYY-MM-DDT08:42:00Z",
  "source_url": "https://news.example/story/42",
  "schema_version": "news.v1"
}
Two clocks, two meanings.

published_at is source-attributed publication time; observed_at is collection time. Neither should overwrite the other.

Identidad y linaje

Los registros relacionados con el grupo sin borrar cada fuente.

Preserva el editor, URL, contexto de descubrimiento y observación de artículos antes de agregar URLs canónicas, grupos, entidades o etiquetas de temas.

  1. 01

    Clave de descubrimiento

    URL de búsqueda + resultado

    Se conservó el contexto de la solicitud.
  2. 02

    Indicaciones de origen

    URL canónica + editor

    Se utiliza cuando se expone y se verifica.
  3. 03

    Estado del contenido

    Título + hash + tiempo

    Comparado bajo una versión de regla nombrada.
  4. 04

    Relaciones

    el mismo artículo, revisión o grupo de candidatos

    La ambigüedad sigue siendo explícita.

Semántica de la frescura

Una historia recientemente publicada y una página recientemente observada son hechos diferentes.

Establezca la cadencia de recogida por flujo de trabajo, luego mantenga el tiempo atribuido por la fuente junto con los tiempos de solicitud, observación, entrega y cambio.

  1. Source timepublished_at

    El tiempo de publicación mostrado, tal como se interpreta en el contrato.

  2. Collectedobserved_at

    El artículo o el resultado se observaron en el contexto solicitado.

  3. Delivereddelivered_at

    El registro se puso a disposición del cliente.

  4. Changedfirst_seen / last_seen

    La observación entró o salió del historial monitoreado.

Calidad y falta

No conviertas un artículo que no está disponible en una historia vacía.

Llevar el estado que explica por qué un campo está faltando para que el descubrimiento, análisis, disponibilidad de la fuente y las exclusiones de políticas permanezcan distinguibles.

Observado

Presencia de la estructura requerida

El registro pasó las verificaciones de campo de descubrimiento o de artículo acordadas.

Fuente ausente

Campo no expuesto

La página fuente no mostró la línea de texto, el tiempo o el campo de cuerpo solicitados.

Revisar

Template o linaje es ambigüo

La página o relación necesita ser inspeccionada de acuerdo con las reglas contratadas.

No está disponible

No se ha realizado ninguna observación

El artículo excluido, restringido, fallido o no disponible es distinto de un artículo vacío.

Control estructural

Las claves requeridas, tipos, recuentos de resultados, razón del estado del cuerpo, forma de timestamp y versión de esquema.

Control de campo

Formatos de URL, atribución de fuente, estado de análisis de tiempo de publicación, lenguaje y hash de contenido opcional.

Fronteras de aceptación

Su equipo aprueba los registros representativos, el conjunto de fuentes, el uso permitido y los umbrales de decisión; operamos las verificaciones técnicas acordadas.

Modelo de operación

Seleccione dónde termina el acceso y comienza el registro mantenido.

Compare the same story lifecycle across infrastructure, APIs, recurring feeds, and a managed data operation.

El control máximo

Construir el flujo de trabajo completo de noticias en Infraestructura de proxies.

Su equipo elige las superficies de descubrimiento, recopila páginas elegibles, extrae campos de artículos, resuelve el linaje, monitorea los cambios y entrega registros.
ResponsabilidadPropietario
Source and field briefCliente
Access infrastructureCompartido
Extraction and schemaCliente
Quality and maintenanceCliente
Storage and decisionsCliente

Aplicaciones

Utilice un modelo de evidencia en el descubrimiento, monitoreo e investigación.

La capa de registro proporciona observaciones vinculadas a la fuente; su equipo define modelos analíticos, materialidad, umbrales y decisiones.

01

Monitoreo de los medios

Rastrear las consultas nombradas, fuentes y campos de historias públicas a lo largo del tiempo.

Results · articles · revisions
02

Investigación de mercado y temas

Construir corpora reviewables para tendencias, narración y análisis de fuentes.

Articles · topics · provenance
03

Recuperación y aterrizaje de IA

Preparar entradas vinculadas a la fuente y con conocimiento del tiempo para los flujos de trabajo de recuperación aprobados.

Text state · source URL · timestamps
04

Las señales de reputación y riesgo

Superficie una nueva cobertura pública para la revisión humana sin presentarla como una conclusión.

Discovery · entities · review state
05

Información de los editores

Comparar los patrones de publicación pública, secciones y comportamiento de revisión.

Publication · article · first seen
06

Archivos de investigación

Mantener los metadatos acordados y el contenido permitido con un historial de recogida rastreable.

Schema version · provenance · change history

Pilotante representativo

Prueba el descubrimiento, la extracción, el linaje y los estados desaparecidos juntos.

Utilice contextos de consulta reales y páginas de artículos públicos representativas, incluyendo historias ordinarias, revisiones, campos ausentes, plantillas cambiadas y estados restringidos.

Scope a news data pilot
  1. 01

    Definición

    Consultas, fuentes, campos de artículos, contextos, cadencia y uso permitido.

  2. 02

    Muestra

    Resultados y páginas que representan plantillas de origen, campos faltantes y cambios.

  3. 03

    Inspección

    Fuente de evidencia, tiempos, estados corporales, candidatos de linaje y excepciones.

  4. 04

    Acceptad

    Aprobar el esquema, el conjunto de fuentes, el modelo operativo y los umbrales técnicos.

Pregunta frecuente sobre la evaluación

Aclara el límite del artículo antes de escalar la colección.

Las respuestas describen las capacidades documentadas y los términos que un piloto específico de la fuente debe confirmar.

¿Qué datos de noticias se documentan hoy?

La API de búsqueda de Google admite el resultado vertical de Google News a través del parámetro tbm=nws. Es adecuado para descubrir resultados de noticias visibles para una consulta definida y contexto de solicitud. Las páginas de artículos públicos elegibles también se pueden recopilar a través del API de scraping o API de navegador, con la extracción manejada por su flujo de trabajo o por un alcance de entrega acordado.

¿Es el resultado de una noticia el mismo que un artículo completo?

No. El descubrimiento no es lo mismo que la extracción de artículos completos. Un resultado puede exponer un título, URL de destino, fuente, fragmento y señal de publicación mostrada sin exponer el cuerpo completo del artículo. Los campos de artículos requieren una página pública elegible separada y un contrato de extracción específico de fuente.

¿Qué campos de artículos se pueden entregar?

Un registro de artículo con alcance puede incluir la URL de la fuente, la URL canónica cuando se expone, el título, el primer lugar, la línea, el tiempo de publicación mostrado, la sección, el cuerpo visible, las referencias de medios, las etiquetas, el idioma y la procedencia. La presencia del campo varía según el editor y la plantilla, por lo que los esquemas normalizados agnósticos de la fuente son piloto primero.

¿Cómo se representan el tiempo de publicación y el tiempo de recogida?

public_at registra el tiempo atribuido a la historia por la fuente cuando uno es expuesto. observado_at registros cuando la colección produjo la observación.

¿Se puede agrupar la cobertura duplicada del mismo evento?

Un piloto programado o administrado puede evaluar la canonización de URL, la identidad del editor, la similitud de los titulares, las señales de entidad y las ventanas de tiempo para crear grupos de historias de candidatos.

¿Se pueden controlar las actualizaciones y revisiones de los artículos?

Un alcance recurrente puede conservar observaciones sucesivas, hashes de contenido, veces vistas por primera vez y vistas por última vez, y cambios de campo seleccionados. El historial de revisión comienza cuando comienza el monitoreo a menos que se valide una fuente histórica separada, y las correcciones de origen no se interpretan más allá de lo que muestra la página pública.

¿Cómo se manejan los cuerpos desaparecidos y las fallas de recogida?

El registro puede distinguir un resultado de búsqueda sin colección de artículos, un campo no expuesto por la página, una página no disponible en el contexto solicitado, un fallo de colección, un patrón de extracción cambiado y una fuente excluida. Estos estados no se desmoronan en un cuerpo de artículos vacíos.

¿Se incluyen artículos con pago o sólo para iniciar sesión?

Los cuerpos de artículos con paredes de pago, solo para iniciar sesión, solo para miembros y restringidos de otra manera no son un alcance estándar.

¿Se puede redistribuir el texto del artículo sin restricciones?

No se implica ningún derecho de redistribución con derechos de autor. Los clientes siguen siendo responsables de los términos de origen, derechos de autor, licencias, retención, controles de acceso y uso permitido en el torrente.

¿Quién mantiene los cambios de origen?

Los clientes de proxy mantienen sus propios coleccionistas y parseres. WebScrapingAPI mantiene el acceso dentro de los límites documentados de la API. Los feeds programados y los datos web administrados pueden incluir extracción contratada, mantenimiento de esquemas, monitoreo de calidad y operaciones de entrega para el conjunto de fuentes acordado.

Noticias y artículos

Comience con el acceso al descubrimiento o alcance de un feed de historias mantenido.

Traer las consultas, fuentes, campos, contextos y casos de uso.