Resultado de las noticias
Un resultado vinculado a la consulta se muestra en la vertical de Noticias de Google.
- Headline and destination
- Source and snippet
- Query and request context
Noticias y artículos
Descubre los resultados de noticias públicas a través de la verticale de noticias de Google Search API documentada, acceda a las páginas de artículos públicos elegibles o alcance un feed mantenido que mantenga registros de publicación, artículo, revisión y procedencia distintos.
Modelo de registro de historias
Modelo de descubrimiento, publicación, contenido, personas, revisiones y temas por separado para que un fragmento de resultado nunca se disfrace como un artículo completo.
Un resultado vinculado a la consulta se muestra en la vertical de Noticias de Google.
La identidad pública del editor y la página fuente asociada con una observación.
Título, guión, cuerpo, metadatos y referencias de medios vinculados a la fuente donde la página elegible los expone.
Una observación sucesiva de campos de artículos seleccionados, nunca una intención editorial inferida.
Una capa de enriquecimiento producida bajo modelos o reglas acordadas y mantenida separada de los hechos de origen.
El descubrimiento no es lo mismo que la extracción de artículos completos. Un fragmento, página de artículo, guión del autor, editor, revisión y tema tienen cada uno un límite de evidencia diferente.
Contrato de cobertura
La cobertura se confirma por la superficie de descubrimiento, la fuente del artículo, la familia de páginas, la localización, los campos requeridos y el límite de uso responsable.
Esquema de registro
Mantenga lo que la fuente expuso separado de lo que la colección observó y lo que un enriquecimiento en aguas posteriores inferido.
{
"record_id": "story_0042",
"object_type": "article_observation",
"discovery": {
"query": "energy outlook",
"surface": "google_news",
"rank": 3
},
"article": {
"headline": "Grid investment accelerates",
"publication": "Example Daily",
"body_state": "observed"
},
"published_at": "YYYY-MM-DDT06:10:00Z",
"observed_at": "YYYY-MM-DDT08:42:00Z",
"source_url": "https://news.example/story/42",
"schema_version": "news.v1"
}published_at is source-attributed publication time; observed_at is collection time. Neither should overwrite the other.
Identidad y linaje
Preserva el editor, URL, contexto de descubrimiento y observación de artículos antes de agregar URLs canónicas, grupos, entidades o etiquetas de temas.
Clave de descubrimiento
Indicaciones de origen
Estado del contenido
Relaciones
Semántica de la frescura
Establezca la cadencia de recogida por flujo de trabajo, luego mantenga el tiempo atribuido por la fuente junto con los tiempos de solicitud, observación, entrega y cambio.
El tiempo de publicación mostrado, tal como se interpreta en el contrato.
El artículo o el resultado se observaron en el contexto solicitado.
El registro se puso a disposición del cliente.
La observación entró o salió del historial monitoreado.
Calidad y falta
Llevar el estado que explica por qué un campo está faltando para que el descubrimiento, análisis, disponibilidad de la fuente y las exclusiones de políticas permanezcan distinguibles.
El registro pasó las verificaciones de campo de descubrimiento o de artículo acordadas.
La página fuente no mostró la línea de texto, el tiempo o el campo de cuerpo solicitados.
La página o relación necesita ser inspeccionada de acuerdo con las reglas contratadas.
El artículo excluido, restringido, fallido o no disponible es distinto de un artículo vacío.
Las claves requeridas, tipos, recuentos de resultados, razón del estado del cuerpo, forma de timestamp y versión de esquema.
Formatos de URL, atribución de fuente, estado de análisis de tiempo de publicación, lenguaje y hash de contenido opcional.
Su equipo aprueba los registros representativos, el conjunto de fuentes, el uso permitido y los umbrales de decisión; operamos las verificaciones técnicas acordadas.
Modelo de operación
El control máximo
Aplicaciones
La capa de registro proporciona observaciones vinculadas a la fuente; su equipo define modelos analíticos, materialidad, umbrales y decisiones.
Rastrear las consultas nombradas, fuentes y campos de historias públicas a lo largo del tiempo.
Results · articles · revisionsConstruir corpora reviewables para tendencias, narración y análisis de fuentes.
Articles · topics · provenancePreparar entradas vinculadas a la fuente y con conocimiento del tiempo para los flujos de trabajo de recuperación aprobados.
Text state · source URL · timestampsSuperficie una nueva cobertura pública para la revisión humana sin presentarla como una conclusión.
Discovery · entities · review stateComparar los patrones de publicación pública, secciones y comportamiento de revisión.
Publication · article · first seenMantener los metadatos acordados y el contenido permitido con un historial de recogida rastreable.
Schema version · provenance · change historyPilotante representativo
Utilice contextos de consulta reales y páginas de artículos públicos representativas, incluyendo historias ordinarias, revisiones, campos ausentes, plantillas cambiadas y estados restringidos.
Consultas, fuentes, campos de artículos, contextos, cadencia y uso permitido.
Resultados y páginas que representan plantillas de origen, campos faltantes y cambios.
Fuente de evidencia, tiempos, estados corporales, candidatos de linaje y excepciones.
Aprobar el esquema, el conjunto de fuentes, el modelo operativo y los umbrales técnicos.
Pregunta frecuente sobre la evaluación
Las respuestas describen las capacidades documentadas y los términos que un piloto específico de la fuente debe confirmar.
La API de búsqueda de Google admite el resultado vertical de Google News a través del parámetro tbm=nws. Es adecuado para descubrir resultados de noticias visibles para una consulta definida y contexto de solicitud. Las páginas de artículos públicos elegibles también se pueden recopilar a través del API de scraping o API de navegador, con la extracción manejada por su flujo de trabajo o por un alcance de entrega acordado.
No. El descubrimiento no es lo mismo que la extracción de artículos completos. Un resultado puede exponer un título, URL de destino, fuente, fragmento y señal de publicación mostrada sin exponer el cuerpo completo del artículo. Los campos de artículos requieren una página pública elegible separada y un contrato de extracción específico de fuente.
Un registro de artículo con alcance puede incluir la URL de la fuente, la URL canónica cuando se expone, el título, el primer lugar, la línea, el tiempo de publicación mostrado, la sección, el cuerpo visible, las referencias de medios, las etiquetas, el idioma y la procedencia. La presencia del campo varía según el editor y la plantilla, por lo que los esquemas normalizados agnósticos de la fuente son piloto primero.
public_at registra el tiempo atribuido a la historia por la fuente cuando uno es expuesto. observado_at registros cuando la colección produjo la observación.
Un piloto programado o administrado puede evaluar la canonización de URL, la identidad del editor, la similitud de los titulares, las señales de entidad y las ventanas de tiempo para crear grupos de historias de candidatos.
Un alcance recurrente puede conservar observaciones sucesivas, hashes de contenido, veces vistas por primera vez y vistas por última vez, y cambios de campo seleccionados. El historial de revisión comienza cuando comienza el monitoreo a menos que se valide una fuente histórica separada, y las correcciones de origen no se interpretan más allá de lo que muestra la página pública.
El registro puede distinguir un resultado de búsqueda sin colección de artículos, un campo no expuesto por la página, una página no disponible en el contexto solicitado, un fallo de colección, un patrón de extracción cambiado y una fuente excluida. Estos estados no se desmoronan en un cuerpo de artículos vacíos.
Los cuerpos de artículos con paredes de pago, solo para iniciar sesión, solo para miembros y restringidos de otra manera no son un alcance estándar.
No se implica ningún derecho de redistribución con derechos de autor. Los clientes siguen siendo responsables de los términos de origen, derechos de autor, licencias, retención, controles de acceso y uso permitido en el torrente.
Los clientes de proxy mantienen sus propios coleccionistas y parseres. WebScrapingAPI mantiene el acceso dentro de los límites documentados de la API. Los feeds programados y los datos web administrados pueden incluir extracción contratada, mantenimiento de esquemas, monitoreo de calidad y operaciones de entrega para el conjunto de fuentes acordado.
Noticias y artículos
Traer las consultas, fuentes, campos, contextos y casos de uso.