La tarea
Los datos del grupo estaban repartidos por varias decenas de fuentes: sitios web, exportaciones, formatos y estructuras diferentes. Hacía falta un único feed XML de formato homogéneo, actualizado con regularidad, que se pudiera entregar a los sistemas conectados sin reensamblaje manual.
Qué hicimos y qué datos recopilamos
Recopilamos los datos de todas las fuentes —sitios, archivos y exportaciones de formatos diversos— y los llevamos a un esquema único. Además, montamos el ensamblado del feed XML final con validación y actualización regular, y la entrega se organizó como DaaS / datos vía API.
Dificultades y cómo las resolvimos
La principal: la heterogeneidad. Varias decenas de fuentes son decenas de estructuras: aquí JSON, allá tablas y CSV, en otro lado documentos, y a veces solo páginas web. Describimos un esquema objetivo único y asignamos los campos de cada fuente a ese esquema.
La segunda: la actualidad. Las fuentes se actualizan a ritmos distintos, así que la recopilación seguía un calendario y los cambios se recogían automáticamente.
La tercera: la corrección del feed. El XML final se validaba estructuralmente antes de publicarse y se deduplicaba, para que los consumidores del feed no recibieran registros rotos o repetidos.
El resultado
El grupo obtuvo un feed XML único, ensamblado de decenas de fuentes de forma automática y según calendario, en lugar de la conciliación manual de exportaciones dispersas.
Servicios en este caso: DaaS y datos vía API · Extracción de datos web · Monitorización de cambios en sitios web y datos
Materiales útiles: Parseo de XML · Parseo de JSON · Parseo de documentos · Normalización de datos