Tecnologías y protecciones 9 min de lectura

Enriquecimiento de datos: qué es, qué atributos se añaden y de qué fuentes proceden

Qué es el enriquecimiento de datos: qué atributos se añaden a empresas, productos y contactos, de dónde se obtienen y cómo funciona a nivel técnico.

EW
Equipo Web-Scraping.es
Recopilación de datos para las necesidades del negocio
Publicado: 10 febrero 2025

Qué es el enriquecimiento de datos

El enriquecimiento de datos (data enrichment) es el proceso de completar un conjunto de datos ya existente con nuevos atributos procedentes de fuentes externas o internas. En la entrada suele haber solo el «esqueleto» de un registro: por ejemplo, el nombre de una empresa, un email o un número de teléfono. En la salida, a ese registro se le adjuntan decenas de campos adicionales: sector, ingresos, región, cargo de la persona de contacto, redes sociales, tecnologías del sitio web, etcétera.

La clave está en que los datos en bruto, por sí solos, suelen aportar poca información. La línea «Ejemplo S.L., juan@ejemplo.es» es casi inútil para la analítica o para las ventas. Pero si se le añaden el número de registro mercantil, la plantilla, el sector, la facturación, el sitio web, el cargo de Juan y su perfil en una red profesional, el registro se convierte en un objeto listo para la segmentación, el scoring o la comunicación personalizada.

El enriquecimiento casi siempre se articula en torno a una clave de emparejamiento (matching key): el campo con el que se localiza el nuevo registro en la fuente externa. Lo más habitual es que sea el email, el dominio de la empresa, el número de registro, el teléfono, las coordenadas o la combinación «nombre + organización».

Para qué se enriquecen los datos

Algunos objetivos típicos:

  • Ventas y marketing. Segmentación de la base, lead scoring, personalización de los envíos, identificación de los responsables de la toma de decisiones.
  • Analítica y Data Science. Cuantos más atributos tiene un objeto, más precisos son los modelos de predicción, clustering y recomendación.
  • Gestión de riesgos y compliance. Verificación de contrapartes, KYC/AML, detección de vinculaciones societarias y de riesgos de sanciones.
  • Calidad de los datos. Relleno de huecos, corrección de errores, deduplicación, normalización de formatos.
  • Tareas de producto. Autocompletado de formularios, sugerencias, vinculación del usuario a una geolocalización o a una organización.

Qué datos se pueden enriquecer

Conviene clasificarlos según el tipo de objeto que se enriquece.

Datos de empresas (firmografía)

El escenario más extendido en B2B. Al registro de una empresa se le añaden:

  • los datos registrales (número de registro, fecha de constitución, estado);
  • el sector y los códigos de actividad (NAICS, SIC y clasificaciones locales);
  • el tamaño (plantilla, ingresos, facturación);
  • la estructura de propiedad y las entidades vinculadas;
  • la dirección, la región, los contactos;
  • el sitio web, el dominio, las redes sociales.

Datos de contacto y personales (contactos B2B)

Aquí se enriquecen registros de personas en un contexto profesional: cargo, departamento, email de trabajo, teléfono, enlace al perfil, antigüedad en la empresa. Importante: los datos personales son la categoría más sensible desde el punto de vista legal (véase la sección sobre los aspectos jurídicos).

Datos geográficos

A partir de una dirección o de unas coordenadas se puede añadir:

  • la geocodificación (dirección → latitud/longitud y viceversa);
  • la adscripción administrativa (distrito, región, país, zona horaria);
  • las características de la ubicación (densidad de población, renta media de la zona, POI cercanos — puntos de interés);
  • las distancias y los tiempos de trayecto hasta los lugares relevantes.

Datos demográficos y socioeconómicos

Para personas físicas o para segmentos agregados: grupos de edad, nivel de ingresos, educación, características de consumo. Casi siempre a nivel agregado (por zona o código postal), porque los datos personales individualizados están estrictamente regulados.

Datos tecnográficos

Qué tecnologías utiliza una empresa: el CMS del sitio, los contadores de analítica, el CRM, las pasarelas de pago, el proveedor de nube. Se determinan a partir del marcado y de las cabeceras del sitio, de los registros DNS y de las ofertas de empleo públicas.

Datos de comportamiento

Historial de interacciones, actividad, patrones de uso. Normalmente proceden de sistemas internos (analítica de producto, CRM), pero pueden completarse con señales externas de actividad (menciones en los medios, noticias, eventos).

Datos financieros

Cuentas anuales, calificaciones crediticias, historial de litigios mercantiles, prendas y garantías, quiebras. Para las empresas cotizadas, las cotizaciones bursátiles y los informes financieros.

Con qué se enriquece: las fuentes de datos

Las fuentes pueden agruparse en tres grandes categorías, que son en las que se centra este artículo: registros estatales y públicos abiertos, scraping de datos abiertos de la web y acceso mediante API.

Registros estatales y públicos abiertos

Son las fuentes primarias y más fiables. Tienen carácter oficial y, a menudo, su uso está permitido de forma explícita. Ejemplos de categorías:

  • registros nacionales de sociedades y de empresarios individuales;
  • registros de la propiedad y catastros;
  • bases de datos judiciales y de litigios mercantiles;
  • registros de licencias, de contratación pública y de quiebras;
  • listas de sanciones y de administradores inhabilitados;
  • datos estadísticos abiertos (Eurostat, los institutos nacionales de estadística, el Banco Mundial, OpenStreetMap).

Muchos Estados mantienen portales de datos abiertos (open data portals) donde los conjuntos se publican en formatos legibles por máquina (CSV, JSON, XML) bajo licencias abiertas. Es la fuente ideal: legal, estructurada y gratuita.

Scraping de datos abiertos de la web

Cuando los datos están en sitios públicos pero no se ofrecen como una descarga cómoda ni mediante una API, se recurre al web scraping: la extracción automatizada de información de páginas web.

Qué se suele scrapear

  • catálogos y directorios de empresas;
  • fichas de producto y precios (para la monitorización del mercado);
  • ofertas de empleo (útiles para la tecnografía y para estimar el crecimiento de una empresa);
  • reseñas y valoraciones;
  • noticias y notas de prensa;
  • perfiles públicos y páginas de contacto de las empresas;
  • POI cartográficos.

Cómo funciona a nivel técnico

El pipeline básico de scraping:

  1. Rastreo (crawling). Un bot recorre las páginas siguiendo los enlaces o a partir de URL conocidas de antemano.
  2. Descarga (fetching). Peticiones HTTP a las páginas. Para el HTML estático bastan bibliotecas sencillas; para el contenido que se carga con JavaScript se usan navegadores «sin cabeza» (headless browsers), que renderizan la página como un navegador real.
  3. Extracción (parseo). Del HTML se sacan los campos necesarios mediante selectores CSS, XPath o expresiones regulares. A veces los datos están cómodamente dispuestos en marcado estructurado: JSON-LD, microdatos de Schema.org, Open Graph.
  4. Normalización y limpieza. Conversión a un formato único, eliminación de basura, validación.
  5. Emparejamiento (matching). Vinculación de lo extraído con los registros existentes mediante la clave.

El stack típico: en Python, requests/httpx para las peticiones, BeautifulSoup/lxml para el parseo del HTML, Scrapy como framework completo y Playwright/Selenium para las páginas dinámicas. En JavaScript, Puppeteer/Playwright.

Dificultades técnicas del scraping

  • Contenido dinámico. Los datos se renderizan en el lado del cliente: hace falta un navegador headless, más lento y más caro.
  • Protección anti-bots. Captchas, limitación de la frecuencia de peticiones (rate limiting), bloqueos por IP y por huella del navegador.
  • Inestabilidad del marcado. El sitio cambia la maquetación y el scraper se rompe. Hacen falta mantenimiento y monitorización.
  • Escala. Los grandes volúmenes exigen un rastreo distribuido, proxies y colas.
  • Calidad. Los datos de la web están sucios: duplicados, erratas, registros obsoletos.

Reglas del scraping «educado»

Una buena práctica es respetar el robots.txt, no generar una carga excesiva (introducir pausas entre las peticiones), cachear, identificar el bot propio mediante el User-Agent y, siempre que sea posible, preferir la API oficial al scraping. Esto reduce tanto los riesgos técnicos como los jurídicos.

Acceso a los datos mediante API

Una API (interfaz de programación) es la vía más cómoda y fiable de obtener datos externos. A diferencia del scraping, los datos llegan ya estructurados (normalmente en JSON), documentados y estables, y el proveedor permite su uso de forma explícita dentro de sus condiciones.

Tipos de API según su accesibilidad

  • Totalmente abiertas — sin clave ni registro (algunos portales públicos, Nominatim de OpenStreetMap, varios servicios estadísticos).
  • Con clave gratuita y límites — exigen registrarse y tienen una cuota de peticiones.
  • Comerciales — pago por suscripción o por número de peticiones; aquí entran la mayoría de los proveedores de firmografía, de enriquecimiento de contactos y de geocodificación de alta calidad.

Qué se suele obtener mediante API

  • Geocodificación y mapas — conversión de direcciones, rutas, POI.
  • Datos de empresas — a partir del número de registro o del dominio, obtener los datos registrales y la firmografía.
  • Validación — comprobación de que los emails, los teléfonos y las direcciones son correctos y existen.
  • Datos financieros y de mercado — cotizaciones, tipos de cambio, informes.
  • Estadística pública abierta — demografía, economía, meteorología.
  • Enriquecimiento de contactos — a partir de un email, encontrar el cargo, la empresa, el perfil.

Aspectos técnicos del trabajo con API

  • Autenticación — claves de API, OAuth, tokens.
  • Límites (rate limits y cuotas) — hay que dosificar las peticiones, configurar reintentos con espera exponencial y cachear las respuestas.
  • Formatos — sobre todo REST + JSON; también hay GraphQL y endpoints por lotes (batch) para el enriquecimiento masivo.
  • Versionado — las API cambian; conviene vigilar las versiones y la obsolescencia de los métodos.
  • Coste — con grandes volúmenes es importante contar las peticiones y cachear las repetidas.

Cómo es el propio proceso de enriquecimiento

Sea cual sea la fuente, el enriquecimiento pasa por etapas similares:

  1. Preparación de la clave. Elección y normalización del campo identificador (pasar los dominios a minúsculas, unificar los teléfonos en el formato E.164, etc.).
  2. Emparejamiento (matching). Búsqueda del registro en la fuente externa. Puede ser exacto (por número de registro, por email) o difuso (fuzzy matching: por similitud de los nombres, tolerando erratas).
  3. Fusión (merging). Adición de los nuevos campos al registro. Aquí se decide qué hacer ante un conflicto de valores: qué fuente tiene prioridad.
  4. Validación. Comprobación de la verosimilitud (por ejemplo, los ingresos no pueden ser negativos; las coordenadas deben caer dentro del país).
  5. Deduplicación. Unificación de los duplicados surgidos tras la fusión.
  6. Registro de metadatos. De dónde procede el valor, cuándo se obtuvo, cómo de reciente es. Es crítico para poder confiar en los datos.

Calidad y problemas de los datos

El enriquecimiento no sale gratis en términos de calidad:

  • Frescura. Los datos externos caducan: las empresas cambian de dirección, las personas cambian de trabajo. Hace falta un refresco periódico.
  • Precisión del emparejamiento. Un emparejamiento difuso puede asociar los datos al registro equivocado. Conviene almacenar un índice de confianza (confidence score).
  • Cobertura. Ninguna fuente cubre el 100% de los registros. A menudo se combinan varias (waterfall: se prueba la fuente A; si no hay resultado, la B y después la C).
  • Contradicciones. Fuentes distintas dan valores distintos para un mismo campo: hace falta una estrategia de resolución de conflictos.
  • Trazabilidad (data lineage). Sin conocer el origen de un valor es imposible depurar los errores y demostrar su legitimidad.

Aspectos legales y éticos

La sección más importante en la práctica, sobre todo en lo relativo a los datos personales.

  • Los datos personales están estrictamente regulados. El RGPD en la UE, la CCPA en California y sus análogos en otras jurisdicciones limitan la recogida, el almacenamiento y el tratamiento de datos sobre personas. Que «los datos estén accesibles públicamente» no otorga de forma automática el derecho a recopilarlos y usarlos con cualquier fin: se necesita una base legal para el tratamiento.
  • Licencias de los datos abiertos. Incluso los conjuntos abiertos tienen condiciones (por ejemplo, la obligación de citar la fuente, la prohibición del uso comercial, share-alike). Hay que cumplirlas.
  • Condiciones de uso de los sitios y las API. Los Terms of Service pueden prohibir expresamente la recogida automatizada. Incumplirlos es un riesgo contractual y, en algunas jurisdicciones, algo más serio.
  • Scraping y ley. El estatus legal del web scraping varía según el país y depende de qué se recopila y cómo. Scrapear información puramente pública y no sensible suele ser menos arriesgado que recopilar datos personales o eludir restricciones técnicas de acceso.
  • Ética. Minimización de los datos (recopilar solo lo necesario), respeto a la privacidad, no imponer una carga excesiva a los servidores ajenos: es reputación y, a la vez, reducción de riesgos.

Conclusión práctica: ante cualquier enriquecimiento con datos personales conviene consultar de antemano con un abogado y adaptar los procesos a la legislación aplicable. Esto no es asesoramiento jurídico: los requisitos concretos dependen de su jurisdicción y de su caso de uso.

Conclusiones breves

El enriquecimiento de datos convierte registros sueltos y en bruto en objetos completos, aptos para el análisis y para la acción. Las tres fuentes de apoyo:

  • Los registros abiertos y los portales de datos abiertos — el material más fiable y legalmente limpio, sobre todo en empresas, inmuebles y estadística.
  • El scraping de la web abierta — la vía flexible para conseguir lo que no se publica en ningún formato cómodo, a cambio de mantenimiento técnico y de una atención mayor a los riesgos legales.
  • Las API — el canal más fiable y escalable: datos estructurados y documentados, con condiciones de uso explícitas.

En la práctica, el mejor resultado lo da la combinación de fuentes, con un emparejamiento bien pensado, control de calidad, trazabilidad del origen de los datos y un cumplimiento estricto de los requisitos legales — ante todo, en lo que respecta a los datos personales.