La tarea
La agencia necesitaba encontrar dominios de confianza entre los que quedan libres (drops): con buenas métricas, antigüedad respetable e historial limpio, para luego capturarlos y utilizarlos. Las listas de dominios expirados están dispersas por decenas de plataformas, los formatos varían y los volúmenes son enormes: cubrirlo a mano es inviable.
Qué hicimos y qué datos recopilamos
Reunimos la lista de plataformas que publican listados de dominios expirados y drops —GoDaddy, DropCatch, SnapNames, nicsell, Dynadot, Kifdom, Sav, UKBackorder, Catched, park.io, Namecheap, NameSilo, Gname, Aftermarket, Domainlore.uk y otras— y organizamos la recopilación regular de sus exportaciones en un flujo único.
Después, el enriquecimiento. Llevamos las fechas de drop a una zona horaria única para saber cuándo se libera realmente cada dominio. Añadimos métricas a través de las API de Ahrefs y Moz (autoridad y perfil de enlaces), incorporamos el WHOIS para la antigüedad y el historial de registro y, para los dominios preseleccionados, sumamos los datos del archivo web: qué se alojaba antes en el dominio y en qué idioma estaba el sitio. Sobre esta base construimos una interfaz donde los analistas de la agencia hacen la puntuación manual final sobre candidatos ya recopilados y enriquecidos.
El proyecto se estructuró como búsqueda y enriquecimiento de datos sobre una base de datos de dominios, con entrega en una interfaz cómoda y exportaciones (DaaS).
Dificultades y cómo las resolvimos
La principal: la escala. Cada día caducan cientos de miles de dominios y pasar el paquete completo de comprobaciones por todos no tiene sentido. Montamos una cadena: primero recopilamos y deduplicamos las listas de drops, luego enriquecemos con métricas, y los pasos caros (archivo web) solo se ejecutan sobre los dominios preseleccionados que pasan el primer filtro. El proceso se ejecuta a diario.
La segunda: la heterogeneidad de las fuentes. Cada plataforma tiene su formato de lista y su manera de indicar la fecha y hora del drop. Lo llevamos todo a un esquema único y a una hora única; sobre cómo unificar datos, vea nuestro artículo de normalización de datos.
La tercera, la clave: descartar los dominios con un pasado «sucio», los que ya habían caducado antes y alojaron spam. Por métricas, un dominio así puede parecer atractivo, pero en realidad está quemado. Revisamos el historial en el archivo web y las señales de drops anteriores para que esos candidatos no pasaran. También resultó útil el trabajo con APIs externas (Ahrefs, Moz, WHOIS) para un enriquecimiento rápido.
Cabe señalar: estas plataformas no tienen protección contra la recopilación; la tarea no iba de evitar bloqueos, sino de escala y calidad de los datos.
El resultado
La agencia obtuvo un flujo diario único de dominios en drop, enriquecido con métricas, antigüedad e historial, y una interfaz para la puntuación manual: la evaluación de candidatos ocurre en un solo lugar, en vez de recorrer decenas de plataformas y cotejar métricas a mano.
Servicios en este caso: Búsqueda y enriquecimiento de datos · Base de datos de dominios · DaaS y datos vía API · Datos para SEO y búsqueda
Materiales útiles: Enriquecimiento de datos · Normalización de datos · Extracción de datos vía API