Scraping por lenguaje 3 min de lectura

Scraper de etiquetas title, description y encabezados H1–H6: revisión masiva de metadatos

Revisión masiva de title, description y encabezados H1–H6 en todo el sitio: por qué la necesita un especialista SEO y cómo automatizar la recolección.

EW
Equipo Web-Scraping.es
Recopilación de datos para las necesidades del negocio
Publicado: 17 enero 2025

El title, la description y los encabezados H1--H6 son los elementos por los que el buscador entiende de qué trata una página y por los que el usuario decide si hace clic en el snippet. En un sitio de cientos o miles de páginas es imposible revisarlos a mano: aquí el title está vacío, allá se repite en decenas de páginas, en otra parte falta el H1 o los encabezados rompen la jerarquía. Un scraper de etiquetas reúne todos los metadatos del sitio en una sola tabla, y los problemas saltan a la vista de inmediato.

Este artículo forma parte de la serie sobre web scraping en SEO. Veamos qué se recopila, para qué y con qué herramientas.

Qué recopila un scraper de metadatos

Al recorrer el sitio, por cada URL el scraper extrae:

  • Title — el título de la página para la pestaña del navegador y el snippet.
  • Description — la metadescripción.
  • H1 — el encabezado principal de la página.
  • H2--H6 — los subtítulos y su jerarquía.
  • La longitud de las etiquetas, para detectar las demasiado cortas y las que se recortan en los resultados de búsqueda.

En esencia es el mismo recorrido que al rastrear la estructura del sitio: una sola pasada del crawler produce a la vez el árbol de secciones y la tabla de metadatos. Por eso las etiquetas, titles y encabezados suelen recopilarse con los mismos programas que la estructura.

Qué problemas se buscan

Titles y descriptions duplicados. Metaetiquetas idénticas en páginas distintas son una causa frecuente de que las páginas compitan entre sí y posicionen peor. El scraper detecta todas las repeticiones al momento.

Etiquetas vacías o ausentes. Las páginas sin title o sin H1 pierden relevancia. En la tabla se distinguen de inmediato por las celdas vacías.

Sobreoptimización y longitud. Los titles demasiado largos se recortan en los resultados, y los encabezados saturados de palabras clave pueden acarrear penalizaciones. La exportación con las longitudes ayuda a poner orden.

Jerarquía de encabezados rota. Varios H1 en una misma página, niveles saltados, un H2 antes del H1: errores estructurales de marcado que estorban tanto al robot como a la accesibilidad.

El resultado de esta auditoría es un pliego de tareas para reescribir las metaetiquetas: qué páginas corregir, dónde eliminar duplicados y dónde completar lo que falta.

Con qué scrapear etiquetas y encabezados

Screaming Frog SEO Spider es la herramienta de referencia. En un rastreo normal del sitio ya recopila los titles, las descriptions y los encabezados, y marca los duplicados, los valores vacíos y los demasiado largos. Con la extracción personalizada (Custom Extraction mediante XPath o expresiones regulares) se pueden extraer también elementos no estándar — por ejemplo, todas las etiquetas <strong> o el contenido de un bloque concreto.

Las auditorías de sitio de plataformas como Ahrefs (Site Audit) y SEMrush también registran los titles durante el rastreo y permiten localizar duplicados y páginas sin encabezado.

Un escenario aparte es recopilar etiquetas y encabezados no de su propio sitio, sino de los resultados de búsqueda o de los sitios de la competencia. Muchos optimizan sus metaetiquetas para posicionar, así que en los title, description y H1--H6 ajenos se encuentran frases clave ya trabajadas e ideas para el plan de contenidos. Para esto resultan cómodos el modo lista de Screaming Frog (se le pasa una lista de URL de la competencia y devuelve sus metadatos) y los informes de análisis de SERP de Ahrefs o SEMrush, que muestran con qué titles compiten los resultados del top de Google. Aquí ya hay solapamiento con la tarea de recopilar palabras clave: los encabezados de la competencia son una buena fuente de consultas pasadas por alto.

Cómo encaja con el resto del trabajo

El scraping de etiquetas es el diagnóstico de la parte de contenido del sitio, en pareja con el diagnóstico técnico mediante el rastreo de la estructura. Para reescribir bien las metaetiquetas hacen falta palabras clave, y esas las aportan la recopilación de semántica, las sugerencias de Google y Google Keyword Planner. Y tras los cambios, el efecto se controla con el seguimiento de posiciones.

Si la tarea no es analizar las etiquetas de sitios concretos, sino los snippets y titulares directamente del top de resultados, eso es la extracción de la SERP de Google, un servicio aparte de nuestra agencia.