Formatos y fuentes de datos 6 min de lectura

Libros sobre web scraping y extracción de datos: panorama

Selección de libros sobre web scraping y extracción de datos: de los manuales de scraping con Python a las obras sobre crawlers, sistemas anti-bots y bases de datos.

EW
Equipo Web-Scraping.es
Recopilación de datos para las necesidades del negocio
Publicado: 12 febrero 2025

Qué leer para recopilar datos de la web — y dónde guardarlos después

El web scraping es una disciplina engañosamente sencilla al principio y muy amplia en el fondo. Para escribir un scraper operativo tendrá que tocar HTTP y HTML, las expresiones regulares, la evasión de protecciones anti-bots, la limpieza de datos «sucios» y, por último, su almacenamiento. Por eso una buena selección de lecturas no es un solo libro, sino un pequeño «arsenal»: un núcleo sobre el scraping en sí más obras sobre los temas colindantes. A continuación, un panorama de lo que merece la pena leer, con apartados dedicados a las expresiones regulares y a las bases de datos.

Dejemos claro lo esencial desde el principio: la obra de referencia del nicho es Web Scraping with Python, de Ryan Mitchell. La edición vigente es la tercera, revisada a fondo. Todo lo demás se articula alrededor de ella.


La literatura en inglés

En inglés la oferta es amplia y permite componer un conjunto a la medida de cada tarea.

Ryan Mitchell. Web Scraping with Python, 3.ª ed. (O'Reilly, 2024)

El manual de base. Su punto fuerte: la autora reconoce con honestidad que el scraping se sitúa en el cruce de muchas áreas y exige trabajar con bases de datos, servidores web, HTTP, HTML, seguridad en internet, procesamiento de imágenes y ciencia de datos, y por eso ofrece una introducción panorámica a cada una de ellas. La estructura es clásica: la primera parte cubre la mecánica del scraping (peticiones al servidor, procesamiento de respuestas, automatización); la segunda, herramientas y escenarios avanzados (Scrapy, almacenamiento, documentos, lenguaje natural, formularios e inicios de sesión, JavaScript, API, reconocimiento de imágenes, evasión de bloqueos).

Seppe vanden Broucke y Bart Baesens. Practical Web Scraping for Data Science (Apress)

El énfasis está en la ciencia de datos. Los autores son científicos de datos, y el libro ofrece una guía moderna y concisa del scraping que no esconde los detalles importantes ni las buenas prácticas. Una buena elección si para usted el scraping es el primer paso de un proyecto de ciencia de datos (recopilar el dataset, limpiarlo, prepararlo para el análisis).

Python Web Scraping Cookbook (Packt)

Formato de «recetas» para tareas concretas: proxies, captchas, Scrapy, dockerización, despliegue. Útil como manual de consulta, no como libro de texto «desde cero».

Hands-On Web Scraping with Python (Packt)

Orientado a la práctica, con el acento puesto en extraer datos de calidad y en las técnicas modernas. Complementa a Mitchell con ejemplos aplicados.

Al Sweigart. Automate the Boring Stuff with Python

No trata el scraping en su totalidad, pero contiene un excelente capítulo introductorio y está disponible gratis en línea. El punto de partida ideal si su Python todavía cojea.

Una salvedad. Los libros de Packt y similares caducan más rápido que el de Mitchell: las bibliotecas y las protecciones anti-bots cambian a toda velocidad. Contraste siempre el código con la documentación actual de las bibliotecas.


Expresiones regulares

Las regex son el caballo de batalla del parseo. Una advertencia importante: para analizar HTML conviene usar parsers especializados (BeautifulSoup, lxml) y reservar las expresiones regulares para el texto «sucio», los logs, la validación y el posprocesamiento de los datos ya extraídos. El canon aquí es estable y apenas envejece.

Jeffrey Friedl. Mastering Regular Expressions, 3.ª ed. (O'Reilly, 2006)

La «biblia» del tema. Pese a su edad, conceptualmente sigue vigente: explica cómo funciona por dentro un motor de expresiones regulares — NFA/DFA, backtracking, optimización de patrones. Es un libro denso, pero después de leerlo las regex dejan de ser magia.

Jan Goyvaerts y Steven Levithan. Regular Expressions Cookbook, 2.ª ed. (O'Reilly, 2012)

Un recetario práctico de soluciones listas para distintos lenguajes, Python incluido. Cómodo como referencia junto al libro de Friedl.

Michael Fitzgerald. Introducing Regular Expressions (O'Reilly)

Una introducción suave, por si Friedl intimida desde la primera página.

Cómo leerlos. Para la mayoría de las tareas de scraping basta el capítulo sobre expresiones regulares del propio Mitchell más el «Cookbook» a mano. Acuda a Friedl cuando choque con el rendimiento o con patrones complejos.


Almacenamiento de datos: «7 bases de datos en 7 semanas» y su contexto

Los resultados del scraping hay que guardarlos en algún sitio, y la elección del almacenamiento depende del tipo de datos:

  • tablas planas → base de datos relacional (PostgreSQL, MySQL);
  • JSON anidado → base de datos documental (MongoDB, CouchDB);
  • relaciones entre entidades → base de datos de grafos (Neo4J);
  • caché, colas, datos temporales → clave-valor (Redis).

Para esta tarea existen libros específicos.

Luc Perkins, Eric Redmond y Jim Wilson. Seven Databases in Seven Weeks, 2.ª ed. (Pragmatic Bookshelf, 2018)

El famoso «7 bases de datos en 7 semanas». La segunda edición es una guía exhaustiva del mundo NoSQL: siete tecnologías — Redis, Neo4J, CouchDB, MongoDB, HBase, Postgres y DynamoDB. Su principal valor para quien se dedica al scraping es que enseña a pensar en modelos de datos: a lo largo del libro se analizan cinco modelos — relacional, clave-valor, columnar, documental y de grafos — desde la perspectiva de aplicaciones reales. Es exactamente la respuesta a la pregunta «¿qué tipo de datos va a qué base?».

Sobre las ediciones: la primera incluía un capítulo sobre Riak; en la segunda lo sustituyeron por uno sobre DynamoDB y actualizaron los ejemplos. Elija precisamente la segunda edición. Una salvedad: el libro es de 2018 y algunos comandos de CLI pueden haber quedado obsoletos, pero como mapa de los «géneros» de bases de datos sigue siendo el mejor.

Martin Kleppmann. Designing Data-Intensive Applications (O'Reilly)

Si «7 bases de datos» responde a la pregunta «¿qué bases de datos existen?», DDIA responde a «¿cómo elegir con criterio y no pegarse un tiro en el pie?»: replicación, consistencia, formatos de codificación, tolerancia a fallos. El estándar de oro cuando los volúmenes de scraping crecen.

Bruce Tate. Seven Languages in Seven Weeks

El libro que dio origen a la serie: de él procede el formato de los «siete en siete semanas». No tiene relación directa con el scraping; lo mencionamos para completar el panorama.

Libros centrados en una base de datos concreta

En combinación con el scraping resultan útiles los libros específicos sobre PostgreSQL (a menudo una sola base relacional basta para empezar) y sobre MongoDB (si vuelca JSON en bruto). Como base mínima para las consultas SQL sirve Learning SQL, de Alan Beaulieu (O'Reilly).


Cómo componer su propia selección

El conjunto mínimo práctico queda así:

  1. El núcleo de scraping — Mitchell (la última edición).
  2. Expresiones regulares — el capítulo del propio Mitchell + el «Regular Expressions Cookbook» como referencia; Friedl, a medida que profundice.
  3. Almacenamiento — «Seven Databases in Seven Weeks» (2.ª ed.) para elegir el modelo de datos; DDIA, cuando crezca la escala; y un libro sobre la base concreta elegida.

El siguiente nivel de detalle depende de su stack y del tipo de datos objetivo: las tablas de productos, los textos de artículos, los grafos de relaciones y los datos en streaming exigen herramientas de almacenamiento distintas y, en consecuencia, un orden de lectura distinto.