Tecnologías y protecciones: sitios dinámicos, sistemas anti-bots, proxies y elusión de bloqueos.
Cómo funcionan los sistemas anti-bot modernos: fingerprinting, análisis del comportamiento, captchas y qué implica todo esto para los propietarios de sitios.
Expresiones regulares en el parseo de datos: sintaxis básica, patrones útiles, límites de aplicación y por qué el HTML requiere un parser y no regex.
Guía de proxies para web scraping: datacenter, residenciales y móviles, rotación, comprobación de la privacidad y protección frente a la detección.
Scraping de sitios con autenticación: cookies y sesiones, tokens, CSRF y ejemplos de inicio de sesión desde código en Python, Node.js, PHP y Go.
Selenium para el scraping de sitios dinámicos: configuración de drivers, esperas, evasión de la detección de automatización y cuándo usar una API.
Dos formas de hacer scraping de sitios dinámicos: ingeniería inversa de las peticiones XHR a la API y navegadores headless — ventajas, inconvenientes y criterios de elección.
Qué es el enriquecimiento de datos: qué atributos se añaden a empresas, productos y contactos, de dónde se obtienen y cómo funciona a nivel técnico.
El término «normalización de datos» tiene tres sentidos: bases de datos relacionales, machine learning y limpieza de datos extraídos por scraping. Analizamos cada uno.
Qué es un parser del DOM y cómo funciona por dentro: construcción del árbol del documento, navegación por nodos y diferencias con los enfoques en flujo y con regex.