Guías, estudios y casos de éxito sobre web scraping, monitorización de precios y entrega de datos para análisis, marketing y producto.
Cómo funcionan los sistemas anti-bot modernos: fingerprinting, análisis del comportamiento, captchas y qué implica todo esto para los propietarios de sitios.
Scraping, parseo y crawling: en qué se diferencian estos procesos, cómo se relacionan entre sí y por qué se confunden tan a menudo.
Cómo recopilar datos de sitios web sin ser programador: del copiado manual y las extensiones al web scraping por encargo, llave en mano.
Web scraping en Ruby: Nokogiri, HTTParty, Mechanize y Watir, del análisis de páginas estáticas a la automatización del navegador.
Parseo de feeds RSS y Atom: estructura de los formatos, bibliotecas listas para usar y monitorización de noticias y blogs sin rastrear páginas.
Expresiones regulares en el parseo de datos: sintaxis básica, patrones útiles, límites de aplicación y por qué el HTML requiere un parser y no regex.
Guía de proxies para web scraping: datacenter, residenciales y móviles, rotación, comprobación de la privacidad y protección frente a la detección.
Control de un navegador real desde PHP: Symfony Panther, chrome-php y Selenium para scrapear sitios dinámicos con JavaScript sin salir del stack PHP.
Cómo trabajar con XML en distintos lenguajes: DOM frente a SAX, XPath, espacios de nombres y lectura en flujo de archivos grandes sin agotar la memoria.