Formatos y fuentes de datos: HTML, XML, JSON, APIs y bases de datos.
Scraping, parseo y crawling: en qué se diferencian estos procesos, cómo se relacionan entre sí y por qué se confunden tan a menudo.
Parseo de feeds RSS y Atom: estructura de los formatos, bibliotecas listas para usar y monitorización de noticias y blogs sin rastrear páginas.
Cómo trabajar con XML en distintos lenguajes: DOM frente a SAX, XPath, espacios de nombres y lectura en flujo de archivos grandes sin agotar la memoria.
Parseo de URL: de qué se compone una dirección, cómo descomponer y construir enlaces y cómo trabajar con parámetros de consulta y codificación en varios lenguajes.
Análisis de archivos de texto: lectura línea a línea de grandes volúmenes, codificaciones, expresiones regulares y ejemplos en varios lenguajes de programación.
Por qué empezar la recolección por el sitemap.xml: parseo de mapas índice, selección de las URL necesarias y ahorro en el rastreo del sitio antes del scraping.
Extracción de texto y tablas de archivos PDF: capas de texto frente a escaneados, OCR con Tesseract y ejemplos de código en Python, JavaScript y Java.
Parseo de logs de servidores y aplicaciones: formatos de los registros de acceso y de errores, expresiones regulares, herramientas listas y ejemplos de análisis.
Parseo de JSON en detalle: estructuras anidadas, streaming de archivos grandes, JSONPath y los errores típicos al trabajar con las API.