Recursos · Blog

Tecnologías y protecciones

Tecnologías y protecciones: sitios dinámicos, sistemas anti-bots, proxies y elusión de bloqueos.

Tecnologías y protecciones
Protección anti-scraping: cómo funcionan los sistemas anti-bot modernos

Cómo funcionan los sistemas anti-bot modernos: fingerprinting, análisis del comportamiento, captchas y qué implica todo esto para los propietarios de sitios.

7 mayo · 14 min
Tecnologías y protecciones
Expresiones regulares para el parseo: sintaxis, patrones y límites

Expresiones regulares en el parseo de datos: sintaxis básica, patrones útiles, límites de aplicación y por qué el HTML requiere un parser y no regex.

27 abril · 8 min
Tecnologías y protecciones
Proxies para web scraping: guía completa de tipos, privacidad y detección

Guía de proxies para web scraping: datacenter, residenciales y móviles, rotación, comprobación de la privacidad y protección frente a la detección.

25 abril · 14 min
Tecnologías y protecciones
Scraping de sitios con autenticación: guía completa con ejemplos de código

Scraping de sitios con autenticación: cookies y sesiones, tokens, CSRF y ejemplos de inicio de sesión desde código en Python, Node.js, PHP y Go.

19 abril · 10 min
Tecnologías y protecciones
Scraping de sitios con Selenium: guía detallada

Selenium para el scraping de sitios dinámicos: configuración de drivers, esperas, evasión de la detección de automatización y cuándo usar una API.

7 abril · 10 min
Tecnologías y protecciones
Scraping de sitios dinámicos: dos enfoques

Dos formas de hacer scraping de sitios dinámicos: ingeniería inversa de las peticiones XHR a la API y navegadores headless — ventajas, inconvenientes y criterios de elección.

2 marzo · 16 min
Tecnologías y protecciones
Enriquecimiento de datos: qué es, qué atributos se añaden y de qué fuentes proceden

Qué es el enriquecimiento de datos: qué atributos se añaden a empresas, productos y contactos, de dónde se obtienen y cómo funciona a nivel técnico.

10 febrero · 9 min
Tecnologías y protecciones
Normalización de datos: tres sentidos distintos de un mismo término

El término «normalización de datos» tiene tres sentidos: bases de datos relacionales, machine learning y limpieza de datos extraídos por scraping. Analizamos cada uno.

8 febrero · 8 min
Tecnologías y protecciones
Parser del DOM: análisis detallado

Qué es un parser del DOM y cómo funciona por dentro: construcción del árbol del documento, navegación por nodos y diferencias con los enfoques en flujo y con regex.

4 febrero · 6 min