ProfoundBot es un agente HTTP iniciado por el usuario. Cuando proporcionas una URL a través de la plataforma o la API de Profound, obtiene esa página web pública y devuelve su contenido en Markdown, HTML o ambos.
Resumen
Qué hace
Cuando proporcionas la URL de una página web pública para leer su contenido, ProfoundBot realiza un conjunto limitado de solicitudes HTTP al origen de esa URL para obtener la página y, luego, devuelve el contenido en Markdown, HTML o ambos.
Cuando una página se renderiza con un navegador sin interfaz gráfica, los subrecursos propios de esa página (scripts, hojas de estilo, imágenes) se cargan como lo harían en cualquier navegador. ProfoundBot no sigue enlaces a otras páginas.
Qué no hace
- Rastrear. Cada acción del cliente obtiene exactamente una URL. El bot no sigue enlaces de forma recursiva ni crea un índice de tu sitio
- Enviar formularios, seguir flujos de inicio de sesión ni acceder a áreas autenticadas
- Conservar un índice persistente de tu sitio. El contenido obtenido se te entrega y no se vuelve a publicar
- Acceder a destinos de redes privadas o internas
Comportamiento de las solicitudes
Cada acción del usuario desencadena una interacción pequeña y limitada, circunscrita a la única URL solicitada.
Origen de red e IP dedicadas
De forma predeterminada, ProfoundBot sale desde un rango de IP dinámico. Identifícalo por su User-Agent.
Puedes inscribir un dominio (una configuración por dominio, desactivada de forma predeterminada) para que ProfoundBot lo obtenga desde un conjunto fijo de IP de salida dedicadas. Esto es útil si prefieres permitir a Profound por IP en lugar de por User-Agent. Cuando un dominio está inscrito, las solicitudes salen desde una de estas IP:
54.71.251.60
54.185.59.110
100.22.234.65
Estas IP dedicadas también están disponibles en un formato JSON legible por máquina.
Para inscribir un dominio en la obtención mediante IP dedicadas, ve a Settings → Web Scrape en tu cuenta de Profound y activa la opción Primary Domain Scraping via Static IPs (On).
Manejo de robots.txt
ProfoundBot es iniciado por el usuario y obtiene una sola página por acción del usuario en lugar de rastrear. La compatibilidad con las directivas Disallow de robots.txt está prevista para una versión futura.
Para impedir que ProfoundBot acceda a tu sitio mientras tanto, consulta la sección Cómo bloquearlo.
Cómo identificar el bot
Usa el encabezado User-Agent exacto:
Todos los bots de Profound usan cadenas de User-Agent que comienzan con Profound, por lo que una coincidencia por prefijo es una buena forma de identificar todo el tráfico de Profound, actual y futuro. Para los dominios inscritos, también puedes buscar coincidencias con las IP de salida dedicadas que se indican en la sección Origen de red e IP dedicadas.
Cómo bloquearlo
Bloquea ProfoundBot con cualquiera de los siguientes métodos:
- Una regla de WAF o CDN que detecte un User-Agent que contenga
ProfoundBot
- Una regla de WAF o CDN que detecte un User-Agent que contenga el prefijo
Profound
- Para los dominios inscritos, una regla de firewall o WAF que bloquee las IP de salida dedicadas (
54.71.251.60, 54.185.59.110, 100.22.234.65)
Cómo reportar abusos
Si observas un comportamiento que no coincide con esta documentación, como rastreo recursivo, tasas de solicitudes incompatibles con la obtención de una sola página iniciada por el usuario o actividad de un User-Agent Profound* no reconocido, repórtalo a security@tryprofound.com con líneas de registro de ejemplo.
Profound trata estos reportes como problemas de seguridad y responde a todos ellos.