waybackurls: extracción de URLs de la Wayback Machine para recon
waybackurls · MIT
waybackurls hace una cosa: pide a la API CDX de la Wayback Machine todas las URLs que ha registrado para un dominio y las imprime. Sin flags dignas de mención, sin configuración. Es una herramienta Unix en el sentido original.
Instalación
go install github.com/tomnomnom/waybackurls@latest Comandos principales
# un único dominio
echo example.com | waybackurls
# incluye subdominios, conserva la fecha de primera observación
cat roots.txt | waybackurls -dates
# sin subdominios
echo example.com | waybackurls -no-subs
# la posición habitual en el pipeline
cat roots.txt | waybackurls | sort -u > wayback.txt Salida
Una URL por línea. Con -dates, se antepone un timestamp:
2024-03-11T08:14:22Z https://example.com/api/v1/export?format=csv Dónde encaja en Tandera
waybackurls se ejecuta en enrich en recon_web_lite y recon_web_full, emparejado con gau.
¿Por qué ambos? gau consulta varios proveedores, incluidos Common Crawl y URLScan; waybackurls consulta el índice CDX de la Wayback directamente y tiende a devolver un historial más profundo de él. Sus salidas se solapan mucho y divergen en los bordes, y los bordes son donde están los endpoints olvidados. Tandera combina y deduplica ambos antes de que cualquier etapa posterior los lea.
Uso en un pentest
Las fechas son triaje. -dates te dice cuándo se observó una URL por última vez. Un path visto por primera vez en 2015 y nunca más probablemente desapareció; uno visto el mes pasado y ausente de tu crawl es un endpoint vivo que la aplicación ya no referencia. El segundo tipo vale tu tiempo.
Extrae nombres de parámetro, no solo URLs. El corpus es una wordlist gratuita a medida para esta aplicación:
cat roots.txt | waybackurls | unfurl -u keys | sort -u > params.txt Trátalo como pistas, nunca como evidencia. Todo aquí es un registro de terceros de cómo se veía una URL en algún momento. Nada va a un informe hasta que tú mismo la re-solicites y captures tu propia respuesta.