waybackurls: extração de URLs da Wayback Machine para recon
waybackurls · MIT
O waybackurls faz uma coisa: pede à API CDX da Wayback Machine todas as URLs que ela registrou para um domínio e as imprime. Sem flags dignas de nota, sem configuração. É uma ferramenta Unix no sentido original.
Instalação
go install github.com/tomnomnom/waybackurls@latest Comandos principais
# um único domínio
echo example.com | waybackurls
# inclui subdomínios, mantém a data de primeira observação
cat roots.txt | waybackurls -dates
# sem subdomínios
echo example.com | waybackurls -no-subs
# a posição usual no pipeline
cat roots.txt | waybackurls | sort -u > wayback.txt Saída
Uma URL por linha. Com -dates, um timestamp é prefixado:
2024-03-11T08:14:22Z https://example.com/api/v1/export?format=csv Onde ele entra no Tandera
O waybackurls roda em enrich no recon_web_lite e no recon_web_full, emparelhado com o gau.
Por que os dois? O gau consulta vários provedores, incluindo Common Crawl e URLScan; o waybackurls consulta o índice CDX da Wayback diretamente e tende a retornar histórico mais profundo dele. As saídas se sobrepõem bastante e divergem nas bordas, e as bordas são onde estão os endpoints esquecidos. O Tandera combina e deduplica os dois antes de qualquer etapa seguinte lê-los.
Usando em um pentest
Datas são triagem. O -dates diz quando uma URL foi observada pela última vez. Um path visto pela primeira vez em 2015 e nunca mais provavelmente sumiu; um visto mês passado e ausente do seu crawl é um endpoint vivo que a aplicação já não referencia. O segundo tipo vale seu tempo.
Extraia nomes de parâmetro, não só URLs. O corpus é uma wordlist gratuita sob medida para esta aplicação:
cat roots.txt | waybackurls | unfurl -u keys | sort -u > params.txt Trate como pistas, nunca como evidência. Tudo aqui é um registro de terceiros de como uma URL era em algum momento. Nada vai num relatório até você mesmo re-requisitar e capturar sua própria resposta.