Wget Baixar Arquivos
wGet Baixar todos arquivos de um site
Por exemplo baixar todos os arquivos em PDF que esteja no site.
Usar –accept-regex
Você pode instruir o wget a aceitar links que terminem em .pdf mesmo que estejam em páginas diferentes:
wget -r -l2 -nd -H -p -A.pdf --accept-regex=".*\.pdf$" -e robots=off https://linux.jar.io/pdf-puglins
-l2 → profundidade de recursão (aumente se precisar seguir mais páginas).
-H → permite seguir links para outros hosts.
–accept-regex → baixa apenas URLs que terminem em .pdf.
Usar wget –span-hosts
Se os arquivos .pdf estão em outros domínios, você precisa permitir que o wget siga links externos:
wget -r -l3 -nd -H --accept-regex=".*\.pdf$" -e robots=off https://linux.jar.io/qbittorrent-files
Usar wget –content-disposition
Alguns links podem apontar para scripts de download (ex: download?id=123) que entregam um .pdf. Nesse caso:
wget -r -l3 -nd -H --content-disposition -A.pdf -e robots=off https://linux.jar.io/qbittorrent-pdf
O –content-disposition faz o wget respeitar o nome do arquivo enviado pelo servidor (mesmo que a URL não termine em .pdf).
Alternativa com httrack ou curl
Se os links forem muito dinâmicos, wget pode não resolver sozinho. Nesse caso, ferramentas como httrack ou um script em python com requests + BeautifulSoup podem ser mais flexíveis para extrair todos os links .pdf.