menos de 1 minuto(s) de leitura

wGet Baixar todos arquivos de um site

Por exemplo baixar todos os arquivos em PDF que esteja no site.

Usar –accept-regex

Você pode instruir o wget a aceitar links que terminem em .pdf mesmo que estejam em páginas diferentes:

wget -r -l2 -nd -H -p -A.pdf --accept-regex=".*\.pdf$" -e robots=off https://linux.jar.io/pdf-puglins

-l2 → profundidade de recursão (aumente se precisar seguir mais páginas).

-H → permite seguir links para outros hosts.

–accept-regex → baixa apenas URLs que terminem em .pdf.

Usar wget –span-hosts

Se os arquivos .pdf estão em outros domínios, você precisa permitir que o wget siga links externos:

wget -r -l3 -nd -H --accept-regex=".*\.pdf$" -e robots=off https://linux.jar.io/qbittorrent-files

Usar wget –content-disposition

Alguns links podem apontar para scripts de download (ex: download?id=123) que entregam um .pdf. Nesse caso:

wget -r -l3 -nd -H --content-disposition -A.pdf -e robots=off https://linux.jar.io/qbittorrent-pdf

O –content-disposition faz o wget respeitar o nome do arquivo enviado pelo servidor (mesmo que a URL não termine em .pdf).

Alternativa com httrack ou curl

Se os links forem muito dinâmicos, wget pode não resolver sozinho. Nesse caso, ferramentas como httrack ou um script em python com requests + BeautifulSoup podem ser mais flexíveis para extrair todos os links .pdf.

Atualizado em: