Httracks Baixar Arquivos De Sites
HTTrack baixar arquivos de um site
O HTTrack é um programa de web scraping que funciona como um “aspirador de sites”: ele baixa páginas inteiras, seguindo links e recriando a estrutura localmente. Diferente do wget, ele já vem preparado para lidar com links que apontam para outras páginas, inclusive em domínios diferentes, e pode ser configurado para baixar apenas certos tipos de arquivos (como .py).
Como instalar WSL Linux (Debian/Ubuntu):
sudo apt update sudo apt install httrack
Windows: Baixe o instalador oficial em https://www.httrack.com.
Como usar HTTrack
httrack https://linux.jar.io/qbittorrent-puglins -O ./site_mirror -%A "*.py"
https://linux.jar.io/qbittorrent-puglins → URL inicial.
-O ./site_mirror → pasta onde os arquivos serão salvos.
-%A “*.py” → filtro para aceitar apenas arquivos .py.
Se os arquivos estiverem em outros domínios, adicione:
httrack https://linux.jar.io/qbittorrent-puglins -O ./site_mirror -%A "*.py" --mirror --stay-on-site=0
Dicas úteis
Você pode limitar a profundidade de links com -rN (ex: -r3 para seguir até 3 níveis).
Se quiser baixar somente os arquivos .py sem o resto do site, use:
httrack https://linux.jar.io/qbittorrent-puglins -O ./pyfiles -%A "*.py" --get-files-only
O HTTrack é mais “inteligente” que o wget para esse tipo de tarefa, mas se os links forem muito dinâmicos (ex: botões de download que geram URLs via JavaScript), pode ser necessário usar um script em Python com requests + BeautifulSoup.
httrack https://linux.jar.io/qbittorrent-puglins \ -O ./mirror \ -%A "*.py" \ --get-files-only \ -r3
-O ./mirror → pasta de destino.
-%A “*.py” → filtro para aceitar apenas arquivos .py.
–get-files-only → baixa só os arquivos, sem recriar toda a estrutura do site.
-r3 → profundidade de recursão (quantos níveis de links seguir).
Se os arquivos estiverem em outros domínios, adicione:
httrack https://linux.jar.io/qbittorrent-puglins \ -O ./mirror \ -%A "*.py" \ --get-files-only \ -r3 \
-%H
(-%H permite seguir links externos).