抓取网站, 趴取网站HTML页面
2021-01-22 17:12
标签:扩展 ext linux服务 文档 生成 网站 扩展名 http 适合 在Linux服务器中输入如下命令抓取网站HTML页面: wget -r -p -np -k -E http://www.xxx.com 抓取整站 wget -l 1 -p -np -k http://www.xxx.com 抓取第一级 -r 递归抓取 wget -m -e robots=off -k -E "http://www.xxx.com/" 解释: -m //镜像,就是整站抓取 抓取网站, 趴取网站HTML页面 标签:扩展 ext linux服务 文档 生成 网站 扩展名 http 适合 原文地址:https://www.cnblogs.com/john-xiong/p/14298873.html
-k 抓取之后修正链接,适合本地浏览.
可以将全站下载以本地的当前工作目录,生成可访问、完整的镜像。
-e robots=off //忽略robots协议,强制、流氓抓取
-k //将绝对URL链接转换为本地相对URL
-E //将所有text/html文档以.html扩展名保存