在写个爬取 url 的爬虫,原理大概是从一个起始的 url 开始爬,然后获取整个页面的链接地址,然后顺着收集到的 url 进行广泛的爬取,这里面出现 2 个问题没找到合适的办法解决.
1,会爬去到国外去
2,会爬到蜘蛛池(一种泛站程序,可以无限多的生成 N 个域名的网站类似,asd123.123.com assss.123.com 123.234.com)
目前通过判断标题是否是中文来避免是不是爬到国外的站,
还有一个就是放一个黑名单的表.存在就不爬.
但是蜘蛛池的域名实在太多了,也找不到太多规律的东西进行判断.
V 友们友什么好的建议么?
1,会爬去到国外去
2,会爬到蜘蛛池(一种泛站程序,可以无限多的生成 N 个域名的网站类似,asd123.123.com assss.123.com 123.234.com)
目前通过判断标题是否是中文来避免是不是爬到国外的站,
还有一个就是放一个黑名单的表.存在就不爬.
但是蜘蛛池的域名实在太多了,也找不到太多规律的东西进行判断.
V 友们友什么好的建议么?