背景如下:
我老师让我分析近年一些新闻网站上出现的化学名词(有一个文本的词库)和相关的频度。
(人家是学化学的啦 - -T)
我现在想到的解决方案是:
首先如果整站mirror下来再做文本分析。这个不用想,数据量就有点太大了。
所以我一开始想的是先通过Google搜索,过滤出含有关键词的网页,再抓取相应的网页下来分析。
URL构造类似下面的:
https://www.google.com/search?q=site:www.guokr.com+%E5%81%8F%E4%BA%8C%E7%94%B2%E8%82%BC&newwindow=1&safe=off&hl=zh-CN&tbs=qdr:m&num=100
通过curl抓取下来。然后过滤URL…… 问题来了。
第一个问题:如何从这么多文本里面过滤出需要的URL,因为我是用guokr来做的,里面的URL类似于:www.guokr.com/post/472922/
第二个问题是:Google似乎对curl有严格限制。我抓过几次以后,就显示禁止访问了。难道是跟我频繁更换模拟的user agent有关系?= =
或者说各位对这个有其他比较好的实现没有?
我老师让我分析近年一些新闻网站上出现的化学名词(有一个文本的词库)和相关的频度。
(人家是学化学的啦 - -T)
我现在想到的解决方案是:
首先如果整站mirror下来再做文本分析。这个不用想,数据量就有点太大了。
所以我一开始想的是先通过Google搜索,过滤出含有关键词的网页,再抓取相应的网页下来分析。
URL构造类似下面的:
https://www.google.com/search?q=site:www.guokr.com+%E5%81%8F%E4%BA%8C%E7%94%B2%E8%82%BC&newwindow=1&safe=off&hl=zh-CN&tbs=qdr:m&num=100
通过curl抓取下来。然后过滤URL…… 问题来了。
第一个问题:如何从这么多文本里面过滤出需要的URL,因为我是用guokr来做的,里面的URL类似于:www.guokr.com/post/472922/
第二个问题是:Google似乎对curl有严格限制。我抓过几次以后,就显示禁止访问了。难道是跟我频繁更换模拟的user agent有关系?= =
或者说各位对这个有其他比较好的实现没有?