因为是监控很多个一个网站的很多个不同的目标源,所以我决定用 APS 启动多个异步任务抓取(根据每个任务的特征,判断启动时间与结束时间,请求间隔设成五分钟一次这样)
然后这些抓取的内容先不洗清,按事先搞好分类扔进不同的 KAFKA 频道。
另一边不同的洗清模块从不同的 KAFKA 频道抽取,进行清洗,并存入 SQL 数据库,一般是 MYSQL
这样的话,我很容易就写成,抓取与清洗是两个程序。等于需要启动两个程序。一个启动爬虫抓,另一个启动清洗程序,是否成熟的作法是只有一个入口文件,启动后两个都开始执行?