网络爬虫的基本工作原理包括( )。
A由用户给定一组网页URLs,作为爬虫程序的输入,爬虫程序会将它们存放在待爬取队列中[|]调度器(Scheduler)会从待爬取URL队列中逐一取出URL,判断该URL是否已经被爬取过,即执行去重判断,之后,按照一定的遍历策略或负载策略,对URL发起网络爬取任务,也就是执行相应的HTTP请求[|]下载器将逐一执行调度器产生的每个HTTP请求,下载对应的Web内容,返回结果包括:HTML网页、CSS文件、JavaScript、图片等等[|]解析器对下载器获得的HTML页面内容进行解析,提取出用户关心的部分内容,这其中,既包括用户感兴趣的关键数据;也包括有待下一步爬取的新的URLs