大学网课搜题引擎
首页
高校帮
网络数据采集与Python爬虫【09.06初版】
第七章 构建健壮的爬虫系统
题目详情
判断题
Scrapy框架各组成部分有( )。
A
Scrapy Engine[|]Scheduler[|]Downloader[|]Spider
查看答案与解析
多选题
Scrapy爬虫框架安装后,创建新爬虫项目test的命令为( )。
多选题
from scrapy.spiders import Spiderfrom scrapy.selector import Selectorfrom dirbot.items import Websiteclass DmozSpider(Spider):name = "dmoz"allowed_domains = ["dmoz.org"]start_urls = ["http://www.dmoz.org/Computers/Programming/Languages/Python/Books/", "http://www.dmoz.org/Computers/Programming/Languages/Python/Resources/",]def parse(self, response):sites = response.css('#site-list-content > div.site-item > div.title-and-desc')items = []for site in sites: item = Website() item['name'] = site.css( 'a > div.site-title::text').extract_first().strip() item['url'] = site.xpath( 'a/@href').extract_first().strip() item['description'] = site.css( 'div.site-descr::text').extract_first().strip() items.append(item) return items上述代码中,待爬取的网页不可能包含( )。
判断题
在scrapy爬虫的下载中间件文件中,可以定义的方法有( ).
多选题
如果在某个scrapy爬虫的XXXspider.py文件的XXXSpider类中有如下代码,则其功能含义是( )。rules = [Rule(LinkExtractor(allow=("/subject/\d+$")), callback='parse_2'),]
判断题
scrapy框架中提供了多种爬虫模板,它们是( )
多选题
如果要激活某个中间件,需要在settings.py文件中激活中间件,下列语句中的数字表示( )。DOWNLOADER_MIDDLEWARES = { 'misc.middleware.CustomHttpProxyMiddleware': 400, 'doubanbook.middlewares.CustomUserAgentMiddleware': 401,}
多选题
from scrapy.spiders import Spiderfrom scrapy.selector import Selectorfrom dirbot.items import Websiteclass DmozSpider(Spider):name = "dmoz"allowed_domains = ["dmoz.org"]start_urls = ["http://www.dmoz.org/Computers/Programming/Languages/Python/Books/", "http://www.dmoz.org/Computers/Programming/Languages/Python/Resources/",]def parse(self, response):sites = response.css('#site-list-content > div.site-item > div.title-and-desc')items = []for site in sites: item = Website() item['name'] = site.css( 'a > div.site-title::text').extract_first().strip() item['url'] = site.xpath( 'a/@href').extract_first().strip() item['description'] = site.css( 'div.site-descr::text').extract_first().strip() items.append(item) return items上述代码是scrapy爬虫框架中哪类文件( )。
多选题
Scrapy爬虫框架安装且创建爬虫项目test后,创建爬虫名为tieba的scrapy命令是( )。
多选题
Scrapy中去除重复URL的方法是( )。
多选题
在编写scrapy爬虫程序之前,一般需要分析内容提取方法,这时我们会运行( )命令,进行分析。
多选题
使用crawl模板生成的爬虫程序中,不正确的操作是( )
多选题
Scrapy爬虫框架安装且创建爬虫项目test后,创建模板类型为crawl且爬虫名为tieba的scrapy命令是( )。
判断题
在运行scrapy交互环境,对爬得页面进行分析时,可以使用( )定位元素。
判断题
Scrapy中的中间件有( )。
多选题
Scrapy爬虫框架在新建爬虫时,可以使用模板。下列( )不是目前可用的scrapy官方模板。
多选题
在运行scrapy交互环境,对爬得页面进行分析时,使用xpath方法得到的元素对象为( )。
多选题
Scrapy爬虫框架安装后,创建新爬虫项目test的命令为( )。
网络数据采集与Python爬虫【09.06初版】
章节列表
第一章 网络数据采集概述
18
第二章 网络爬取相关的Web技术
40
第三章 web页面爬取
17
第四章 web页面内容解析
19
第五章 自动跨越身份认证
10
第六章 RIA网站数据爬取
14
第七章 构建健壮的爬虫系统
18
第八章 构建高性能的爬虫系统
9
Scrapy框架各组成部分有( )。 - 第七章 构建健壮的爬虫系统 - 网络数据采集与Python爬虫【09.06初版】 - 高校帮 | 大学网课搜题引擎