大学网课搜题引擎
首页
融优学堂
Python网络爬虫与信息提取
6 第四周 网络爬虫之框架
题目详情
简答题
下面哪个不是“网络爬虫与信息提取”相关的技术路线?
A、scrapy-bs4
B、requests-re
C、requests-bs4-re
D、bs4-re
查看答案与解析
简答题
以下不是Scrapy框架支持的HTML信息提取方法的是: A、Beautiful Soup B、CSS Selector C、json D、lxml
简答题
在Scrapy框架中,请求从Spider模块发出后,被Engine发送到: A、丢弃 B、ITEM Pipeline C、Scheduler D、Downloader
简答题
在Scrapy框架中,Spiders模块产生的HTML分析结果经Engine模块发送给哪个模块? A、Scheduler B、Downloader C、Item Pipelines D、Item Pipelines和Scheduler
简答题
在Scrapy框架下,Spider Middleware在Spiders和Engine之间,以下对其作用描述错误的是: A、仅能表现为一个队列行为(先进先出) B、用户可以扩展编写配置代码 C、可以修改或新增爬取项 D、对请求和爬取项进行再处理
简答题
以下不是Scrapy框架和requests库共同点的是: A、可用性都很好,文档丰富 B、使用方法类似,相互兼容 C、都无法执行爬取后的JavaScript脚本、不能提交表单 D、都能够完成Web页面爬取功能
简答题
在Scrapy框架中,Spiders模块作用描述错误的是: A、维护一个爬取队列 B、对获取的响应进行分析 C、产生最初始的爬取请求 D、产生额外的爬取请求
简答题
以下不是使用Scrapy框架配置爬虫中所需要流程的是: A、编写Spider代码 B、编写Scheduler代码 C、建立工程和Spider模板 D、配置优化
简答题
在scrapy框架中,数据流最初始的请求来自于: A、Downloader B、Scheduler C、Spiders D、Engine
简答题
下面哪个不是网络爬虫可能引发的问题? A、隐私泄露 B、网络攻防对抗 C、法律风险 D、性能骚扰
简答题
判断一个网络爬虫应用可行性的最主要因素是什么? A、Robots协议是否有允许 B、技术路线选取 C、网页条件,即尽量没有JavaScript脚本产生的数据 D、部署代价和经济成本
简答题
在Scrapy框架中,以下不是数据流所承载数据元素的是 A、REQUESTS B、RESPONSE C、ITEMS D、URLS
简答题
在Scrapy框架下,配置Downloader最大并发下载数量的参数是: A、CONCURRENT_REQUESTS_PER_IP B、CONCURRENT_ITEMS C、CONCURRENT_REQUESTS_PER_DOMAIN D、CONCURRENT_REQUESTS
简答题
Requests库的方法与HTTP协议请求方法对应,下面哪个不是Requests库的对应方法? A、.get() B、.push() C、.patch() D、.put()
简答题
保留字yield所在函数是一个什么Python类型? A、整数类型 B、函数类型 C、对象类型 D、生成器
简答题
Scrapy是一个网络爬虫框架,以下对框架描述正确的是: A、框架是一个系统,配置参数后即可使用 B、框架是一个系统的半成品,提供了共性功能,需要开发定制功能 C、框架是一个理念,按照理念去编程 D、框架是一组功能,类似API
简答题
在Scrapy框架下,Engine模块作用描述错误的是: A、需要用户修改配置才能正常工作 B、所有数据流都经过这个模块 C、控制所有模块之间的数据流 D、根据条件出发事件
简答题
在Scrapy框架中,Downloader爬取页面内容后,结果经Engine发送到哪个模块? A、ITEM Pipelines B、Scheduler C、丢弃 D、Spiders
简答题
以下不是Scrapy框架组成模块的是: A、Spiders B、Blocklist C、Downloader D、Engine
简答题
开发一个网站级爬虫,可以7*24(7天每天24小时)不间断运行,应该选择的Python库是: A、Requests B、re C、Scrapy D、Beautiful Soup
Python网络爬虫与信息提取
章节列表
3 第一周 网络爬虫之规则
20
4 第二周 网络爬虫之提取
20
5 第三周 网络爬虫之实战
20
6 第四周 网络爬虫之框架
20