大学网课搜题引擎
首页
高校帮
网络数据采集与Python爬虫【09.06初版】
第一章 网络数据采集概述
题目详情
判断题
典型自然语言处理的基本思路包含下列( )。
A
获取待处理的文本,可以从已有的文本截取,也可以从网上爬取。[|]语料预处理,包括清洗、分词、词性标注、去停用词等。[|]特征工程,把分词之后的字和词语表示成计算机能够计算的类型。[|]特征选择,即分析语义信息,理解文本词句。
查看答案与解析
多选题
随着ASP、PHP、JSP、表单、数据库等技术成为组建网站的主流技术和关键部件,网络爬虫发展为( )。
判断题
URL去重是大规模网络爬虫必要组成,URL去重方法包括( )。
多选题
Python语言与Java语言都适合编写网络爬虫程序, Python的优势在于( )。
判断题
网络爬虫的基本工作原理包括( )。
多选题
静态网页爬虫的典型代表是( )。
多选题
爬虫经历了()个阶段
多选题
如果我们将WWW中的Web页面看作节点,将一个页面指向另一个页面的链接看作有向边,那么一个网站中的页面和链接可以抽象为( )模型;而多个网站则可抽象为是( )。
判断题
网络爬虫程序通常由下列( )组成。
判断题
在设计大规模网络信息采集系统时应注意的问题有( )。
判断题
当前Web页面爬取的主要困难有( )。
多选题
下列程序中最可能含有网络爬虫的是( )。
判断题
网站都会设计一种或多种机制防止爬虫爬取,这些机制包括( )。
判断题
根据网络爬虫程序功能和目标的不同,网络爬虫系统可以分为
判断题
在对网络爬虫进行功能分析时,比较明确的功能需求包括( )。
判断题
现实中,可供我们使用的网络数据,主要来自( )方面。
多选题
数据科学中常见的工作流程是( )。
判断题
网络爬虫的主要功能有( )。
网络数据采集与Python爬虫【09.06初版】
章节列表
第一章 网络数据采集概述
18
第二章 网络爬取相关的Web技术
40
第三章 web页面爬取
17
第四章 web页面内容解析
19
第五章 自动跨越身份认证
10
第六章 RIA网站数据爬取
14
第七章 构建健壮的爬虫系统
18
第八章 构建高性能的爬虫系统
9