简答题在大型数据集上快速训练决策树的方法是? A、增加树的深度 B、减少树的深度 C、增加学习率 D、减少树的数量简答题在线性可分的情况下,支持向量是那些最接近决策平面的数据点 A、正确 B、错误简答题列表是不可变对象,支持在原处修改。 A、正确 B、错误简答题在集成学习中,模型集成了弱学习者的预测,所以这些模型的集成将比使用单个模型预测效果更好。那么关于集成学习模型中的弱学习者正确的是? A、他们通常会过拟合 B、他们经常不会过拟合 C、他们通常带有高偏差,所以其并不能解决复杂学习问题简答题仅仅知道变量的均值(Mean)和中值(Median),能计算的到变量的偏斜度(Skewness)吗? A、可以 B、不可以简答题一个训练好的模型在测试集上有100%的准确率,那么在一个新的数据集上,也会有同样好的表现。 A、正确 B、错误简答题使用SVM学习数据X,数据X里面有些点存在错误。若使用一个二次核函数,多项式阶数为2,使用惩罚参数C作为超参之一。当使用较大的C(C趋于无穷)时,对于训练集数据不能正确分类 A、正确 B、错误简答题逻辑回归输出不适用的评估指标是? A、均方误差 B、准确度 C、召回率 D、AUC-ROC简答题已知目标变量有 [0,0,0,1,1,1,1,1] 8 个实际值,则目标变量的熵是所少? A、5/8 log(3/8) – 3/8 log(5/8) B、3/8 log(5/8) + 5/8 log(3/8) C、5/8 log(5/8) + 3/8 log(3/8) D、-(5/8 log(5/8) + 3/8 log(3/8))简答题下面有关分类算法的准确率,召回率,F1 值的描述,错误的是( )。简答题两个变量的 Pearson 相关性系数为零,但这两个变量的值可以相关。 A、正确 B、错误简答题对于PCA说法正确的是:( ) A、我们必须在使用PCA前规范化数据 B、我们应该选择使得模型有最大variance的主成分 C、我们应该选择使得模型有最小variance的主成分 D、我们可以使用PCA在低维度上做数据可视化简答题针对一个二类分类模型, 输出是0或1, 初始时设阈值为0.5, 超过0.5概率估计, 为1, 否则就为0 ; 如果我们现在使用大于0.5的阈值, 关于模型正确的是 : A、模型分类准确率会降低 B、模型分类准确率会升高或不变 C、模型分类的召回率会升高 D、模型分类的召回率会降低或不变简答题使用Logistic回归模型在大型数据集上,快速的给出相近精度的方法是? A、提高学习率,增加迭代次数 B、增加学习率,减少迭代次数 C、降低学习率,增加迭代次数 D、降低学习率,减少迭代次数简答题假设你有以下数据:输入和输出都只有一个变量。使用线性回归模型(y=wx+b)来拟合数据。那么使用留一法(Leave-One Out)交叉验证得到的均方误差是多少? A、10/27 B、39/27 C、49/27 D、55/27简答题已知三次多项式回归产生的数据且三次多项式完美契合数据,那么正确的是? A、简单线性回归有低偏差和高方差 B、简单线性回归有高偏差和低方差 C、三次多项式有低偏差和低方差 D、三次多项式有低偏差和高方差简答题在变量选择过程中, 针对模型的效率,需要考虑的是? A、变量对于模型的解释有多大作用 B、交叉验证 C、特征携带的信息 D、多个变量其实有相同的用处简答题已知一个主要类别占训练数据 99%的极度不平衡分类问题,且模型在测试集上准确度为 99% 。那么说法正确的是? A、准确度适合于衡量不平衡类别问题 B、准确度并不适合于衡量不平衡类别问题 C、精确率和召回率适合于衡量不平衡类别问题 D、精确率和召回率不适合于衡量不平衡类别问题简答题在下面给出的三个残差图中,下面哪一个代表了与其他模型相比更差的模型?注意:1. 所有的残差都已经标准化 2. 图中横坐标是预测值,纵坐标是残差 A、1 B、2 C、3 D、无法比较简答题在以下场景中所使用的分析方法不正确的是 A、根据商家最近一年的经营及服务数据,用聚类算法判断出天猫商家在各自主营类目下所属的商家层级 B、根据商家近几年的成交数据,用聚类算法拟合出用户未来一个月可能的消费金额公式 C、用关联规则算法分析出购买了汽车坐垫的买家,是否适合推荐汽车脚垫 D、根据用户最近购买的商品信息,用决策树算法识别出淘宝买家可能是男还是女