简答题给出如下数据集:删除 a,b,c,d 哪个点对拟合回归线的影响最大? A、d B、c C、b D、a简答题下图是一个简单的线性回归模型,图中标注了每个样本点预测值与真实值的残差。请计算 SSE A、0.604 B、0.75 C、1.01 D、3.02简答题减少数据集维度的技术有? A、删除数据差异较大的列 B、删除不同数据趋势的列 C、删除缺少值太多的列简答题下图中,主成分的最佳数目是多少? A、10 B、20 C、30 D、无法确定简答题Logistic Regression主要用于回归 A、正确 B、错误简答题给定三个变量 X,Y,Z。(X, Y)、(Y, Z) 和 (X, Z) 的 Pearson 相关性系数分别为 C1、C2 和 C3。现在 X 的所有值加 2(即 X+2),Y 的全部值减 2(即 Y-2),Z 保持不变。运算之后的 (X, Y)、(Y, Z) 和 (X, Z) 相关性系数分别为 D1、D2 和 D3。则D1、D2、D3 和 C1、C2、C3 之间的关系是? A、D1= C1, D2 C3 B、D1 = C1, D2 > C2, D3 > C3 C、D1 = C1, D2 D、D1 = C1, D2 = C2, D3 = C3简答题关于SVM的泛化误差,描述正确的是 A、超平面与支持向量之间距离 B、SVM对未知数据的预测能力 C、SVM的误差阈值简答题已知一个数据集在深度为 6 的决策树下,训练精确度为 100% ,那么可以得出的结论是? A、深度为 4 时将有低偏差和低方差 B、深度为 4 时将有高偏差和低方差 C、A和B简答题如下图所示,对同一数据集进行训练,得到 3 个模型。对于这 3 个模型的评估,下列说法正确的是? A、第一个模型的训练误差最大 B、第三个模型性能最好,因为其训练误差最小 C、第二个模型最稳健,其在测试集上表现应该最好 D、第三个模型过拟合简答题我们如何做到将聚类算法应用在监督式学习中? A、首先,可以创建聚类,然后分别在不同的集群上应用监督式学习算法 B、在应用监督式学习之前,不能创建聚类 C、在应用监督式学习算法之前,不能将其类别 ID 作为特征空间中的一个额外的特征 D、在应用监督式学习算法之前,可以将其类别 ID 作为特征空间中的一个额外的特征简答题逻辑回归与LDA之间的差异是? A、如果样本量小,并且每个类的特征分布是正常的。在这种情况下,线性判别分析比逻辑回归更稳定。 B、如果类别分离好,逻辑回归的参数估计可能不稳定。简答题使用Lasso回归拟合有100个特征值(X1,X2…X100)的数据集后,将其中一个值乘10(将它视作X1),并再次同一模型,那么X1会? A、很难说 B、X1很可能被模型排除 C、X1很可能被包含在模型内简答题一监狱人脸识别准入系统用来识别待进入人员的身份,此系统一共包括识别4种不同的人员:狱警、小偷、送餐员、其他,下面哪种学习方法最适合此种应用需求? A、二分类问题 B、多分类问题 C、层次聚类问题 D、回归问题简答题关于梯度下降(GD)和随机梯度下降(SGD)正确的是? A、在 GD 中,每一次迭代需要使用整个训练集或子训练集的数据更新一个参数。 B、在 SGD 中,每一次迭代都需要遍历训练集中的所有样本以更新一次参数。 C、在 GD 和 SGD 中,每一次迭代中都是更新一组参数以最小化损失函数。简答题已知卷积神经网络输入图像的尺寸为28x28x3,卷积核的大小为3x3x3,卷积核的个数为8,卷积步幅Stride=1,填充值padding=1,则输出的特征图尺寸为是? A、13 宽、13 高、8 深 B、13 宽、28 高、8 深 C、28 宽、28 高、8 深 D、28 宽、13 高、8 深简答题回归预测的目标是离散值,分类预测的目标是连续值。 A、正确 B、错误简答题决策树中,父子节点之间熵的大小关系是? A、两者相等 B、决策树的父节点更大 C、子节点的熵更大 D、根据具体情况而定简答题散点图最适合检验连续变量x,y之间的线性关系。 A、正确 B、错误简答题精确率、查全率、准确率、F1分数四种指标各有侧重,指标值都是越高越好,最佳值均为1,最差值均为0。 A、正确 B、错误简答题在Logistic Regression 中,如果同时加入L1和L2范数,不会产生什么效果() A、以做特征选择,并在一定程度上防止过拟合 B、能解决维度灾难问题 C、能加快计算速度 D、可以获得更准确的结果