寻找并可视化交互
使用特征重要性、弗里德曼 H 统计量和 ICE 图分析相互作用 > > 本文中的代码需要安装 R 语言包
使用特征重要性、弗里德曼 H 统计量和 ICE 图分析相互作用 > > 本文中的代码需要安装 R 语言包
如何创建美国选举结果的时间序列分级统计图 > > 数据地址为源地址,如果失效请与我联系。
为什么我们需要了解模型如何进行预测
多项式回归的过度拟合及其避免方法
Interpretability 模型和 Explainability 模型之间的区别以及为什么它可能不那么重要
使用 DNN 和字符 n-gram 对一段文本的语言进行分类(附 Python 代码)
使用 PCA 探索数据分类的效果(使用 Python 代码)
原文:https://towardsdatascience.com/identifying-restaurant-hotspots-with-a-gaussian-mixture-model-2a840ab0c782 使用 GMM 识别加拿大多伦多的直观餐厅集群(附 Python 代码) 聚类算法(例如 GMM)是一种有用的工具,可帮助识别数据中的模式。它们使我们能够识别数据集中的子组,从而提高你的理解或增强预测模型。在本文中,借助 GMM,我们将尝试使用位置数据识别多伦多的餐厅集群。目标是找到在地理上合理但在其他特征(例如餐厅评级)方面具有不同特征的集群。我们将讨论关键代码,你可以在GitHub[^5]上找到完整的项目。
原文:The Power of Feature Engineering 为什么你应该使用逻辑回归来建模非线性决策边界(使用 Python 代码) 作为一名大数据从业者,复杂的机器学习技术非常具有吸引力。使用一些深度神经网络 (DNN) 获得额外的 1% 准确率,并在此过程中启动 GPU 实例,这让人非常满意。然而,这些技术通常将思考留给计算机,让我们对模型的工作原理了解甚少。所以,我想回到基础知识。
本地可解释模型–不可知论解释(LIME)的直觉、理论和代码