寻找并可视化交互

使用特征重要性、弗里德曼 H 统计量和 ICE 图分析相互作用 > > 本文中的代码需要安装 R 语言包

July 12, 2024 · 1 min · Hivan Du

使用 Python 绘制美国选举分级统计图

如何创建美国选举结果的时间序列分级统计图 > > 数据地址为源地址,如果失效请与我联系。

July 11, 2024 · 4 min · Hivan Du

机器学习中的可解释性

为什么我们需要了解模型如何进行预测

July 9, 2024 · 1 min · Hivan Du

太多项会毁了回归

多项式回归的过度拟合及其避免方法

July 8, 2024 · 1 min · Hivan Du

Interpretability 与 Explainability 机器学习

Interpretability 模型和 Explainability 模型之间的区别以及为什么它可能不那么重要

July 6, 2024 · 1 min · Hivan Du

深度神经网络语言识别

使用 DNN 和字符 n-gram 对一段文本的语言进行分类(附 Python 代码)

July 5, 2024 · 4 min · Hivan Du

使用 PCA 可视化数据的分类能力

使用 PCA 探索数据分类的效果(使用 Python 代码)

July 4, 2024 · 2 min · Hivan Du

使用高斯混合模型识别餐厅热点

原文:https://towardsdatascience.com/identifying-restaurant-hotspots-with-a-gaussian-mixture-model-2a840ab0c782 使用 GMM 识别加拿大多伦多的直观餐厅集群(附 Python 代码) 聚类算法(例如 GMM)是一种有用的工具,可帮助识别数据中的模式。它们使我们能够识别数据集中的子组,从而提高你的理解或增强预测模型。在本文中,借助 GMM,我们将尝试使用位置数据识别多伦多的餐厅集群。目标是找到在地理上合理但在其他特征(例如餐厅评级)方面具有不同特征的集群。我们将讨论关键代码,你可以在GitHub[^5]上找到完整的项目。

July 2, 2024 · 2 min · Hivan Du

特征工程的力量

原文:The Power of Feature Engineering 为什么你应该使用逻辑回归来建模非线性决策边界(使用 Python 代码) 作为一名大数据从业者,复杂的机器学习技术非常具有吸引力。使用一些深度神经网络 (DNN) 获得额外的 1% 准确率,并在此过程中启动 GPU 实例,这让人非常满意。然而,这些技术通常将思考留给计算机,让我们对模型的工作原理了解甚少。所以,我想回到基础知识。

July 1, 2024 · 5 min · Hivan Du

深入研究 LIME 的本地解释

本地可解释模型–不可知论解释(LIME)的直觉、理论和代码

June 27, 2024 · 4 min · Hivan Du