⼤数据分析之分类算法 数据分析之决策树ID3算法 什么是分类算法? 分类算法跟之前的聚类都是让不同对象个体划分到不同的组中的。但是分类不同之处在于类别在运算之前就已经是确定的。 分类是根据训练数据集合,结合某种分类算法,⽐如这篇讲的ID3算法来⽣成最终的分类规则,这样当提供⼀个对象的时候我们可以根据它 们的特征将其划分到某个分组中。 决策树ID3算法是分类中的经典算法,决策树的每⼀层节点依照某⼀确定程度⽐较⾼的属性向下分⼦节点,每个⼦节点在根据其他确定程度 相对较⾼的属性进⾏划分,直到 ⽣成⼀个能完美分类训练样例的决策树或者满⾜某个分类终⽌条件为⽌。 术语定义: ⾃信息量:设信源X发出a的概率p(a),在收到符号a之前,收信者对a的不确定性定义为a的⾃信息量I(a)=-logp(a)。 信息熵:⾃信息量只能反映符号的不确定性,⽽信息熵⽤来度量整个信源整体的不确定性,定义为:H(X)= 求和(p(ai) I(ai)) 条件熵:设信源为X,收信者收到信息Y,⽤条件熵H(X"Y)来描述收信者收到Y后X的不确定性的估计。 平均互信息量:⽤平均互信息量来表⽰信息Y所能提供的关于X的信息量的⼤⼩。 互信息量I(X"Y)=H(X)-H(X"Y) 下边的ID3算法就是⽤到了每⼀个属性对分类的信息增益⼤⼩来决定属性所在的层次,信息增益越⼤,则越 应该先作为分类依据。 ID3算法步骤 a.对当前例⼦集合,计算属性的信息增益; b.选择信息增益最⼤的属性Ai(关于信息增益后⾯会有详细叙述) c.把在Ai处取值相同的例⼦归于同于⼦集,Ai取⼏个值就得⼏个⼦集 d.对依次对每种取值情况下的⼦集,递归调⽤建树算法,即返回a, e.若⼦集只含有单个属性,则分⽀为叶⼦节点,判断其属性值并标上相应的符号,然后返回调⽤处,或者树达到规定的深度,或者⼦集所有 元素都属于⼀个分类都结束。 举例分析 世界杯期间我和同学⼀起去吃了⼏回⼤排档,对那种边凑热闹边看球的氛围感觉很不错,但虽然每个夏天我都会凑⼏回这种热闹,但肯定并 不是所有⼈都喜欢凑这种热闹的,⽽应⽤决策树算法则能有效发现哪些⼈愿意去,哪些⼈偶尔会去,哪些⼈从不愿意去; 变量如表1所⽰,⾃变量为年龄、职业、性别;因变量为结果(吃⼤排档的频率)。 年龄A 职业B 性别C 结果 20-30 学⽣ 男 偶尔 30-40 ⼯⼈ 男 经常 40-50 教师 ⼥ 从不 20-30 ⼯⼈ ⼥ 偶尔 60-70 教师 男 从不 40-50 ⼯⼈ ⼥ 从不 30-40 教师 男 偶尔 20-30 学⽣ ⼥ 从不 20以下 学⽣ 男 偶尔 20以下 ⼯⼈ ⼥ 偶尔 20-30 ⼯⼈ 男 经常 20以下 学⽣ 男 偶尔 20-30 教师 男 偶尔 60-70 教师 ⼥ 从不 30-40 ⼯⼈ ⼥ 偶尔 60-70 ⼯⼈ 男 从不 计算过程: 1、⾸先计算结果选项出现的频率: 表2 结果频率表 从不p1 经常p2 偶尔p3 0.375 0.125 0.5 2、计算因变量的期望信息: E(结果)=-(p1*log2(p1)+p2*log2(p2)+p3*log2(p3) ) =-(0.375*log2(0.375)+0.125*log2(0.125)+0.5*log2(0.5) ) =1.406 注:这⾥Pi对应上⾯的频率 3、计算⾃变量的期望信息(以年龄A为例): E(A)= count(Aj)/count(A)* (-(p1j*log2(p1j)+p2j*log2(p2j)+p3j*log2(p3j) )) 3.1公式说明: Count(Aj):年龄A第j个选项个数; j是下⾯表3五个选项任⼀ 表3 年龄记录数量表 选项 20-30 20以下 30-40 40-50 60-70 数量 5 3 3 2 3 Count(A):年龄总记录数 p1j =count(A1j)/count(Aj) :年龄A第j个选项在结果中选择了"从不"的个数占年龄A第j个选项个数的⽐例; p2j =count(A2j)/count(Aj) :年龄A第j个选项在结果中选择了"偶尔"的个数占年龄A第j个选项个数的⽐例; p3j =count(A3j)/count(Aj) :年龄A第j个选项在结果中选择了"经常"的个数占年龄A第j个选项个数的⽐例; 3.2公式分析 在决策树中⾃变量是否显著影响因变量的判定标准由⾃变量选项的不同能否导致因变量结果的不同决定,举例来说如果⽼年⼈都从不去⼤排 档,中年⼈都经常去,⽽少年都偶尔去,那么年龄因素肯定是决定是否吃⼤排档的主要因素; 按照假设,即不同年龄段会对结果产⽣确定的影响,以表3年龄在20以下的3个⼈为例,假设他们都在结果中选择了"偶尔"选项,此时: p2j =count(A2j)/count(Aj)=1, p1j =co
2024-02-20 10:50:40 149KB 文档资料
1
2023.7 更新-最全的GB/T 4754-2017 国民经济行业分类 sql 脚本(含数据)
2024-02-08 22:24:02 862KB sql
1
Python是一种高级、通用、解释型的编程语言,由Guido van Rossum于1989年发起,1991年正式发布。Python以简洁而清晰的语法著称,强调代码的可读性和易于维护。以下是Python的一些主要特点和优势: 易学易用: Python的语法设计简单直观,更接近自然语言,使初学者更容易上手。这种易学易用的特性促使了Python在教育领域和初学者中的广泛应用。 高级语言: Python是一种高级编程语言,提供了自动内存管理(垃圾回收)等功能,减轻了程序员的负担,同时具有动态类型和面向对象的特性。 跨平台性: Python具有很好的跨平台性,可以在多个操作系统上运行,包括Windows、Linux、macOS等,使得开发的代码可以轻松迁移。 丰富的标准库: Python内置了大量的模块和库,涵盖了文件操作、网络编程、数据库访问等各个方面。这些标准库使得开发者能够快速构建功能丰富的应用程序。 开源: Python是开源的,任何人都可以免费使用并查看源代码。这种开放性促进了Python社区的发展,使得有大量的第三方库和框架可供使用。 强大的社区支持: Python拥有庞大而活跃的开发社区,这使得开发者可以轻松获取帮助、分享经验,并参与到Python的发展中。 适用于多个领域: Python在各种领域都有广泛的应用,包括Web开发、数据科学、人工智能、自动化测试、网络编程等。特别是在数据科学和人工智能领域,Python成为了主流的编程语言之一。 支持面向对象编程: Python支持面向对象编程,允许开发者使用类和对象的概念,提高了代码的重用性和可维护性。
2024-02-04 18:29:35 47.7MB python 毕业设计 课程设计
1
中文微博情感数据库(2分类数据集) 带情感标注的微博语料数量: 10000(train.txt)+500(test.txt) 数据格式: 文档的每一行代表一条语料 每条语料的第一个数据为微博对应的mid,是每条微博的唯一标签,可以通过"https://m.weibo.cn/status/" + mid 访问到该条微博的网页(部分微博可能已被博主删除) 第二个数据为情感标签, 0表示负面, 1表示正面 其余后面部分都是微博文本 微博表情都被转义成[xx]的格式, 如: avatar被标记为[doge] avatar被标记为[允悲] 微博话题/地理定位/视频、文本超链接等都转义成了{%xxxx%}的格式,使用正则可以很方便地将其清洗
2024-02-03 19:51:46 1.73MB 数据集 情感分析
1
haarcascade_eye.xml;eye_tree_eyeglasses.xml;frontalcatface.xml;frontalface_alt.xml;frontalface_alt2.xml;frontalface_alt_tree.xml;frontalface_default.xml;fullbody.xml;lefteye_2splits.xml;licence_plate_rus_16stages.xml;lowerbody.xml;mcs_eyepair_big.xml;mcs_eyepair_small.xml;mcs_leftear.xml;mcs_lefteye
2024-02-02 12:50:38 2.14MB opencv
1
一百零二类花分类数据集
2024-01-29 15:13:55 297.26MB 数据集
1
粒子群算法(PSO)优化xgboost的分类预测,多输入单输出模型。PSO-xgboost分类预测模型。 多特征输入单输出的二分类及多分类模型。程序内注释详细,直接替换数据就可以用。 程序语言为matlab,程序可出分类效果图,迭代优化图,混淆矩阵图。
2024-01-27 19:27:15 54MB
1
内容概要 资源包括三部分(时间序列预测部分和时间序列分类部分和所需的测试数据集全部包含在内) 在本次实战案例中,我们将使用Xgboost算法进行时间序列预测。Xgboost是一种强大的梯度提升树算法,适用于各种机器学习任务,它最初主要用于解决分类问题,在此基础上也可以应用于时间序列预测。 时间序列预测是通过分析过去的数据模式来预测未来的数值趋势。它在许多领域中都有广泛的应用,包括金融、天气预报、股票市场等。我们将使用Python编程语言来实现这个案例。 其中包括模型训练部分和保存部分,可以将模型保存到本地,一旦我们完成了模型的训练,我们可以使用它来进行预测。我们将选择合适的输入特征,并根据模型的预测结果来生成未来的数值序列。最后,我们会将预测结果与实际观测值进行对比,评估模型的准确性和性能。 适合人群:时间序列预测的学习者,机器学习的学习者, 能学到什么:本模型能够让你对机器学习和时间序列预测有一个清楚的了解,其中还包括数据分析部分和特征工程的代码操作 阅读建议:大家可以仔细阅读代码部分,其中包括每一步的注释帮助读者进行理解,其中涉及到的知识有数据分析部分和特征工程的代码操作。
2024-01-26 20:05:19 407KB python 机器学习
1
本软件应用于windows平台,支持批量截取人脸,成功率很高,自动定位人脸,裁取人脸,对于识别不成功自动归类,结果仅供参考,请勿用在商业用途,侵权请联系,会及时删除。喜欢请支持,siesie~
2024-01-26 19:12:02 77.57MB 人脸识别
1
灰狼优化算法GWO优化SVM支持向量机惩罚参数c和核函数参数g,有例子,易上手,简单粗暴,替换数据即可,分类问题。 仅适应于windows系统
2024-01-23 09:05:21 239KB 支持向量机
1