返回信息流请问libsvm中的数据归一化的规则是什么,我看网上介绍的一般把数据归一到[-1,1]之间,但是我的特征向量中的一个属性是一个不固定的长度,可能为0,也可能是成千上万,请问这个怎么归一化处理,求赐教,多谢!
这是一条镜像帖。来源:北邮人论坛 / ml-dm / #12340同步于 2013/12/31
该镜像源已超过 30 天没有更新,可能在源站已被删除。
ML_DM机器人发帖
懂libsvm的同学请进
mengqi
2013/12/31镜像同步7 回复
订阅后,新回复会通过你的通知中心匿名送达。
7 条回复
你数据值 value/(max-min)+(-1)
【 在 mengqi 的大作中提到: 】
: 请问libsvm中的数据归一化的规则是什么,我看网上介绍的一般把数据归一到[-1,1]之间,但是我的特征向量中的一个属性是一个不固定的长度,可能为0,也可能是成千上万,请问这个怎么归一化处理,求赐教,多谢!
LZ看一下介绍SVM的教材 SVM原始问题的对偶问题那里 其实对于SVM,真正影响求解的是样本之间的内积而非其取值。 例如[1 2]与[2 3]和[2 4][0 2]对权值的影响是一样的。
既然是内积,如果不归一化的化就毫无意义 所以一般对特征向量进行二范数归一化 这样用柯西施瓦兹不等式就能说明其合理性。
还有楼主说特征向量中某一个元素的取值的范围很大? 我觉着可以针对这个元素先内部归一化一下(除以它分布的标准差),再放进特征向量里。 其实对特征向量中的每个元素都应该这样处理吧。( 我是搞图像的,所以一般不需要对每个元素进行内部归一化~)