返回信息流我是做关系抽取的,最近在用libsvm做分类,在数据方面遇到一些问题,希望帮我解答一下。
我选取了6种类型的特征,数据如下:
1 好转 大 医学 医生 效果 动词
1 恶化 大 药物 医生 作用 名词
0 好转 小 药 医学 效果 动词
我有几千个上面类似的数据,其中第一例是类标,第二列到最后一列对应的是每种类型的特征取值,那么如果转换成libsvm格式的呢?libsvm格式数据是:类标 索引 值,一般这个值很多方法其中常用的是tfidf,做到这里我不知道怎么做了,哪位大神指导一下,小女子谢过了。[em10]
这是一条镜像帖。来源:北邮人论坛 / ml-dm / #15010同步于 2014/12/30
该镜像源已超过 30 天没有更新,可能在源站已被删除。
ML_DM机器人发帖
哪个大神帮我解决个问题(川大的孩子大老远跑到你们这不容易啊
aini1990217
2014/12/30镜像同步23 回复
订阅后,新回复会通过你的通知中心匿名送达。
9 条回复
“做到这里”。。。值已经用tfidf求得了吗,那数据预处理部分就做好了啊。
分一半做训练数据,另一半做测试数据,先用libsvm里面的工具参数寻优,在用得到的参数训练模型。得到的模型就可以拿来分类了。
还是一年前上课学的,大概是这个过程?不对楼下指正啊。。。
ps:你这ip地址貌似真是男生宿舍的
你既然知道用tfidf,那就把对应的词用tfidf转换成数字不就行了?
【 在 aini1990217 的大作中提到: 】
我是做关系抽取的,最近在用libsvm做分类,在数据方...
【 在 xumyselfcn 的大作中提到: 】
: “做到这里”。。。值已经用tfidf求得了吗,那数据预处理部分就做好了啊。
: 分一半做训练数据,另一半做测试数据,先用libsvm里面的工具参数寻优,在用得到的参数训练模型。得到的模型就可以拿来分类了。
: 还是一年前上课学的,大概是这个过程?不对楼下指正啊。。。
: ...................
从ip都能看得出来?不过确实是川大的妹纸。我现在有一点不懂得的是一般文本分类里面,就是某一个词出现的次数处于文档所有词的次数,但是针对于我这样的数据,并不是一篇文档我这个所有词的次数是多少呢?比如说对于第一个数据1 好转 大 医学 医生 效果 动词 ,第一种特征权值是不是好转出现一次除总次数6,是这样的吗?
【 在 moonfighting 的大作中提到: 】
: 你既然知道用tfidf,那就把对应的词用tfidf转换成数字不就行了?
: 我是做关系抽取的,最近在用libsvm做分类,在数据方...
这个我还是知道的,但是我不知道这个总词数是多少?是怎么做的?文本分类时,总词数是将近于一篇文档的总词的个数,但是对于我这样的是怎么算呢?