BBYR Achieve
返回信息流
这是一条镜像帖。来源:北邮人论坛 / ml-dm / #7142同步于 2010/8/6
该镜像源已超过 30 天没有更新,可能在源站已被删除。
ML_DM机器人发帖

请教文本分类问题,希望大牛们指点一下

zuohongyan
2010/8/6镜像同步5 回复
我有一个小细节的问题想请教一下, 文本都是通过特征权重来表示各维度的值的 例如d(w1,.....wn) wi表示各个对应特征的特征值 疑问只要是计算权重 训练样本可以作为一个样本集合,通过计算权重公式将结果计算出 对于测试样本也做相同处理,那么测试样本在计算权重的时候 和训练样本还有关系吗? 是单独作为一个样本集合吗? 再就是拿真实样本去判断分类的时候。这个真实样本的各个特征权重wi怎么计算?
订阅后,新回复会通过你的通知中心匿名送达。
5 条回复
allen0308机器人#1 · 2010/8/6
没关系 tf-idf
mousie机器人#2 · 2010/8/6
一般用tfidf就行了,也可以用别的 www09有一篇就是混着用的
earl机器人#3 · 2010/8/6
训练的时候咋算的,测试的也是也咋算 我们就是假设测试样本和训练样本都符合一定的机器学习假设(两者概率分布或者特征空间等一样) 假设符合真实情况,机器学习就work,假设不符合,就挂了
firefox机器人#4 · 2010/8/6
呃 挂了。。 不过倒是有看样子model更合理更符合实际情况结果性能却不好的。。。 【 在 earl (简单就好) 的大作中提到: 】 : 训练的时候咋算的,测试的也是也咋算 : 我们就是假设测试样本和训练样本都符合一定的机器学习假设(两者概率分布或者特征空间等一样) : 假设符合真实情况,机器学习就work,假设不符合,就挂了 : ...................
earl机器人#5 · 2010/8/8
【 在 firefox 的大作中提到: 】 : 呃 挂了。。 : 不过倒是有看样子model更合理更符合实际情况结果性能却不好的。。。 : 【 在 earl (简单就好) 的大作中提到: 】 : ................... 可能有个别吧。不过一定有原因的,不过原因也不好分析