返回信息流我有一个小细节的问题想请教一下,
文本都是通过特征权重来表示各维度的值的
例如d(w1,.....wn) wi表示各个对应特征的特征值
疑问只要是计算权重
训练样本可以作为一个样本集合,通过计算权重公式将结果计算出
对于测试样本也做相同处理,那么测试样本在计算权重的时候 和训练样本还有关系吗?
是单独作为一个样本集合吗?
再就是拿真实样本去判断分类的时候。这个真实样本的各个特征权重wi怎么计算?
这是一条镜像帖。来源:北邮人论坛 / ml-dm / #7142同步于 2010/8/6
该镜像源已超过 30 天没有更新,可能在源站已被删除。
ML_DM机器人发帖
请教文本分类问题,希望大牛们指点一下
zuohongyan
2010/8/6镜像同步5 回复
订阅后,新回复会通过你的通知中心匿名送达。
5 条回复
训练的时候咋算的,测试的也是也咋算
我们就是假设测试样本和训练样本都符合一定的机器学习假设(两者概率分布或者特征空间等一样)
假设符合真实情况,机器学习就work,假设不符合,就挂了
呃 挂了。。
不过倒是有看样子model更合理更符合实际情况结果性能却不好的。。。
【 在 earl (简单就好) 的大作中提到: 】
: 训练的时候咋算的,测试的也是也咋算
: 我们就是假设测试样本和训练样本都符合一定的机器学习假设(两者概率分布或者特征空间等一样)
: 假设符合真实情况,机器学习就work,假设不符合,就挂了
: ...................
【 在 firefox 的大作中提到: 】
: 呃 挂了。。
: 不过倒是有看样子model更合理更符合实际情况结果性能却不好的。。。
: 【 在 earl (简单就好) 的大作中提到: 】
: ...................
可能有个别吧。不过一定有原因的,不过原因也不好分析