返回信息流大三的……期末了……要交作业……没人做的出来不知老师怎么想的
求助啊!
这是一条镜像帖。来源:北邮人论坛 / ml-dm / #3875同步于 2008/12/17
该镜像源已超过 30 天没有更新,可能在源站已被删除。
ML_DM机器人发帖
请问各位师兄师姐……有做过文本分类的么?
cinderellahi
2008/12/17镜像同步15 回复
订阅后,新回复会通过你的通知中心匿名送达。
9 条回复
什么专业,什么课啊,哪个变态老师大三布置这种作业啊....
【 在 cinderellahi 的大作中提到: 】
: 大三的……期末了……要交作业……没人做的出来不知老师怎么想的
: 求助啊!
智能科学与技术专业
《机器智能》 必修
做文本分类系统,给定训练集测试集,要求分类并且计算准确率召回率f1值
全班只有一个人做了还没做出来……
跟老师协商老师说:“没想到你们程序设计这样……不行就用伪代码写吧!”
伪代码也不会呀……老师什么都没讲……苍天啊!
有没有做过的师兄师姐给个提点呀!
【 在 hunterlee 的大作中提到: 】
: 什么专业,什么课啊,哪个变态老师大三布置这种作业啊....
[em9]
算法简单,但我觉着算法背后的那些东西对于大三的学生来说还是太难了。
我出个馊主意吧:
如果你们要分类的语料不是太难的话,直接找一些关键字,如果文章包含关键字就归为a类,不包含就归为b类。
例如如果文章包含NBA,贝克汉姆等等,就把它识别成体育类。
【 在 czpt 的大作中提到: 】
: 借本《机器学习》吧,朴素贝叶斯分类那一张有详细的贝叶斯分类器的算法描述,照着算法实现就行了。很容易,写完分类也就明白了。
要交代码的呀……这还是自动文本分类么?
【 在 hunterlee 的大作中提到: 】
: 算法简单,但我觉着算法背后的那些东西对于大三的学生来说还是太难了。
: 我出个馊主意吧:
: 如果你们要分类的语料不是太难的话,直接找一些关键字,如果文章包含关键字就归为a类,不包含就归为b类。
: ...................
是啊,只不过是基于规则而不是基于统计而已。其实统计方法的核心思想也就是这样。
这个关键词呢,你可以是凭感觉自己给,如果你还想做复杂一些,也可以算出来。
比如一个词c,在所有的N篇A类文章中有n篇文章包含了词c,而在所有的M篇B类文章中有m篇文章包含了词c。那么你可以计算一个差值|n/N - m/M|,这个值越大,用这个关键词分类越管用。而且,如果值 n/N - m/M是正值,那么认为这个词c是类别A的关键词,否则就是类别B的关键词(这个好理解吧)。
你可以计算所有的词,然后挑选出前K个值最大的关键词。
然后呢,对于测试集中的一篇文章,首先你要找到它包含了多少个关键词。假设它包含了l个关键词,l个关键词中,如果是A类的关键词就+1,如果是B类关键词就-1,最后加加减减能得到一个值就是你的评价标准咯。
【 在 cinderellahi 的大作中提到: 】
: 要交代码的呀……这还是自动文本分类么?