ML_DM
学术科技 · 当前来自首页固化板块目录。
现在实习有个任务将英文论文中的文章拆分成句子,请问有什么比较好的方案吗? 现在想的方法是简单的通过"." "?" 等标点分割。但是有些切分很乱想问下有什么好办法能切分准确一些? 谢谢大家
管院IT小白一枚,现在导师有一个题目需要用到微博数据,需要采集的数据是某个/某批博主所发布的微博及各条微博所获得的评论、转发和赞。除此之外,还需要这些评论和转发所获得的评论和赞。其中,评论既要有数量,还要有内容。 一头雾水啊??不知道从何下手,比如:用什么软件?有没有符合以上要求的现成的代码?跪求高人出手相助!
最近有个模型需要验证数据,以前caffe比较熟悉,新工程调得tensorflow接口,不知道如何获取每一层操作的输入和输出数据。有了解的帮忙说下,感激不尽啦! 发自「贵邮」
最近有个大数据词频统计的作业,零基础小白看了一堆网页还是感觉没有思路,真心求助! 我目前已经把数据预处理的工作做完了,整理出一个txt文档,内容如下: 123,234,159, 234, 146,159,159, ……………… 就是只有数字和逗号,只不过有两百万行,想统计出每个数字出现的次数,比如159出现3次,123…
毕设可能会用到,之前用过Ikanalyzer, 还有什么好用的工具没?还有求推荐中文词典
在虚拟机中装的linux系统,并将hadoop装在了上边,用linux命令时一切正常,但是用win7上的eclipse就是连不上,在win7 的cmd中ping一下hadoop中的nat网址,也是正常的。求大神指教。
做分类完全半路出家,就会调个包。 现在小论文很捉急,自己找了俩月都没啥思路。 所以求问各位大神,libsvm结合adaboosting的时候,样本权重体现在哪啊。 现在能找到libsvm在训练过程中加权重的包,但是测试的时候就不能用了啊。 但是adaboosting收集的都是测试结果的权重吧。这样就没法进行下一轮迭代了…
最近准备去玩kaggle了,不知道现在有没有打kaggle的同学或者群什么的好交流啊
题目: 单次1000元以上急求NLP大神指导 内容: 本人单次1000元以上急求熟悉NLP的优秀硕士、博士或已工作人员指导,如果效果好,价钱您定~绝对真诚! 方向是以question-answering为目的的query-rewrite(paraphrase),大致有三个办法:paraphrase rule,语意语法,…
貌似大规模数据的线性SVM更喜欢随机梯度下降来求解(看到很多这么求解的,包括spark的MLlib),那么线性不可分SVM也可以用随机梯度下降么? 这个时候核函数怎么融入进去?怎么用? 不知道我这么表述清不清楚,相关的论文我也没怎么搜到。 还请大神赐教! p.s. 现在是想用spark实现SVM
如果你有激情加入创业公司,同时又对投资与创业感兴趣,来吧,股权+money都有,薪水7k左右,毕竟创业公司嘛
不太理解这一点 是可以有交叠,还是完全不一样? 求大神指点
于是北邮大多数搞数据挖掘的老板是以下三种类型: 1. 不会数据挖掘,搞数据挖掘的 2.不会数据挖掘,喜欢瞎指导,不关心模型和效果只关心工程,搞数据挖掘的 3.不会数据挖掘,喜欢瞎指导,不关心模型和效果只关心工程,还特么没数据,搞数据挖掘的 没错,上次说类型2是辣鸡,上了10大,然后删帖的是我。这回我又忍不住来吐槽了,欢…
如题,因项目需要,求次课程PPT。哪位小伙伴有的话可以私信我,万分感谢
第一次昨天池,然后现在碰到了这种情况。。。。。。。测试集上效果好的模型,提交后的结果不一定好。。。。。交叉验证的结果来看,train和test的rmse都在降,所以感觉基本没有过拟合的可能性。。。。现在感觉心好累调好了参数也没用,交上去的结果还是那么差。。。。。。有人有过这种情况么。。。