ML_DM
学术科技 · 当前来自首页固化板块目录。
LZ在做文本聚类,用的是VSM模型。我想请问下如何区别关键词有很多相同或者相似但语义不同的文本。例如"小李是警察"和"小李是警察的儿子"。随便举的例子,像这种情况,基于向量相似度的方法可能很容易聚为一类。不知道这种问题怎么解决?
在做基于cnn的人脸识别课题.老师说在人家的算法上优化,然而人家论文都复现不了,怎么优化啊? 有没有哪位大神给点帮助呢 跪谢~
神经计算2016 (Introduction to Machine Learning and Data Science) 即将重装开讲! 地点: 教三117 时间:从3月1日开始 每周二上午3-4节 10:10 - 12:00 课程内容安排若干个专题: 专题 0: 学习问题发展简史 专题 1: 基于实例的学习 (NN …
前段时间做大作业,感觉自己对这个领域一些前沿的东西不是很了解,word2vec,glove,batch normolization什么的感觉以前都完全没有听过。。。。。。想看论文也不知道看那些论文比较好求推荐一些好的ml的博客[ema23][ema23]
题主在欧洲读研,这学期在上data mining这门课(虽然本科在经管院也上过这门课。。。)最近做小组项目,教授给了一些有趣的找datasets的网站,分享给大家,有一些挑战赛可以去玩玩儿,哈哈哈哈哈。 The Data Hub o http://thedatahub.org/ o Large European dat…
彻头彻尾的新手,用的编程环境是 IntelliJ IDEA。 要用Scala实现一个机器学习的算法。 想问问这两个开发包是怎么回事? /app/hadoop/spark100/lib/spark-assembly-1.0.0-hadoop2.2.0.jar /app/scala2104/lib/scala-librar…
面试时被问到一个聚类优化问题,说现在新来了100W条数据,已经有了100个类,如果一条一条的聚类,需要1亿次比较,面试官说他认为这样很浪费,有什么方法优化,不用比较1亿次,并且已经假设这100个类很稳定,中心向量不会变。 大数据的处理接触不多啊,注意不是说时间,而是说比较次数,所以并行化什么的貌似不在点上,求各位大神提…
自己问的这个问题的问法好不专业。。。 问题是这样的现在有几万个文本,其中一个文本内容是: Household income is the combined gross income of all the members of a household who are 15 years old and older. Ind…
【实习】百度spider团队 实习生招聘 团队简介: spider团队属于百度互联网数据研发部,其为大搜索相关团队提供最全面的互联网数据与最精准的互联网数据挖掘方法, 其下包括页面分析、链接发现、链接调度、覆盖率等技术topic。 现招聘研发实习生,实习职位要求如下: 一、必须技能: 1.熟练掌握C/C++编程语言。 …
楼主近期才开始学习Scala的,现在用它写了一个机器学习的算法(DBSCAN),我用Point类表示数据点,RDD[Point]存储数据,但是当我在之后修改RDD[point]的point的属性值的时候发现怎么都修改不了??这是怎么一回事呢?求大神指教 修改的时候用dataSet.foreach(func)通过func…
我也不知道我的这个问题应该定义为什么问题.. 我想要实现的是一个Hadoop下的爬虫,现在有两个任务模块:网页下载模块和网页解析模块。网页下载模块需要从URL池中获取没有下载过的URL并对其下载储存,网页解析模块是对已下载的网页进行解析,得到需要的数据以及新的URL,对新的URL进行去重处理后放入URL池中。 现在我纠…
在网上找了mahout in action. mahout实践指南 mahout算法解析与案例实战这三本书的pdf,奈何都找不到。 想有偿求版内大神可以发一份pdf版本!!! 求私信!!
我们最近想高薪挖几位有经验些的做机器学习的同学,可是有没有猎头预算,所以想问问大家,一般有什么论坛或者网站可以有针对性的发布一些招聘信息吗? 好像这方面的人确实比较缺,所以真的做好了高薪挖人的准备,可是就是不知道去哪挖。。
TensorFlow出品:http://playground.tensorflow.org 看着每一个节点的权重和分类效果的变化,我感觉我突然明白了神经网络内部到底怎么回事。
语音库选的是TIMIT,用网上一个代码提取了每个frame(大概10多毫秒)的24维的MFCC参数,目前只取了4个人共6000组MFCC做训练和测试(每个人1500组),想对这些数据按说话人简单分4类,自己搭了一个24-12-4的神经网络用来训练这个数据集,结果分类正确率才不到60%。。 这两天做了ufldl上的稀疏自…