ML_DM
学术科技 · 当前来自首页固化板块目录。
有没有玄学的调参的技巧能让我的loss下去的= =,什么样的都行,在这谢过大佬们了
答复的人太多了,就删掉了,之前有答复我的,如果被我落下了,可以私信我~[ema3]
问题: 有上百万条短文本序列[由一个词一个词组成的,说序列是因为词和词之间是有一定的前后关系的,但是这些词中有些词是无用的信息,会影响序列前后关系,就是噪声],有些词会出现同义词,一条序列词的个数大概在10~30之间,如何更好的聚类,效果好且聚的类少【我是先随机采样了2000条数据分析的,总共有两百多万条文本在数据库中…
如题 目前做的都是一些很水的事情,聚类,跑跑CRF什么的[还是自己争取的],都是些杂活,现在连深度学习都没用到 实习公司也不好,就是因为离学校近,想换了 马上秋招了,感觉简历上都没什么可讲的
请问各位同学,斯坦福大学cs224d课程视频在哪看呀? 找不到,最好带字幕 求助!谢谢!
假设我有5000万道路目标检测的数据集,如果使用5000万数据训练的模型和用2000万数据训练的同一模型,精度没有进一步提升,那么是不是说,2000万数据集就超过了该特定任务下此模型的数据集需求上限? 如何定义是否达到数据集需求的上限,以及进一步采集数据的策略?
有意的可以站内,互相学习
[face=宋体]2018北京地区 高校校园大数据竞赛 报名网站: https://bigdata.bupt.edu.cn 智慧校园吹响集结号!虚位以待,等你来战! 校园数据那么多, 创新应用怎么做, 三校联办搭平台, 数据竞赛等你来! 开采属于我们自己的富矿,更能赢得丰厚的奖品! 接下来为大家一一介绍本次比赛有关事项…
这里不方便贴东西,加我qq吧 跪谢 QQ[em5]3106199727
百度面试题:现有10亿数量级别的文档,要求从中建立出一套词表,无现成分词工具,请说出能想到的最佳解决方案,无论是效果上或者性能上。
想请教各位大大: 看了skip-gram的tensorflow实现,label都只是一个单词。 label不应该是输入单词的上下文么?这样子label只有一个为1,拆开来训练不会出问题么?
有在做神经网络剪枝的大佬吗。。 我用tf.assign函数把卷积核参数张量替换成剪枝后的参数张量,但是assign函数只改变张量的具体值,不改变张量的shape属性。这会导致保存ckpt文件,下次加载回来的时候参数形状对不上。 举个例子,本来卷积核参数形状是[3,3,3,64],剪枝后是[3,3,3,45],虽然张量里…
实验室最近在做文字识别相关的应用(并非专门做CV的实验室),训练数据一部分是真实场景下手工标注的,一部分是用了公开的数据集,还有就是人工生成的了。 老师想要我论证下这种人工生成的数据集是可以用的,这三类数据集哪种训练出来的效果最好 还有想问下需要使用GAN来生成文字数据吗,感觉选好背景,字体,文字,噪声简单合成下就行了…
看的是李航《统计学习方法》里边的剪枝,里边提到改变alpha,生成一个子树序列{T0, T1, ···, Tn},然后比较这些子树在验证集中的表现,选择最优子树作为剪枝结果。 我的问题是,为什么要如此费劲的生成子树序列呢? 直接从树的叶子节点开始往上判断,如果一组叶子节点回缩后在验证集上的表现更好,就回缩;否则不做处理…