Python
学术科技 · 当前来自首页固化板块目录。
有人用过portia爬虫吗?求问怎么安装,我安装了好久都没有成功,求指点。 通过『我邮2.0』发布
主要代码如下: # -*- coding:utf-8 -*- import urllib.parse import urllib.request url = 'http://www.zhihu.com/' headers={ 这里面是我知乎账号的cookie } response=urllib.request.Requ…
还有个问题是:(基本信息:服务器逻辑核24个,进程池10,爬的网站大概10位数) 用multiprocessing去爬网站,总是会过一段时间,大概1k就停下来或者速度变得很慢。在run中能打印出每个进程的信息, 1:能排除多进程写的不对的错误吗? 2:这种速度慢下来是哪方面原因啊?应该怎么优化? 3:多进程怎么写文件L…
如图所示,怎么写正则表达式可以匹配出日期字段啊 ,比如 <li tag="show_26" style="display:none;"><a href="/Price/List?marketID=270&year=2011&month=9&day=23" target="_blank"><span>[2011-9-23…
lz这两天在折腾ubuntu下pyopencl的安装,参考的是这个帖子: https://wiki.tiker.net/PyOpenCL/Installation/Linux/Ubuntu。 再折腾到step 3的时候,总是报错[ema1],编译不通过,好心塞啊![ema16] 错误截屏如下图: 求安装过或者了解的大神…
import re a = "aaaba" b = "abababab" print(re.findall(r'(?=(aba))', b)) print(re.findall(r'aa(?=aba)', a)) print(re.findall(r'aa(?=(aba))', a)) 输出: ['aba', 'aba…
## 0.0.5 版本 修复了windows版本运行时显示console的bug,[下载链接](https://github.com/ingbyr/GUI-YouGet/releases) ## 0.0.3版本: 新增选择不同画质下载功能,[下载链接](https://github.com/ingbyr/GUI-You…
最近做NLP作业,提取词袋,我已经用了isalpha()方法把包含非英文字母的词全部去掉了,但是里面还是有很多非词明显不是英文单词(如:aaaaaaaaa、zzzzzzzzzzzl这种) 我想问一下python中怎么判断这个单词是不是英文单词(也就是英文词典中的单词),有没有什么好用的库吗?
情景: 请教@nuanyangyang 暖神一个问题,然后等待回复的时候不停的刷新论坛,如果他在另一个半球的话我是不是得刷新一天了[ema0] 所以能不能有一个chrome插件啊 这样子就能畅快的聊私信了 所以有人也有同样的痛点么
Django多容易啊,一个人学足矣了。楼主先确保自己用的是Python3吧,然后玩过PythonChallenge。
尝试爬去豆瓣网上的电影评论,用beautifulsoup解析以下网页,出现问题 <a class="" href="https://movie.douban.com/review/7873268/" onclick="moreurl(this, {from: ''})" title="说说不二情书中的古诗句词的引用">…
不支持为啥不报错呢? 用的python 2.7.5
用python进行原生socket编程,socket类型socket.SOCK-RAW,协议socket.IPPROTO-RAW ,在client端自定义数据包,然后发送。问题是在server端如何接收这个包?
爬虫需要处理一些资讯,但是资讯里含有图片,部分资讯的图片含有下标题,下标题有的用p标签标注,有的是i标签标注,如这篇资讯http://robot.ofweek.com/2016-02/ART-8321203-8500-29063993_3.html 求问如何将资讯正文(对应字段content)与这个图片标题(对应字段i…