Python
学术科技 · 当前来自首页固化板块目录。
replace函数利用正则替换字符串怎么不起作用呢?难道该函数不支持正则啊
rt,然后爬过来的数据想传到android手机上,求师兄师姐推荐老师。描述可能不是很清楚,请大家多多包涵小白。编程不能说是太好,但是挺感兴趣的,正在努力修炼。先提前谢过了
老师布置任务让写一个新浪微博的爬虫,目前只完成了模拟登录部分,可是登录完却怎么也写不了了啊,之前用过正则觉得爬取的内容不是很干净,于是想用XPATH的方式,但是怎么也找不到正确的XML,能read得到微博个人页面的html,然后就不知道该怎么办了,怎么办都不对。求各位大神看看能怎么解决!谢谢谢谢!! auto_logi…
在配置的时候,我绑定ip是可以访问的 但是如果我绑定域名的话,就不行 而我域名和ip是绑定的。。。不知道为啥 请问是我哪里配置错了吗?还是别的原因
python2.7,pycharm下运行所有的py文件都是Process finished with exit code 0,而且什么结果都没有。。。。百度也没百度出来。。麻烦大家了!
rt 通过『我邮2.0』发布
rt 通过『我邮2.0』发布
1、python2 不能多核,优势?记得之前模拟ab命令进行压力测试的时候就是用了多线程模拟多个用户发送请求,不知道算不算优势,还有一般抓数据都要多线程,并行io请求? 2、threading?没用过thread 3、没用过多进程,不过一般都用协程,多进程还不是很了解。听说协程+多进程很爽。lz可以复习下操作系统相关知…
from lxml.html.soupparser import fromstring import urllib2 response = urllib2.urlopen('http://www.haojiazhang123.com') html = response.read() root = fromstring(…
RT,如果用requests.get()打开水木社区的某个版面,会出现 “<!DOCTYPE html><html><head><meta charset="GBK"><meta name="keywords" content="水木,清华,社区,论坛,BBS,smth" /><meta name="descripti…
1.登录问题 登录需要验证码太麻烦,直接从Chrome里抄cookie 2.URL 最好按照上传数排序,去除死种;免得领导到时候要下载确没有源 URL = 'http://bt.byr.cn/torrents.php?cat408=1&incldead=1&spstate=0&inclbookmarked=0&sear…
搜半天找不到问题 from urllib import request from lxml import etree import asyncio @asyncio.coroutine def crawl(url): req = request.Request(url) req.add_header('User-Age…
逛python版,发现很多问题是关于爬虫的,没有同学用django,flask什么的吗?难道python就真的只是个玩具???
之前自己用python,scrapy框架参考网上的资料(http://blog.csdn.net/monsion/article/details/7981366, http://www.cnblogs.com/mouse-coder/archive/2013/03/03/2941265.html)写了个微博爬虫。一直用…
一个item存一个类别,另一个item存类别对应的数据 在线等,急~~~ 来自「北邮人论坛手机版」