Python
学术科技 · 当前来自首页固化板块目录。
想用python写一个爬虫,能把东西爬下来保存为pdf文件到本地,比如像知网,百度学术这种网站的论文。有什么推荐的框架吗?
最近在看scrapy,发现都是只能抓取固定格式的某一个网页。如何能自动抓取多域名的网页。即使同一个域名的网页,有时候格式变化了,爬虫分析那块岂不是还得需要重写?这些问题各位都是怎么解决的?谢谢!
soup.find_all()出来的结果需要用正则表达式2次处理, re.findall()调用不了soup.find_all()的结果啊,看了一下soup.find_all()返回的类型是bs4.element.ResultSet,怎么能变换成re.findall()可以调用的类型啊
本意是学习下Python的GUI编程,顺便写一个BYRBT的GUI Toolkit。目前只做了一个登陆的功能,其他诸如刷感谢骗魔力值、PTliar之类的以后有时间慢慢加吧。 程序依赖requests、beautifulsoup4和Pillow这三个非标准库,需要自己安装一下。 目前只支持Python3,因为有些编码的问…
RT 通过『我邮2.0』发布
本人以前只有C语言基础,最近看完了Python基本的语法部分,想求教大神们指点如何继续深入学习,还有,什么开发环境比较适合上手?PyCharm怎么样?Eclipse+pydev? 发自〖iBYR-iOS客户端〗
正则表达式好恶心啊,有时候半天也找不到规律,求大牛推荐点好办法。
我先有一个txt文件,我想注册到hdfs中 可是因为权限问题,不能直接操作hadoop 命令 现在在想如何通过python将txt文件注册到 hdfs中 请问各位大神,改如何进行操作
小白一枚,求不鄙视。。python如何获取字符串的unicode编码,比如输入‘中国’,返回'4e2d56fd', 输入'aa',返回'6161',要求返回值类型是字符串,而不是unicode对象,求问~[ema9]
scrapy 的请求队列在哪里? 能得到这个请求队列吗?
某些文件夹内文件又多又乱,图片,pdf,rar等。例如下载文件夹。 现在希望整理下,整理方式为将同样类型的文件保存到以类型字符串为名字的文件夹下。 简单地,编写程序(见附件)以实现上述功能。 用法: 改下path=u"D:\\我的文档" ,再运行即可,需要安装python哈。 整理完之后真是心旷神怡! 附件(625B)…
lintcode上刷triangle这道题,简单的动态规划。建状态数组,我是这样建的。 给一个测试样例 triangle = [[-1],[2,3],[1,-1,-3]],state现在是这样的 初始化状态数组 state[0][0] = triangle[0][0], 预期是只让state的第一个值为-1,然而结果却…
想在tornado端实现定时运行某个handle,可有实现方案? 谢谢。
import random domain=[(0,9)]*12 step=1 def mutate(vec): i=random.randint(0,len(domain)-1) print i a=random.random() print a if a<0.5 and vec[i]>domain[i][0]: pr…
知乎上看来的图 http://www.zhihu.com/question/25627959