返回信息流我实在是看java看不进去啊。然后想想有人说过python要学到自己写一个爬虫才能算是学会了,果不其然我之前是不会python的。为了有可能学会python,搜了一下python,偶遇百度竟然有一个什么学堂,教写爬虫的,也就20分钟左右的视频吧。然后就在一个沉闷的午后,周围的人们正在沉浸与今晚要加班的痛苦中,我也由于睡眠不足而有些精神失常的情况下,看起了视频。。。谁知。。竟然这么简单。。
代码如下:
import urllib2
import urllib
import sys
class get_mm_pic(object):
def __init__(self,page_num):
self.page_num = page_num
self.mmurl= "http://mm.taobao.com/json/request_top_list.htm?type=0&page="
def get_pic(self):
i = 1
page_num = self.page_num
temp ='''<img src="'''
while i<page_num:
url = self.mmurl + str(i)
up = urllib2.urlopen(url)
cont = up.read()
pa = j = 0
while True:
ahref = '''<a href="http'''
target = "target"
pa = cont.find(ahref)
pt = cont.find(target, pa)
if pa == -1:
break
modelurl = cont[pa+len(ahref)-4: pt-2]
mup= urllib2.urlopen(modelurl)
mcont = mup.read()
header = "<img style"
tail = ".jpg"
iph = k = 0
while True:
iph = mcont.find(header)
ipj = mcont.find(tail, iph)
if iph == -1:
break
mpic = mcont[iph : ipj + len(tail)]
ips = mpic.find("src")
urlpic = mpic[ips +len("src ="):]
try:
print ">>>downloading : lady_p"+str(i)+"_no_"+str(j)+"_pic_"+str(k)+".jpg......"
urllib.urlretrieve(urlpic, "lady_p"+str(i)+"_no_"+str(j)+"_pic_"+str(k)+".jpg")
except KeyboardInterrupt:
print "SIGINT, exit..."
sys.exit(0)
except:
pass
mcont = mcont[ipj+1:]
k+=1
cont = cont[pt+1:]
j+=1
i += 1
print ">>>download completed"
def main(page_num):
get_mm_pictures = get_mm_pic(page_num)
print "@Author:www.muzixing.com"
get_mm_pictures.get_pic()
if __name__ == '__main__':
main(int(sys.argv[1]))
哎呀,一天郁闷的心情都因为写成功这个简单的东西而高兴啊。虽然别人看起来可能简单到不行啊,但是,成功的快感还是大大的啊!!哇哈哈![upload=1][/upload]
这是一条镜像帖。来源:北邮人论坛 / python / #1859同步于 2014/7/24
该镜像源已超过 30 天没有更新,可能在源站已被删除。
Python机器人发帖
【spider】我要看美女!淘女郎图集!
lc10210103
2014/7/24镜像同步155 回复
订阅后,新回复会通过你的通知中心匿名送达。
9 条回复
巨快!其实我不是很懂其他的什么,这个也是看视频做的,但是真的好简单啊!非常开心!!嘿嘿嘿!半小时内绝对成功啦!
【 在 reverland 的大作中提到: 】
: 哈哈,腻害,连re都没用!
: 分分钟出爬虫的节奏啊