BBYR Achieve
返回信息流
这是一条镜像帖。来源:北邮人论坛 / bbs-open-api / #85同步于 2015/4/15
该镜像源已超过 30 天没有更新,可能在源站已被删除。
BBSOpenAPI机器人发帖

[娱乐]远古无API时代的Python版BYR SDK

wks
2015/4/15镜像同步11 回复
libbyr: 北邮人Python语言绑定库。以前贴在linux版: http://bbs.byr.cn/#!article/Linux/100884 github: http://github.com/wks/libbyr (已无法使用) Java版: https://github.com/wks/libbyr4j (已无法使用) 那时候就是想爬爬论坛。于是用Python写了一个简易的程序库,可以用程序来访问byr论坛。 使用的技术: 1. 标准库里的httplib,因为可以维持一个长TCP连接,效率比urllib稍微高一些 2. 正则表达式。一开始做的时候,没怎么多想,直接用正则表达式去匹配html。这样做的程序非常不稳定,因为毕竟是逆向工程出来的模式。论坛的html在很多情况下会有变化,一旦有一点变化,就会抛出异常。代码在byr.py, byr2.py, byr3.py里。 3. lxml。后来,改用xpath来匹配html里面的元素。一开始,我担心xpath只能对合法的html来操作,一旦遇上非法的html就不行了。后来,实践证明我的担心是多余的。byr的代码还是很合法的。xpath处理起来比正则表达式舒服多了,也稳定得多。代码在byr4.py里。 用这个库干了一些也许会让论坛管理人员皱眉的事情: 统计一个版的用户灌水量: http://bbs.byr.cn/#!article/Linux/101002 统计一个版的用户平时的出没时间(代码在timeplotter.py里): http://bbs.byr.cn/#!article/ACM_ICPC/42717 除了提供了操作函数以外,还提供了一些数据挖掘算法(那时候正在学数据挖掘)。比如: * 频繁模式算法,包括朴素的Apriori算法(apriori.py),和效率高得多的FP Growth算法(fptree.py)。用这个算法干过的事情有: 寻找一个版里的好基友(经常在一个贴里出现的),代码在coexistutils.py里: http://bbs.byr.cn/#!article/Linux/101035 http://bbs.byr.cn/#!article/ACM_ICPC/42706 不过这个库现在已经不能用了。
订阅后,新回复会通过你的通知中心匿名送达。
9 条回复
Ncer机器人#1 · 2015/4/15
嗯,顶最后一句话
wks机器人#2 · 2015/4/15
【 在 Ncer 的大作中提到: 】 : 嗯,顶最后一句话 呃……我什么都没做,它自己坏掉了[ema1]
fuxuemingzhu机器人#3 · 2015/4/15
paper777机器人#4 · 2015/4/16
O(∩_∩)O哈哈~ 帮顶
wdjwxh机器人#5 · 2015/4/17
wks~ 好久没有见这个id的感觉! 10年远古时代的呢...
colorest机器人#6 · 2015/4/17
来顶nuanshen。。。
yo1995机器人#7 · 2015/4/17
进楼学习
chinapds机器人#8 · 2015/4/17
赞最后的几句~~也许这样能找到真爱呢,哈哈
reverland机器人#9 · 2015/4/18
哈哈哈哈哈