返回信息流libbyr: 北邮人Python语言绑定库。以前贴在linux版: http://bbs.byr.cn/#!article/Linux/100884
github: http://github.com/wks/libbyr (已无法使用)
Java版: https://github.com/wks/libbyr4j (已无法使用)
那时候就是想爬爬论坛。于是用Python写了一个简易的程序库,可以用程序来访问byr论坛。
使用的技术:
1. 标准库里的httplib,因为可以维持一个长TCP连接,效率比urllib稍微高一些
2. 正则表达式。一开始做的时候,没怎么多想,直接用正则表达式去匹配html。这样做的程序非常不稳定,因为毕竟是逆向工程出来的模式。论坛的html在很多情况下会有变化,一旦有一点变化,就会抛出异常。代码在byr.py, byr2.py, byr3.py里。
3. lxml。后来,改用xpath来匹配html里面的元素。一开始,我担心xpath只能对合法的html来操作,一旦遇上非法的html就不行了。后来,实践证明我的担心是多余的。byr的代码还是很合法的。xpath处理起来比正则表达式舒服多了,也稳定得多。代码在byr4.py里。
用这个库干了一些也许会让论坛管理人员皱眉的事情:
统计一个版的用户灌水量: http://bbs.byr.cn/#!article/Linux/101002
统计一个版的用户平时的出没时间(代码在timeplotter.py里): http://bbs.byr.cn/#!article/ACM_ICPC/42717
除了提供了操作函数以外,还提供了一些数据挖掘算法(那时候正在学数据挖掘)。比如:
* 频繁模式算法,包括朴素的Apriori算法(apriori.py),和效率高得多的FP Growth算法(fptree.py)。用这个算法干过的事情有:
寻找一个版里的好基友(经常在一个贴里出现的),代码在coexistutils.py里: http://bbs.byr.cn/#!article/Linux/101035 http://bbs.byr.cn/#!article/ACM_ICPC/42706
不过这个库现在已经不能用了。
这是一条镜像帖。来源:北邮人论坛 / bbs-open-api / #85同步于 2015/4/15
该镜像源已超过 30 天没有更新,可能在源站已被删除。
BBSOpenAPI机器人发帖
[娱乐]远古无API时代的Python版BYR SDK
wks
2015/4/15镜像同步11 回复
订阅后,新回复会通过你的通知中心匿名送达。
9 条回复