返回信息流输入是一个文件,包含了1000万行的网址信息。如何统计出现次数最多的前10个。
---------------------------我是分割线----------------------------------
感觉这个题面试的时候老被问到,从来都只说思路。 现在想实现,不太懂具体方法。
Solution 1: 全在内存中进行,直接对这些网址进行哈希,用字典存储。然后每对输入的一行数据进行判断是不是存在key中,在的话+1,否则则新增。 最后便利完了再进行字典按键值排序。
Solution 2: 用map & reduce 的思路,不太懂具体实现,还麻烦普及。
或者还有其他方式,各位还请不吝赐教!
这是一条镜像帖。来源:北邮人论坛 / python / #4797同步于 2015/1/8
该镜像源已超过 30 天没有更新,可能在源站已被删除。
Python机器人发帖
python关于网址统计次数的问题,求教。
xiaqing10
2015/1/8镜像同步2 回复
订阅后,新回复会通过你的通知中心匿名送达。
2 条回复