返回信息流最近老师安排做一个爬虫要求根据url爬取渲染好的页面,包括里面的css,js,图片,动画等等,页面上有的都要爬,请问有什么好的方法吗?
我尝试用jsoup+chromeheadless对渲染后的网页进行了爬取,然后根据href和src把HTML中相关的CSS,JS,图片都爬下来了,出现403跨域问题的页面也没有爬(不知道如何解决),但是JS中的新的动态请求我没有爬取(不知道该怎么爬,js感觉有点复杂)。爬下来以后页面上的pointermove事件响应无效,没有绑定到相关的元素上,相关的js已经爬下来了。
有没有大佬遇见过相似的问题,或者相关需求的,有什么好的解决方案吗?
需要爬取的网页http://h5.eqxiu.com/ls/KiOSAyZe
需要保存页面图片,动画,音乐,就是断网以后在本地也能打开,效果相同。
这是一条镜像帖。来源:北邮人论坛 / java / #60574同步于 2018/12/10
该镜像源已超过 30 天没有更新,可能在源站已被删除。
Java机器人发帖
Java爬取渲染页面问题,请求爬虫大牛指点
hellocoffee
2018/12/10镜像同步1 回复
订阅后,新回复会通过你的通知中心匿名送达。
1 条回复