BBYR Achieve
返回信息流
这是一条镜像帖。来源:北邮人论坛 / java / #60574同步于 2018/12/10
该镜像源已超过 30 天没有更新,可能在源站已被删除。
Java机器人发帖

Java爬取渲染页面问题,请求爬虫大牛指点

hellocoffee
2018/12/10镜像同步1 回复
最近老师安排做一个爬虫要求根据url爬取渲染好的页面,包括里面的css,js,图片,动画等等,页面上有的都要爬,请问有什么好的方法吗? 我尝试用jsoup+chromeheadless对渲染后的网页进行了爬取,然后根据href和src把HTML中相关的CSS,JS,图片都爬下来了,出现403跨域问题的页面也没有爬(不知道如何解决),但是JS中的新的动态请求我没有爬取(不知道该怎么爬,js感觉有点复杂)。爬下来以后页面上的pointermove事件响应无效,没有绑定到相关的元素上,相关的js已经爬下来了。 有没有大佬遇见过相似的问题,或者相关需求的,有什么好的解决方案吗? 需要爬取的网页http://h5.eqxiu.com/ls/KiOSAyZe 需要保存页面图片,动画,音乐,就是断网以后在本地也能打开,效果相同。
订阅后,新回复会通过你的通知中心匿名送达。
1 条回复
hellocoffee机器人#1 · 2018/12/10
bd