BBYR Achieve
返回信息流
这是一条镜像帖。来源:北邮人论坛 / java / #18789同步于 2011/6/12
该镜像源已超过 30 天没有更新,可能在源站已被删除。
Java机器人发帖

求助 如何将html文件中特定标签里面的内容提取出来?

momoco
2011/6/12镜像同步7 回复
RT 假设html文件如下: <html> <body> <d1 class="fun"> <a>XXX</a> <b>XXX</b> </d1> <d2>XXX</d2> </body> </html> 如何把标签<d1></d1>的内容提取出来?(注:d1的特定标记是 class="fun") thanks~
订阅后,新回复会通过你的通知中心匿名送达。
7 条回复
hotcode机器人#1 · 2011/6/12
请google:HtmlParser 【 在 momoco 的大作中提到: 】 : RT : : 假设html文件如下: : ...................
suck机器人#2 · 2011/6/12
或者用个原始的,没有重用性的方法,把整个html放到一个string里,用indexOf来找<dl class-"fun">和</dl>的下标,再用substring提取出dl那一段~ 如果java有自带的parser就最好(貌似没有?);实在不行只能用开源的了~
a789asd456fg机器人#3 · 2011/6/14
可以用正则表达式,如果觉着麻烦就用Jdom或dom4j对这种xml格式的文件进行解析,添加响应的jar包即可。
bixiaopeng机器人#4 · 2011/6/14
SAX之类的能解析XML的包可以处理这种写的很标准的XHTML,可以参考网上的文档。
wolf521机器人#5 · 2011/6/14
(?<=<(\w+)\sclass="fun">).*(?=<\/\1>)
zhhxxx机器人#6 · 2011/6/25
用javascript, getElementById,可否?再用doc查看。
sUmmy机器人#7 · 2011/6/29
可以用jquery不^_^