Jsoup使用演示

标签:#JAVA##网络爬虫# 时间:2016-04-06 21:32:56 作者:十七岁的雨季

jsoup 是一款Java 的HTML解析器,可直接解析某个URL地址、HTML文本内容。它提供了一套非常省力的API,可通过DOM,CSS以及类似于jQuery的操作方法来取出和操作数据。

下面是我写的一个案例欢迎大家参考:

  1. import java.io.IOException;
  2. import org.jsoup.Jsoup;
  3. import org.jsoup.nodes.Document;
  4. import org.jsoup.nodes.Element;
  5. import org.jsoup.select.Elements;
  6. public class JsoupTest {
  7. public static void main(String[] args) throws IOException {
  8. /*
  9. * 解析一个字符串
  10. */
  11. String html = "First parse"
  12. + "Parsed HTML into a doc.";
  13. Document doc = Jsoup.parse(html);
  14. System.out.println(doc);
  15. /*
  16. * 解析url
  17. */
  18. String url="http://www.tripadvisor.com/SearchForums?q=airbnb&x=18&y=10&pid=34633&s=+";
  19. Document doc1=Jsoup.connect(url).userAgent("bbb").timeout(50000).get();
  20. Elements ele=doc1.select("table[class=forumsearchresults]").select("tr[class~=firstpostrow?]");
  21. for (Element elem:ele) {
  22. String _id=elem.attr("id");
  23. String _url="http://www.tripadvisor.com"+elem.select("td[onclick~=setPID?]").select("a").
  24. attr("href");
  25. String _content=elem.select("td[onclick~=setPID?]").select("a").text();
  26. System.out.println(_id+"===="+_url+"===="+_content);
  27. }
  28. }
  29. }
欢迎大家关注DataLearner官方微信,接受最新的AI技术推送
Back to Top