java - getElementByClass Jsoup 没有打印任何内容

标签 java html parsing jsoup

我有一个网上商店,在搜索某种项目后,我需要从该网上商店获取一组具有特定参数(如名称、价格、描述等)的产品。通过输入关键字进行搜索。 这是一个网站:https://www.aboutyou.de/dein-shop 。这是我试图解析的搜索:https://www.aboutyou.de/frauen/accessoires/huete-und-muetzen/caps?pl=1

因此,考虑到页面的 html 源中存在复杂的标签层次结构,我需要获取所有这些数据。我尝试按类获取元素,但最高的元素除外,它由 id 标记并由正文包裹。 所以我尝试使用 jsoup 做这样的事情:

lements resultt = doc.body().select("main#app");
    for(Element el : resultt){
        Elements main = el.getElementsByClass("section.layout_11glwo1-o_O-stretchLayout_1jug6qr > " +
                "div.content_1jug6qr > " +
                "div.container > " +
                "div.mainContent_10ejhcu > " +
                "div.productStream_6k751k > " +
                "div > " +
                "div.wrapper_8yay2a > " +
                "div.col-sm-6.col-md-4 > " +
                "div.wrapper_1eu800j > " +
                "div > " +
                "div.categoryTileWrapper_e296pg > " +
                "a.anchor_wgmchy > " +
                "div.details_197iil9 > " +
                "div.meta_1ihynio > " +
                "div.finalPrice_11ythok > " +
                "span.price_1543wg1");
        System.out.println("just print it" + main.text());
    }

但是在“just print it”短语之后什么也没有打印。我知道这不是配置问题,因为我使用更高级别的标签将一些信息与 gem 绑定(bind)在一起。我可以在代码中更改什么来获取该产品实体信息? 我是 jsoup 新手,因此我将不胜感激任何帮助!

最佳答案

如果将 Elements main = el.getElementsByClass("section.layout_11glwo1-o_O-stretchLayout_1jug6qr >... 替换为 el.select,您将获得所有价格的列表:

17,90€ 19,90€ 19,90€ 24,90€ 19,90€ 24,90€ 24,90€ 19,90€ 17,90€ 19,90€ 17,90€ 49,90€ 39,90€ 39,90€ 17,90€ 19,99€ 39,90€ 19,99€ 34,95€ 17,90€

这可能是因为选择器不是类选择器。

编辑 这是适合我的完整代码 -

Document doc = Jsoup.connect("https://www.aboutyou.de/frauen/accessoires/huete-und-muetzen/caps?pl=1")
            .userAgent("Mozilla/5.0 (Windows NT 6.1; Win64; x64; rv:57.0) Gecko/20100101 Firefox/57.0")
            .get();
    Elements result = doc.body().select("main#app");
    for(Element el : result) {
        Elements e = el.select("section.layout_11glwo1-o_O-stretchLayout_1jug6qr > " +
                "div.content_1jug6qr > " +
                "div.container > " +
                "div.mainContent_10ejhcu > " +
                "div.productStream_6k751k > " +
                "div > " +
                "div.wrapper_8yay2a > " +
                "div.col-sm-6.col-md-4 > " +
                "div.wrapper_1eu800j > " +
                "div > " +
                "div.categoryTileWrapper_e296pg > " +
                "a.anchor_wgmchy > " +
                "div.details_197iil9 > " +
                "div.meta_1ihynio > " +
                "div.finalPrice_11ythok > " +
                "span.price_1543wg1");
        System.out.println(e.text());
    }

关于java - getElementByClass Jsoup 没有打印任何内容,我们在Stack Overflow上找到一个类似的问题: https://stackoverflow.com/questions/47947880/

相关文章:

javascript - javascript文件可以有自己的名字吗?

html - 不要在页面源中显示URL

java - 如何迭代IntelliJ插件项目中的所有文件?

C++解析字符串以查找出现

javascript - 我如何通过ajax解析html

java - Hibernate:在 Servlet 中运行时找不到合适的驱动程序

JavaFX:位置未设置

java - webview 没有命中服务器套接字代理

java - 在 Paho 中建立连接时的回调

html - 如何防止跨越多行的 iText 表 PdfPCell 跨页拆分?