网站首页 > 技术教程 正文
1.Jsoup介绍
- 官网文档:https://jsoup.org
- Jsoup 是一款Java 的HTML解析器,可直接解析某个URL地址、HTML文本内容。它提供了一套非常省力的API,可通过DOM,CSS以及类似于jQuery的操作方法来取出和操作数据。
2. Jsoup快速入门
- 获取网页标题
  String url = "https://search.jd.com/Search?keyword=手机&wq=手机&page=1";
  Document document = Jsoup.connect(url).get();
  String title = document.select("title").text();
  System.out.println(title);
  ```- 运行效果:手机 - 商品搜索 - 京东
3. 网站数据分析
3.1 分析网站的访问地址
- 以京东商城为例,商品分页列表的url地址,需要带如下几个参数,因此,在发送http请求时,需要携带正确的参数。
- URL:https://search.jd.com/Search?keyword=手机&wq=手机&page=1
3.2 分析网站的页面结构
- 通过浏览器的开发者工具,可以分析出页面中我们需要的html结构。
<img src="assets/image-20220717171103097.png" alt="image-20220717171103097" style="zoom:67%;" />- 可以看出,我们需要的商品数据,封装在一个id=J_goodsList的div标签中,我们可以方便的通过DOM解析出这块数据。
4. 实战实现过程
- 获取第1页的商品基本数据
public static void main(String[] args) throws Exception {
    //第1页地址
    String url = "https://search.jd.com/Search?keyword=手机&wq=手机&page=1";
    //发送http请求
    Document document = Jsoup.connect(url).get();
    //在id=J_goodsList的div下,获取所有带有data-sku属性的li标签
    Elements lis = document.select("div[id=J_goodsList] li[data-sku]");
    lis.forEach(
            li -> {
                //获取商品sku
                String sku = li.attr("data-sku");
                //获取商品name
                String name = li.select("div[class='p-name p-name-type-2'] a em").text();
                //获取商品图片地址
                String img = li.select("div[class=p-img] a img[data-lazy-img]").attr("data-lazy-img");
               
                System.out.println(String.format("%s, %s, %s", sku, name, img));
            }
    );
}- 效果预览
- 改造为分页获取
public static void main(String[] args) throws Exception {
    //第N页地址
    String url = "https://search.jd.com/Search?keyword=手机&wq=手机&page=" + i;
    //发送http请求
    Document document = Jsoup.connect(url).get();
    //在id=J_goodsList的div下,获取所有带有data-sku属性的li标签
    Elements lis = document.select("div[id=J_goodsList] li[data-sku]");
    lis.forEach(
            li -> {
                //获取商品sku
                String sku = li.attr("data-sku");
                //获取商品name
                String name = li.select("div[class='p-name p-name-type-2'] a em").text();
                //获取商品图片地址
                String img = li.select("div[class=p-img] a img[data-lazy-img]").attr("data-lazy-img");
                System.out.println(String.format("%s, %s, %s", sku, name, img));
            }
    );
}
    
- 上一篇: 维护网站的方法有哪些?
 - 下一篇: 程序猿必知的免费学习网站
 
猜你喜欢
- 2024-12-03 ofo小黄车更新了!想退押金?来试试
 - 2024-12-03 还你清爽流畅!这五款手机浏览器!黑马强推
 - 2024-12-03 程序猿必知的免费学习网站
 - 2024-12-03 维护网站的方法有哪些?
 - 2024-12-03 想体验更流畅的微信吗?64位微信拿去不谢
 - 2024-12-03 微软官方出品的优质模板网站,居然还有人不知道
 - 2024-12-03 三分钟了解http和https
 - 2024-12-03 百设网:一个专注于应用界面设计的作品交易网站
 - 2024-12-03 不仅能解压还能整蛊朋友,这几个网站让我玩到不想睡觉
 
欢迎 你 发表评论:
- 10-23Excel计算工龄和年份之差_excel算工龄的公式year
 - 10-23Excel YEARFRAC函数:时间的"年份比例尺"详解
 - 10-23最常用的10个Excel函数,中文解读,动图演示,易学易用
 - 10-23EXCEL中如何计算截止到今日(两个时间中)的时间
 - 10-2390%人不知道的Excel神技:DATEDIF 精准计算年龄,告别手动算错!
 - 10-23计算工龄及工龄工资(90%的人搞错了):DATE、DATEDIF组合应用
 - 10-23Excel中如何计算工作日天数?用这两个函数轻松计算,附新年日历
 - 10-23怎样快速提取单元格中的出生日期?用「Ctrl+E」批量搞定
 
- 最近发表
 - 
- Excel计算工龄和年份之差_excel算工龄的公式year
 - Excel YEARFRAC函数:时间的"年份比例尺"详解
 - 最常用的10个Excel函数,中文解读,动图演示,易学易用
 - EXCEL中如何计算截止到今日(两个时间中)的时间
 - 90%人不知道的Excel神技:DATEDIF 精准计算年龄,告别手动算错!
 - 计算工龄及工龄工资(90%的人搞错了):DATE、DATEDIF组合应用
 - Excel中如何计算工作日天数?用这两个函数轻松计算,附新年日历
 - 怎样快速提取单元格中的出生日期?用「Ctrl+E」批量搞定
 - Excel日期函数之DATEDIF函数_excel函数datedif在哪里
 - Excel函数-DATEDIF求司龄_exceldatedif函数计算年龄
 
 
- 标签列表
 - 
- 下划线是什么 (87)
 - 精美网站 (58)
 - qq登录界面 (90)
 - nginx 命令 (82)
 - nginx .http (73)
 - nginx lua (70)
 - nginx 重定向 (68)
 - Nginx超时 (65)
 - nginx 监控 (57)
 - odbc (59)
 - rar密码破解工具 (62)
 - annotation (71)
 - 红黑树 (57)
 - 智力题 (62)
 - php空间申请 (61)
 - 按键精灵 注册码 (69)
 - 软件测试报告 (59)
 - ntcreatefile (64)
 - 闪动文字 (56)
 - guid (66)
 - abap (63)
 - mpeg 2 (65)
 - column (63)
 - dreamweaver教程 (57)
 - excel行列转换 (56)
 
 

本文暂时没有评论,来添加一个吧(●'◡'●)