java - 如何将Jsoup中的Element保存到数据库-6ren

java - 如何将Jsoup中的Element保存到数据库

转载作者：行者123 更新时间：2023-12-02 01:44:50

25

4

我使用 Jsoup 从网站获取所有数据，并在获取时如果匹配某些内容则保存元素。我想要当我们获得元素时。如果它匹配某些字符，我会从数据库(MYSQL，Postgress ...)保存元素。我的代码看起来像:

Connection conn = Jsoup.connect("https://viblo.asia");
                Document doc = conn.userAgent("Mozilla").get();
                Elements elements = doc.getElementsByClass("post-feed").get(0).children();
                Elements list = new Elements();
                Elements strings = new Elements();
                for (Element element : elements) {
                    if (element.hasClass("post-feed-item")) {
                        list.add(element);
                        Element e = element.children().get(1).children().get(1).children().get(0);
                        if (e.text().matches("^.*?(Docker|docker|DOCKER).*$")) {
                            strings.add(e);
                            //save to element to DB
                        }

                    }
                }

                for (Element page : elements) {
                    if (links.add(URL)) {
                        //Remove the comment from the line below if you want to see it running on your editor
                        System.out.println(URL);
                    }
                    getPageLinks(page.attr("abs:href"));
                }

我希望如果元素中的标题包含:“Docker”，它将我的元素保存到数据库。但在 element 中，它包含 div 和一些东西链接 url、img 、内容。我如何将其保存到数据库。如果我想将每个元素保存在数据库的某个字段中可行怎么办？如果没有我可以将元素转换为 html 并保存吗？请帮忙。

我想要保存数据库的示例 html:

<div class="post-feed-item">
 <a href="/u/HoanKi"><img src="https://images.viblo.asia/avatar/1d0e5458-ad41-4d1c-89db-292dc198b4fa.png" srcset="https://images.viblo.asia/avatar/1d0e5458-ad41-4d1c-89db-292dc198b4fa.png 1x, https://images.viblo.asia/avatar-retina/1d0e5458-ad41-4d1c-89db-292dc198b4fa.png 2x" class="avatar avatar--md mr-05"></a>
 <div class="post-feed-item__info">
  <div class="post-meta--inline">
   <div class="user--inline d-inline-flex">
    <!---->
    <a href="/u/HoanKi" class="mr-05">Hoàn Kì</a>
    <!---->
   </div>
   <div class="post-meta d-inline-flex align-items-center flex-wrap">
    <div class="text-muted mr-05">
     <span class="mr-05">about 3 hours ago</span>
     <button title="Copy URL" class="icon-btn _13z_mK0hRyRB3dPzawysKe_0"><i aria-hidden="true" class="fa fa-link"></i></button>
    </div>
    <!---->
    <!---->
   </div>
  </div>
  <div class="post-title--inline">
   <h3 class="word-break mr-05"><a href="/p/docker-chua-biet-gi-den-biet-dung-phan-3-docker-compose-3P0lPm6p5ox" class="link">Docker: Chưa biết gì đến biết dùng (Phần 3 docker-compose )</a></h3>
   <div class="tags" data-v-cbe11868>
    <a href="/tags/docker" class="el-tag _3wKNDsArij9ZFjXe8k4ryR_0 el-tag--info el-tag--mini" data-v-cbe11868>Docker</a>
   </div>
  </div>
  <!---->
  <div class="d-flex justify-content-between">
   <div class="d-flex">
    <div class="stats">
     <span title="Views" class="stats-item text-muted"><i aria-hidden="true" class="stats-item__icon fa fa-eye"></i> 62 </span>
     <span title="Clips" class="stats-item text-muted"><i aria-hidden="true" class="stats-item__icon fa fa-paperclip"></i> 1 </span>
     <span title="Comments" class="stats-item text-muted"><i aria-hidden="true" class="stats-item__icon fa fa-comments"></i> 0 </span>
    </div>
    <!---->
   </div>
   <div title="Score" class="points">
    <div class="carets">
     <i aria-hidden="true" class="fa fa-caret-up"></i>
     <i aria-hidden="true" class="fa fa-caret-down"></i>
    </div>
    <span class="text-muted">4</span>
   </div>
  </div>
 </div>
</div>

最佳答案

首先，修改您的获取 post-feed-item 的逻辑，如下所示 -

Connection conn = Jsoup.connect("https://viblo.asia");
Document doc = conn.userAgent("Mozilla").get();

Elements elements = doc.getElementsByClass("post-feed-item"); //This will get the whole element.

for (Element element : elements) {
    String postFeeds = "";

    if (element.toString().contains("docker")) {
        postFeeds = postFeeds.concat(element.toString());  
        //save postFeeds to DB
    }
}

额外

/**
 * Your parsed element may contain single quote ('). 
 * This will cause error while persisting.
 * to avoid this you need to escape single quote (')
 * with double single quote ('')
 */

 if (element.toString().contains("docker")) {
     postFeeds = postFeeds.concat(element.toString().replaceAll("'", "''"));  
     //save postFeeds to DB
 }

第二，如果我想将每个元素保存在数据库中的某个字段中可行吗？

您不需要单独的列来存储数据库中的每个元素。但是您可以保存，但可行性取决于您的用例。如果您只想存储 post-feed-items 以便将其写回到您的网页，那么这是不可行的。

第三，如何将element转换为html并保存？

您不需要将element转换为html，但需要将element转换为String > 如果你想将其保存到数据库。
您所需要的只是 BLOB 数据类型的列类型(您也可以将其保存为 VARCHAR，但 BLOB 更安全)。

更新

如何遍历所有页面？

通过查看该页面的源代码，我发现这就是获取总页码的方法 -

Elements pagination = doc.getElementsByAttributeValueMatching("href", "page=\\d");

int totalPageNo = Integer.parseInt(pagination.get(pagination.size() - 2).text());

然后循环浏览每个页面。

for(int page = 1; page <= totalPageNo; page++) {
    Connection conn = Jsoup.connect("https://viblo.asia/?page=" + page);
    //rest of your code
}

关于java - 如何将Jsoup中的Element保存到数据库，我们在Stack Overflow上找到一个类似的问题： https://stackoverflow.com/questions/53844099/

25

4

0

文章推荐： wordpress - Woocommerce:仅显示来自同一子类别的相关产品

文章推荐： java - 从书签处的 PDF 中提取文本

文章推荐： d3.js - 如何在 d3 中正确重复嵌套转换？

文章推荐： java - 实时数据库快照的存储位置

数据库
我的问题是如何在 python 中创建一个简单的数据库。我的例子是: User = { 'Name' : {'Firstname', 'Lastname'}, 'Address' : {'Street
mysql - iOS开发。数据库？数据库？什么是最好的方法？
我需要创建一个与远程数据库链接的应用程序! mysql 是最好的解决方案吗？ Sqlite 是唯一的本地解决方案吗？我使用下面的方法，我想知道它是否是最好的方法! NSString *evento
java 应用程序无法连接到远程 MySQL 数据库，但可以连接到本地 MySQL 数据库
给定两台 MySQL 服务器，一台本地，一台远程。两者都有一个包含表 bohica 的数据库 foobar。本地服务器定义了用户 'myadmin'@'%' 和 'myadmin'@'localhos
java - 灵活查询适用于 HANA 数据库，但不适用于 HSQL 数据库
我有以下灵活的搜索查询 Select {vt:code},{vt:productcode},{vw:code},{vw:productcode} from {abcd AS vt JOIN wxyz
mysql - 从原始数据文件恢复 MySQL 数据库 [XAMPP | MySQL |数据库]
好吧，我的电脑开始运行有点缓慢，所以我重置了 Windows，保留了我的文件。因为我的大脑还没有打开，所以我忘记事先备份我的 MySQL 数据库。我仍然拥有所有原始文件，因此我实际上仍然拥有数据库，但
android - 如何将我的 Access 数据库 (.accdb) 转换为 SQLite 数据库 (.sqlite)？
如何将我的 Access 数据库 (.accdb) 转换为 SQLite 数据库 (.sqlite)？请，任何帮助将不胜感激。最佳答案 1)如果要转换 db 的结构，则应使用任何 DB 建模工具:
django - 实际上我将我的 django 数据库 sqlite3 连接到 Mysql 数据库，每当我迁移时我都会收到此错误
系统检查发现了一些问题: 警告:？:(mysql.W002)未为数据库连接“默认”设置 MySQL 严格模式提示:MySQL 的严格模式通过将警告升级为错误来修复 MySQL 中的许多数据完整性问题
django - 实际上我将我的 django 数据库 sqlite3 连接到 Mysql 数据库，每当我迁移时我都会收到此错误
系统检查发现了一些问题: 警告:？:(mysql.W002)未为数据库连接“默认”设置 MySQL 严格模式提示:MySQL 的严格模式通过将警告升级为错误来修复 MySQL 中的许多数据完整性问题
android - 如何在 phonegap 数据库中使用 android 数据库/作为 phonegap 数据库
我想在相同的 phonegap 应用程序中使用 android 数据库。更多说明: 我创建了 phonegap 应用程序，但 phonegap 应用程序不支持服务，所以我们已经在 java 中为 a
javascript - 将日期插入 mysql 数据库 [我正在使用 php 和 xampp mysql 数据库]
Time Tracker function clock() { var mytime = new Date(); var seconds
php - MySQL如何从年份(参数)、weekOfYear(参数)、时间(数据库)和dayofweek(数据库)创建时间戳？
我需要在现有项目上实现一些事件的显示。我无法更改数据库结构。在我的 Controller 中，我(从 ajax 请求)传递了一个时间戳，并且我需要显示之前的 8 个事件。因此，如果时间戳是(转换后)
performance - : {REST API, 网站} --> {数据库} 或 {网站} --> {REST API} --> {数据库} 哪个更好？
我有一个可以收集和显示各种测量值的产品(不会详细介绍)。正如人们所期望的那样，显示部分是一个数据库+建立在其之上的网站(使用 Symfony)。但是，我们可能还会创建一个 API 来向第三方公开数据
sql-server - Azure SQL 数据库 - 查询速度明显慢于 Azure VM 上的 SQL 数据库
我们将 SQL Server 从 Azure VM 迁移到 Azure SQL 数据库。 Azure VM 为 DS2_V2、2 核、7GB RAM、最大 6400 IOPS Azure SQL 数据
java - MongoDB 如何在 Java 本地测试 MongoDB 数据库，比如 H2 和 sql 数据库？
我正在开发一个使用 MongoDB 数据库的程序，但我想问在通过 Java 执行 SQL 时是否可以使用内部数据库进行测试，例如 H2？最佳答案你可以尝试使用Testcontainers Test
sql - 如何从 unix 终端连接到 Microsoft SQL Server 数据库？我必须连接 SQL Server 2008 数据库
已关闭。此问题不符合Stack Overflow guidelines 。目前不接受答案。已关闭 9 年前。此问题似乎与 a specific programming problem, a sof
python - 尝试使用 MSI 身份验证从 Azure ML 服务连接 Azure SQL 数据库(无需用户名和密码即可连接 Azure 数据库)
我正在尝试使用 MSI 身份验证(无需用户名和密码)从 Azure 机器学习服务连接 Azure SQL 数据库。我正在尝试在 Azure 机器学习服务上建立机器学习模型，目的是我需要数据，这就是我
数据库；空场似乎不空
我在我的 MySQL 数据库中使用这个查询来查找 my_column 不为空的所有行: SELECT * FROM my_table WHERE my_column != ""; 不幸的是，许多行在
数据库 |选择不同的记录
我有那个基地:http://sqlfiddle.com/#!2/e5a24/2这是 WordPress 默认模式的简写。我已经删除了该示例不需要的字段。如您所见，我的结果是“类别 1”的两倍。我喜欢
数据库。提取过滤列的数据
我有一张这样的 table : mysql> select * from users; +--------+----------+------------+-----------+ | userid
数据库 |高级分面搜索
我有表: CREATE TABLE IF NOT EXISTS `category` ( `id` int(11) NOT NULL, `name` varchar(255) NOT NULL

首页

博学

6Ren·AI

商城

java - 如何将Jsoup中的Element保存到数据库

额外

更新