使用 BeautifulSoup 从 HTML 中提取文本-Python教程-PHP中文网

使用 BeautifulSoup 从 HTML 中提取文本

花韻仙語

发布： 2025-08-31 18:18:01

原创

413人浏览过

使用 beautifulsoup 从 html 中提取文本

本文介绍了如何使用 Python 的 BeautifulSoup 库从 HTML 文档中提取文本内容。通过 get_text() 方法，可以轻松地从 HTML 标签中剥离标签信息，仅保留文本数据，从而方便后续的数据处理和分析。本文提供了示例代码，展示了如何针对特定 HTML 结构提取所需文本，并将其组织成易于使用的数据结构。

在使用 BeautifulSoup 进行网页抓取时，经常需要从 HTML 标签中提取纯文本内容，而去除 HTML 标签本身。 BeautifulSoup 提供了 get_text() 方法，可以方便地实现这一目标。

以下是一个示例，展示了如何使用 get_text() 方法从 HTML 表格中提取数据，并将其存储为字典列表：

from bs4 import BeautifulSoup
import requests

website = 'https://www.klavkarr.com/data-trouble-code-obd2.php?dtc=p0000-p0299#dtc'
result = requests.get(website)
content = result.text

soup = BeautifulSoup(content, 'lxml')

box = soup.find('div', class_='main_article-blog')

title = box.find('table')

headers = [header for header in title.find_all('th')]
results = [
    {
        headers[i].get_text(): cell.get_text() 
        for i, cell in enumerate(row.find_all('td'))
    }
    for row in title.find_all('tr')
]

print(results)

登录后复制

代码解释：

立即学习“前端免费学习笔记（深入）”；

Git版本控制与工作流中文WORD版

篇文章是针对git版本控制和工作流的总结，如果有些朋友之前还没使用过git，对git的基本概念和命令不是很熟悉，可以从以下基本教程入手： Git是分布式版本控制系统，与SVN类似的集中化版本控制系统相比，集中化版本控制系统虽然能够令多个团队成员一起协作开发，但有时如果中央服务器宕机的话，谁也无法在宕机期间提交更新和协同开发。甚至有时，中央服务器磁盘故障，恰巧又没有做备份或备份没及时，那就可能有丢失数据的风险。感兴趣的朋友可以过来看看

查看详情

导入库： 首先，导入 BeautifulSoup 和 requests 库。requests 用于获取网页内容，BeautifulSoup 用于解析 HTML。
获取网页内容： 使用 requests.get() 方法获取指定 URL 的网页内容。
创建 BeautifulSoup 对象： 使用 BeautifulSoup 将 HTML 内容解析为 BeautifulSoup 对象。 'lxml' 是一个解析器，需要安装pip install lxml。
定位目标元素： 使用 find() 或 find_all() 方法定位包含目标数据的 HTML 元素。在本例中，首先找到 div 标签，其 class 属性为 'main_article-blog'，然后在该 div 中找到 table 标签。
提取文本内容： 使用列表推导式和 get_text() 方法提取每个 td 标签中的文本内容，并将其与对应的表头文本组合成字典。
- headers[i].get_text(): 提取表头元素的文本内容。
- cell.get_text(): 提取单元格元素的文本内容。

注意事项：

get_text() 方法会提取元素及其所有子元素的文本内容，并将它们连接成一个字符串。
如果需要更精细的控制，可以使用 stripped_strings 属性迭代元素的所有文本子节点，并进行自定义处理。
确保安装了 lxml 解析器，以便 BeautifulSoup 可以正确解析 HTML。可以使用 pip install lxml 命令安装。

总结：

get_text() 方法是 BeautifulSoup 中一个非常实用的方法，可以方便地从 HTML 元素中提取纯文本内容。通过结合列表推导式和其他 BeautifulSoup 方法，可以灵活地处理各种 HTML 结构，并提取所需的数据。使用时注意选择合适的解析器，并根据实际需求进行适当的文本处理。

以上就是使用 BeautifulSoup 从 HTML 中提取文本的详细内容，更多请关注php中文网其它相关文章！

大家都在看：

使用异步请求在 Laravel 和 Flask 服务器之间进行通信如何在正则表达式中使用条件匹配？正则表达式中的反向引用是什么？如何使用？在 Python 中如何实现类似 PHP array_column 函数的功能？在Python中如何实现类似PHP的array_column方法来提取嵌套列表中的特定字段？