Python爬虫基础之XPath语法与lxml库的用法详解

站长资源 2024/11/16 佚名

27 1538 27

相思资源网 Design By www.200059.com

前言

本来打算写的标题是XPath语法，但是想了一下Python中的解析库lxml，使用的是Xpath语法，同样也是效率比较高的解析方法，所以就写成了XPath语法和lxml库的用法

XPath 即为 XML 路径语言，它是一种用来确定 XML（标准通用标记语言的子集）文档中某部分位置的语言。

XPath 基于 XML 的树状结构，提供在数据结构树中找寻节点的能力。 XPath 同样也支持HTML。

XPath 是一门小型的查询语言。

python 中 lxml库使用的是 Xpath 语法，是效率比较高的解析方法。

下面话不多说了，来一起看看详细的介绍吧

安装

为什么要用这个库呢，因为要写爬虫啊，利用lxml库来解析 HTML 代码，同时lxml也继承了libxml2的特性自动修正HTML代码，利用pip安装即可

pip install lxml

XPath语法

XPath是一门在XML文档中查找信息的语言，可以用于在XML文档中通过元素和属性进行导航

举个栗子 "htmlcode">

<urlset> <url> <loc>https://qq52o.me</loc> <lastmod>2018-04-28T19:00:42+00:00</lastmod> <changefreq>daily</changefreq> <priority>1.0</priority> </url> </urlset>

第一个：父（Parent）

每个元素以及属性都有一个父

url元素是 loc、lastmod、changefreq以及 priority元素的父

第二个：子（Children）

元素节点可有零个、一个或多个子

loc、lastmod、changefreq以及 priority元素都是url元素的子

第三个：同胞（Sibling）

拥有相同的父的节点

loc、lastmod、changefreq以及 priority元素都是url元素的同胞

第四个：先辈（Ancestor）

某节点的父、父的父，等等

loc元素的先辈是 url元素和 urlset元素

第五个：后代（Descendant）

某个节点的子，子的子，等等

urlset的后代是url、loc、lastmod、changefreq以及 priority元素

如果你分不清楚，就按照子元素从上到下的去找元素节点

选取节点

XPath使用路径表达式在 XML 文档中选取节点，节点是通过沿着路径或者 step 来选取的，也就是上面所说的按照子元素从上到下去找元素节点

这些是最有用的路径表达式 "external nofollow" target="_blank" href="http://www.w3school.com.cn/xpath/xpath_syntax.asp">w3school

XPath实例测试

提取本站网站地图中id属性为content的的子元素h3的内容以及子元素a的href属性，F12去看代码找这个属性

div的id属性，下面的子元素h3的内容，直接利用 text 方法来获取元素的内容，然后输出

这里的子元素层级关系必须按顺序写好，不然会报错的

IndexError: list index out of range

这就说明你的XPath规则没写好，list是一个空的，没有一个元素

XPath 是一个非常好用的解析方法，同时也是作为爬虫学习的基础

总结

以上就是这篇文章的全部内容了，希望本文的内容对大家的学习或者工作具有一定的参考学习价值，如果有疑问大家可以留言交流，谢谢大家对的支持。

xpath爬虫,python爬虫xpath,python爬虫库

标签：
xpath爬虫,python爬虫xpath,python爬虫库

相思资源网 Design By www.200059.com

广告合作：本站广告合作请联系QQ：858582 申请时备注：广告合作（否则不回）
免责声明：本站文章均来自网站采集或用户投稿，网站不提供任何软件下载或自行开发的软件！如有用户或公司发现本站内容信息存在侵权行为，请邮件告知！ 858582#qq.com

上一篇
python3 拼接字符串的7种方法

下一篇
python简单操作excle的方法

相思资源网 Design By www.200059.com

评论“Python爬虫基础之XPath语法与lxml库的用法详解”

再想想

暂无Python爬虫基础之XPath语法与lxml库的用法详解的评论...

www.200059.com 相思资源网

139,976影音资源

144,792福利资源

21,817软件资源

631,128技术资源

最新文章

转载一个别人收藏的精典网站Ruby,HIBERNATE

2024/11/16
56

可与Spreadsheets媲美的在线表格系统:EditG

2024/11/16
34

cygwin使用心得

2024/11/16
73

脚本的DVD开发

2024/11/16
28

局域网设置自动配置脚本文件的写法与用途

2024/11/16
15

一句话新闻
苹果官宣WWDC 2024！预计会有大批AI功能 - 2024/11/16

3月27日消息，苹果宣布2024年全球开发者大会（WWDC）将于6月10日至6月14日举行，巧合的是，这次大会与端午假期重合。

苹果官方表示：

在线参加 Apple 每年规模最大的开发者盛会。亲眼见证 Apple 最新平台、技术和工具的发布。了解如何创建和改进你的 App 和游戏。与 Apple 设计师和工程师互动交流，与全球开发者社区建立联系。以上活动均免费在线举行。

探索各种新的工具、框架和功能，助力你打造出理想的 App 和游戏。通过视频讲座学习新技能，与 Apple 专家进行一对一会面，以推进你的项目，完善你的构思。

Swift Student Challenge 旨在支持和鼓舞下一代开发者、创作者和企业家。太平洋时间 3 月 28 日，我们将公布今年的获奖者名单。获奖者将有资格参加在 Apple Park 举办的特别活动。我们还会选出 50 名杰出获胜者，他们将受邀前往库比提诺，获得为期三天的非凡体验，包括参加 Apple Park 的特别活动。

Python爬虫基础之XPath语法与lxml库的用法详解

xpath爬虫,python爬虫xpath,python爬虫库

python3 拼接字符串的7种方法

python简单操作excle的方法

评论“Python爬虫基础之XPath语法与lxml库的用法详解”

RTX 5090要首发性能要翻倍！三星展示GDDR7显存

友情链接

Python爬虫基础之XPath语法与lxml库的用法详解

xpath爬虫,python爬虫xpath,python爬虫库

python3 拼接字符串的7种方法

python简单操作excle的方法

评论“Python爬虫基础之XPath语法与lxml库的用法详解”

RTX 5090要首发 性能要翻倍！三星展示GDDR7显存

友情链接

RTX 5090要首发性能要翻倍！三星展示GDDR7显存