Beautiful Soup使用时,一般可以通过指定对应的name和attrs去搜索,特定的名字和属性,以找到所需要的部分的html代码。
但是,有时候,会遇到,对于要处理的内容中,其name或attr的值,有多种可能,尤其是符合某一规律,此时,就无法写成固定的值了。
所以,就可以借助正则表达式来解决此问题。
比如,
对应的BeautifulSoup代码如下:
而如果html是这种:
那么想要一次性地找到所有的,符合条件的h1的部分的代码,则之前的写法,就只能找到单个的class="h1user"的部分,剩下的两个
和
就找不到了。
那么,此时,就可以用到,BeautifulSoup中非常好用的,非常强大的功能:
attrs中支持正则表达式的写法
了。
就可以写成:
就可以一次性地,找到:
了。
想要查找到对应的此div标签,之前不知道如何实现。
如果写成:
则xxx必须写出来,如果不写出来属性值,也就没法用上attrs了,就没法实现此处查找特性属性值的标签了。
所以针对:
1 2 3 4 5 6 7 8 9 10 11 12 13 14 15 16 17 | < div aria-label = "5星, 747 份评分" class = "rating" role = "img" tabindex = "-1" > < div > < span class = "rating-star" > </ span > < span class = "rating-star" > </ span > < span class = "rating-star" > </ span > < span class = "rating-star" > </ span > < span class = "rating-star" > </ span > </ div > < span class = "rating-count" > 747 份评分 </ span > </ div > |
可以通过:
去查找到属性包含aria-lable的div标签的。
所以,对于上面的,之前不知道如何处理:
用BeautifulSoup查找未知属性值,但是已知属性的名字的标签
则此处,就可以针对:
去用:
就可以查找到对应的包含属性aria-lable的div标签了。
联系客服