如何使用python正则爬取某段子网站前20页段子-创新互联
这篇文章主要介绍如何使用python正则爬取某段子网站前20页段子,文中介绍的非常详细,具有一定的参考价值,感兴趣的小伙伴们一定要看完!
我们提供的服务有:成都网站设计、网站制作、外贸营销网站建设、微信公众号开发、网站优化、网站认证、宁远ssl等。为近千家企事业单位解决了网站和推广的问题。提供周到的售前咨询和贴心的售后服务,是有科学管理、有技术的宁远网站制作公司首先还是谷歌浏览器抓包对该网站数据进行分析,结果如下:
该网站地址:http://www.budejie.com/text
该网站数据都是通过html页面进行展示,网站url默认为第一页,http://www.budejie.com/text/2为第二页,以此类推
对网站的内容段子所处位置进行分析,发现段子内容都是在一个 a 标签中
坑还是有的,这是我第一次写的正则:
content_list = re.findall(r'(.+?)', html_str)
之后发现竟然匹配到了一些推荐的内容,最后我把正则改变下面这样,发现没有问题了,关于正则的知识这里就不做过多解释了
现在要的是爬取前20页的段子并保存到本地,已经知道翻页的规律和匹配内容的正则,就直接可以写代码了 代码如下,整体思路还是和前两排爬虫博客一样,面向对象的写法: 以上是“如何使用python正则爬取某段子网站前20页段子”这篇文章的所有内容,感谢各位的阅读!希望分享的内容对大家有帮助,更多相关知识,欢迎关注创新互联行业资讯频道!content_list = re.findall(r'
import requests
import re
import json
class NeihanSpider(object):
"""内涵段子,百思不得其姐,正则爬取一页的数据"""
def __init__(self):
self.temp_url = 'http://www.budejie.com/text/{}' # 网站地址,给页码留个可替换的{}
self.headers = {
'User-Agent': 'Mozilla/5.0 (Windows NT 10.0; Win64; x64) AppleWebKit/537.36 (KHTML, like Gecko) Chrome/75.0.3770.100 Safari/537.36',
}
def pass_url(self, url): # 发送请求,获取响应
print(url)
response = requests.get(url, headers=self.headers)
return response.content.decode()
def get_first_page_content_list(self, html_str): # 提取第一页的数据
content_list = re.findall(r'
新闻名称:如何使用python正则爬取某段子网站前20页段子-创新互联
网页路径:http://azwzsj.com/article/diccgj.html