如何使用python正则爬取某段子网站前20页段子-创新互联

这篇文章主要介绍如何使用python正则爬取某段子网站前20页段子，文中介绍的非常详细，具有一定的参考价值，感兴趣的小伙伴们一定要看完！

我们提供的服务有：成都网站设计、网站制作、外贸营销网站建设、微信公众号开发、网站优化、网站认证、宁远ssl等。为近千家企事业单位解决了网站和推广的问题。提供周到的售前咨询和贴心的售后服务，是有科学管理、有技术的宁远网站制作公司

首先还是谷歌浏览器抓包对该网站数据进行分析，结果如下：

该网站地址：http://www.budejie.com/text

该网站数据都是通过html页面进行展示，网站url默认为第一页，http://www.budejie.com/text/2为第二页，以此类推

对网站的内容段子所处位置进行分析，发现段子内容都是在一个 a 标签中

如何使用python正则爬取某段子网站前20页段子

坑还是有的，这是我第一次写的正则：

content_list = re.findall(r'(.+?)', html_str)

之后发现竟然匹配到了一些推荐的内容，最后我把正则改变下面这样，发现没有问题了，关于正则的知识这里就不做过多解释了

content_list = re.findall(r'

\s*(.+?)', html_str)

现在要的是爬取前20页的段子并保存到本地，已经知道翻页的规律和匹配内容的正则，就直接可以写代码了

代码如下，整体思路还是和前两排爬虫博客一样，面向对象的写法：

import requests
import re
import json

class NeihanSpider(object):
  """内涵段子，百思不得其姐，正则爬取一页的数据"""
  def __init__(self):
    self.temp_url = 'http://www.budejie.com/text/{}' # 网站地址，给页码留个可替换的{}
    self.headers = {
      'User-Agent': 'Mozilla/5.0 (Windows NT 10.0; Win64; x64) AppleWebKit/537.36 (KHTML, like Gecko) Chrome/75.0.3770.100 Safari/537.36',
    }

  def pass_url(self, url): # 发送请求，获取响应
    print(url)
    response = requests.get(url, headers=self.headers)
    return response.content.decode()

  def get_first_page_content_list(self, html_str): # 提取第一页的数据
    content_list = re.findall(r'\s*(.+?)', html_str) # 非贪婪匹配
    return content_list

  def save_content_list(self, content_list):
    with open('neihan.txt', 'a', encoding='utf-8') as f:
      for content in content_list:
        f.write(json.dumps(content, ensure_ascii=False))
        f.write('\n') # 换行
      print('成功保存一页！')

  def run(self): # 实现主要逻辑
    for i in range(20): # 只爬取前20页数据
      # 1. 构造url
      # 2. 发送请求，获取响应
      html_str = self.pass_url(self.temp_url.format(i+1))
      # 3. 提取数据
      content_list = self.get_first_page_content_list(html_str)
      # 4. 保存
      self.save_content_list(content_list)

if __name__ == '__main__':
  neihan = NeihanSpider()
  neihan.run()

以上是“如何使用python正则爬取某段子网站前20页段子”这篇文章的所有内容，感谢各位的阅读！希望分享的内容对大家有帮助，更多相关知识，欢迎关注创新互联行业资讯频道！

文章名称：如何使用python正则爬取某段子网站前20页段子-创新互联
URL网址：http://bzwzjz.com/article/diccgj.html

其他资讯

Copyright © 2007-2020 广东宝晨空调科技有限公司 All Rights Reserved 粤ICP备2022107769号
友情链接：网站设计成都网站建设网站设计成都网站设计公司响应式网站设计方案成都网站制作网站制作重庆网站制作网站建设方案重庆网站制作高端网站设计四川成都网站建设成都网站建设推广成都定制网站建设手机网站制作成都网站设计成都网站建设手机网站设计上市集团网站建设企业网站建设成都网站设计手机网站制作设计

用户体验为先导 为品牌带来生命力

如何使用python正则爬取某段子网站前20页段子-创新互联

其他资讯

用户体验为先导为品牌带来生命力