python批量爬取xml文件

1.网站链接:https://www.cnvd.org.cn/shareData/list

十多年的萧县网站建设经验,针对设计、前端、开发、售后、文案、推广等六对一服务,响应快,48小时及时工作处理。成都全网营销推广的优势是能够根据用户设备显示端的尺寸不同,自动调整萧县建站的显示方式,使网站能够适用不同显示终端,在浏览器中调整网站的宽度,无论在任何一种浏览器上浏览网站,都能展现优雅布局与设计,从而大程度地提升浏览体验。成都创新互联公司从事“萧县网站设计”,“萧县网站推广”以来,每个客户项目都认真落实执行。

2.需要下载的页面文件:
python批量爬取xml文件

3.该页面需要登陆,然后批量下载共享漏洞文件,我们就通过cookie来实现。

#!/usr/bin/env python
# -*- coding: utf-8 -*-

"""
Date: 2019-08-17
Author: Bob
Description: python爬取xml文件
"""

import requests
from bs4 import BeautifulSoup

def cnvd_spider():
    url = 'https://www.cnvd.org.cn/shareData/list?max=240&offset=0'

    headers = {
        "Cookie": "__jsluid_s=65d5e7902f04498e89b16e93fb010b3c; __jsluid_h=1ab428e655aee36ac3c9835db29b6714; JSESSIONID=91BB91B37543D365AA64895EDFCD828F; __jsl_clearance=1566003116.655|0|CYPFsKirGYBG12qtoOrS5Kq1rM0%3D",
        "User-Agent": "Mozilla/5.0 (Macintosh; Intel Mac OS X 10_14_6) AppleWebKit/537.36 (KHTML, like Gecko) Chrome/76.0.3809.100 Safari/537.36",
    }

    html = requests.get(url=url, headers=headers).text
    soup = BeautifulSoup(html, 'lxml')
    links = soup.find_all('a', attrs={'title': '下载xml'})

    for link in links:
        url = 'https://www.cnvd.org.cn' + link.get('href')
        file_name = link.get_text()
        html_data = requests.get(url=url, headers=headers)
        with open(file_name, 'w') as f:
            f.write(html_data.content)

if __name__ == '__main__':
    cnvd_spider()

本文标题:python批量爬取xml文件
当前链接:http://bzwzjz.com/article/jejgdh.html

其他资讯

Copyright © 2007-2020 广东宝晨空调科技有限公司 All Rights Reserved 粤ICP备2022107769号
友情链接: 梓潼网站设计 成都模版网站建设 成都企业网站建设公司 网站制作 高端网站设计推广 网站建设 定制级高端网站建设 手机网站建设套餐 网站建设方案 品牌网站建设 成都网站设计公司 外贸网站设计方案 手机网站建设 盐亭网站设计 网站建设方案 古蔺网站建设 定制网站设计 教育网站设计方案 成都网站设计 高端网站设计 成都h5网站建设 重庆企业网站建设