【Python爬虫必备—＞Scrapy框架快速入门篇——上】_scrpy框架教学-程序员宅基地

技术标签：爬虫框架万字博文快速入门原力计划 Scrapy框架从入门到实战 scrapy

相信不少小伙伴们在经历过我的上几篇关于爬虫技术的万字博文的轮番轰炸后，已经可以独立开发出属于自己的爬虫项目！！！——爬虫之路，已然开启！

第一篇之爬虫入坑文；一篇万字博文带你入坑爬虫这条不归路（你还在犹豫什么&抓紧上车）
第二篇之爬虫库requests库详解。两万字博文教你python爬虫requests库，看完还不会我把我女朋友都给你
第三篇之解析库Beautiful Soup库详解。Python万字博文教你玩透Beautiful Soup库【️建议收藏系列️】
第四篇之Selenium详解。【️爬虫必备-＞Selenium从黑铁到王者️】初篇——万字博文详解(建议收藏)

但是前几日有很多粉丝私聊我反馈说:"自己爬虫基础库已经学差不多了，实战也做了不少，但是好多自己接的爬虫单或者老板都要求使用scrapy框架来爬取数据，自己没有接触过scrapy框架不知道如何下手！"

其实我已经有一个scrapy一条龙教学的分栏，也有不少人订阅并且反响不错，【Scrapy框架详解】。但是呢？我又想了想，确实少了篇总结性的文章——来从总体上介绍Scrapy框架。

所以应粉丝们要求，本博主花了假期周六周日两天时间，肝出本文（共分上中下三篇），目的在于带领想要学习scrapy的同学走近scrapy的世界！并在文末附带一整套scrapy框架学习路线，如果你能认认真真看完这三篇文章，在心里对scrapy有个印象，然后潜心研究文末整套学习路线，那么，scrapy框架对你来说——手到擒来！！！
我会尽量把技术文写的通俗易懂/生动有趣，保证每一个想要学习知识&&认认真真读完本文的读者们能够有所获，有所得。当然，如果你读完感觉本文写的还可以，真正学习到了东西，希望给我个「赞」和「收藏」，这个对我很重要，谢谢了！

重点来啦！重点来啦！！下面就让我们一同走入scrapy的神奇世界！

第一部分：走近scrapy！

0.简介及安装

1️⃣简介：

scrapy设计目的：用于爬取网络数据，提取结构性数据的框架，其中，scrapy使用了Twisted异步网络框架，大大加快了下载速度！

官方文档地址！！！

2️⃣安装：

直接pip安装（一句命令&&一步到位）：

pip install scrapy

1.scrapy项目开发流程：

创建项目：scrapy startproject mySpider
生成一个爬虫：scrapy genspider baidu baidu.com
提取数据：根据网站结构在spider中实现数据采集相关内容
保存数据：使用pipeline进行数据后续处理和保存

2.scrapy框架运行流程：

在这里插入图片描述

说明——scrapy中每个模块的具体作用！

在这里插入图片描述
原理描述：

爬虫中起始url构造的url对象–>爬虫中间件–>引擎–>调度器
调度器把request–>引擎–>下载中间件–>下载器
下载器发送请求，获取response响应—>下载中间件—>引擎–>爬虫中间件—>爬虫
爬虫提取url地址，组装成request对象—>爬虫中间件—>引擎—>调度器，重复步骤2
爬虫提取数据—>引擎—>管道处理和保存数据

注意：爬虫中间件和下载中间件只是运行的逻辑的位置不同，作用是重复的：如替换UA等！

拓展——scrapy中三个内置对象：

三个内置对象：（scrapy框架中只有三种数据类型）

   request请求对象：由url，method，post_data，headers等构成；
   response响应对象：由url，body，status，headers等构成；
   item数据对象：本质是一个字典。

第二部分：创建&&运行你的第一个scrapy项目！

1.创建项目：

创建scrapy项目的命令：scrapy startproject <项目名字>
示例：

scrapy startproject myspider

生成的目录和文件结果如下：

在这里插入图片描述

2.爬虫文件的创建：

在项目根路径下执行：

 scrapy genspider <爬虫名字> <允许爬取的域名>

示例：

cd myspider
scrapy genspider itcast itcast.cn

讲解：

爬虫名字：作为爬虫运行时的参数；
允许爬的域名：为对于爬虫设置的爬取范围，设置之后用于过滤要爬取的url，如果爬取的url与允许的域名不同，则被过滤掉。

3.运行scrapy爬虫：

命令：在项目目录下执行：
scrapy crawl <爬虫名字>

示例：

scrapy crawl itcast

不过，在运行之前，我们先要编写itcast.py爬虫文件：

# -*- coding: utf-8 -*-
import scrapy


class ItcastSpider(scrapy.Spider):
    # 爬虫运行时的参数
    name = 'itcast'
    # 检查允许爬的域名
    allowed_domains = ['itcast.cn']
    # 1.修改设置起始的url
    start_urls = ['见评论区']

    # 数据提取的方法：接收下载中间件传过来的response，定义对于网站相关的操作
    def parse(self, response):
        # 获取所有的教师节点
        t_list = response.xpath('//div[@class="li_txt"]')
        print(t_list)
        # 遍历教师节点列表
        tea_dist = {
    }
        for teacher in t_list:
            # xpath方法返回的是选择器对象列表     extract()方法可以提取到selector对象中data对应的数据。
            tea_dist['name'] = teacher.xpath('./h3/text()').extract_first()
            tea_dist['title'] = teacher.xpath('./h4/text()').extract_first()
            tea_dist['desc'] = teacher.xpath('./p/text()').extract_first()
            yield teacher

然后再运行，会发现已经可以正常运行！
在这里插入图片描述

4.明确了爬虫所爬取数据之后，使用管道进行数据持久化操作：

修改itcast.py爬虫文件：

# -*- coding: utf-8 -*-
import scrapy
from ..items import UbuntuItem


class ItcastSpider(scrapy.Spider):
    # 爬虫运行时的参数
    name = 'itcast'
    # 检查允许爬的域名
    allowed_domains = ['itcast.cn']
    # 1.修改设置起始的url
    start_urls = ['见评论区']

    # 数据提取的方法：接收下载中间件传过来的response，定义对于网站相关的操作
    def parse(self, response):
        # 获取所有的教师节点
        t_list = response.xpath('//div[@class="li_txt"]')
        print(t_list)
        # 遍历教师节点列表
        item = UbuntuItem()
        for teacher in t_list:
            # xpath方法返回的是选择器对象列表     extract()方法可以提取到selector对象中data对应的数据。
            item['name'] = teacher.xpath('./h3/text()').extract_first()
            item['title'] = teacher.xpath('./h4/text()').extract_first()
            item['desc'] = teacher.xpath('./p/text()').extract_first()
            yield item

注意：

scrapy.Spider爬虫类中必须有名为parse的解析；
如果网站结构层次比较复杂，也可以自定义其他解析函数；
在解析函数中提取的url地址如果要发送请求，则必须属于allowed_domains范围内，但是start_urls中的url地址不受这个限制；
启动爬虫的时候注意启动的位置，是在项目路径下启动；
parse()函数中使用yield返回数据，注意：解析函数中的yield能够传递的对象只能是：BaseItem, Request, dict, None。

小知识点1——定位元素以及提取数据、属性值的方法：
（解析并获取scrapy爬虫中的数据: 利用xpath规则字符串进行定位和提取）

response.xpath方法的返回结果是一个类似list的类型，其中包含的是selector对象，操作和列表一样，但是有一些额外的方法；
额外方法extract()：返回一个包含有字符串的列表；
额外方法extract_first()：返回列表中的第一个字符串，列表为空没有返回None。

小知识点2——response响应对象的常用属性：

response.url：当前响应的url地址
response.request.url：当前响应对应的请求的url地址
response.headers：响应头
response.requests.headers：当前响应的请求头
response.body：响应体，也就是html代码，byte类型
response.status：响应状态码

5.管道保存数据

在pipelines.py文件中定义对数据的操作！

定义一个管道类；
重写管道类的process_item方法；
process_item方法处理完item之后必须返回给引擎。

️初级篇：

在这里插入图片描述

️进阶篇：

# Define your item pipelines here
#
# Don't forget to add your pipeline to the ITEM_PIPELINES setting
# See: https://docs.scrapy.org/en/latest/topics/item-pipeline.html
import json


class UbuntuPipeline(object):

    def __init__(self):
        self.file = open('itcast.json', 'w', encoding='utf-8')

    def process_item(self, item, spider):
        # 将item对象强制转为字典，该操作只能在scrapy中使用
        item = dict(item)
        # 爬虫文件中提取数据的方法每yield一次，就会运行一次
        # 该方法为固定名称函数
        # 默认使用完管道，需要将数据返回给引擎
        # 1.将字典数据序列化
        '''ensure_ascii=False 将unicode类型转化为str类型，默认为True'''
        json_data = json.dumps(item, ensure_ascii=False, indent=2) + ',\n'

        # 2.将数据写入文件
        self.file.write(json_data)

        return item

    def __del__(self):
        self.file.close()

6.settings.py配置启用管道：

在settings文件中，解封代码，说明如下：

在这里插入图片描述

7.scrapy数据建模与请求：

（通常在做项目的过程中，在items.py中进行数据建模！）

（1）为什么建模？

定义item即提前规划好哪些字段需要抓，防止手误，因为定义好之后，在运行过程中，系统会自动检查，值不相同会报错；
配合注释一起可以清晰的知道要抓取哪些字段，没有定义的字段不能抓取，在目标字段少的时候可以使用字典代替；
使用scrapy的一些特定组件需要Item做支持，如scrapy的ImagesPipeline管道类。

（2）本项目中实操：

在items.py文件中操作：

# Define here the models for your scraped items
#
# See documentation in:
# https://docs.scrapy.org/en/latest/topics/items.html

import scrapy


class UbuntuItem(scrapy.Item):
    # 讲师名字
    name = scrapy.Field()
    # 讲师职称
    title = scrapy.Field()
    # 讲师座右铭
    desc = scrapy.Field()

注意：

from …items import UbuntuItem这一行代码中注意item的正确导入路径，忽略pycharm标记的错误；
python中的导入路径要诀：从哪里开始运行，就从哪里开始导入。

8.设置user-agent：

# settings.py文件中找到如下代码解封，并加入UA:
# Override the default request headers:
DEFAULT_REQUEST_HEADERS = {
    
  'Accept': 'text/html,application/xhtml+xml,application/xml;q=0.9,*/*;q=0.8',
  'Accept-Language': 'en',
  'User-Agent': 'Mozilla/5.0 (Windows NT 10.0; Win64; x64) AppleWebKit/537.36 (KHTML, like Gecko) Chrome/80.0.3987.162 Safari/537.36',
}

9.到目前为止，一个入门级别的scrapy爬虫已经OK了，基操都使用了！

如何run呢？

现在cd到项目目录下，输入

scrapy crawl itcast

即可运行scrapy！

在这里插入图片描述

10.开发流程总结：

创建项目：
scrapy startproject 项目名
明确目标：
在items.py文件中进行建模！
创建爬虫：

创建爬虫：
scrapy genspider 爬虫名允许的域名
完成爬虫：
修改start_urls；检查修改allowed_domains；编写解析方法！
保存数据：
在pipelines.py文件中定义对数据处理的管道
在settings.py文件中注册启用管道

结语：

通过上面的学习，你已经可以独立创建一个scrapy项目并使用此框架进行简单的爬虫项目编写。但是！任何一种功夫都不是一下就能学好学会学精的！所以跟着本专栏，只要你跟着潜心学完，那么！恭喜你！你已经是名优秀的scrapy框架使用者了！！！

第三部分——In The End！

请添加图片描述

从现在做起，坚持下去，一天进步一小点，不久的将来，你会感谢曾经努力的你！

本文链接：https://blog.csdn.net/qq_44907926/article/details/119531324

原作者删帖不实内容删帖广告或垃圾文章投诉

智能推荐

从零开始搭建Hadoop_创建一个hadoop项目-程序员宅基地

文章浏览阅读331次。第一部分：准备工作1 安装虚拟机2 安装centos73 安装JDK以上三步是准备工作，至此已经完成一台已安装JDK的主机第二部分：准备３台虚拟机以下所有工作最好都在root权限下操作1 克隆上面已经有一台虚拟机了,现在对master进行克隆,克隆出另外2台子机;1.1 进行克隆21.2 下一步1.3 下一步1.4 下一步1.5 根据子机需要,命名和安装路径1.6 ..._创建一个hadoop项目

心脏滴血漏洞HeartBleed CVE-2014-0160深入代码层面的分析_heartbleed代码分析-程序员宅基地

文章浏览阅读1.7k次。心脏滴血漏洞HeartBleed CVE-2014-0160 是由heartbeat功能引入的，本文从深入码层面的分析该漏洞产生的原因_heartbleed代码分析

java读取ofd文档内容_ofd电子文档内容分析工具（分析文档、签章和证书）-程序员宅基地

文章浏览阅读1.4k次。前言ofd是国家文档标准，其对标的文档格式是pdf。ofd文档是容器格式文件，ofd其实就是压缩包。将ofd文件后缀改为.zip，解压后可看到文件包含的内容。ofd文件分析工具下载：点我下载。ofd文件解压后，可以看到如下内容：对于xml文件，可以用文本工具查看。但是对于印章文件(Seal.esl)、签名文件(SignedValue.dat)就无法查看其内容了。本人开发一款ofd内容查看器，..._signedvalue.dat

基于FPGA的数据采集系统（一）_基于fpga的信息采集-程序员宅基地

文章浏览阅读1.8w次，点赞29次，收藏313次。整体系统设计本设计主要是对ADC和DAC的使用，主要实现功能流程为：首先通过串口向FPGA发送控制信号，控制DAC芯片tlv5618进行DA装换，转换的数据存在ROM中，转换开始时读取ROM中数据进行读取转换。其次用按键控制adc128s052进行模数转换100次，模数转换数据存储到FIFO中，再从FIFO中读取数据通过串口输出显示在pc上。其整体系统框图如下：图1：FPGA数据采集系统框图从图中可以看出，该系统主要包括9个模块：串口接收模块、按键消抖模块、按键控制模块、ROM模块、D.._基于fpga的信息采集

微服务 spring cloud zuul com.netflix.zuul.exception.ZuulException GENERAL-程序员宅基地

文章浏览阅读2.5w次。1.背景错误信息：-- [http-nio-9904-exec-5] o.s.c.n.z.filters.post.SendErrorFilter : Error during filteringcom.netflix.zuul.exception.ZuulException: Forwarding error at org.springframework.cloud..._com.netflix.zuul.exception.zuulexception

邻接矩阵-建立图-程序员宅基地

文章浏览阅读358次。1.介绍图的相关概念　　图是由顶点的有穷非空集和一个描述顶点之间关系-边（或者弧）的集合组成。通常，图中的数据元素被称为顶点，顶点间的关系用边表示，图通常用字母G表示，图的顶点通常用字母V表示，所以图可以定义为:　　G=(V,E)其中，V(G)是图中顶点的有穷非空集合，E(G)是V(G)中顶点的边的有穷集合1.1 无向图：图中任意两个顶点构成的边是没有方向的1.2 有向图：图中..._给定一个邻接矩阵未必能够造出一个图

随便推点

MDT2012部署系列之11 WDS安装与配置-程序员宅基地

文章浏览阅读321次。（十二）、WDS服务器安装通过前面的测试我们会发现，每次安装的时候需要加域光盘映像，这是一个比较麻烦的事情，试想一个上万个的公司，你天天带着一个光盘与光驱去给别人装系统，这将是一个多么痛苦的事情啊，有什么方法可以解决这个问题了？答案是肯定的，下面我们就来简单说一下。WDS服务器，它是Windows自带的一个免费的基于系统本身角色的一个功能，它主要提供一种简单、安全的通过网络快速、远程将Window..._doc server2012上通过wds+mdt无人值守部署win11系统.doc

python--xlrd/xlwt/xlutils_xlutils模块可以读xlsx吗-程序员宅基地

文章浏览阅读219次。python–xlrd/xlwt/xlutilsxlrd只能读取，不能改,支持 xlsx和xls 格式xlwt只能改，不能读xlwt只能保存为.xls格式xlutils能将xlrd.Book转为xlwt.Workbook，从而得以在现有xls的基础上修改数据，并创建一个新的xls，实现修改xlrd打开文件import xlrdexcel=xlrd.open_workbook('E:/test.xlsx') 返回值为xlrd.book.Book对象,不能修改获取sheett_xlutils模块可以读xlsx吗

关于新版本selenium定位元素报错：‘WebDriver‘ object has no attribute ‘find_element_by_id‘等问题_unresolved attribute reference 'find_element_by_id-程序员宅基地

文章浏览阅读8.2w次，点赞267次，收藏656次。运行Selenium出现'WebDriver' object has no attribute 'find_element_by_id'或AttributeError: 'WebDriver' object has no attribute 'find_element_by_xpath'等定位元素代码错误，是因为selenium更新到了新的版本，以前的一些语法经过改动。..............._unresolved attribute reference 'find_element_by_id' for class 'webdriver