当前位置：极客教程 > Scrapy > Scrapy 基本概念 > Scrapy – 概述

Scrapy – 概述

Scrapy是一个用Python编写的快速、开源的网络抓取框架，用于在基于XPath的选择器的帮助下从网页上提取数据。

Scrapy于2008年6月26日首次发布，采用BSD授权，2015年6月发布了里程碑式的1.0版本。

为什么使用Scrapy

它更容易建立和扩展大型抓取项目。
它有一个内置的机制，称为选择器，用于从网站中提取数据。
它以异步方式处理请求，速度很快。
它使用Auto-throttling机制自动调整爬行速度。
确保开发者的可及性。

Scrapy的功能

Scrapy是一个开源的、免费使用的网络抓取框架。
Scrapy生成JSON、CSV和XML等格式的feed输出。
Scrapy内置支持通过XPath或CSS表达式从源头选择和提取数据。
基于爬虫的Scrapy，可以自动从网页中提取数据。

Scrapy的优势

Scrapy易于扩展，速度快，功能强大。
它是一个跨平台的应用框架（Windows、Linux、Mac OS和BSD）。
Scrapy的请求被计划并以异步方式处理。
Scrapy内置了名为Scrapyd的服务，允许上传项目并使用JSON网络服务控制蜘蛛。
它可以爬取任何网站，尽管该网站没有原始数据访问的API。

Scrapy的劣势

Scrapy只适用于Python 2.7.+
不同操作系统的安装是不同的。

Python教程

Python 教程

Python 教程

Tkinter 教程

Tkinter 教程

Pandas 教程

Pandas 教程

NumPy 教程

NumPy 教程

Flask 教程

Flask 教程

Django 教程

Django 教程

PySpark 教程

PySpark 教程

wxPython 教程

wxPython 教程

SymPy 教程

SymPy 教程

Seaborn 教程

Seaborn 教程

SciPy 教程

SciPy 教程

RxPY 教程

RxPY 教程

Pycharm 教程

Pycharm 教程

Pygame 教程

Pygame 教程

PyGTK 教程

PyGTK 教程

PyQt 教程

PyQt 教程

PyQt5 教程

PyQt5 教程

PyTorch 教程

PyTorch 教程

Matplotlib 教程

Matplotlib 教程

Web2py 教程

Web2py 教程

BeautifulSoup 教程

BeautifulSoup 教程

Java教程

Java 教程

Java 教程

Web教程

HTML 教程

HTML 教程

CSS 教程

CSS 教程

CSS3 教程

CSS3 教程

jQuery 教程

jQuery 教程

Ajax 教程

Ajax 教程

AngularJS 教程

AngularJS 教程

TypeScript 教程

TypeScript 教程

WordPress 教程

WordPress 教程

Laravel 教程

Laravel 教程

Next.js 教程

Next.js 教程

PhantomJS 教程

PhantomJS 教程

Three.js 教程

Three.js 教程

Underscore.JS 教程

Underscore.JS 教程

WebGL 教程

WebGL 教程

WebRTC 教程

WebRTC 教程

VueJS 教程

VueJS 教程

数据库教程

SQL 教程

SQL 教程

MySQL 教程

MySQL 教程

MongoDB 教程

MongoDB 教程

PostgreSQL 教程

PostgreSQL 教程

SQLite 教程

SQLite 教程

Redis 教程

Redis 教程

MariaDB 教程

MariaDB 教程

图形图像教程

Vulkan 教程

Vulkan 教程

OpenCV 教程

OpenCV 教程

大数据教程

R语言教程

R语言教程

开发工具教程

Git 教程

Git 教程

VSCode 教程

VSCode 教程

Docker 教程

Docker 教程

Gerrit 教程

Gerrit 教程

Excel 教程

Excel 教程

计算机教程

Go语言教程

Go语言教程

C++ 教程

C++ 教程

Scrapy 基本概念

回顶
回顶部