久久99久久精品久久99综合,国产在线精品一区二区在线观看,国产精品亚洲欧美高清

人妖在线一区,国产日韩欧美一区二区综合在线,国产啪精品视频网站免费,欧美内射深插日本少妇

公司動態(tài)

產(chǎn)品資訊

行業(yè)資訊

輕云服務(wù)器升級CN2線路有什么優(yōu)點

在日常爬蟲練習(xí)中，我們爬取到的數(shù)據(jù)需要進行保存操作，在scrapy中我們可以使用ImagesPipeline這個類來進行相關(guān)操作，這個類是scrapy已經(jīng)封裝好的了，我們直接拿來用即可。

在使用ImagesPipeline下載圖片數(shù)據(jù)時，我們需要對其中的三個管道類方法進行重寫，其中 — get_media_request 是對圖片地址發(fā)起請求

— file path 是返回圖片名稱

— item_completed 返回item,將其返回給下一個即將被執(zhí)行的管道類

那具體代碼是什么樣的呢，首先我們需要在pipelines.py文件中，導(dǎo)入ImagesPipeline類，然后重寫上述所說的3個方法：

from scrapy.pipelines.images import ImagesPipeline
import  scrapy
import os
 
 
class ImgsPipLine(ImagesPipeline):
 def get_media_requests(self, item, info):
  yield scrapy.Request(url = item['img_src'],meta={'item':item})
 
 
 #返回圖片名稱即可
 def file_path(self, request, response=None, info=None):
  item = request.meta['item']
  print('########',item)
  filePath = item['img_name']
  return filePath
 
 def item_completed(self, results, item, info):
  return item

方法定義好后，我們需要在settings.py配置文件中進行設(shè)置，一個是指定圖片保存的位置IMAGES_STORE = 'D:\\ImgPro'，然后就是啟用“ImgsPipLine”管道，

ITEM_PIPELINES = {
'imgPro.pipelines.ImgsPipLine': 300,  #300代表優(yōu)先級，數(shù)字越小優(yōu)先級越高
}

設(shè)置完成后，我們運行程序后就可以看到“D:\\ImgPro”下保存成功的圖片。

完整代碼如下：

spider文件代碼：

# -*- coding: utf-8 -*-
import scrapy
from imgPro.items import ImgproItem
 
 
 
class ImgSpider(scrapy.Spider):
 name = 'img'
 allowed_domains = ['www.521609.com']
 start_urls = ['http://www.521609.com/daxuemeinv/']
 
 def parse(self, response):
  #解析圖片地址和圖片名稱
  li_list = response.xpath('//div[@class="index_img list_center"]/ul/li')
  for li in li_list:
item = ImgproItem()
item['img_src'] = 'http://www.521609.com/'  + li.xpath('./a[1]/img/@src').extract_first()
item['img_name'] = li.xpath('./a[1]/img/@alt').extract_first() + '.jpg'
# print('***********')
# print(item)
yield item

items.py文件

import scrapy
 
 
class ImgproItem(scrapy.Item):
 # define the fields for your item here like:
 # name = scrapy.Field()
 img_src = scrapy.Field()
 img_name = scrapy.Field()

pipelines.py文件

from scrapy.pipelines.images import ImagesPipeline
import  scrapy
import os
from  imgPro.settings import IMAGES_STORE as IMGS
 
class ImgsPipLine(ImagesPipeline):
 def get_media_requests(self, item, info):
  yield scrapy.Request(url = item['img_src'],meta={'item':item})
 
 
 #返回圖片名稱即可
 def file_path(self, request, response=None, info=None):
  item = request.meta['item']
  print('########',item)
  filePath = item['img_name']
  return filePath
 
 def item_completed(self, results, item, info):
  return item

settings.py文件

import random
BOT_NAME = 'imgPro'
 
SPIDER_MODULES = ['imgPro.spiders']
NEWSPIDER_MODULE = 'imgPro.spiders'
 
IMAGES_STORE = 'D:\\ImgPro'#文件保存路徑
LOG_LEVEL = "WARNING"
ROBOTSTXT_OBEY = False
#設(shè)置user-agent
USER_AGENTS_LIST = [
  "Mozilla/5.0 (Windows NT 6.1; WOW64) AppleWebKit/537.1 (KHTML, like Gecko) Chrome/22.0.1207.1 Safari/537.1",
  "Mozilla/5.0 (X11; CrOS i686 2268.111.0) AppleWebKit/536.11 (KHTML, like Gecko) Chrome/20.0.1132.57 Safari/536.11",
  "Mozilla/5.0 (Windows NT 6.1; WOW64) AppleWebKit/536.6 (KHTML, like Gecko) Chrome/20.0.1092.0 Safari/536.6",
  "Mozilla/5.0 (Windows NT 6.2) AppleWebKit/536.6 (KHTML, like Gecko) Chrome/20.0.1090.0 Safari/536.6",
  "Mozilla/5.0 (Windows NT 6.2; WOW64) AppleWebKit/537.1 (KHTML, like Gecko) Chrome/19.77.34.5 Safari/537.1",
  "Mozilla/5.0 (X11; Linux x86_64) AppleWebKit/536.5 (KHTML, like Gecko) Chrome/19.0.1084.9 Safari/536.5",
  "Mozilla/5.0 (Windows NT 6.0) AppleWebKit/536.5 (KHTML, like Gecko) Chrome/19.0.1084.36 Safari/536.5",
  "Mozilla/5.0 (Windows NT 6.1; WOW64) AppleWebKit/536.3 (KHTML, like Gecko) Chrome/19.0.1063.0 Safari/536.3",
  "Mozilla/5.0 (Windows NT 5.1) AppleWebKit/536.3 (KHTML, like Gecko) Chrome/19.0.1063.0 Safari/536.3",
  "Mozilla/5.0 (Macintosh; Intel Mac OS X 10_8_0) AppleWebKit/536.3 (KHTML, like Gecko) Chrome/19.0.1063.0 Safari/536.3",
  "Mozilla/5.0 (Windows NT 6.2) AppleWebKit/536.3 (KHTML, like Gecko) Chrome/19.0.1062.0 Safari/536.3",
  "Mozilla/5.0 (Windows NT 6.1; WOW64) AppleWebKit/536.3 (KHTML, like Gecko) Chrome/19.0.1062.0 Safari/536.3",
  "Mozilla/5.0 (Windows NT 6.2) AppleWebKit/536.3 (KHTML, like Gecko) Chrome/19.0.1061.1 Safari/536.3",
  "Mozilla/5.0 (Windows NT 6.1; WOW64) AppleWebKit/536.3 (KHTML, like Gecko) Chrome/19.0.1061.1 Safari/536.3",
  "Mozilla/5.0 (Windows NT 6.1) AppleWebKit/536.3 (KHTML, like Gecko) Chrome/19.0.1061.1 Safari/536.3",
  "Mozilla/5.0 (Windows NT 6.2) AppleWebKit/536.3 (KHTML, like Gecko) Chrome/19.0.1061.0 Safari/536.3",
  "Mozilla/5.0 (X11; Linux x86_64) AppleWebKit/535.24 (KHTML, like Gecko) Chrome/19.0.1055.1 Safari/535.24",
  "Mozilla/5.0 (Windows NT 6.2; WOW64) AppleWebKit/535.24 (KHTML, like Gecko) Chrome/19.0.1055.1 Safari/535.24"
 ]
USER_AGENT = random.choice(USER_AGENTS_LIST)
DEFAULT_REQUEST_HEADERS = {
 'Accept': 'text/html,application/xhtml+xml,application/xml;q=0.9,*/*;q=0.8',
 'Accept-Language': 'en',
# 'User-Agent':"Mozilla/5.0 (Windows NT 10.0; Win64; x64) AppleWebKit/537.36 (KHTML, like Gecko) Chrome/58.0.3029.110 Safari/537.36",
 'User-Agent':USER_AGENT
}
 
#啟動pipeline管道
ITEM_PIPELINES = {
'imgPro.pipelines.ImgsPipLine': 300,
}

以上即是使用ImagesPipeline下載保存圖片的方法，今天突生一個疑惑，爬蟲爬的好，真的是牢飯吃的飽嗎？還請各位大佬解答！更多相關(guān)Python scrapy下載保存內(nèi)容請搜索本站以前的文章或繼續(xù)瀏覽下面的相關(guān)文章希望大家以后多多支持本站！

香港服務(wù)器租用

版權(quán)聲明：本站文章來源標(biāo)注為YINGSOO的內(nèi)容版權(quán)均為本站所有，歡迎引用、轉(zhuǎn)載，請保持原文完整并注明來源及原文鏈接。禁止復(fù)制或仿造本網(wǎng)站，禁止在非www.sddonglingsh.com所屬的服務(wù)器上建立鏡像，否則將依法追究法律責(zé)任。本站部分內(nèi)容來源于網(wǎng)友推薦、互聯(lián)網(wǎng)收集整理而來，僅供學(xué)習(xí)參考，不代表本站立場，如有內(nèi)容涉嫌侵權(quán)，請聯(lián)系alex-e#qq.com處理。

相關(guān)文章

動態(tài)撥號：關(guān)鍵詞排名下降是啥緣故，快速提高排名怎樣做

排名優(yōu)化：網(wǎng)站排名優(yōu)化方法有什么，如何做有效果

老域名：怎樣才算老域名，老域名建站有什么影響

內(nèi)容優(yōu)化：關(guān)鍵字排名要做哪些方面的優(yōu)化，怎樣做

技巧：網(wǎng)站轉(zhuǎn)化率究竟是什么，有什么提升的技巧

一下吧：外貿(mào)站優(yōu)化有哪些基本的做法和注意事項

概要：競價推廣費用大概要多少呢，競價推廣好不好

一下吧：SEO中site是什么意思，作用和應(yīng)用是怎樣的

郵箱：付費郵箱有哪些優(yōu)勢，付費郵箱挑選要考慮什么

集群是什么意思：集群是什么意思，都有哪些優(yōu)勢呢