Python使用Scrapy爬取妹子图

2019-03-02 13:31:34浏览：692 来源：山村网

核心摘要：　　前面我们给大家介绍了使用nodejs来爬取妹纸图片的方法，下面我们来看下使用Python是如何实现的呢，有需要的小伙伴参考下吧。

　　前面我们给大家介绍了使用nodejs来爬取妹纸图片的方法，下面我们来看下使用Python是如何实现的呢，有需要的小伙伴参考下吧。

　　Python Scrapy爬虫，听说妹子图挺火，我整站爬取了，上周一共搞了大概8000多张图片。和大家分享一下。

　　核心爬虫代码

1 2 3 4 5 6 7 8 9 10 11 12 13 14 15 16 17 18 19 20 21 22 23 24 25 26 27 28 29 30 31 32 33 34 35 36 # -*- coding: utf-8 -*- from scrapy.selector import Selector import scrapy from scrapy.contrib.loader import ItemLoader, Identity from fun.items import MeizituItem class MeizituSpider(scrapy.Spider): name = "meizitu" allowed_domains = ["meizitu.com"] start_urls = ( 'http://www.meizitu.com/', ) def parse(self, response): sel = Selector(response) for link in sel.xpath('//h2/a/@href').extract(): request = scrapy.Request(link, callback=self.parse_item) yield request pages = sel.xpath("//div[@class='navigation']/div[@id='wp_page_numbers']/ul/li/a/@href").extract() print('pages: %s' % pages) if len(pages) > 2: page_link = pages[-2] page_link = page_link.replace('/a/', '') request = scrapy.Request('http://www.meizitu.com/a/%s' % page_link, callback=self.parse) yield request def parse_item(self, response): l = ItemLoader(item=MeizituItem(), response=response) l.add_xpath('name', '//h2/a/text()') l.add_xpath('tags', "//div[@id='maincontent']/div[@class='postmeta clearfix']/div[@class='metaRight']/p") l.add_xpath('image_urls', "//div[@id='picture']/p/img/@src", Identity()) l.add_value('url', response.url) return l.load_item()

　　以上所述就是本文的全部内容了，希望大家能够喜欢。

(责任编辑：豆豆)

打赏

免责声明

•: 本文仅代表作者个人观点，本站未对其内容进行核实，请读者仅做参考，如若文中涉及有违公德、触犯法律的内容，一经发现，立即删除，作者需自行承担相应责任。涉及到版权或其他问题，请及时联系我们 xfptx@outlook.com

• ja vasc ript 返回上一页及刷新页面的实现方法	• 兼容所有浏览器的设为首页收藏本站js代码
• WordPress用户注册无法接收邮件等相关问题的解	• VB中子分类技术的应用
• Java语言接口与继承的本质	• J2EE应用应遵循的几点原则
• JavaBeans 与 Ejb 的区别	• 使用Java程序连接各种数据库的方法介绍
• 编写一个JAVA的队列类	• 进程调度模拟程序

Python使用Scrapy爬取妹子图

Python基于smtplib实现异步发送邮件服务

Python实现统计单词出现的个数