煎蛋网妹子图爬虫

[Python爬虫]煎蛋OOXX妹子爬虫(1)——解密片地址 之前在鱼C论坛的时候,看到很多人都在用Python写爬虫煎蛋妹子,当时我也写过,爬了很多的妹子片。后来煎蛋妹子页改进了,对片的地址进行了加密,所以论坛里面的人经常有人问怎么请求的页面没有链接。这篇文章就来说一下煎蛋OOXX妹子的链接获取方式。 首先说明一下,之前煎蛋之所以增加了反爬虫机制,应该就是因为有太多的人去爬他们的站了。爬虫频繁的访问站会给站带来压力,所以,... 阅读详情
自从开了自己的站点,就好久没来写过CSDN的博客了。维护自己那个站点的功夫确实也画的比较多,所以这里也就没怎么更新了。
由于自己也是大四了,需要考雅思出国,能留给自己兴趣爱好的时间就更加的少了。现在雅思也考完了,学校的水课还没有开始考,处于这种大四退休生活中的我终于又有时间来写博客了。
#coding:utf8
import os, sys
import md5
import time, random
import requests
import urllib, urllib2
from termcolor import colored
import multiprocessing
from bs4 import BeautifulSoup

def for_one_page_test( url ):

    #opener = urllib2.build_opener(urllib2.ProxyHandler({'http':'218.244.149.184:8888'}), urllib2.HTTPHandler(debuglevel=1))
    #urllib2.install_opener(opener)

    #opener = urllib2.build_opener(urllib2.ProxyHandler({'http':'80.242.171.35:8888'}), urllib2.HTTPHandler(debuglevel=1))
    #urllib2.install_opener(opener)

    UA = "Mozilla/"+ str(random.randint(10, 100))  +".0 (Windows; U; Windows NT 5.1; zh-CN; rv:1.9.1) Gecko/20090625 Firefox/3.5"
    print UA

    i_headers = {"User-Agent": "Mozilla/8.0 (Windows; U; Windows NT 5.1; zh-CN; rv:1.9.1) Gecko/20090624 Firefox/3.5","Referer": 'http://jiandan.net'}
        req = urllib2.Request(url, headers=i_headers)
    html = urllib2.urlopen(req).read()
    print colored( html , 'blue')
    soup = BeautifulSoup(html)

    for img_address in soup.find_all('a'):
        if ( isinstance(img_address.get('class'), (list,str) ) and img_address.get('class')[0] == "view_img_link" ):
            try:            
                img_url = img_address.get('href')
                                print colored( img_url[2:] , 'green')
                image_downlode( img_url )

                        except Exception, e:  
                                print Exception, ":", e


def image_downlode( url ):
        img = requests.get( 'http://' + url[2:] )
        name = get_name(url) + '.' + url[-3:] 
    try:
        open('/home/elfsong/image/'+name,'wb').write(img._content)
        print ( name + " done!")
    except Exception, e:
                print Exception, ":", e
        print ( name + " flased!")
    pass

def get_name( url ):
    m = md5.new()
    m.update( url )
    return m.hexdigest()


if __name__ == "__main__":
    start = *起始爬取页码*
    end = *结尾爬取页码*        
    pool = multiprocessing.Pool(processes = *使用进程数量*)

    btime = time.time()

    for page in range(start,end+1):
        url = "http://jandan.net/ooxx/page-" + str(page)
        pool.apply_async(for_one_page_test, (url, ) )

    pool.close()
    pool.join()

    etime = time.time()

    print (etime - btime)
然后我一行代码都没改去测试了一下代码,发现这个脚本居然还可以完整运行,也是对煎蛋网的Anti-spider策略没话说。
由于爬虫属于对抗性编码,所以我自己一直认为还是一切从简比较好。之前很喜欢用Selenium+PhantomJS的组合来写爬虫的,这样确实功能强大,但很多时候都是一些华而不实的功能,再加上这两套方案根本不是一个数量级的,所以复杂的方案我觉得能不用还是尽量不要用比较好。
BTW,我给Urllib加了两个Opener,都是高匿代理。如果被Anti-spider盯上了,可以挂上Opener。这两个代理我也是从网上找的,对其可靠性和安全性都不负责。大家有需要的话也可以去万能的度娘那里找。
Python爬虫煎蛋妹子爬虫,解密片链接加密方式 之前在鱼C论坛的时候,看到很多人都在用Python写爬虫煎蛋妹子,当时我也写过,爬了很多的妹子片。后来煎蛋妹子页改进了,对片的地址进行了加密,所以论坛里面的人经常有人问怎么请求的页面没有链接。这篇文章就来说一下煎蛋OOXX妹子的链接获取方式。 首先说明一下,之前煎蛋之所以增加了反爬虫机制,应该就是因为有太多的人去爬他们的站了。爬虫频繁的访问站会给站带来压力,所以... 阅读详情

相关推荐

python 爬虫爬取煎蛋妹子,我1T的硬盘装满了!

前言 大家好,这里是「brucepk」爬虫 系列教程。此系列教程以实例项目为材料进行分析,从项目中学习 python 爬虫,跟着我一起学习,每天进步一点点。 煎蛋站 image 很多朋友都反应学 python 语言太枯燥,学不进去,其实学语言最好的方法是自己用所学的语言做项目,在项目中学习语言的用法。今天给大家带来的项目是用 python3 爬取煎蛋妹子片。片质量还不错,我放...

weixin_42500431的博客 1309

mzitu_win_爬虫python_爬虫_python爬取片_mzitu片_python爬虫_

Python实现爬取片的爬虫脚本,可以当做参考

python项目之 爬虫爬取煎蛋jandan的妹子-上

python项目之 爬虫爬取煎蛋jandan的妹子-上抓取妹子练练手。url格式 http://jandan.net/ooxx/page-1777#comment 只需改变页码1777即可 分析页面源码发现妹子有两个一个是缩略<img src="http://ww1.sinaimg.cn/mw600/4bf31e43jw1f09htnzkh5j20dw0kumz0.jpg" /

To be better 1万+

Python爬虫学习(六)爬取mzitu

通过发出GET请求,通过接收html页面,通过xpath获取我们需要的a标签,再次通过访问这个片链接,获取资源,通过IO写入文件,通过for循环增加URL页码数来循环获取。

DreamsArchitects的博客 1532

python爬mzitu_[Python]爬取mzitu

1 importio2 importos3 importre4 importsys5 importdatetime6 from bs4 importBeautifulSoup7 from pxydowwload importrequest8 from pymongo importMongoClient910 sys.stdout = io.TextIOWrapper(sys.stdout.buff...

weixin_39545895的博客 6086

探索Mzitu-Crawler:一款强大的爬虫项目

探索Mzitu-Crawler:一款强大的爬虫项目 是一个开源的Python项目,专注于抓取和下载络上的美资源,特别是自MZITU站上的片。对于那些需要批量获取像的开发者或者数据爱好者来说,这是一个非常实用的工具。 技术分析 Mzitu-Crawler的核心是基于Python的爬虫框架Scrapy。Scrapy是一个强大且灵活的爬虫框架,支持异步处理,可以高效地处理大量的HT...

gitblog_00088的博客 719

静态站生成器:Mzitu Scrapy - 美爬虫的魅力

静态站生成器:Mzitu Scrapy - 美爬虫的魅力 去发现同类优质开源项目:https://gitcode.com/ 项目简介 是一个基于 Python 的爬虫项目,专门用于抓取 Mzitu 站上的美女片和相关信息,并将其转换为静态 HTML 页。这个项目不仅展示了 Python 在数据抓取和处理方面的强大能力,还提供了一个现成的解决方案,让喜欢收藏或研究片数据的用户可以直接...

gitblog_00073的博客 746

python爬虫 煎蛋妹子 动态爬虫1

                                                                                                                      ——————来自某潮汕人的菜鸟教程    爬虫目标站:http://jandan.net/ooxx    爬虫目标中文名称:煎蛋 妹子    爬虫需求:分析j...

ycj10分钟入门 4598

Python爬虫 煎蛋全站妹子爬虫

爬取流程 从煎蛋妹子第一页开始抓取; 爬取分页标签获得最后一页数字; 根据最后一页页数,获得所有页URL; 迭代所有页,对页面所有妹子url进行抓取;访问URL并且保存片到文件夹。 开始 通过上一篇文章的爬取过程,我们基本上理解了抓取一个站的大致流程。因为一个站虽然有很多页,但是大部分站每一页的HTML标签内容都是相同的。我们只要获取到一页的内容,就可以获得所有页的内...

qq_40417296的博客 5946

煎蛋妹子爬虫(requests库实现)

煎蛋妹子爬虫(requests库实现) 文章目录煎蛋妹子爬虫(requests库实现)一、前言环境配置二、完整代码 一、前言 说到煎蛋爬虫,相比很多人都写过,我这里试着用request库简单的完成,爬取煎蛋妹子并保存到本地,直接上爬取效果。 环境配置 1、requests库 2、BeautifulSoup库 3、os库 二、完整代码 import requests from bs...

Paramete的博客 1180

爬虫煎蛋妹子 大爬哦

今天为了测试一下urllib2模块中的headers部分,也就是模拟客户端登陆的那个东东,就对煎蛋妹子练了一下手,感觉还可以吧。分享一下! 代码如下 # coding:UTF-8 import urllib2,urllib,re,random def getHtml(url) : request = urll...

weixin_34001430的博客 446

Python爬虫之爬取煎蛋妹子

这篇文章通过简单的Python爬虫(未使用框架,仅供娱乐)获取并下载煎蛋妹子指定页面或全部片,并将片下载到磁盘。 首先导入模块:urllib.request、re、os import urllib.request import re import os urllib.request模块用于获取HTML页面数据 re模块用于通过正则表达式解析并截取HTML页面片u...

weixin_34049948的博客 194

Python爬虫(6):煎蛋全站妹子爬虫

Python爬虫(6):煎蛋全站妹子爬虫上一篇文章中我们抓取了豆瓣书的数据,如果大家运行成功,并且看到文件夹下的 txt 文件了。是不是有一种刚接触编程,第一次输出Hello world!时的欣喜。和上一篇实践不同,我们这一次来爬取 煎蛋 全站妹子,并且保存到指定文件夹下。爬取流程从煎蛋妹子第一页开始抓取;爬取分页标签获得最后一页数字;根据最后一页页数,获得所有页URL;迭代所有页,...

hzp666的博客 1万+

Python3抓取煎蛋妹子

闲来无事,从煎蛋妹子抓取所有片并保存。ps:900页之前片都看不到了,所以只能抓900页之后的 #coding=utf-8 import httplib2,re,random,os urls=[] imgUrls=[] h = httplib2.Http(".cache") reg=r'img src="(http.*?gif)" />' imgre = re.comp

xingya771的专栏 1302

[Python 爬虫]煎蛋 OOXX 妹子爬虫(1)——解密片地址

之前在鱼C论坛的时候,看到很多人都在用 Python 写爬虫煎蛋妹子,当时我也写过,爬了很多的妹子片。后来煎蛋妹子页改进了,对片的地址进行了加密,所以论坛里面的人经常有人问怎么请求的页面没有链接。这篇文章就来说一下煎蛋 OOXX 妹子的链接获取方式。首先说明一下,之前煎蛋之所以增加了反爬虫机制,应该就是因为有太多的人去爬他们的站了。爬虫频繁的访问站会给站带来压力,...

husongbo的博客 3万+

手把手教你用Python爬虫煎蛋妹纸海量

我们的目标是 用爬虫来干一件略污事情 最近听说煎蛋上有好多可爱的妹子,而且爬虫妹子抓起练手最好,毕竟动力大嘛。而且现在络上的妹子很黄很暴力,一下接受太多容易营养不量,但是本着有人身体就比较好的套路,特意分享下用点简单的技术去获取资源。 以后如果有机会,再给大家说说日本爱情动(大)作(雾)片的种子搜索爬取,多多关注。 请先准备作案工具

bigsec的博客 1860

python 爬虫爬取煎蛋妹子

python 爬虫爬取煎蛋妹子 前言 大家好,这里是「brucepk」爬虫 系列教程。此文首发于「brucepk」公众号,欢迎大家去关注。此系列教程以实例项目为材料进行分析,从项目中学习 python 爬虫,跟着我一起学习,每天进步一点点。 煎蛋煎蛋.png 很多朋友都反应学 python 语言太枯燥,学不进去,其实学语言最好的方法是自己用所学的语言...

ding740101的博客 365

爬取煎蛋妹子

import requests import bs4 import base64 import urllib.request num_photo = 1 def download_photo(url , num ): global num_photo response = urllib.request.urlopen(url) cat = response.read() with ...

大梦小半 2067
上一篇: 关于JQuery Moblie多选表单提交时PHP接收的处理方法
spirtsong
博客等级 码龄15年 8粉丝 64原创
评论
添加红包

请填写红包祝福语或标题

红包个数最小为10个

红包金额最低5元

当前余额3.43前往充值 >
需支付:10.00
成就一亿技术人!
领取后你会自动成为博主和红包主的粉丝 规则
hope_wisdom
发出的红包
实付
使用余额支付
点击重新获取
扫码支付
钱包余额 0

抵扣说明:

1.余额是钱包充值的虚拟货币,按照1:1的比例进行支付金额的抵扣。
2.余额无法直接购买下载,可以购买VIP、付费专栏及课程。

余额充值