python爬取有妖气漫画

手把手教你搭建一个漫画小说网站?(有斗罗大陆和斗破苍穹漫画的福利哦) 由于《斗罗大陆》和《斗破苍穹》动漫的热播,让我深深沉迷其中,因为动画更新的太慢了,搞得我只能去找小说,找漫画去过瘾,来来回回也刷了不少遍了。 在这个过程中,由于热爱,我甚至把他们的漫画全都下载了下来,想随时随地的看,啊哈哈哈哈哈哈哈哈嗝 然后下载下来图片,在电脑上一张一张翻着看并不方便,所以便萌生了自己搭建一个小说网站的想法,真正的在手机上随时随地的看。 如何搭建一个漫画小说网站? PS:小说和漫画都有版权,本文主要交流技术,请勿用做商用盈利 ... 阅读详情

爬取URL=https://www.u17.com/chapter/26636.html#image_id=221085
爬取有妖气漫画,本人谷歌浏览器获取到的信息:
位置selector:#cur_img_221085
属性位置:tc > comic_read_img 盒子下

开始爬取

url='https://www.u17.com/chapter/26636.html#image_id=221085'
resp=requests.get(url)
print(resp.text)

发现并没有img图片,重新摸索浏览器信息,在加载HTML页面是JS部分声明img列表;由此可判断该部分img图片由js动态生成。
原因:requests爬取静态HTML文内容在这里插入图片描述在这里插入图片描述
当然动态加载的网页自然也有办法爬取
准备:
pip install selenium
下载PhantomJS
下载地址:https://phantomjs.org/download.html
或http://npm.taobao.org/dist/phantomjs/
环境变量path加入phantomjs/bin即可
在这里插入图片描述

import requests
from bs4 import BeautifulSoup
from selenium import webdriver
pic_list=[]
url='https://www.u17.com/chapter/929918.shtml#image_id=8108355'
driver=webdriver.PhantomJS(executable_path='D:/Program Files (x86)/phantomjs-2.1.1-windows/bin/phantomjs.exe')
driver.get(url)
soup=BeautifulSoup(driver.page_source,'html.parser')
result=soup.find_all('img',class_='image_cache loading')
for img_src in result:
    if img_src['data-src'] not in pic_list:
        pic_list.append(img_src['data-src'])
head={'User-Agent':'Mozilla/5.0 (iPhone; CPU iPhone OS 13_2_3 like Mac OS X) AppleWebKit/605.1.15 (KHTML, like Gecko) Version/13.0.3 Mobile/15E148 Safari/604.1',
      'Connection':'keep-alive'}
for img_src in pic_list:
    count=1
    resp=requests.get(img_src)
    f=open('Z-H-J-'+count+'.jpg','wb')
    f.write(resp.content)
    count=count+1

如果出现以下信息,请忽略,只是因为目前的Selenium版本放弃 PhantomJS,但不影响程序运行

UserWarning: Selenium support for PhantomJS has been deprecated, please use headless versions of Chrome or Firefox instead
  warnings.warn('Selenium support for PhantomJS has been deprecated, please use headless '

结果爬取到的图片,像素化的图片有待结果…
在这里插入图片描述

MDPI期刊投稿全流程解析:从注册到提交的实用指南 本文详细解析了向MDPI期刊投稿的全过程,从注册账号、完善个人资料、上传稿件,到填写作者信息、推荐审稿人及提交附信等关键步骤。指南强调了使用机构邮箱、遵循期刊模板、认真准备Cover Letter等实用技巧,旨在帮助作者高效、规范地完成投稿,避免常见错误,提升稿件处理效率。 阅读详情

相关推荐

【STM32】STM32F407实现简单的Modbus协议

1.ModBus协议简介 MODBUS协议是一种串行通信协议,由Modicon公司(施耐德公司前身)发表,由于其公开发表且无版权要求,易于部署和维护,在工业界广泛应用。MODBUS采用主从通信(Master/Slave),MODBUS有三种报文格式:ASCII、RTU、TCP,本文主要讨论RTU。 如下图所示,串行通信上的MODBUS协议主要由地址,功能码,数据,CRC校验四部分数据帧构成。主机和从机的串行通信设备要求一致,参数要求一致,即假设使用串口,主从机波特率,奇偶校验...

BadBoyHolly的博客 8158

comic_downloader_v0.1.1.exe

在学习python过程中,写了一个在线漫画自动下载工具,用于收藏自己喜爱的漫画!仅供学习交流使用。有问题可以访问github

18comic

18漫画

2021-07-16

import io import sys import urllib.request as req import bs4 import re import PIL.Image import time import random from PIL import Image import urllib import os import requests from fake_useragent import UserAgent from multiprocessing import Pool import mu

qq_52895917的博客 2万+

因提供18禁动漫,毒害未成年人,国内最大动漫网站被重罚

作为二次元 动漫迷们必备的在线观看漫画工具,那么“动漫之家”肯定是每个人必入坑之一,毕竟它的上线时间也是于2005年的时候。 最早一批的动漫网站,很早二次元喜欢的人,就在里面进行打卡分享番在这网站里的,也有业余大佬汉化组为网站发电提供内容! 主要吧之前市场的管理制度不算严格,所有漫画没有按照进行审核删减,都是各种类型的漫画因有尽有,然而随后人们版权意识提高,所以各种盗版以及内容是否符合核心价值观也是人们所聊到的话题! 网上能依稀看到2013年央视点名批评进击巨人,除了点名批评外,在2015年6月8日。

欢迎关注公众号:【码农突围】,公号后台回复9999,可以获取一份500页的LeetCode刷题笔记。 136万+

python爬取下载有妖气漫画网站免费漫画

首先获取所有免费漫画的信息 进入开发者模式,由于漫画是采取异步访问的方式,我们直接点击XHR,查看里面的list,可以获得所有漫画的信息 我们尝试在网页访问里面的Headers里面的URL, 得到 显然,网页采取了反爬虫机制,这边我们要设置代理,伪装成浏览器去访问,这边要添加一些头部信息 代码如下: headers = { "Request Method": "POST",...

weixin_42478037的博客 10万+

(鬼刀)记一次异步加载Python爬虫分析

@[TOC]一次异步加载爬虫尝试记录 一次想看《鬼刀》,上有妖气看发现不能保存图片,刚好开始学爬虫,我为什么不试着把它爬下来呢? selenium尝试 第一步当然是F12看网页源码啦 很轻松的找到我要的图片链接,接下来只要把链接提取出来就完成啦,看起来很简单嘛,搞起! 先把网页源码爬下来。 import urllib import requests from bs4 import BeautifulSoup #网页解析~获取数据 url="https://www.u17.com/chapter/26

weixin_44443377的博客 7626

Python爬虫获取B站漫画

的请求输入是之前GetImageIndex...得到的/bfs/manga........jpg’添加一些字符串,如上图所示。

m0_59092412的博客 3898

python爬虫 爬取漫画网站

-- coding: UTF-8 -- import requests import re from bs4 import BeautifulSoup import lxml from lxml import etree from fake_useragent import UserAgent import time import os import random from multiproces...

yjx199407061301的博客 2013

完整的scrapy爬虫(爬取有妖气》榜单前三十的所有漫画最近两天的所有评论(动态界面))

# -*- coding: utf-8 -*- ''' @author Mrpora ''' import json import os import sys from ipindex_spider_py.utils.MongoHandler import MongoHandler from ipindex_spider_py.items.Ip.baseCaAuthorItem import B...

qq_37858326的博客 1533

爬虫第二战,beautifulsoup小例

额。。这个标题着实难到我这个英文很烂的人了,毕竟在验证bs的时候有着四个单词写错俩的战绩,不过想要真的成为一只程序熊,阴雨(英语)很烂可是不行的。进入正题。    如果有在bs安装的时候遇见问题的小伙伴可以去看之前的博客,虽然很烂,,只希望能稍微帮上一丢丢。bs在某些方面是要优于正则的,比如它是通过标签对问题进行获取分析的,直观上看起来会比较简单,但,有些时候单靠bs是获取不到有些内容的佐以正则

菜鸟程序熊的博客 1184

Python爬虫

真正的商用爬虫是非常复杂的,比如谷歌的爬虫,首先因为数据量太大要采用分布式系统,其次还需要维护已爬的网址集合,再次要进行网页内容是否重复的判断,还要遵守各个网站的要求,爬虫本身还需要具有相当好的稳定性和抗干扰能力。这些内容都不包含在本文章中,这里将介绍的爬虫非常简单,我们最后会写一个能将漫画《十万个冷笑话》爬取到本地的爬虫。 我们会用到两个第三方模块,requests和beautiful

ekkie的博客 882

Python爬虫----爬取腾讯动漫全站漫画

目标网站:https://ac.qq.com/ 实现功能:下载全部漫画到本地文件夹中 实现代码: import requests from lxml import etree from selenium import webdriver from time import sleep from bs4 import BeautifulSoup from selenium.webdriver.chro...

hjmscanf的博客 3032

基于Html+Css+javascript的动漫网站

1.前端三门技术 学习Web前端技术需要掌握三门基本技术:HTML,CSS,JavaScript: HTML:HTML是网页内容的载体。内容就是网页制作者放在页面上想要用户浏览的信息,可以包含文件、图片、视频等 CSS:CSS样式是表现,就像网页的外衣比字体、颜色变化等 JavaScript:JavaScript用来实现网页上的特效效果。比如鼠标滑过弹出下拉菜单、鼠标滑过北京颜色改变等 本次项目主要是介绍海贼王主题的简介,使用html+css+javascript来制作网站,实现项目的效果; index.h

weixin_46820017的博客 3万+

【亲测免费】 探索漫画世界的新宝藏:18漫画资源文件下载

探索漫画世界的新宝藏:18漫画资源文件下载 去发现同类优质开源项目:https://gitcode.com/ 项目介绍 在数字化的今天,漫画作为一种深受大众喜爱的娱乐形式,其便捷性和多样性使得越来越多的人选择在线阅读。为了满足广大漫画爱好者的需求,我们推出了“18漫画资源文件下载”项目。这个项目提供了一个名为“18漫画”的资源文件,其中包含了丰富的漫画内容,适合所有热爱漫画的用户使用。 项目技术分...

gitblog_09811的博客 5069

Haec fortis sequitur illam indocti possident: A linguistic analysis of demonstratives in genres【翻译】

Acknowledgments I am forever indebted to the ceaseless effort of my advisor, Dr. Eric Acton, who accepted me as an advisee though I had never been his student and had, in fact, not been anyone's stude...

hongfu951的专栏 1007

国外类似VeryCD的emule下载网站网址大全

<br />4. CDMSShare http://www.cdmsshare.org/ <br /><br /><br /><br />5. Descargatorrent http://descargatorrent.webcindario.com/ <br /><br /><br /><br />6. eChule.NET http://www.echule.net/ <br /><br /><br /><br />7. EliteFreak http://www.elitefreak.net/ <b

Kevin的专栏 1万+

python为在线漫画网站自制非官方API(未完待续)

接下来将记录我一步一步写一个非官方API的过程,因为一些条件的约束,最后的成品可能很粗暴简陋 现在介绍要准备的所有工具: 系统:ubuntu 14.04 语言:python 2.7 需要自行安装的库:flask,BeautifulSoup4,requests,selenium,pinyin,phantomjs-1.9.8 服务器:Sina App Engine 因为成本原因我选择了Si

阿友的专栏 1万+

动画动漫网址集锦持续更新

http://abowman.com/google-modules/ http://www.xiao-i.com/index.aspx http://comic.qq.com/a/20120321/000020.htm#p=41

crystalNB的专栏 1万+

盛名列车时刻表 2013.02.06

盛名时刻表是同类软件中最专业的一款铁路时刻表软件。 盛名时刻表的特色:1.票价更准确 -- 是首款能对特殊票价进行处理的列车时刻表软件!此类票价涉及到几百趟列车,如K407,K115,2272,T739等。2.信息更完整 -- 除正常开行的列车外,同时将包括临时列车时刻!3.更新更及时 -- 数据更新将随铁路运行图的调整及时更新! 4.数据更精确 -- 票价将随着上浮、下调作及时调整!特别是春运,票价会有所上浮、下浮,我们的时刻表将会及时调整!5.功能更专业 -- 票价完全根据实际列车编组显示,如某次只有硬座、软座,则显示硬座、软座票价,硬卧、软卧则不会显示。  可显示列车所有到站票价清单!具有在线升级功能等! 盛名时刻表的目标:做最专业的铁路列车时刻表!力争成为同类软件中票价计算最准确的,数据更新最及时的铁路列车时刻表软件。

上一篇: Scrapy爬取博人传漫画
下一篇: Django ORM 操作
 lOsEr
博客等级 码龄8年 1粉丝 9原创
评论
添加红包

请填写红包祝福语或标题

红包个数最小为10个

红包金额最低5元

当前余额3.43前往充值 >
需支付:10.00
成就一亿技术人!
领取后你会自动成为博主和红包主的粉丝 规则
hope_wisdom
发出的红包
实付
使用余额支付
点击重新获取
扫码支付
钱包余额 0

抵扣说明:

1.余额是钱包充值的虚拟货币,按照1:1的比例进行支付金额的抵扣。
2.余额无法直接购买下载,可以购买VIP、付费专栏及课程。

余额充值