# -*- coding: utf-8 -*-
__author__ = 'YangShengjie'
import urllib
url = "http://blog.sina.com.cn/s/blog_4701280b0100h3c8.html"#下载文章:前扑后继
#之所以选择这篇文章是因为其网页结构的特殊性,中间嵌套了视频
conn = urllib.urlopen(url).read() #读取网页
#print conn
s1 = conn.find(r'<div id="sina_keyword_ad_area2') #将文章内容所在区域化块
t1 = conn.find(r'</div>',s1) #运用相对位置
conn1 = conn[s1:t1]
#print conn1
s = conn1.find(r'<p STYLE') #缩小文章内容所在区域,在上一个获取的文章块内再次化快
t = conn1.find(r'</P>',s)
conn2= conn1[s +29 :t] #获取首段内容,其结构较特殊,不能加入循环
#print conn2
content = " "
while s !=-1 and t !=-1: # 控制爬取的范围
content = content +'\n'+ conn2 #将文章连在一块,每一段之间用换行标示
s = conn1.find(r'<p STYLE',t)
t = conn1.find(r'</P>',s)
conn2= conn1[s+45:t] #不同于首段的29
else:
print content #输出文章内容
#下载文章
filename = url[26:]
open(filename,'w').write(content)
相关推荐
Python 爬虫实战:新浪博客内容爬取(登录认证 + 文章结构化解析)
在信息爆炸的时代,博客成为了人们分享知识、记录生活的重要平台。新浪博客作为国内知名的博客平台之一,拥有海量的优质内容。通过 Python 爬虫技术,我们可以高效地抓取新浪博客的文章数据,实现内容的结构化解析,为后续的数据分析、内容推荐等应用提供基础支持。本文将深入浅出地讲解如何构建一个完整的新浪博客内容爬取系统,涵盖登录认证、文章抓取、结构化解析等关键步骤。
[Python爬虫] 简单网络爬虫抓取博客文章及思想介绍
前面一直强调Python运用到网络爬虫方面非常有效,这篇文章也是结合学习的Python视频知识及我研究生数据挖掘方向的知识.从而简单介绍下Python是如何爬去网络数据的,文章知识非常简单,但是也分享给大家,就当简单入门吧!同时只分享知识,希望大家不要去做破坏网络的知识或侵犯别人的原创型文章.主要介绍了如何手动爬取新浪播客和CSDN博客的思想和方法.如果有错误或不足之处,请海涵!
Python 爬虫爬取指定博客的所有文章
自上一篇文章 Z Story : Using Django with GAE Python 后台抓取多个网站的页面全文 后,大体的进度如下: 1.增加了Cron: 用来告诉程序每隔30分钟 让一个task 醒来, 跑到指定的那几个博客上去爬取最新的更新 2.用google 的 Datastore 来存贮每次爬虫爬下来的内容。。只存贮新的内容。。 就像上次说的那样,这样以来 性能有了大幅度的提高: 原来的每次请求后, 爬虫才被唤醒 所以要花大约17秒的时间才能从后台输出到前台而现在只需要2秒不到 3.对爬虫进行了优化 1. Cron.yaml 来安排每个程序醒来的时间 经过翻文档, 问问题终于弄
python爬取一个博主的所有文章至pdf
Step 1: 安装pdfkit包: https://blog.csdn.net/qq_35865125/article/details/109920565 Step 2: 将单篇文章爬取下来转成pdf。 首先,根据文章的网址得到该网页的所有内容(借助urllib,bs4,re模块),然后,从中截取文章主题部分,因为网页内容包括评论区等太多东西。 最后将主题部分转成pdf。 例子: 可以运行: import pdfkit import os import urllib.requ...
python requests爬虫——爬取李开复博客信息(包括javascript部分信息)
今天是国庆假期第二天,已经玩了一天了,今天整理一下前两天写的数据分析作业思路,给实验报告打一下底稿。供对爬虫有兴趣的小伙伴们参考,也希望给实验没完成的同学提供一点小小的帮助。 任务要求。 1)分析页面结构,确定待抓取的数据项,至少应抓取文章标题、发表时间、正文内容、文章URL等,可以根据选择的抓取目标的内容特点增加额外的数据项。(如抓取新浪博客时可以额外抓取标签、分类、阅读数、评论数等数据项),新闻类可以额外抓取作者、新闻来源等数据项。 注意:标签、分类都是数组,应按...
【零基础入门】python爬虫-爬取博客园博客信息(含源码)
item['title'] = response.xpath('//a[@class="titlelnk"]/text()').extract() #使用xpath搜索。基于python语言开发、scrapy框架实现的博客园首页博客爬取项目。运行main.py,程序会自动生成一个cnblog.txt的文件,里面就是我们爬取下来的内容了。title = scrapy.Field() #定义爬取的标题。link = scrapy.Field() #定义爬取的连接。2、定义爬取的内容、标题。
Python爬虫教程:入门爬取网页数据
本文简单介绍了爬虫的基础知识以及需要用的库和方法,并做了非常简单的示例。总地来说,爬虫就是模拟网络请求,并解析、提取出我们想要的数据。爬虫可以帮助我们更快地获取网站上的数据,为工作和生活带来诸多便利。当然,也希望在学习 python 爬虫的过程中,大家能够更好的理解和应用 python的语法。
python爬取csdn的博客内容
首先说明爬虫的大体结构可以通用,不过针对字符串的匹配是不能通用的,比如你用爬取csdn的代码想去爬取博客园就是不行的了,因为爬取的字符是根据对应的html内容设置的。 使用python构建爬虫程序有一个简单的套路,我总结为3步走: 1.re.compile设置查找的字符串样式 2.page = urllib.urlopen打开网页,page.read读取网页内容 3.re.search/r
python爬虫爬取csdn博客专家所有博客内容
python爬虫爬取csdn博客专家所有博客内容: 全部过程采取自动识别与抓取,抓取结果是将一个博主的所有 文章存放在以其名字命名的文件内,代码如下 #coding:utf-8 import urllib2 from bs4 import BeautifulSoup import os import re #import sys #reload(...
python爬虫教程:基于python框架Scrapy爬取自己的博客内容过程详解
前言 python中常用的写爬虫的库常有urllib2、requests,对于大多数比较简单的场景或者以学习为目的,可以用这两个库实现。这里有一篇我之前写过的用urllib2+BeautifulSoup做的一个抓取百度音乐热门歌曲的例子,有兴趣可以看一下。 本文介绍用Scrapy抓取我在博客园的博客列表,只抓取博客名称、发布日期、阅读量和评论量这四个简单的字段,以求用较简单的示例说明Scrapy的...
基于python框架Scrapy爬取自己的博客内容过程详解
这篇文章主要介绍了基于python框架Scrapy爬取自己的博客内容过程详解,文中通过示例代码介绍的非常详细,对大家的学习或者工作具有一定的参考学习价值,需要的朋友可以参考下 前言 python中常用的写爬虫的库常有urllib2、requests,对于大多数比较简单的场景或者以学习为目的,可以用这两个库实现。这里有一篇我之前写过的用urllib2+BeautifulSoup做的一个抓取百度音乐热...
python爬取CSDN博客内容为html到本地
系统环境: ubuntu16.04 python环境:3.6 默认保存在用户目录下的 Document下 import re import urllib.request from bs4 import BeautifulSoup def trim(s): if s.startswith(' ') or s.endswith(' '): return re.s...
Python Scrapy批量爬取CSDN博客内容
今天忽然想着爬一下之前写的所有博客的内容,也是巩固练习一下scrapy,目标定位,爬取标题,url与内容: 采用 scrapy genspider -t crawl 命令创建爬虫,之后在爬虫文件中进行修改,主代码很简单: # -*- coding: utf-8 -*- import scrapy from scrapy.linkextractors import LinkExtractor fro...
Python爬虫入门教程!手把手教会你爬取网页数据
其实在当今社会,网络上充斥着大量有用的数据,我们只需要耐心的观察,再加上一些技术手段,就可以获取到大量的有价值数据。这里的“技术手段”就是网络爬虫。今天就给大家分享一篇爬虫基础知识和入门教程:
Python爬虫入门教程!手把手教会你爬取网页数据,不信你学不会
其实在当今社会,网络上充斥着大量有用的数据,我们只需要耐心的观察,再加上一些技术手段,就可以获取到大量的有价值数据。这里的“技术手段”就是网络爬虫。
文本内容获取-python爬虫
本文通过python工具,对网页信息进行爬取下载python工具下载安装: 库安装:方法1:使用requests库 1、代码解析如下:2、应用案例 输入如下结果: 3、故障收集 故障1:报如下error 解决办法:将.py名字修改成不以requests命名。方法1:使用pandas库 1、代码解析如下:2、应用案例........................................................................
想要高效爬取数据?五种Python爬虫方式全解析!
本文将介绍五种常见的爬虫方式,分别是:基于 Python 的 Requests 库、基于 Python 的 Scrapy 框架、基于 Node.js 的 Express 框架、基于 Node.js 的 Cheerio 库和基于 Java 的 WebMagic 框架。当我学到一定基础,有自己的理解能力的时候,会去阅读一些前辈整理的书籍或者手写的笔记资料,这些笔记详细记载了他们对一些技术点的理解,这些理解是比较独到,可以学到不一样的思路。此外,Scrapy 的文档和社区支持相对较弱,这也是需要考虑的一个因素。
如何用Python爬取网站数据:基础教程与实战
网站数据爬取是通过编写程序自动抓取网页内容的技术,通常用于从公开网站中提取特定数据。收集商品价格和评论数据新闻文章爬取社交媒体信息分析金融数据的实时跟踪爬取数据时,通常会先获取网页的HTML源代码,然后解析其中的内容,从中提取需要的信息。本文介绍了如何使用Python爬取网站数据的基础知识和实战示例。通过requests获取网页内容,使用解析网页,最终提取出我们关心的数据并保存到CSV文件中。通过这个流程,你可以轻松上手并定制化爬取你感兴趣的网站数据。
1375




被折叠的 条评论
为什么被折叠?



