# encoding: utf-8
import urllib
import urllib2
import cookielib
'''
许多网站资源获取需要用户登录,登录后再次访问就不需要再次输入账号密码等信息了。
那么这个功能网站是如何实现的呢?
一般的,用户登录之后,服务器会为该用户创建一个Session,Session相当于用户的私人档案,也可以等同于用户;
那么到底哪一次访问时输入该用户的呢?其实在登录的时候,浏览器存储了一个Session ID的Cookie值,每一次访问都带上该Cookie值,
服务器将Cookie值中的Session ID与服务器中的Session ID进行对比就可以得知请求访问资源的是哪一个用户了。
其中,urllib2对Cookie的处理是自动的,使用CookieJar函数进行Cookie的管理
如果需要得到某个Cookie项的值:
_______________________________________________________________________________________________
我们在调用urllib2.urlopen(url)的时候,其实urllib2在open函数内部创建了一个默认的opener对象;
然后调用opener.open()函数,但是默认的opener并不支持cookie。
那么我们需要先新建一个支持cookie的opener,比如通过urllib2中的HTTPCookieProcessor()。
创建HTTPCookieProcessor需要一个存放cookie的容器。
Python提供的存放cookie的容器位于cookielib,有以下几个。
CookieJar -> FileCookieJar -> MozillaCookieJar / LWPCookieJar
'''
cookie = cookielib.CookieJar()
opener = urllib2.build_opener(urllib2.HTTPCookieProcessor(cookie))
response = opener.open('http://zhihu.com')
html = response.read()
# print html
for item in cookie:
print item.name + ':' + item.value,相关推荐
Python 爬虫的预备知识(容器数据类型、函数、面向对象、模块介绍与安装、常用内置函数/常见类型的属性方法、文件读写)
1、函数的定义def funcname(arg1 , arg2 . . .) : 函数体 return something定义函数使用def这个关键词(Key Word)开头,之后空一格接函数名arg1,arg2,…argN是函数的参数(非必须),但即使函数没有参数,()也不可省略,任何传入参数和自变量必须放在圆括号中间。圆括号之间可以用于定义参数。
基于Docker容器的分布式爬虫的设计与实现.pdf
#资源达人分享计划#
Python编程基础教程:网络爬虫入门
作者:禅与计算机程序设计艺术 1.背景介绍 概念定义 网络爬虫(Web Crawling),也叫网页蜘蛛(web spider),它是一个自动化的工具,用来从互联网上抓取信息。按照程序运行逻辑,网络爬虫包括两个部分: 1、引擎(Scrapy/Sel
Python容器
列表内的每一个数据,称之为元素以 [] 作为标识列表内每一个元素之间用, 逗号隔开定义形式://结果可以容纳多个元素(上限为2**63-1、9223372036854775807个)可以容纳不同类型的元素(混装)数据是有序存储的(有下标序号)允许重复数据存在可以修改(增加或删除元素等)元组同列表一样,都是可以封装多个、不同类型的元素在内。但最大的不同点在于: 元组一旦定义完成,就不可修改所以,当我们需要在程序内封装数据,又不希望封装的数据被篡改,那么元组就非常合适了。
docker布置一个爬虫容器
启动一个爬虫程序,并就主机目录挂载到容器目录,保证容器销毁数据仍在
chrome容器化部署实战
本文是作者在selenium自动运维中的实战总结,一扫网上诸多不清晰的介绍文章
创建python新环境(容器)
创建python新环境 1)点击window开始菜单,找到Anaconda Prompt。 2)输入如下图所示的代码。
python cookies是什么_Python网络爬虫之Cookie技术(一)
原标题:Python网络爬虫之Cookie技术(一)当我们访问一个需要用户名和密码登录的网站(例如某宝)时,只要我们注册好并成功登录后,下次访问该网站时,网站就会记住我们的登录信息,而无需重新登录。我们都知道HTTP协议是无状态的,是不可能对用户名和密码进行记录的,那浏览器或者服务器是怎么做到的?其实,这里面就使用到了一种叫Cookie的技术。1 Cookie是什么?cookie 是指某些网站为了...
Python网络爬虫实战:爬取新闻网站新闻
正则表达式(Regular Expression)是一串由字符和特殊符号构成的字符串,它描述了一种字符串匹配的模式,用来检索、替换那些符合某个模式(规则)的文本。在Python中,正则表达式可以使用re模块进行处理。下面是一个简单的例子,展示了如何使用re模块来匹配特定模式的字符串:import re# 待搜索的字符串text = "今天天气不错,明天也不错。# 正则表达式,匹配“天”字后的字符pattern = r"天(后|上|下)"
《python3 网络爬虫开发实践》笔记
最近阅读了一本书《python3 网络爬虫开发实践》,涉及的工具比较多,这本书可以当工具书来进行查阅。 由于书中内容繁多,所以我记的笔记都是理论部分较多,代码编写以及工具的使用涉及不多,感兴趣可以查阅下该书。 本文大纲如下(预计读完需要 15 分钟): 1、基本的环境和工具 1.1、请求库,发送网络请求 1.2、解析库,解析网页中提取的信息 1.3、数据库,用于存储获得的数据 1.4、Web 库,开发网站和接口 1.5、抓包工具,模拟与分析 1.6、成熟的爬虫框架 1.7、部署工具 2、基础知
Python3网络爬虫开发实战:开启你的数据挖掘之旅
Python3网络爬虫开发实战:开启你的数据挖掘之旅 去发现同类优质开源项目:https://gitcode.com/ 一、项目介绍 在数字时代,信息就是力量。Python3网络爬虫开发实战不仅仅是一本图书,它更是一个完整的项目指南,旨在帮助开发者掌握从零构建高效网络爬虫的技术。这不仅涵盖了基础理论与实践指导,更提供了丰富的真实世界案例,使读者能够快速上手并深入理解网络爬虫的每一个细节。 二、项目...
零基础掌握Python网络爬虫:从入门到实战的书籍推荐
网络爬虫(Web Crawler)是一种按照一定规则自动抓取互联网信息的程序或脚本,广泛应用于数据采集、搜索引擎优化、市场分析等领域。本文精选GitHub_Trending/boo/books项目中与Python爬虫相关的优质书籍资源,帮助读者系统学习爬虫开发技术。 ## 一、Python基础入门 ### 1. Python核心语法 [Python para Desenvolvedores]
网络爬虫技术(python)
爬虫也用了这么久,最开始用Jave再换到了python。在学习和应用的过程中也遇到了有很多问题,在这里就简要地谈谈 整个过程中关于爬虫技术的一点点个人经验和理解。对于初学者来说,可以将本篇文章作为参考,也欢迎大家分享自己的经验。本篇文章,主要会依据以下三个步骤来讲解: 一、入门 二、实例 三、进阶 一、入门1.爬虫基础1.1).什么是爬虫 爬虫是一个自动提取网页的程序,它为搜索引擎从万维
cookie登陆_Python网络爬虫之Cookie技术(一)
当我们访问一个需要用户名和密码登录的网站(例如某宝)时,只要我们注册好并成功登录后,下次访问该网站时,网站就会记住我们的登录信息,而无需重新登录。我们都知道HTTP协议是无状态的,是不可能对用户名和密码进行记录的,那浏览器或者服务器是怎么做到的?其实,这里面就使用到了一种叫Cookie的技术。1 Cookie是什么?cookie 是指某些网站为了辨别用户身份、进行session跟踪而储存在用户本地...
入门Docker:构建你的第一个Python爬虫容器
Docker是一个开源容器化平台,允许开发者打包应用以及所需的库和依赖,然后发布到任何支持Docker的平台上。简而言之,Docker可以在隔离的环境中运行你的应用,并保证其在不同的环境中都能以相同的方式运行。通过上述步骤,我们成功的将一个Python爬虫程序容器化,并运行在Docker中。Docker容器化可以极大地增强应用的可移植性和环境一致性。以上只是Docker使用的入门知识,Docker的强大功能远不止于此,建议继续探索Docker文档来了解更多高级特性。
浏览器缓存、本地存储、Cookie、SessionStorage、LocalStorage、Token
=
python使用requests时使用RequestsCookieJar自动保存并传递cookie
使用python的requests开发爬虫类程序时,经常需要将之前请求返回的set-cookie值,作为下一个请求的cookie发送。比如模拟登录之后的返回的sessionId,就需要作为后续请求的cookie参数。 网上找了一圈,发现很多说需要手动添加或设置cookie的值。殊不知cookie是与域名、路径先关的,而且具有有效期。手动操作很容易掉坑里。。。 之前做C#时就有一个CookieC...
2025最稳爬虫容器化方案:Crawl4AI Docker部署与REST API实战验证
你还在为反爬机制头疼吗?还在为分布式部署爬虫集群烦恼吗?本文将带你一步到位掌握Crawl4AI的容器化部署与API测试全流程,让你从此轻松应对各类网页抓取需求。读完本文,你将能够: - 使用Docker快速部署Crawl4AI服务 - 熟练调用REST API实现网页抓取 - 掌握流式爬取与批量处理技巧 - 配置高级参数如代理、SSL证书获取等 ## 为什么选择Crawl4AI容器化方案? C...
260




被折叠的 条评论
为什么被折叠?



