Python3 爬虫带上 cookie-Python教程-PHP中文网

首页

后端开发

Python教程

Python3 爬虫带上 cookie

Guanhui

Jul 28, 2020 pm 06:34 PM

cookiepython3爬虫

Python3 爬虫带上 cookie

Cookie的英文原意是“点心”，它是在客户端访问Web服务器时，服务器在客户端硬盘上存放的信息，好像是服务器发送给客户的“点心”。服务器可以根据Cookie来跟踪客户状态，这对于需要区别客户的场合（如电子商务）特别有用。

当客户端首次请求访问服务器时，服务器先在客户端存放包含该客户的相关信息的Cookie，以后客户端每次请求访问服务器时，都会在HTTP请求数据中包含Cookie，服务器解析HTTP请求中的Cookie，就能由此获得关于客户的相关信息。

下面我们就来看一下python3爬虫带上cookie的方法：

1、直接将Cookie写在header头部

# coding:utf-8
import requests
from bs4 import BeautifulSoup
cookie = &#39;&#39;&#39;cisession=19dfd70a27ec0eecf1fe3fc2e48b7f91c7c83c60;CNZZDATA1000201968=181584
6425-1478580135-https%253A%252F%252Fwww.baidu.com%252F%7C1483922031;Hm_lvt_f805f7762a9a2
37a0deac37015e9f6d9=1482722012,1483926313;Hm_lpvt_f805f7762a9a237a0deac37015e9f6d9=14839
26368&#39;&#39;&#39;
header = {
&#39;User-Agent&#39;: &#39;Mozilla/5.0 (Windows NT 6.1; WOW64) AppleWebKit/537.36 (KHTML, like Geck
o) Chrome/53.0.2785.143 Safari/537.36&#39;,
&#39;Connection&#39;: &#39;keep-alive&#39;,
&#39;accept&#39;: &#39;text/html,application/xhtml+xml,application/xml;q=0.9,image/webp,*/*;q=0.8&#39;,
&#39;Cookie&#39;: cookie}
url = &#39;https://www.jb51.net/article/191947.htm&#39;
wbdata = requests.get(url,headers=header).text
soup = BeautifulSoup(wbdata,&#39;lxml&#39;)
print(soup)

2、使用requests插入Cookie

# coding:utf-8
import requests
from bs4 import BeautifulSoup
cookie = {
"cisession":"19dfd70a27ec0eecf1fe3fc2e48b7f91c7c83c60",
"CNZZDATA100020196":"1815846425-1478580135-https%253A%252F%252Fwww.baidu.com%252F%7C1483
922031",
"Hm_lvt_f805f7762a9a237a0deac37015e9f6d9":"1482722012,1483926313",
"Hm_lpvt_f805f7762a9a237a0deac37015e9f6d9":"1483926368"
}
url = &#39;https://www.jb51.net/article/191947.htm&#39;
wbdata = requests.get(url,cookies=cookie).text
soup = BeautifulSoup(wbdata,&#39;lxml&#39;)
print(soup)

实例扩展：

使用cookie登录哈工大ACM站点

获取站点登录地址

http://acm.hit.edu.cn/hoj/system/login

查看要传送的post数据
user和password

Code:

#!/usr/bin/env python
# -*- coding: utf-8 -*-
"""
__author__ = &#39;pi&#39;
__email__ = &#39;pipisorry@126.com&#39;

"""
import urllib.request, urllib.parse, urllib.error
import http.cookiejar

LOGIN_URL = &#39;http://acm.hit.edu.cn/hoj/system/login&#39;
values = {&#39;user&#39;: &#39;******&#39;, &#39;password&#39;: &#39;******&#39;} # , &#39;submit&#39; : &#39;Login&#39;
postdata = urllib.parse.urlencode(values).encode()
user_agent = r&#39;Mozilla/5.0 (Windows NT 6.1; WOW64) AppleWebKit/537.36 (KHTML, like Gecko) Chrome/44.0.2403.157 Safari/537.36&#39;
headers = {&#39;User-Agent&#39;: user_agent, &#39;Connection&#39;: &#39;keep-alive&#39;}

cookie_filename = &#39;cookie.txt&#39;
cookie = http.cookiejar.MozillaCookieJar(cookie_filename)
handler = urllib.request.HTTPCookieProcessor(cookie)
opener = urllib.request.build_opener(handler)

request = urllib.request.Request(LOGIN_URL, postdata, headers)
try:
  response = opener.open(request)
  page = response.read().decode()
  # print(page)
except urllib.error.URLError as e:
  print(e.code, &#39;:&#39;, e.reason)

cookie.save(ignore_discard=True, ignore_expires=True) # 保存cookie到cookie.txt中
print(cookie)
for item in cookie:
  print(&#39;Name = &#39; + item.name)
  print(&#39;Value = &#39; + item.value)

get_url = &#39;http://acm.hit.edu.cn/hoj/problem/solution/?problem=1&#39; # 利用cookie请求訪问还有一个网址
get_request = urllib.request.Request(get_url, headers=headers)
get_response = opener.open(get_request)
print(get_response.read().decode())
# print(&#39;You have not solved this problem&#39; in get_response.read().decode())

推荐教程：《Python教程》

以上是Python3 爬虫带上 cookie的详细内容。更多信息请关注PHP中文网其他相关文章！

声明

本文内容由网友自发贡献，版权归原作者所有，本站不承担相应法律责任。如您发现有涉嫌抄袭侵权的内容，请联系admin@php.cn

2小时的Python计划：一种现实的方法Apr 11, 2025 am 12:04 AM

2小时内可以学会Python的基本编程概念和技能。1.学习变量和数据类型，2.掌握控制流（条件语句和循环），3.理解函数的定义和使用，4.通过简单示例和代码片段快速上手Python编程。

Python：探索其主要应用程序Apr 10, 2025 am 09:41 AM

Python在web开发、数据科学、机器学习、自动化和脚本编写等领域有广泛应用。1)在web开发中，Django和Flask框架简化了开发过程。2)数据科学和机器学习领域，NumPy、Pandas、Scikit-learn和TensorFlow库提供了强大支持。3)自动化和脚本编写方面，Python适用于自动化测试和系统管理等任务。