〖Python网络爬虫实战⑤〗- Session和Cookie介绍

订阅：新手可以订阅我的其他专栏。免费阶段订阅量1000+
          python项目实战

          Python编程基础教程系列（零基础小白搬砖逆袭)
说明：本专栏持续更新中，目前专栏免费订阅，在转为付费专栏前订阅本专栏的，可以免费订阅付费专栏，可报销****（名额有限，先到先得）。

作者：爱吃饼干的小白鼠。Python领域优质创作者，2022年度博客新星top100入围，荣获多家平台专家称号。

🌟上节回顾

上一节，我们学习了代理的基本原理，以及，我们为什么要配置代理，它的作用是什么。本文，我们了解一下。什么是Session和Cookie，以及他们的作用是什么。

⭐️Session和Cookie

    我们在访问一些网站的时候，需要我们登录，比如讲邮箱等等网站，也就是，有一些网站需要登录，我们才能看到页面。我们会发现，我们有时候在登录网站之后，当我们再次打开的时候，就会自动登录，而且长时间不会失效，但是，有时候有的网站，时间长了，就需要重新登录。

    这是什么原因呢？其实，这里面涉及到了Session和Cookie的相关知识，本文，我们就来具体的介绍它。

🌟静态网页和动态网页

    我们在了解Session和Cookie之前，我们先知道什么是静态网页和动态网页。

✨静态网页

    在网站设计中，纯粹HTML（标准通用标记语言下的一个应用）格式的网页通常被称为“静态网页”，静态网页是标准的HTML文件，它的文件扩展名是.htm、.html，可以包含文本、图像、声音、FLASH动画、客户端脚本和ActiveX控件及JAVA小程序等。

    这里我展示一个静态网页示例代码。

<!DOCTYPE html>  
<html lang="zh">  
<head>  
    <meta charset="UTF-8">  
    <meta name="viewport" content="width=device-width, initial-scale=1.0">  
    <title>静态网页示例</title>  
    <style>  
        body {  
            font-family: Arial, sans-serif;  
            text-align: center;  
            background-color: #f2f2f2;  
            margin: 0 auto;  
            padding: 20px;  
        }  
  
        h1 {  
            font-size: 36px;  
            color: #333;  
            margin-top: 0;  
            margin-bottom: 20px;  
        }  
  
        p {  
            font-size: 18px;  
            line-height: 1.5;  
            margin-bottom: 20px;  
        }  
    </style>  
</head>  
<body>  
    <h1>欢迎来到静态网页示例</h1>  
    <p>这是一个简单的静态网页示例，使用 HTML 和 CSS 创建一个基本的网页。</p>  
</body>  
</html>

✨动态网页

    动态网页是指跟静态网页相对的一种网页编程技术。静态网页，随着html代码的生成，页面的内容和显示效果就基本上不会发生变化了——除非你修改页面代码。而动态网页则不然，页面代码虽然没有变，但是显示的内容却是可以随着时间、环境或者数据库操作的结果而发生改变的。动态网页使用的语言包括ASP、PHP、JSP、Python等，这些语言都是服务器端的脚本语言，负责与客户端的交互，处理客户端的请求，生成动态的网页。

    我们回到之前的问题，许多页面是需要登录才能查看，肯定是拿到了什么凭证，然后，我们才可以访问这些页面。那么，这个凭证是什么呢？实际上就是Session和Cookie共同作用的结果。

    这里，我也放一个动态网页的示例代码。

<!DOCTYPE html>  
<html>  
<head>  
    <title>动态网页示例</title>  
    <script>  
        function showMessage() {  
            document.getElementById("message").innerHTML = "这是一个动态网页示例";  
        }  
    </script>  
</head>  
<body>  
    <h1>欢迎来到动态网页示例</h1>  
    <p>这是一个简单的动态网页示例，使用 JavaScript 和 HTML 创建一个简单的网页。</p>  
    <p id="message"></p>  
</body>  
</html>

🌟Session

    在计算机中，尤其是在网络应用中，session 指的是一个终端用户与交互系统进行通信的时间间隔，通常指从注册进入系统到注销退出系统之间所经过的时间，需要注意的是，一个session的概念需要包括特定的客户端，特定的服务器端以及不中断的操作时间。

    Session 对象存储特定用户会话所需的属性及配置信息，当用户在应用程序的 Web 页之间跳转时，存储在 Session 对象中的变量将不会丢失，而是在整个用户会话中一直存在下去。当用户请求来自应用程序的 Web 页时，如果该用户还没有会话，则 Web 服务器将自动创建一个 Session 对象。当会话过期或被放弃后，服务器将终止该会话。Session 对象最常见的一个用法就是存储用户的首选项，例如，如果用户指明不喜欢查看图形，就可以将该信息存储在 Session 对象中。

🌟Cookie

我们先了解一下什么是Cookie？

Cookie是一种存储在计算机浏览器目录中的文本文件。当用户浏览某个站点并注册帐号，就会生成一个Cookie文件用于记录登录信息。目前，大多数网站都会应用Cookie技术，这既能给用户提供一个好的网络环境，又能方便收集访客信息。

Cookie 的组成结构包括以下几个部分：

cookie 的 name 和 value：这是 Cookie 的名称和对应的值，其中 name 是 Cookie 的标识符，value 是 Cookie 的值。
cookie 的 domain：这是 Cookie 可以访问的域名，当需要跨域访问 Cookie 时，可以在该字段进行添加相应域名。
cookie 的 path：这是 Cookie 可以访问的路径，当 Cookie 需要跨域访问时，可以在该字段中指定 Cookie 的访问路径。
cookie 的 httpOnly：这个字段主要是禁止调用 JavaScript 的 document.cookie 这个 API，从而防止跨站脚本攻击（XSS）。
cookie 的 secure：这个字段表明了 Cookie 是否安全，默认值为 False，表示 Cookie 不安全。
cookie 的 expiry：这是 Cookie 的有效终止日期，当 Cookie 到期后，服务器端将自动删除 Cookie。
cookie 的 path 属性：这是 Cookie 定义的 Web 服务器上哪些路径下的页面可获取服务器设置的 Cookie。
cookie 的 domain 属性：这是 Cookie 定义的服务器域名，当 Cookie 需要跨域访问时，可以在该字段中指定服务器的域名。
```
 以上就是 Cookie 的基本组成结构，不同的 Cookie 可能还包括其他的属性和值。
```

🌟总结

    本文介绍了Session和Cookie的相关知识，这对我们后面学习网络爬虫有很大的作用。

标签：爬虫 python pycharm

本文转载自: https://blog.csdn.net/BROKEN__Y/article/details/129972479
版权归原作者 爱吃饼干的小白鼠 所有，如有侵权，请联系我们删除。

〖Python网络爬虫实战⑤〗- Session和Cookie介绍

最近更新

🌟上节回顾

⭐️Session和Cookie

🌟静态网页和动态网页

✨静态网页

✨动态网页

🌟Session

🌟Cookie

🌟总结

发表评论

“〖Python网络爬虫实战⑤〗- Session和Cookie介绍”的评论:

关于作者

overfit同步小助手

相关阅读

文章导航