爆款云主机2核4G限时秒杀,88元/年起!
查看详情

活动

天翼云最新优惠活动,涵盖免费试用,产品折扣等,助您降本增效!
热门活动
  • 618智算钜惠季 爆款云主机2核4G限时秒杀,88元/年起!
  • 免费体验DeepSeek,上天翼云息壤 NEW 新老用户均可免费体验2500万Tokens,限时两周
  • 云上钜惠 HOT 爆款云主机全场特惠,更有万元锦鲤券等你来领!
  • 算力套餐 HOT 让算力触手可及
  • 天翼云脑AOne NEW 连接、保护、办公,All-in-One!
  • 中小企业应用上云专场 产品组合下单即享折上9折起,助力企业快速上云
  • 息壤高校钜惠活动 NEW 天翼云息壤杯高校AI大赛,数款产品享受线上订购超值特惠
  • 天翼云电脑专场 HOT 移动办公新选择,爆款4核8G畅享1年3.5折起,快来抢购!
  • 天翼云奖励推广计划 加入成为云推官,推荐新用户注册下单得现金奖励
免费活动
  • 免费试用中心 HOT 多款云产品免费试用,快来开启云上之旅
  • 天翼云用户体验官 NEW 您的洞察,重塑科技边界

智算服务

打造统一的产品能力,实现算网调度、训练推理、技术架构、资源管理一体化智算服务
智算云(DeepSeek专区)
科研助手
  • 算力商城
  • 应用商城
  • 开发机
  • 并行计算
算力互联调度平台
  • 应用市场
  • 算力市场
  • 算力调度推荐
一站式智算服务平台
  • 模型广场
  • 体验中心
  • 服务接入
智算一体机
  • 智算一体机
大模型
  • DeepSeek-R1-昇腾版(671B)
  • DeepSeek-R1-英伟达版(671B)
  • DeepSeek-V3-昇腾版(671B)
  • DeepSeek-R1-Distill-Llama-70B
  • DeepSeek-R1-Distill-Qwen-32B
  • Qwen2-72B-Instruct
  • StableDiffusion-V2.1
  • TeleChat-12B

应用商城

天翼云精选行业优秀合作伙伴及千余款商品,提供一站式云上应用服务
进入甄选商城进入云市场创新解决方案
办公协同
  • WPS云文档
  • 安全邮箱
  • EMM手机管家
  • 智能商业平台
财务管理
  • 工资条
  • 税务风控云
企业应用
  • 翼信息化运维服务
  • 翼视频云归档解决方案
工业能源
  • 智慧工厂_生产流程管理解决方案
  • 智慧工地
建站工具
  • SSL证书
  • 新域名服务
网络工具
  • 翼云加速
灾备迁移
  • 云管家2.0
  • 翼备份
资源管理
  • 全栈混合云敏捷版(软件)
  • 全栈混合云敏捷版(一体机)
行业应用
  • 翼电子教室
  • 翼智慧显示一体化解决方案

合作伙伴

天翼云携手合作伙伴,共创云上生态,合作共赢
天翼云生态合作中心
  • 天翼云生态合作中心
天翼云渠道合作伙伴
  • 天翼云代理渠道合作伙伴
天翼云服务合作伙伴
  • 天翼云集成商交付能力认证
天翼云应用合作伙伴
  • 天翼云云市场合作伙伴
  • 天翼云甄选商城合作伙伴
天翼云技术合作伙伴
  • 天翼云OpenAPI中心
  • 天翼云EasyCoding平台
天翼云培训认证
  • 天翼云学堂
  • 天翼云市场商学院
天翼云合作计划
  • 云汇计划
天翼云东升计划
  • 适配中心
  • 东升计划
  • 适配互认证

开发者

开发者相关功能入口汇聚
技术社区
  • 专栏文章
  • 互动问答
  • 技术视频
资源与工具
  • OpenAPI中心
开放能力
  • EasyCoding敏捷开发平台
培训与认证
  • 天翼云学堂
  • 天翼云认证
魔乐社区
  • 魔乐社区

支持与服务

为您提供全方位支持与服务,全流程技术保障,助您轻松上云,安全无忧
文档与工具
  • 文档中心
  • 新手上云
  • 自助服务
  • OpenAPI中心
定价
  • 价格计算器
  • 定价策略
基础服务
  • 售前咨询
  • 在线支持
  • 在线支持
  • 工单服务
  • 建议与反馈
  • 用户体验官
  • 服务保障
  • 客户公告
  • 会员中心
增值服务
  • 红心服务
  • 首保服务
  • 客户支持计划
  • 专家技术服务
  • 备案管家

了解天翼云

天翼云秉承央企使命,致力于成为数字经济主力军,投身科技强国伟大事业,为用户提供安全、普惠云服务
品牌介绍
  • 关于天翼云
  • 智算云
  • 天翼云4.0
  • 新闻资讯
  • 天翼云APP
基础设施
  • 全球基础设施
  • 信任中心
最佳实践
  • 精选案例
  • 超级探访
  • 云杂志
  • 分析师和白皮书
  • 天翼云·创新直播间
市场活动
  • 2025智能云生态大会
  • 2024智算云生态大会
  • 2023云生态大会
  • 2022云生态大会
  • 天翼云中国行
天翼云
  • 活动
  • 智算服务
  • 产品
  • 解决方案
  • 应用商城
  • 合作伙伴
  • 开发者
  • 支持与服务
  • 了解天翼云
      • 文档
      • 控制中心
      • 备案
      • 管理中心

      Python爬虫 - 使用代理IP池维护虚拟用户

      首页 知识中心 软件开发 文章详情页

      Python爬虫 - 使用代理IP池维护虚拟用户

      2025-02-10 08:54:34 阅读次数:11

      代理,功能,模块,网站,访问

              导语:在我们使用爬虫时,有些网站会限制每个 IP 的访问速度或访问次数,超出了它的限制IP 就会被封掉,对于访问次数限制的突破,就需要使用代理 IP了,使用多个代理 IP 伪装成不同的用户轮换着去访问目标网址可以有效地解决问题。

      代理池架构

      必要性

              互联网上有大量公开的免费代理,当然我们也可以购买付费代理,但我们如何保证我们的这个代理IP是可用的呢,总不能爬一会出一个代理超时,爬一会因为和别人共用一个代理IP导致被封。一旦选用的是一个不可用的代理ip,势必就会影响爬虫的工作效率。所以要提前做筛选,删除掉不可用的代理,只保留可用代理。 那么怎么实现呢?这就需要借助一个叫代理池的东西了。

      功能架构图

      Python爬虫 - 使用代理IP池维护虚拟用户

      代理池各模块功能 

      获取模块

      功能介绍

              负责定时在从代理网站爬取代理。代理既可以是免费公开的,也可以是付费的, 形式上都是处理为 ip + port ,此模块尽量从优质代理处获取,以确保获取高匿代理,我这里使用了天启的优质ip,点这里可以注册,新人会送一千个代理IP的貌似(一般玩玩都够了),获取成功后将可用代理存储到存储模块。

             根据需求我们选择好如下配置,生成api链接。 Python爬虫 - 使用代理IP池维护虚拟用户

       打开链接是这个样子:

      Python爬虫 - 使用代理IP池维护虚拟用户

       当然了,这个获取模块会实现这个功能,我们看代码。

      代码示例

      def get_ip():
          url = 在天启注册后配置的api
          res = requests.get(url)
          # print(res.text)
          for i in json.loads(res.text)["data"]:
              print(i, type(i))
              ip = {
                  "http": str(i["ip"]) + ":" + str(i["port"]),
                  "https": str(i["ip"]) + ":" + str(i["port"])
              } 
              return ip
      

      注意

      我们拿到的代理是 {"ip":"117.57.91.154","port":40021} 这种样子的;

      爬虫使用的代理要装成:

      {'http': '163.125.104.6:40011', 'https': '163.125.104.6:40011'}

      这种样子。

      存储模块

      功能介绍

              存储模块负责存储爬取下来的代理。首先要保证代理不重复,标识代理的可用情况,其次要 动态实时地处理每个代理, 一种比较高效和方便的存储方式就是 Redis 的 Sorted set,即有序集合。

      本次以教学为主,我们直接将代理ip放进一个list中即可,需要用的时候直接从列表中获取。

      检测模块

      功能介绍

              负责定时检测存储模块中的代理是否可用。这里需要设置一个检测链接,最好是设置为要爬取的那个网站,这样更具有针对性。而对于一个通用型的代理,可以设置为百度等链接。

              另外,需要标识每一个代理的状态,例如设置分数标识,100 分代表可用,分数越少代表越不 可用。经检测,如果代理可用,可以将分数标识立即设置为满分 100,也可以在原分数基础上 加1;如果代理不可用,就将分数标识减 1,当分数减到一定國值后,直接从存储模块中删除此代理。这样就可以标识代理的可用情况,在选用的时候也会更有针对性。

      代码示例

      在示例中,我们严格要求一些,如果代理ip不可用,就删除,如果代理IP可以使用,就返回

      verif = requests.get
      if verif.status_code == 200 and json.loads(verif.text)["origin"] == i["ip"]:
          print("配置成功,返回代理:{0}".format(ip))
          return ip

      这是一个检测ip的网站,他可以返回你当前的ip地址,我们对这个网址发起一个requests请求,如果状态码是200,同时这个网站返回的是代理IP,就说明这个ip生效了,是有用的。如果状态码不是200,或者返回来的不是代理IP而是本机IP都说明代理未生效。

      接口模块

      功能介绍

              用API提供对外服务的接口。其实我们可以直接连接数据库来获取对应的数据,但这样需要知道数据库的连接信息,并且要配置连接。比较安全和方便的方式是提供一个 Web API 接口,访问这个接口即可拿到可用代理。另外,由于可用代理可能有多个,所以可以设置一个 随机返回某个可用代理的接口,这样就能保证每个可用代理都有机会被获取,实现负载均衡。

      对于本次练习来说,我们直接从维护的列表中提取一个元素即可

      实战实例

      1. 访问天启api,获取代理IP信息
      2. 将返回数据组装成爬虫可用的格式
      3. 访问网站,测试代理ip是否可用

      结果图:

      Python爬虫 - 使用代理IP池维护虚拟用户

      虚拟用户

      原理

              当我们第一次访问某个网站时,我们是没有任何网站信息或者记录的,这时候我们是作为一个新人来访问这个网站;

              当我们第二次访问某个网站时,我们是带着cookies等网站信息或者记录的,这时候我们是作为一个老人来访问这个网站。

              说到这里有人应该明白了,我先使用代理ip访问网站,这个时候相当于一个新人,然后把cookies等信息全部保留下来一起存进虚拟用户池中,当我的爬虫项目拿到这个ip的时候,也拿到了这个IP曾经访问目标网站时存下来的cookies,我把ip和cookies一起带着过去,不就相当于是老人了。

      话不多说,我们实战一下。

      实战实例

      # 任意header 
      head = {
              'User-Agent': 'Mozilla/5.0 (Windows; U; Windows NT 6.1; en-us) AppleWebKit/534.50 (KHTML, like Gecko) Version/5.1 Safari/534.50',
              'Accept-Encoding': 'gzip, deflate',
              'Accept': '*/*',
              'Connection': 'keep-alive',
              'Accept-Language': 'zh-CN,zh;q=0.8,zh-TW;q=0.7,zh-HK;q=0.5,en-US;q=0.3,en;q=0.2',
              'Upgrade-Insecure-Requests': '1',
              'Sec-Fetch-Dest': 'document',
              'Sec-Fetch-Mode': 'navigate',
              'Sec-Fetch-Site': 'none',
              'Sec-Fetch-User': '?1'
          }
      
      
      ip = get_ip()
      # 将ip信息放入虚拟用户user中
      user = {"ip":ip}
      print(user)
      # 第一次访问百度
      res = requests.get
      #将百度返回的cookies装回user中
      user["cookies"] = res.cookies.get_dict()
      print(user)
      # 第二次带着cookies访问百度
      res = requests.get
                          headers=head, 
                          proxies=user["ip"], 
                          cookies=user["cookies"])

       我们输出这两个user:

      Python爬虫 - 使用代理IP池维护虚拟用户

       可以看到第二次的时候我们已经有了cookies信息。

              该方法适用于某些必须要通过首页验证的网站,格外好用,将首页验证的逻辑与代理IP池构建在一起,每一个爬虫任务就不需要访问首页了

      版权声明:本文内容来自第三方投稿或授权转载,原文地址:https://blog.csdn.net/qq_52213943/article/details/130340661,作者:昊昊该干饭了,版权归原作者所有。本网站转在其作品的目的在于传递更多信息,不拥有版权,亦不承担相应法律责任。如因作品内容、版权等问题需要同本网站联系,请发邮件至ctyunbbs@chinatelecom.cn沟通。

      上一篇:C++——模版

      下一篇:【C++11】lambda函数及其基本用法

      相关文章

      2025-05-16 09:15:10

      【强化学习】强化学习的基本概念与应用

      强化学习(Reinforcement Learning, RL)是一种机器学习方法,通过与环境的交互来学习如何采取行动,以最大化累积奖励。强化学习在机器人控制、游戏AI、自动驾驶等领域取得了显著成就。

      2025-05-16 09:15:10
      代理 , 学习 , 状态
      2025-05-14 10:07:38

      30天拿下Rust之箱、包和模块

      Rust语言使用模块系统来组织工程和代码。模块系统允许我们将相关的函数、类型、常量等组织在一起,形成一个逻辑上的单元。通过模块系统,我们可以隐藏实现细节,只暴露必要的接口,从而提高代码的可读性和可维护性。

      2025-05-14 10:07:38
      Rust , 关键字 , 文件 , 模块 , 访问
      2025-05-14 10:03:05

      30天拿下Python之模块和包

      Python的模块(Module)和包(Package)是Python的两个主要概念,它们都是用来组织和封装代码的机制。

      2025-05-14 10:03:05
      Python , 代码 , 函数 , 导入 , 文件 , 模块
      2025-05-14 09:51:15

      java实现管线拓扑关系连通性分析

      管线拓扑关系的连通性分析通常涉及图论(Graph Theory)中的概念,特别是无向图(Undirected Graph)的遍历算法,如深度优先搜索(DFS, Depth-First Search)或广度优先搜索(BFS, Breadth-First Search)。

      2025-05-14 09:51:15
      BFS , DFS , 复杂度 , 搜索 , 节点 , 访问 , 遍历
      2025-05-13 09:53:23

      Java静态变量在静态方法内部无法改变值

      在Java中,静态变量(也称为类变量)属于类本身,而不是类的任何特定实例。它们可以在没有创建类的实例的情况下访问和修改。如果我们发现在静态方法内部无法改变静态变量的值,这通常是因为我们的代码中有一些逻辑错误或误解。

      2025-05-13 09:53:23
      Java , 变量 , 实例 , 类名 , 访问 , 静态 , 静态方法
      2025-05-13 09:49:12

      Java学习(动态代理的思想详细分析与案例准备)(1)

      Java学习(动态代理的思想详细分析与案例准备)(1)

      2025-05-13 09:49:12
      java , 代理 , 代码 , 对象 , 接口 , 方法 , 需要
      2025-05-13 09:49:12

      Maven学习(Maven项目模块化。模块间“继承“机制。父(工程),子项目(模块)间聚合)

      Maven项目模块化是指将一个大型项目拆分成多个模块(Module)。

      2025-05-13 09:49:12
      maven , Maven , 模块 , 继承 , 项目
      2025-05-12 08:40:18

      基于SSM框架实现的汽车维修管理系统【源码+数据库】

      本项目是一套基于SSM框架实现的汽车维修管理系统,主要针对计算机相关专业的正在做毕设的学生与需要项目实战练习的Java学习者。

      2025-05-12 08:40:18
      模块 , 源码 , 管理 , 项目
      2025-05-09 08:50:42

      访问相册

      访问相册

      2025-05-09 08:50:42
      知识点 , 访问
      2025-05-09 08:20:32

      系统架构——Spring Framework

      Spring Framework 是 Spring 生态圈中最基础的项目。其它所有的项目的都是在它的基础上运行使用。

      2025-05-09 08:20:32
      AOP , Data , Spring , 学习 , 模块
      查看更多
      推荐标签

      作者介绍

      天翼云小翼
      天翼云用户

      文章

      33561

      阅读量

      5229564

      查看更多

      最新文章

      30天拿下Python之模块和包

      2025-05-14 10:03:05

      Java静态变量在静态方法内部无法改变值

      2025-05-13 09:53:23

      Java学习(动态代理的思想详细分析与案例准备)(1)

      2025-05-13 09:49:12

      系统架构——Spring Framework

      2025-05-09 08:20:32

      基于spring+jsp+mysql实现的Java web论坛系统【源码+数据库+指导运行】

      2025-05-08 09:03:21

      spring AOP 代理模式

      2025-05-08 09:03:07

      查看更多

      热门文章

      apache域名301跳转和访问控制的优先级

      2024-06-28 06:18:44

      Python零基础入门-6 模块和包

      2023-05-19 05:50:50

      驱动开发:内核取应用层模块基地址

      2023-06-21 06:37:20

      【实用软件测试教程】5-集成测试

      2023-07-11 08:44:52

      SpringAOP【静态代理、动态代理:JDK/CGLIB】

      2023-06-14 09:12:57

      spring——代理(静/动态代理)

      2024-09-24 06:30:33

      查看更多

      热门标签

      java Java python 编程开发 代码 开发语言 算法 线程 Python html 数组 C++ 元素 javascript c++
      查看更多

      相关产品

      弹性云主机

      随时自助获取、弹性伸缩的云服务器资源

      天翼云电脑(公众版)

      便捷、安全、高效的云电脑服务

      对象存储

      高品质、低成本的云上存储服务

      云硬盘

      为云上计算资源提供持久性块存储

      查看更多

      随机文章

      【Java】static 修饰变量

      spring——代理(静/动态代理)

      基于PHP+MySql的留言管理系统的设计与实现

      深入理解Java中的反射和动态代理

      【数据结构】遍历二叉树(递归思想)-->赋源码

      关于软件测试那些事儿

      • 7*24小时售后
      • 无忧退款
      • 免费备案
      • 专家服务
      售前咨询热线
      400-810-9889转1
      关注天翼云
      • 旗舰店
      • 天翼云APP
      • 天翼云微信公众号
      服务与支持
      • 备案中心
      • 售前咨询
      • 智能客服
      • 自助服务
      • 工单管理
      • 客户公告
      • 涉诈举报
      账户管理
      • 管理中心
      • 订单管理
      • 余额管理
      • 发票管理
      • 充值汇款
      • 续费管理
      快速入口
      • 天翼云旗舰店
      • 文档中心
      • 最新活动
      • 免费试用
      • 信任中心
      • 天翼云学堂
      云网生态
      • 甄选商城
      • 渠道合作
      • 云市场合作
      了解天翼云
      • 关于天翼云
      • 天翼云APP
      • 服务案例
      • 新闻资讯
      • 联系我们
      热门产品
      • 云电脑
      • 弹性云主机
      • 云电脑政企版
      • 天翼云手机
      • 云数据库
      • 对象存储
      • 云硬盘
      • Web应用防火墙
      • 服务器安全卫士
      • CDN加速
      热门推荐
      • 云服务备份
      • 边缘安全加速平台
      • 全站加速
      • 安全加速
      • 云服务器
      • 云主机
      • 智能边缘云
      • 应用编排服务
      • 微服务引擎
      • 共享流量包
      更多推荐
      • web应用防火墙
      • 密钥管理
      • 等保咨询
      • 安全专区
      • 应用运维管理
      • 云日志服务
      • 文档数据库服务
      • 云搜索服务
      • 数据湖探索
      • 数据仓库服务
      友情链接
      • 中国电信集团
      • 189邮箱
      • 天翼企业云盘
      • 天翼云盘
      ©2025 天翼云科技有限公司版权所有 增值电信业务经营许可证A2.B1.B2-20090001
      公司地址:北京市东城区青龙胡同甲1号、3号2幢2层205-32室
      • 用户协议
      • 隐私政策
      • 个人信息保护
      • 法律声明
      备案 京公网安备11010802043424号 京ICP备 2021034386号