• Python爬虫入狱小技巧


    在这里插入图片描述

    一、整体思路

    python爬虫最基础的一定要一开始要把思路理清楚,即从网页源代码或者网页数据接口,获取需要的数据.大致思路如下

    1.有数据接口,直接用requests获取json文件源代码,然后字典操作获取数据

    2.没有数据集接口:

    1)通过requests获取源代码,通过三大方法解析数据

    2)通过selenium获取源代码,通过三大方法解析数据

    3.伪装:

    1)user-agent主要用于获取源代码时,网站防爬虫伪装浏览器

    2)cookie主要用于账号登陆,伪装身份登录网站

    3)代理ip用于访问网站被封ip后,用其他地址进入网站获取数据

    4.文件保存:把文件长期保存,便于后期调用,搭建数据库

    在这里插入图片描述

    二、登录

    1.user-agent:通过如图获取(图片敏感,删了):

    进入网页
    检查网页
    点击network
    All
    刷新网页
    选择网页的那个点
    Headers
    寻找user-agent

    2.cookie获取:如图获取(图片敏感,删了):

    进入网页
    检查网页
    点击network
    All
    选择网页的那个点
    Headers
    寻找cookie

    3.代理ip使用:

    1).requests:

    headers = {
       xxx}
    proxies = {
       'https': '代理ip'}
    response = requests.get('网站地址', headers=headers, proxies=proxies)
    
    • 1
    • 2
    • 3
    • 4
    • 5

    2).selenium:

    from selenium.webdriver import Chrome, ChromeOptions
    
    # 1. 给浏览器添加配置
    options = ChromeOptions()
    #设置代理
    options.add_argument('--proxy-server=http://171.83.191.223:4526')
    b = Chrome(options=options)
    b.get('网站')
    
    • 1
    • 2
    • 3
    • 4
    • 5
    • 6
    • 7
    • 8

    三、有数据接口:

    1.获取数据接口

    在preview中观察比较像数据接口的点,选择最像字典,而且有数据的点
    在这里插入图片描述
    确定哪个是自己想要的数据接口后,点击他的Headers,然后获取Request URL
    在这里插入图片描述

    2.进入接口,转json解析

    import requests
    response = requests.get('数据接口')
    # 接口数据转字典
    result = response
    • 1
    • 2
    • 3
  • 相关阅读:
    docker、docker-compose安装教程,很详细
    SQL Server的备份和还原
    计算机网络(五):运输层
    1465. 切割后面积最大的蛋糕
    Python小波分析库pywt介绍
    vue项目配置代理解决跨域问题
    微信小程序地图polyline坐标太多异常显示BUG
    YOLOv5 Focus C3 各模块详解及代码实现
    manim边学边做--Matrix
    第八周学习笔记DAY.1-异常
  • 原文地址:https://blog.csdn.net/m0_58239511/article/details/127500015