• Python网络爬虫与信息提取 第1周网络爬虫之规则 单元1:Requests库入门


    内容导学
    Requests
    Requests库入门

    https://www.python-requests.org

    Requests的安装方法
    命令行输入

    pip install requests
    
    • 1

    python IDLE中输入以下命令

    >>> import requests
    >>> r = requests.get("http://www.baidu.com")
    >>> r.status_code
    200
    >>> r.encoding = 'utf-8'
    >>> r.text
    '\r\n 百度一下,你就知道  

    关于百度 About Baidu

    ©2017 Baidu 使用百度前必读  意见反馈 京ICP证030173号 

    \r\n'
    • 1
    • 2
    • 3
    • 4
    • 5
    • 6
    • 7

    在这里插入图片描述

    Requests库的get()方法
    在这里插入图片描述
    requests.get(url,params = None,**kwargs)
    url:拟获取页面的url链接
    params:url中的额外参数,字典或字节流格式,可选
    **kwargs:12个控制访问的参数
    在这里插入图片描述
    在这里插入图片描述
    在这里插入图片描述
    在这里插入图片描述
    在这里插入图片描述

    >>> import requests
    >>> r = requests.get("http://www.baidu.com")
    >>> r.status_code
    200
    >>> r.encoding = 'utf-8'
    >>> r.text
    '\r\n 百度一下,你就知道  

    关于百度 About Baidu

    ©2017 Baidu 使用百度前必读  意见反馈 京ICP证030173号 

    \r\n'
    >>> type(r) <class 'requests.models.Response'> >>> r.headers {'Cache-Control': 'private, no-cache, no-store, proxy-revalidate, no-transform', 'Connection': 'keep-alive', 'Content-Encoding': 'gzip', 'Content-Type': 'text/html', 'Date': 'Sun, 21 Aug 2022 12:52:26 GMT', 'Last-Modified': 'Mon, 23 Jan 2017 13:28:24 GMT', 'Pragma': 'no-cache', 'Server': 'bfe/1.0.8.18', 'Set-Cookie': 'BDORZ=27315; max-age=86400; domain=.baidu.com; path=/', 'Transfer-Encoding': 'chunked'} >>> r.encoding 'utf-8' >>> r.apparent_encoding 'utf-8' >>> r.tetx Traceback (most recent call last): File "", line 1, in <module> r.tetx AttributeError: 'Response' object has no attribute 'tetx' >>> r.text '\r\n 百度一下,你就知道

    关于百度 About Baidu

    ©2017 Baidu 使用百度前必读  意见反馈 京ICP证030173号 

    \r\n'
    • 1
    • 2
    • 3
    • 4
    • 5
    • 6
    • 7
    • 8
    • 9
    • 10
    • 11
    • 12
    • 13
    • 14
    • 15
    • 16
    • 17
    • 18
    • 19
    • 20
    • 21
    • 22

    在这里插入图片描述
    r = requests.get(url)

    爬取网页的通用代码框架

    网络连接有风险,异常处理很重要
    在这里插入图片描述
    在这里插入图片描述
    在这里插入图片描述

    import requests
    
    def getHTMLText(url):
        try:
            r = requests.get(url,timeout = 30)
            r.raise_for_status() #如果状态不是200,引发HTTPError异常
            r.encoding = r.apparent_encoding
            return r.text
        except:
            return "产生异常"
    
    if __name__ == "__main__":
        url = "http://www.baidu.com"
        print(getHTMLText)
    
    • 1
    • 2
    • 3
    • 4
    • 5
    • 6
    • 7
    • 8
    • 9
    • 10
    • 11
    • 12
    • 13
    • 14

    http协议及Requests库方法
    在这里插入图片描述
    在这里插入图片描述
    在这里插入图片描述
    在这里插入图片描述
    在这里插入图片描述
    在这里插入图片描述
    在这里插入图片描述
    在这里插入图片描述
    在这里插入图片描述
    在这里插入图片描述
    在这里插入图片描述
    Requests主要方法解析
    在这里插入图片描述
    在这里插入图片描述
    在这里插入图片描述
    在这里插入图片描述
    在这里插入图片描述
    在这里插入图片描述
    在这里插入图片描述
    在这里插入图片描述
    在这里插入图片描述
    在这里插入图片描述
    在这里插入图片描述
    在这里插入图片描述
    在这里插入图片描述
    在这里插入图片描述
    在这里插入图片描述
    在这里插入图片描述
    在这里插入图片描述
    单元小结
    在这里插入图片描述
    在这里插入图片描述

  • 相关阅读:
    如何下载MySQL的JDBC驱动包
    阻塞队列BlockingQueue实战及其原理分析
    复杂任务中,流程的解耦设计
    fcntl函数
    2024.2.16力扣每日一题——二叉树的锯齿形层序遍历
    开一家咖啡店应具备什么
    性能测试-基础理论知识
    简述CompletableFuture异步任务编排
    SpringCloud-7-Spring Boot使用Jetty容器
    5. 最长回文子串
  • 原文地址:https://blog.csdn.net/qq_37975179/article/details/126455219