• 手写一个简单爬虫--手刃豆瓣top250排行榜


     

    1. #拿到页面面源代码 request
    2. #通过re来提取想要的有效信息 re
    3. import requests
    4. import re
    5. url="https://movie.douban.com/top250"
    6. headers={
    7. "user-agent":"Mozilla/5.0 (Windows NT 10.0; Win64; x64) AppleWebKit/537.36 (KHTML, like Gecko) Chrome/115.0.0.0 Safari/537.36"}
    8. resp=requests.get(url,headers=headers)
    9. page_content=resp.text
    10. #解析数据
    11. obj=re.compile(r'
    12. .*?
      .*?(?P.*?)'
  • r'.*?

    .*?
    .*?(?P.*?) .*?(?P.*?).*?(?P.*?)人',re.S)

  • result=obj.finditer(page_content)
  • for it in result:
  • print(it.group("name"))
  • print(it.group("year").strip())
  • print(it.group("score"))
  • print(it.group("people")+" peple judge")
  • #上述操作在于爬取文件
  • 相关阅读:
    java对象以及引用方式
    服务器搭建日记(一):准备工作
    rust中结构体的属性默认是不能修改的,要想修改可以有两种方式
    wps文件没有保存怎么恢复?
    23种设计模式之:命令模式
    基于SSM的动漫商城管理系统
    38、HTML进阶——SVG
    Java高级---Spring Boot---1引言
    【剑指 Offer 56 - II. 数组中数字出现的次数 II】
    商业化广告--体系学习--5--广告产品存在那些共性和区别
  • 原文地址:https://blog.csdn.net/Ultravioletrays/article/details/132592321