码农知识堂 - 1000bd
  •   Python
  •   PHP
  •   JS/TS
  •   JAVA
  •   C/C++
  •   C#
  •   GO
  •   Kotlin
  •   Swift
  • scrapy框架选择器


    scrapy框架选择器

    Scrapy有自己的数据提取机制。它们被称为选择器,因为它们“选择”HTML文档的某些部分 XPath 或 CSS 表达。

    • XPath是一种在XML文档中选择节点的语言,也可以与HTML一起使用。

    • CSS是用于将样式应用于HTML文档的语言。它定义选择器,将这些样式与特定的HTML元素相关联。

    参考文献:scrapy官方文档-选择器https://docs.scrapy.org/en/latest/topics/selectors.html

    一、使用选择器

    1.构建选择器

    response.selector.xpath('//span/text()').get() #提取span标签内的值
    
    • 1
    • 响应对象公开 Selector实例对 .selector 属性

    selector是一个很薄的包装 parsel library;这个包装器的目的是提供更好的与slapy响应对象的集成。

    parsel 是一个独立的网页爬取库,可以使用没有 Scrapy 。它使用 lxml库位于引擎盖下,并在LXML API之上实现一个简单的API。这意味着scrapy选择器在速度和解析精度方面与lxml非常相似。

    • 使用xpath和css查询响应非常常见,因此响应中还包含两个快捷方式:

      • response.xpath()

      • response.css()

        response.xpath('//span/text()').get() 	#xpath
        response.css('span::text').get()		#css
        
        • 1
        • 2
    • 如果需要,可以使用 Selector 直接。从文本构建:

      from scrapy.selector import Selector
      body = 'good'
      Selector(text=body).xpath('//span/text()').get()
      
      • 1
      • 2
      • 3

    2.使用选择器

    以scrapy官方文档为例示例:https://docs.scrapy.org/en/latest/_static/selectors-sample1.html

    第一步:获取页面节点元素

    response.xpath('//title/text()') #结果:[]
    
    • 1

    第二步:获取文本内容

    response.xpath('//title/text()').getall() 	#['Example website']
    response.xpath('//title/text()').get()		#'Example website'
    
    • 1
    • 2
    • **.get()**总是返回一个结果;如果有多个匹配项,则返回第一个匹配项的内容;如果没有匹配项,则返回None。

    • **.getall()**返回包含所有结果的列表。

    • 除了使用例如**@srcXPath之外,还可以使用.attrib**a的属性查询属性Selector

    案例:

    response.css('img').attrib['src'] 	#获取图片链接
    
    • 1

    3.将选择器与正则表达式一起使用

    Selector还提供了**.re()一种使用正则表达式提取数据的方法。但是,与使用.xpath()**或 **.css()方法不同,它.re()返回字符串列表。因此,您无法构造嵌套.re()**调用。

    案例:

    response.xpath('//a[contains(@href, "image")]/text()').re(r'Name:\s*(.*)') 
    
    • 1
  • 相关阅读:
    力扣第347题 堆(优先队列) 经典题 c++ 简易注释版 附(相关知识点解答)
    Leetcode_C++之525. Contiguous Array(连续子数组)
    遗传算法GA求解TSP问题
    简约的博客网页制作 大学生个人博客网页设计模板 学生个人网页成品 DIV简单个人网站作品下载 静态HTML CSS个人网页作业源代码
    【OpenPCDet】稀疏卷积SPConv-v1.2代码解读(3)
    Flume(二)
    2023亿发数字化智能工单,专业管理工单处理全流程,助力企业转型腾飞
    一道题让你秒懂Java中静态代码块、构造代码块、构造方法、普通代码块、main函数的执行顺序
    Spring Boot集成WebSocket以及基本使用
    React报错之Expected `onClick` listener to be a function
  • 原文地址:https://blog.csdn.net/zhongjianboy/article/details/126776588
  • 最新文章
  • 沪漂五周年了:我越来越迷茫了
    Agentic Skill Routing 实战:别再把所有 Skill 塞进 AI Agent 上下文
    MySQL-Seconds_behind_master的精度误差
    [MAF预定义ChatClient中间件-03]CachingChatClient——利用缓存省钱省时间
    AI的至暗历史:从万众期待到被政府撤资,AI的两次死亡徘徊
    Agent OS :五种驯服不确定性的范式
    PortSwigger SQL注入LAB11
    数据库即时编译JIT
    [Begin]AI Learn Data Day 0
    深度学习进阶(二十七)现代 LLM 的核心架构设计其二:SwiGLU
  • 热门文章
  • 十款代码表白小特效 一个比一个浪漫 赶紧收藏起来吧!!!
    奉劝各位学弟学妹们,该打造你的技术影响力了!
    五年了,我在 CSDN 的两个一百万。
    Java俄罗斯方块,老程序员花了一个周末,连接中学年代!
    面试官都震惊,你这网络基础可以啊!
    你真的会用百度吗?我不信 — 那些不为人知的搜索引擎语法
    心情不好的时候,用 Python 画棵樱花树送给自己吧
    通宵一晚做出来的一款类似CS的第一人称射击游戏Demo!原来做游戏也不是很难,连憨憨学妹都学会了!
    13 万字 C 语言从入门到精通保姆级教程2021 年版
    10行代码集2000张美女图,Python爬虫120例,再上征途
小工具 小游戏
Copyright © 2022 侵权请联系2656653265@qq.com    京ICP备2022015340号-1

京公网安备 11010502049817号