今日内容概要
- selenium的使用
- 打码平台使用
- xpath使用
- 爬取京东商品信息
- scrapy 介绍和安装
内容详细
1、selenium模块的使用
pip3 install selenium
https://registry.npmmirror.com/binary.html?path=chromedriver/
跟浏览器版本一定要对应
100.0.4896.127----》驱动也要对应https://registry.npmmirror.com/binary.html?path=chromedriver/101.0.4951.41/
如果没有具体版本找一个最接近的
把驱动放在项目下
1.0 基本使用
from selenium import webdriver
import time
bro = webdriver.Chrome(executable_path='chromedriver.exe')
bro.get('https://www.baidu.com')
search = bro.find_element_by_id('kw')
search.send_keys("美女")
button = bro.find_element_by_id('su')
button.click()
time.sleep(2)
print(bro.page_source)
with open('baidu.html', 'w', encoding='utf-8') as f:
f.write(bro.page_source)
bro.close()
1.1 无头浏览器
from selenium import webdriver
from selenium.webdriver.chrome.options import Options
chrome_options = Options()
chrome_options.add_argument('window-size=1920x3000')
chrome_options.add_argument('--disable-gpu')
chrome_options.add_argument('--hide-scrollbars')
chrome_options.add_argument('blinfk-settings=imagesEnabled=alse')
chrome_options.add_argument('--headless')
bro = webdriver.Chrome(executable_path='./chromedriver', options=chrome_options)
bro.get('http://www.cnblogs.com')
print(bro.page_source)
bro.close()
1.2 获取元素位置,属性,大小
补充:标签位置和大小:size和location
print(tag.id)
print(tag.location)
print(tag.tag_name)
print(tag.size)
from selenium import webdriver
import time
from PIL import Image
bro = webdriver.Chrome(executable_path='./chromedriver')
bro.get('https://www.jd.com/')
bro.implicitly_wait(10)
img = bro.find_element_by_css_selector('a.logo_tit_lk')
location = img.location
size = img.size
bro.save_screenshot('./main.png')
img_tu = (
int(location['x']), int(location['y']), int(location['x'] + size['width']), int(location['y'] + size['height']))
img = Image.open('./main.png')
code_img = img.crop(img_tu)
code_img.save('./code.png')
bro.close()

1.3 等待元素被加载
显示等待:每个标签都要写等待逻辑
隐式等待:任何要取的标签都遵循这个逻辑,只需要写一次(推荐用)
bro.implicitly_wait(10)
1.4 元素操作
from selenium import webdriver
import time
bro = webdriver.Chrome(executable_path='./chromedriver')
bro.get('https://www.baidu.com/')
bro.implicitly_wait(10)
login_a = bro.find_element_by_link_text('登录')
login_a.click()
login_pwd_btn = bro.find_element_by_id('TANGRAM__PSP_11__changePwdCodeItem')
login_pwd_btn.click()
username = bro.find_element_by_name('userName')
pwd = bro.find_element_by_css_selector('#TANGRAM__PSP_11__password')
username.send_keys("30033445@qq.com")
pwd.send_keys('lqz12345678')
time.sleep(3)
username.clear()
username.send_keys("lqz12345@qq.com")
submit = bro.find_element_by_id('TANGRAM__PSP_11__submit')
submit.click()
time.sleep(5)
bro.close()
1.5 执行js
from selenium import webdriver
import time
bro = webdriver.Chrome(executable_path='./chromedriver')
bro.get('https://www.pearvideo.com/category_9')
bro.implicitly_wait(10)
time.sleep(5)
bro.close()
1.6 切换选项卡
import time
from selenium import webdriver
browser = webdriver.Chrome(executable_path='./chromedriver')
browser.get('https://www.baidu.com')
browser.execute_script('window.open()')
print(browser.window_handles)
browser.switch_to.window(browser.window_handles[1])
browser.get('https://www.taobao.com')
time.sleep(2)
browser.switch_to.window(browser.window_handles[0])
browser.get('https://www.sina.com.cn')
browser.close()
browser.quit()
1.7 模拟前进后退
import time
from selenium import webdriver
browser = webdriver.Chrome(executable_path='./chromedriver')
browser.get('https://www.baidu.com')
browser.get('https://www.taobao.com')
browser.get('http://www.sina.com.cn/')
browser.back()
time.sleep(2)
browser.forward()
browser.close()
1.8 异常处理
from selenium import webdriver
from selenium.common.exceptions import TimeoutException, NoSuchElementException, NoSuchFrameException
try:
browser = webdriver.Chrome()
browser.get('http://www.runoob.com/try/try.php?filename=jqueryui-api-droppable')
browser.switch_to.frame('iframssseResult')
except TimeoutException as e:
print(e)
except NoSuchFrameException as e:
print(e)
finally:
browser.close()
1.9 selenium登录cnblogs获取cookie
from selenium import webdriver
import json
import time
bro = webdriver.Chrome(executable_path='./chromedriver')
try:
bro.get('http://www.cnblogs.com')
bro.implicitly_wait(10)
with open('cnblogs.json', 'r', encoding='utf-8') as f:
cookie_dic = json.load(f)
for item in cookie_dic:
bro.add_cookie(item)
bro.refresh()
time.sleep(2)
except Exception as e:
print(e)
finally:
bro.close()
1.10 抽屉半自动点赞
from selenium import webdriver
import time
import json
import requests
from bs4 import BeautifulSoup
header = {
'User-Agent': 'Mozilla/5.0 (Macintosh; Intel Mac OS X 10_15_7) AppleWebKit/537.36 (KHTML, like Gecko) Chrome/101.0.4951.54 Safari/537.36'
}
res = requests.get('https://dig.chouti.com/', headers=header)
soup = BeautifulSoup(res.text, 'lxml')
div_list = soup.find_all(class_='link-item')
for div in div_list:
article_id = div.attrs.get('data-id')
print(article_id)
if article_id:
data = {
'linkId': article_id
}
cookie = {}
with open('chouti.json', 'r') as f:
res = json.load(f)
for item in res:
cookie[item['name']] = item['value']
res = requests.post('https://dig.chouti.com/link/vote', headers=header, data=data, cookies=cookie)
print(res.text)
2、打码平台使用
开发文档:python示例代码
应用案例:爬虫采集技术,自动智能化、人工化(大妈破解--》传给你)多种模式兼备
价格体系:1元=1000分
import requests
from hashlib import md5
class ChaojiyingClient():
def __init__(self, username, password, soft_id):
self.username = username
password = password.encode('utf8')
self.password = md5(password).hexdigest()
self.soft_id = soft_id
self.base_params = {
'user': self.username,
'pass2': self.password,
'softid': self.soft_id,
}
self.headers = {
'Connection': 'Keep-Alive',
'User-Agent': 'Mozilla/4.0 (compatible; MSIE 8.0; Windows NT 5.1; Trident/4.0)',
}
def PostPic(self, im, codetype):
"""
im: 图片字节
codetype: 题目类型 参考 http://www.chaojiying.com/price.html
"""
params = {
'codetype': codetype,
}
params.update(self.base_params)
files = {'userfile': ('ccc.jpg', im)}
r = requests.post('http://upload.chaojiying.net/Upload/Processing.php', data=params, files=files,
headers=self.headers)
return r.json()
def PostPic_base64(self, base64_str, codetype):
"""
im: 图片字节
codetype: 题目类型 参考 http://www.chaojiying.com/price.html
"""
params = {
'codetype': codetype,
'file_base64': base64_str
}
params.update(self.base_params)
r = requests.post('http://upload.chaojiying.net/Upload/Processing.php', data=params, headers=self.headers)
return r.json()
def ReportError(self, im_id):
"""
im_id:报错题目的图片ID
"""
params = {
'id': im_id,
}
params.update(self.base_params)
r = requests.post('http://upload.chaojiying.net/Upload/ReportError.php', data=params, headers=self.headers)
return r.json()
if __name__ == '__main__':
chaojiying = ChaojiyingClient('306334678', 'lqz12345', '903641')
im = open('./b.png', 'rb').read()
print(chaojiying.PostPic(im, 6001))


3、xpath使用
.
..
/
//
nodename
// div
/ div
*
@href
/ text()
doc = '''
<html>
<head>
<base href='http://example.com/' />
<title>Example website</title>
</head>
<body>
<div id='images'>
<a href='image1.html' id='id_a'>Name: My image 1 <br /><img src='image1_thumb.jpg' /></a>
<a href='image2.html'>Name: My image 2 <br /><img src='image2_thumb.jpg' /></a>
<a href='image3.html'>Name: My image 3 <br /><img src='image3_thumb.jpg' /></a>
<a href='image4.html'>Name: My image 4 <br /><img src='image4_thumb.jpg' /></a>
<a href='image5.html' class='li li-item' name='items'>Name: My image 5 <br /><img src='image5_thumb.jpg' /></a>
<a href='image6.html' name='items'><span><h5>test</h5></span>Name: My image 6 <br /><img src='image6_thumb.jpg' /></a>
</div>
</body>
</html>
'''
from lxml import etree
html = etree.HTML(doc)
a = html.xpath('//*')
a = html.xpath('//head')
a = html.xpath('//body//a')
a = html.xpath('//body//a[1]/parent::body')
a = html.xpath('//body//a[@href="image1.html"]')
a = html.xpath('//body//a[@href="image1.html"]/text()')
a = html.xpath('//body//a[1]/@href')
a = html.xpath('//body//a[contains(@class,"li")]/text()')
a = html.xpath('//body//a[contains(@class,"li")]/text()')
a = html.xpath('//a[last()-2]/@href')
a = html.xpath('//a[6]/descendant::*')
a = html.xpath('//a[1]/following-sibling::*[2]/@href')
print(a)
4、使用selenium爬取京东商品信息
from selenium import webdriver
from selenium.webdriver.common.keys import Keys
import time
def get_goods(driver):
try:
goods = driver.find_elements_by_class_name('gl-item')
for good in goods:
detail_url = good.find_element_by_tag_name('a').get_attribute('href')
p_name = good.find_element_by_css_selector('.p-name em').text.replace('\n', '')
price = good.find_element_by_css_selector('.p-price i').text
p_commit = good.find_element_by_css_selector('.p-commit a').text
img = good.find_element_by_css_selector('div.p-img img').get_attribute('src')
if not img:
img = 'http:' + good.find_element_by_css_selector('div.p-img img').get_attribute('data-lazy-img')
msg = '''
商品 : %s
链接 : %s
图片 : %s
价钱 :%s
评论 :%s
''' % (p_name, detail_url, img, price, p_commit)
print(msg, end='\n\n')
button = driver.find_element_by_partial_link_text('下一页')
button.click()
time.sleep(1)
get_goods(driver)
except Exception:
pass
def spider(url, keyword):
driver = webdriver.Chrome(executable_path='./chromedriver')
driver.get(url)
driver.implicitly_wait(3)
try:
input_tag = driver.find_element_by_id('key')
input_tag.send_keys(keyword)
input_tag.send_keys(Keys.ENTER)
get_goods(driver)
finally:
driver.close()
if __name__ == '__main__':
spider('https://www.jd.com/', keyword='精品内衣')
5、scrapy框架 介绍和安装
框架 类似于djagno框架,在固定的位置写固定的代码即可
pip3 install scrapy
win上可能装不上(90%都能装上)---》其实是因为twisted装不上
1、pip3 install wheel
2、pip3 install lxml
3、pip3 install pyopenssl
4、下载并安装pywin32:https://sourceforge.net/projects/pywin32/files/pywin32/
5、下载twisted的wheel文件:http://www.lfd.uci.edu/~gohlke/pythonlibs/
6、执行pip3 install 下载目录\Twisted-17.9.0-cp36-cp36m-win_amd64.whl
7、pip3 install scrapy
可以到cmd窗口下执行
scrapy startproject myfirst
使用pycharm打开
scrapy genspider 爬虫名 爬虫地址
scrapy genspider cnblogs www.cnblogs.com
scrapy crawl cnblogs