1月10日学习内容整理：请求库selenium之基本使用

一、介绍

requests模块是模拟浏览器的请求向网站服务器获取数据，模拟请求的过程中若遇到比较复杂的请求会很麻烦，而且很容易会被服务器禁掉

而selenium模块则是驱动浏览器去访问服务器，完完全全模拟浏览器的操作

selenium最初是一个自动化测试工具,而爬虫中使用它主要是为了解决requests无法直接执行JavaScript代码的问题

selenium本质是通过驱动浏览器，完全模拟浏览器的操作，比如跳转、输入、点击、下拉等，来拿到网页渲染之后的结果，可支持多种浏览器

from selenium import webdriver
browser=webdriver.Chrome()
browser=webdriver.Firefox()
browser=webdriver.PhantomJS()
browser=webdriver.Safari()
browser=webdriver.Edge()

官网：http://selenium-python.readthedocs.io

二、安装

#安装：selenium+chromedriver
pip3 install selenium
下载chromdriver.exe放到python安装路径的scripts目录中即可，注意最新版本是2.29，并非2.9
国内镜像网站地址：http://npm.taobao.org/mirrors/chromedriver/2.29/
最新的版本去官网找:https://sites.google.com/a/chromium.org/chromedriver/downloads

#验证安装
C:\Users\Administrator>python3
Python 3.6.1 (v3.6.1:69c0db5, Mar 21 2017, 18:41:36) [MSC v.1900 64 bit (AMD64)] on win32
Type "help", "copyright", "credits" or "license" for more information.
>>> from selenium import webdriver
>>> driver=webdriver.Chrome() #弹出浏览器
>>> driver.get('https://www.baidu.com')
>>> driver.page_source

#注意：
selenium3默认支持的webdriver是Firfox，而Firefox需要安装geckodriver
下载链接：https://github.com/mozilla/geckodriver/releases

selenium+chromedriver

#安装：selenium+phantomjs
pip3 install selenium
下载phantomjs，解压后把phantomjs.exe所在的bin目录放到环境变量
下载链接：http://phantomjs.org/download.html

#验证安装
C:\Users\Administrator>phantomjs
phantomjs> console.log('egon gaga')
egon gaga
undefined
phantomjs> ^C
C:\Users\Administrator>python3
Python 3.6.1 (v3.6.1:69c0db5, Mar 21 2017, 18:41:36) [MSC v.1900 64 bit (AMD64)] on win32
Type "help", "copyright", "credits" or "license" for more information.
>>> from selenium import webdriver
>>> driver=webdriver.PhantomJS() #无界面浏览器
>>> driver.get('https://www.baidu.com')
>>> driver.page_source

selenium+phantomjs

三、基本使用

1、引入

from selenium import webdriver
from selenium.webdriver import ActionChains
from selenium.webdriver.common.by import By #按照什么方式查找，By.ID,By.CSS_SELECTOR
from selenium.webdriver.common.keys import Keys #键盘按键操作
from selenium.webdriver.support import expected_conditions as EC
from selenium.webdriver.support.wait import WebDriverWait #等待页面加载某些元素

2、得到一个浏览器对象

browser=webdriver.Chrome()

3、模拟浏览器发送请求

browser.get('https://www.baidu.com') 浏览器会自动弹出，并且显示请求的页面

4、用户在页面的输入框中输入内容，首先要找到这个输入框

input_tag=browser.find_element_by_id('kw') 得到了这个标签，通过id值查找到

5、在标签中输入内容

input_tag.send_keys('美女') #python2中输入中文错误，字符串前加个u

6、输入好后，按回车

input_tag.send_keys(Keys.ENTER) #输入回车

页面中若有需要二次请求的标签，比如图片，js文件等，可能整个页面加载不是立刻完成的，这时我们去找某个图片标签可能都没有加载好

这时就需要整个页面或者某些标签加载好后我们再去做其它操作

7、等整个页面加载好后或者等某些标签加载好后：

wait=WebDriverWait(browser,10) 参数是浏览器对象，10代表最多等10秒

wait.until(EC.presence_of_element_located((By.ID,'content_left'))) #等到id为content_left的元素加载完毕,最多等10秒

8、关闭浏览器，一定要记得这一步

browser.close()

补充：浏览器对象的一些属性和方法

整个页面的内容，字符串

print(browser.page_source)

URL地址

print(browser.current_url)

cookie信息，列表形式，里面是一个个字典

print(browser.get_cookies())

posted @ 2018-01-10 15:47 九二零阅读(111) 评论(0) 编辑收藏举报

会员力量，点亮园子希望

刷新页面返回顶部

王浩林

1月10日学习内容整理：请求库selenium之基本使用

公告