selenuim自动化爬取汽车在线谷米爱车网车辆GPS数据爬虫

#为了实时获取车辆信息，以及为了后面进行行使轨迹绘图，写了一个基于selelnium的爬虫爬取了车辆gps数据。

#在这里发现selenium可以很好的实现网页解析和处理js处理

#导包

import time
from selenium import webdriver
from selenium.webdriver.support.wait import WebDriverWait

#以下两个包是为了设置显示等待（从网上复制的）
from selenium.webdriver.support import expected_conditions as EC
from selenium.webdriver.common.by import By

class Car_Lines():
　　def __init__(self):
　　　　self.driver = webdriver.Chrome()

#登录网站
　　def login_web(self):
　　　　self.driver.get('http://www.gpsoo.net/index.shtml')
　　　　time.sleep(0.5)
　　　　while 1:
　　　　　　try:
　　　　　　　　self.driver.find_element_by_id('loginToggle').click()
　　　　　　　　self.driver.find_element_by_class_name('first').click()
　　　　　　　　self.driver.find_element_by_id('txtUserName').send_keys('***')
　　　　　　　　self.driver.find_element_by_id('txtPwd').send_keys('***')
　　　　　　　　self.driver.find_element_by_class_name('login_btn').click()
　　　　　　　　print('已成功登录')
　　　　　　　　break
　　　　　　except:
　　　　　　　　print('未登录成功，继续登录')

# 点击下载轨迹
　　def download_data(self):
　　　　self.driver.find_element_by_xpath("//div[@id='dl-gps-data']/span").click()
　　　　self.clear_js()

　　　　#清楚原始输入框的信息
　　　　self.driver.find_element_by_id('dl-from').clear()

　　　　#此处传入下载起始时间
　　　　self.driver.find_element_by_id('dl-from').send_keys(self.seven_day())
　　　　time.sleep(2)
　　　　self.driver.find_element_by_id("dl-data-btn").click()
　　　　self.driver.back()

#车辆信息
　　def info(self,x):

　　　　#此处url是一个iframe框里的url地址，可以进入页面时刷新页面会出现
　　　　self.driver.get(url)
　　　　time.sleep(1)
　　　　#给xpath传入变量,解析三种车辆，此处用format传入
　　　　info = self.driver.find_elements_by_xpath("//div[@groupid={}]/div[@class='group_canvas']/div".format(x))
　　　　time.sleep(0.5)
　　　　return info

#消除input框的readonly属性
　　def clear_js(self):
　　　　try:

　　　　　　#首先因为id为dl-from的标签在网页源码中是不存在的，此处是通过js加载出来，所以设置显示等待等待dl-from标签加载出来

　　　　　　#显示等待可以按频率一直等到标签出现，此处合适，有利于时间利用
　　　　　　WebDriverWait(self.driver, 20, 0.5).until(EC.presence_of_element_located((By.ID, "dl-from")))
　　　　　　except Exception as e:
　　　　　　print(e)

　　　　　　#同时这个标签是一个只读标签，因为此处是个日期控件，需要设置js消除标签的只读属性
　　　　　　js = 'document.getElementById("dl-from").removeAttribute("readonly");'
　　　　　　return self.driver.execute_script(js)

#时间间隔为7天
　　def seven_day(self):

　　　　#用datetime包算出七天前的日期时间
　　　　t1 = time.time()
　　　　t2 = t2 = t1 - 86400 * 7
　　　　t2_1 = time.localtime(t2)
　　　　t3 = time.strftime("%Y-%m-%d %H:%M:%S", t2_1)
　　　　return t3

#获取车辆ID和username并下载轨迹
　　def get_id_username(self,x):
　　#默认的id及用户
　　　　id = '***'
　　　　username = "***"
　　　　#遍历所有车辆
　　　　for i in range(99):
　　　　#这里并不是遍历了99次，因为每一类型车辆数量不足99，也为了节省时间和处理不确定情况，所以while循环是在最后一辆结束后再10次爬取后停止爬取
　　　　j = 10
　　　　while j > 0:
　　　　　　try:

　　　　　　　　#遍历获取每一辆车的id和username
　　　　　　　　id = self.info(x)[i].get_attribute('id')
　　　　　　　　username = self.info(x)[i].get_attribute('username')
　　　　　　　　print('id获取成功')
　　　　　　　　break
　　　　　　except:
　　　　　　　　print('继续获取id')
　　　　　　j -= 1
　　　　if j == 0:
　　　　　　break

　　　　#传入url车辆id和username构建url地址获取每辆车信息
　　　　self.driver.get('http://mapoo.10010care.com/user/playback.shtml?　　v=20190401.1357&lang=cn&mds=&requestSource=web&custid=233257382459121121&loginUrl=http://www1.gpsoo1.net/&logout=http://www1.gpsoo1.net/?ip&psip=in1.gpsoo1.net/&custname=' + username + '&random=232423452784459&objectid=' + id)
　　　　time.sleep(1)

　　　　self.download_data()
　　　　print(username + '已下载成功')
　　　　time.sleep(1)

#这里有三类所以分三种爬取

#爬取默认组的
　　def onLine(self, l1):

　　　　#l1 = [a, b, c]三个参数是三种情况

　　　　for i in l1:
　　　　　　print('开始爬取正在使用的'+i+'车辆')
　　　　　　self.get_id_username(i)
　　　　　　print('爬取完毕')

#退出
　　def close_web(self):
　　　　self.driver.quit()

#主函数
　　def main(self):
　　　　self.login_web()
　　　　self.onLine(l1)
　　　　self.close_web()

if __name__ == '__main__':
　　c = Car_Lines()
　　c.main()

#可以发现已经下载成功间隔为7天的车辆信息

posted @ 2019-04-15 10:39 温祖斌阅读(758) 评论(0) 收藏举报

刷新页面返回顶部

温祖斌

selenuim自动化爬取汽车在线谷米爱车网车辆GPS数据爬虫

公告