目的
工作中遇到一个需求,通过需要通过网站查询船舶名称得到MMSI码,网站来自船讯网。
分析请求
根据以往爬虫的经验,打开F12,通过输入船舶名称,观察发送的请求,发现返回数据的网址
本身网址是一个get请求,直接用这个网址请求,也能返回数据,即网址本身并没有加密,这就简单许多,直接通过改变参数,就能实现数据的获取,马上开始动手
编写代码
代码中,通过request发送请求,为了不给服务器造成太大压力,每隔0.5秒发送一个请求,因为会出现查询不到的情况,通过exception判断,数据结果一是通过pandas中的to_excel存为excel文件,或者是直接通过pymysql入数据库,为了提高入库的速度,采用一次拼接三百条的方式入库
import requests import os import time import pymysql import pandas as pd import re ''' author:shikailiang function:通过读取船舶数据,分别请求拿到json数据入库 ''' #定义入库的类 class company_ship_in_database: def __init__(self): self.conn = pymysql.connect(host="192.168.1.222", user="root", password="Cjh#Sjzx@", database="test", charset="utf8") self.cursor = self.conn.cursor() #获取当前文件的父级地址 self.last_path = os.path.abspath(os.path.dirname(os.getcwd())) #写入mysql def in_database(self,data_list): #j用来对数据进行计数 j=1 #定义sql sql = "" #定义sql头 sql0 = "insert into bms_company_ship_test(oc_name,ship_name,mmsi) values" rowcount=len(data_list) for i in data_list: #定义拼接sql sql2 = (("(" + "'{}'," * 3)[:-1] + ")").format(i[1][0],i[1][1],i[0]) sql = sql + "," + sql2 # print(sql0 + sql[1:]) if divmod(j, 300)[1] == 0 or j == rowcount: #如果执行错误回滚当前事务 # print(sql0 + sql[1:]) try: self.cursor.execute(sql0 + sql[1:]) except: #执行错误,回滚事务 self.conn.rollback() continue sql= "" self.conn.commit() j=j+1 #通过pandas写入excel def in_xls(self, data_list): df=pd.DataFrame(data_list) #通过pandas实现存为excel df.to_excel(self.last_path + r"\data\result.xls",header=False,index=False) #请求船的方法 def company_ship_in_database(self): data_path = self.last_path + r"\data" file=open(data_path + "\company.txt") data=[] j = 0 for i in file.readlines(): #将船公司和船舶名称分开 chuan=i.strip().split() dic={ 'f':'auto', 'kw':chuan[1] } rq=requests.get("http://searchv3.shipxy.com/shipdata/search3.ashx",params=dic) #判断是否请求成功 if rq.status_code==200: try: result_json=rq.json() result=result_json['ship'][0] #判断船舶数字部分是否相同 if re.search('\d+',result['n']).group()==re.search('\d+',chuan[1]).group(): result=result['m'] data.append([result,chuan]) else: data.append(["", chuan]) except: data.append(["",chuan]) else: print(chuan + "请求错误") time.sleep(0.5) j = j + 1 if divmod(j,100)[1] == 0: print("已经请求" + str(j) + "条") # if j > 10: # self.in_xls(data) # break self.in_database(data) if __name__=="__main__": company_ship=company_ship_in_database() company_ship.company_ship_in_database()
尾记
写程序的过程中其实有发现一个问题,即我们请求的其实是输入文字时候自动发送的请求,其实有一个问题,如果我们需要查询的是"华为5"的船,但是如果系统中没有这个船,就是返回"华为548"扽船,所以在代码中需要做一个判断
即用正则提取出船的数字,然后和返回的船的数字进行比对,如果一致,即为同一条船舶
总结
以上所述是小编给大家介绍的基于Python实现船舶的MMSI的获取,希望对大家有所帮助,如果大家有任何疑问请给我留言,小编会及时回复大家的。在此也非常感谢大家对网站的支持!
如果你觉得本文对你有帮助,欢迎转载,烦请注明出处,谢谢!
免责声明:本站文章均来自网站采集或用户投稿,网站不提供任何软件下载或自行开发的软件! 如有用户或公司发现本站内容信息存在侵权行为,请邮件告知! 858582#qq.com
稳了!魔兽国服回归的3条重磅消息!官宣时间再确认!
昨天有一位朋友在大神群里分享,自己亚服账号被封号之后居然弹出了国服的封号信息对话框。
这里面让他访问的是一个国服的战网网址,com.cn和后面的zh都非常明白地表明这就是国服战网。
而他在复制这个网址并且进行登录之后,确实是网易的网址,也就是我们熟悉的停服之后国服发布的暴雪游戏产品运营到期开放退款的说明。这是一件比较奇怪的事情,因为以前都没有出现这样的情况,现在突然提示跳转到国服战网的网址,是不是说明了简体中文客户端已经开始进行更新了呢?
更新日志
- 雨林唱片《赏》新曲+精选集SACD版[ISO][2.3G]
- 罗大佑与OK男女合唱团.1995-再会吧!素兰【音乐工厂】【WAV+CUE】
- 草蜢.1993-宝贝对不起(国)【宝丽金】【WAV+CUE】
- 杨培安.2009-抒·情(EP)【擎天娱乐】【WAV+CUE】
- 周慧敏《EndlessDream》[WAV+CUE]
- 彭芳《纯色角3》2007[WAV+CUE]
- 江志丰2008-今生为你[豪记][WAV+CUE]
- 罗大佑1994《恋曲2000》音乐工厂[WAV+CUE][1G]
- 群星《一首歌一个故事》赵英俊某些作品重唱企划[FLAC分轨][1G]
- 群星《网易云英文歌曲播放量TOP100》[MP3][1G]
- 方大同.2024-梦想家TheDreamer【赋音乐】【FLAC分轨】
- 李慧珍.2007-爱死了【华谊兄弟】【WAV+CUE】
- 王大文.2019-国际太空站【环球】【FLAC分轨】
- 群星《2022超好听的十倍音质网络歌曲(163)》U盘音乐[WAV分轨][1.1G]
- 童丽《啼笑姻缘》头版限量编号24K金碟[低速原抓WAV+CUE][1.1G]