python正则分析nginx的访问日志

脚本专栏 2025/1/11 佚名

3 2 1

圆月山庄资源网 Design By www.vgjia.com

前言

本文的脚本是分析nginx的访问日志，主要为了检查站点uri的访问次数的，检查的结果会提供给研发人员做参考，因为谈到分析嘛，那肯定要用到正则表达式了，所以请没有接触过正则的小伙伴自行补脑，因为涉及正则的内容，实在没法展开写，正则的内容太过庞大，根本不是一篇两篇能写清楚的。

开始前，我们先看看要分析的日志结构：

127.0.0.1 - - [19/Jun/2012:09:16:22 +0100] "GET /GO.jpg HTTP/1.1" 499 0 "http://domain.com/htm_data/7/1206/758536.html" "Mozilla/4.0 (compatible; MSIE 7.0; Windows NT 5.1; Trident/4.0; .NET CLR 1.1.4322; .NET CLR 2.0.50727; .NET CLR 3.0.4506.2152; .NET CLR 3.5.30729; SE 2.X MetaSr 1.0)"
127.0.0.1 - - [19/Jun/2012:09:16:25 +0100] "GET /Zyb.gif HTTP/1.1" 499 0 "http://domain.com/htm_data/7/1206/758536.html" "Mozilla/4.0 (compatible; MSIE 6.0; Windows NT 5.1; QQDownload 711; SV1; .NET4.0C; .NET4.0E; 360SE)"

这是修改过的日志内容，敏感内容都以删除或替换了，不过不影响我们的分析结果，当然格式什么的这都不重要，Nginx访问日志是可以自定义的，每家公司可能都会稍有不同，所以要能理解脚本内容，并通过自己修改应用到了自己工作中才是重点，我给的日志格式也就是个参考，我打赌你在你公司服务器上看到的日志格式肯定跟我的格式不一样，看完日志格式，我们开始要写我们的脚本了

我先贴代码，稍后解释：

import re
from operator import itemgetter
 
def parser_logfile(logfile):
 pattern = (r''
   '(\d+.\d+.\d+.\d+)\s-\s-\s' #IP address
   '\[(.+)\]\s' #datetime
   '"GET\s(.+)\s\w+/.+"\s' #requested file
   '(\d+)\s' #status
   '(\d+)\s' #bandwidth
   '"(.+)"\s' #referrer
   '"(.+)"' #user agent
  )
 fi = open(logfile, 'r')
 url_list = []
 for line in fi:
  url_list.append(re.findall(pattern, line))
 fi.close()
 return url_list
 
def parser_urllist(url_list):
 urls = []
 for url in url_list:
  for r in url: 
   urls.append(r[5])
 return urls
 
def get_urldict(urls):
 d = {}
 for url in urls:
  d[url] = d.get(url,0)+1
 return d
 
def url_count(logfile):
 url_list = parser_logfile(logfile)
 urls = parser_urllist(url_list)
 totals = get_urldict(urls)
 return totals
 
if __name__ == '__main__':
 urls_with_counts = url_count('example.log')
 sorted_by_count = sorted(urls_with_counts.items(), key=itemgetter(1), reverse=True)
 print(sorted_by_count)

脚本解释，parser_logfile()函数功能是分析日志，返回匹配的行列表，正则部分就不解释了，大家看注释应该知道它是匹配什么内容的，parser_urllist()函数功能是将获取用户访问的url，get_urldict()函数功能是返回一个字典，以url为键，如果键相同值增1，返回的字典是每个url和最大的访问次数，url_count()函数功能就是调用了之前定义的函数，主函数部分，就说说itemgetter，它可以实现按指定元素进行排序，举例就明白了：

> from operator import itemgetter
> a=[('b',2),('a',1),('c',0)] 
> s=sorted(a,key=itemgetter(1))
> s
[('c', 0), ('a', 1), ('b', 2)]
> s=sorted(a,key=itemgetter(0))
> s
[('a', 1), ('b', 2), ('c', 0)]

reverse=True参数表示降序排序，就是从大到小排序，脚本运行结果：

[('http://domain.com/htm_data/7/1206/758536.html', 141), ('http://domain.com/?q=node&page=12', 3), ('http://website.net/htm_data/7/1206/758536.html', 1)]

总结

以上就是这篇文章的全部内容了，希望本文的内容对大家的学习或者工作能带来一定的帮助，如果有疑问大家可以留言交流，谢谢大家对的支持。

python,nginx日志,nginx日志解析,python,nginx,日志分析

标签：

python,nginx日志,nginx日志解析,python,nginx,日志分析

圆月山庄资源网 Design By www.vgjia.com

广告合作：本站广告合作请联系QQ：858582 申请时备注：广告合作（否则不回）
免责声明：本站文章均来自网站采集或用户投稿，网站不提供任何软件下载或自行开发的软件！如有用户或公司发现本站内容信息存在侵权行为，请邮件告知！ 858582#qq.com

圆月山庄资源网 Design By www.vgjia.com

评论“python正则分析nginx的访问日志”

暂无评论...

www.vgjia.com 圆月山庄资源网

139,976互联网资源

144,792高清电影

21,817无损音乐

631,128技术资源

最新文章

转载一个别人收藏的精典网站Ruby,HIBERNATE

2025/1/11

可与Spreadsheets媲美的在线表格系统:EditG

2025/1/11

cygwin使用心得

2025/1/11

脚本的DVD开发

2025/1/11

局域网设置自动配置脚本文件的写法与用途

2025/1/11

一句话新闻

苹果官宣WWDC 2024！预计会有大批AI功能 - 2025/1/11

3月27日消息，苹果宣布2024年全球开发者大会（WWDC）将于6月10日至6月14日举行，巧合的是，这次大会与端午假期重合。

苹果官方表示：

在线参加 Apple 每年规模最大的开发者盛会。亲眼见证 Apple 最新平台、技术和工具的发布。了解如何创建和改进你的 App 和游戏。与 Apple 设计师和工程师互动交流，与全球开发者社区建立联系。以上活动均免费在线举行。

探索各种新的工具、框架和功能，助力你打造出理想的 App 和游戏。通过视频讲座学习新技能，与 Apple 专家进行一对一会面，以推进你的项目，完善你的构思。

Swift Student Challenge 旨在支持和鼓舞下一代开发者、创作者和企业家。太平洋时间 3 月 28 日，我们将公布今年的获奖者名单。获奖者将有资格参加在 Apple Park 举办的特别活动。我们还会选出 50 名杰出获胜者，他们将受邀前往库比提诺，获得为期三天的非凡体验，包括参加 Apple Park 的特别活动。

python正则分析nginx的访问日志

python,nginx日志,nginx日志解析,python,nginx,日志分析

python subprocess 杀掉全部派生的子进程方法

用python记录运行pid,并在需要时kill掉它们的实例

评论“python正则分析nginx的访问日志”

RTX 5090要首发性能要翻倍！三星展示GDDR7显存

更新日志

友情链接

python正则分析nginx的访问日志

python,nginx日志,nginx日志解析,python,nginx,日志分析

python subprocess 杀掉全部派生的子进程方法

用python记录运行pid,并在需要时kill掉它们的实例

评论“python正则分析nginx的访问日志”

RTX 5090要首发 性能要翻倍！三星展示GDDR7显存

更新日志

友情链接

RTX 5090要首发性能要翻倍！三星展示GDDR7显存