文章详情页

hadoop - 使用python hdfs模块或者其他类似模块过滤HDFS上的日志日志内容

浏览：219日期：2022-06-28 15:26:32

问题描述

目前公司使用HDFS存储各个节点服务器上传的日志。因为历史遗留问题，所以日志比较混杂。就是各种数据都会存入日志中。一个日志文件200mb左右。有时候要过滤一些内容，则需要根据时间戳，然后使用hdfs 的cat命令，之后再grep关键字。再通过stdin输入到一个python脚本中，把相关的数据做一些处理。现在我想把他做成输入要查询的时间、节点、关键字以及匹配模型，然后一条龙完成这个任务。这样就可以把这个小工具推向所有需求数据的人，而不是每次让运维来查询。于是开始研究python的相关模块，这个hdfs可以上传下载，查询目录文件内容。但是到读这块，就比较麻烦了。with client.read(hdfs_path=.....,其他参数)as reader:

content = reader.read()然后再对content处理

这种方式并不可行，因为一次要匹配的内容实在太多，大概有几gb的数据，根本不可能全部读出来然后再做处理。肯定得在读的过程就进行筛选和处理

我尝试了for line in content,也匹配不出内容。应该如何解决这个问题呢？难道用python把符合条件的文件路径记录下来，然后再执行HDFS命令，再把匹配的数据传入python？那样也显得太麻烦了，而且稳定性肯定不好

后来我看了一下，hdfs这个模块，创建客户端的时候，连的是hadoop 50070这个web管理页面，想了下是不是这个模块本身就不是为了做数据分析用的？希望各位能给点帮助

问题解答

回答1：

多线程呢，并行计算呢？你这样一次性读几个Gb自然慢。既然是hadoop框架，用好mapreduce应该就行了吧。这玩意应该就不是为了快速而设计的。

Python 编程

上一条：python - PyQt5 如何获得标题?下一条：python小白问关于形参和实参的问题

相关文章：

1. golang - 用IDE看docker源码时的小问题2. Docker for Mac 创建的dnsmasq容器连不上/不工作的问题3. docker images显示的镜像过多，狗眼被亮瞎了，怎么办？4. 前端 - 类到底该如何去命名 .newsList 这种的命名难道真的不是过度语义化吗？~5. docker api 开发的端口怎么获取？6. 如何解决Centos下Docker服务启动无响应，且输入docker命令无响应？7. docker容器呢SSH为什么连不通呢？8. docker start -a dockername 老是卡住，什么情况？9. python - pyspider 运行和 age 参数问题？10. MySQL分表之后如何做排序的问题

排行榜

					
					Docker for Mac 创建的dnsmasq容器连不上/不工作的问题
docker容器呢SSH为什么连不通呢？
golang - 用IDE看docker源码时的小问题
docker api 开发的端口怎么获取？
docker start -a dockername 老是卡住，什么情况？
docker images显示的镜像过多，狗眼被亮瞎了，怎么办？
前端 - 类到底该如何去命名 .newsList 这种的命名难道真的不是过度语义化吗？~
如何解决Centos下Docker服务启动无响应，且输入docker命令无响应？
angular.js - angular中的a标签不起作用
取不出SQL得到的当前页
javascript - 求助这种功能有什么好点的插件？
				

热门标签