gpt4 book ai didi

regex - hive 正则表达式不工作

转载 作者:可可西里 更新时间:2023-11-01 16:09:08 26 4
gpt4 key购买 nike

我正在尝试使用 org.apache.hadoop.hive.serde2.RegexSerDe 创建一个配置单元外部表来分析一些 Log4J 日志。

然而,即使在 http://www.regexr.com/ 中测试正常时,我的 regex 也无法正常工作。 .

我的问题是当我有多行日志时,例如,一个异常日志及其对应的 StackTrace。

这是一个例子:

@@@@ 2015-09-29T11:20:45,549 INFO MYHOSTNAME my-app org.hibernate.jpa.internal.util.LogHelper HHH000204: Processing PersistenceUnitInfo [
name: name
...] @@@@

我在日志的开头和结尾添加了一个模式,以帮助在多行时提取它。

这是我的正则表达式:

@@@@ (.{23}) ([\\w]+) ([\\w]+) ([\\w\\-]+) ([\\w\\.$]+) ([\\s\\S]+) @@@@

这是我的 table :

CREATE EXTERNAL TABLE log4j(
dt STRING,
level STRING,
host STRING,
app_name STRING,
clazz STRING,
message STRING)
ROW FORMAT SERDE 'org.apache.hadoop.hive.serde2.RegexSerDe'
WITH SERDEPROPERTIES ("input.regex" = "@@@@ (.{23}) ([\\w]+) ([\\w]+) ([\\w\\-]+) ([\\w\\.$]+) ([\\s\\S]+) @@@@")
STORED AS TEXTFILE
LOCATION 'hdfs://localhost:9000/logs/';

对于单行日志,它工作正常,但对于像示例中的多行日志,它会提取多行,所有列均为空。

最佳答案

如果您使用:

STORED AS TEXTFILE

然后 Hadoop 将首先按行分解输入(\r\n\r\n), second 将每个输入行输入 RegexSerDe。这就是您无法使用 TEXTFILE 将多行输入转换为单行输出的原因。相反,请尝试使用:

STORED AS INPUTFORMAT 'org.apache.hadoop.mapred.TextInputFormat'

并将 Hadoop 配置属性 textinputformat.record.delimiter 设置为分隔输入中两条记录的任何字符串。对于您的数据,一个示例分隔符可能是 @@@@\n@@@@@@@@\r\n@@@@。请记住,设置此分隔符会从数据中删除匹配的文本,因此您处理的记录中不会有 @@@@

在更改任何配置文件之前测试它的一种方法是在运行查询之前在 Hive shell session 中设置它:

set textinputformat.record.delimiter=@@@@\n@@@@

关于regex - hive 正则表达式不工作,我们在Stack Overflow上找到一个类似的问题: https://stackoverflow.com/questions/32852315/

26 4 0
Copyright 2021 - 2024 cfsdn All Rights Reserved 蜀ICP备2022000587号
广告合作:1813099741@qq.com 6ren.com