Apache Druid接入Kafka实时流数据

简介: 一.任务配置文件使用类型为kafka{ "type": "kafka", "dataSchema": { "dimensionsSpec": {... ...}, "transformSpec":{.

一.任务配置文件

使用类型为kafka

{
  "type": "kafka",
  "dataSchema": {
      "dimensionsSpec": {... ...},
      "transformSpec":{... ...},
      "metricsSpec":{... ...}
  },
  "tuningConfig": {... ...},
  "ioConfig": {... ...}
}

Ⅰ).数据源

数据源配置部分5部分,表信息、解析器、数据转换、指标度量和聚合&查询粒度

  "dataSchema": {
    "dataSource": "druid_table_name",
    "parser": {},
    "transformSpec": {},
    "metricsSpec": {}
    }

a).表信息

"dataSource": "druid_table_name"

b).解析器

解析器包括:解析器类型、聚合字段和非聚合字段

    "parser": {
            "type": "string",
            "parseSpec": {
                "format": "json",
                "timestampSpec": {
                    "column": "time",
                    "format": "auto"
                },
                "dimensionsSpec": {
                    "dimensions": [
                        "appName",
                        "nodeName"
                    ],
                    "dimensionExclusions": []
                }
            }

c).数据转换

数据转换主要使用:时间转换、表达式、过滤等;其中,表达式可满足一些根据不同区间范围的指标统计类需求

    "transformSpec": {
            "transforms": [
                {
                    "type": "expression",
                    "name": "time",
                    "expression": "timestamp_format(time,'yyyy-MM-dd HH:mm:ss.SSS')"
                },
                {
                    "type": "expression",
                    "name": "status",
                    "expression": "if(status, 1, 0)"
                },
                {
                    "type": "expression",
                    "name": "processRange1",
                    "expression": "if(processTime<=100, 1, 0)"
                },
                {
                    "type": "expression",
                    "name": "processRange2",
                    "expression": "if(processTime>100  && processTime<= 500, 1, 0)"
                },
                {
                    "type": "expression",
                    "name": "processRange3",
                    "expression": "if(processTime>500, 1, 0)"
                }
            ]
        },

d).指标度量

指标度量主要使用:Sum、Max、Min、hyperUnique

    "metricsSpec": [
            {
                "name": "TotalTransCount",
                "fieldName": "count",
                "type": "longSum"
            },
            {
                "name": "MaxProcessTime",
                "fieldName": "processTime",
                "type": "longMax"
            },
            {
                "name": "MinProcessTime",
                "fieldName": "processTime",
                "type": "longMin"
            },
            {
                "name": "TotalProcessRange1",
                "fieldName": "processRange1",
                "type": "longSum"
            },
            {
                "name": "TotalProcessRange1",
                "fieldName": "processRange2",
                "type": "longSum"
            },
            {
                "name": "TotalProcessRange1",
                "fieldName": "processRange3",
                "type": "longSum"
            },
            {
                "name": "NodeName",
                "fieldName": "nodeName",
                "type": "hyperUnique"
            }
        ]

e).聚合&查询粒度

聚合&查询粒度主要使用:all、none、second、minute、fifteen_minute、thirty_minute、hour、day、week、month、quarter、year

      "granularitySpec": {
            "type": "uniform",
            "segmentGranularity": "DAY",
            "queryGranularity": "HOUR"
        }

Ⅱ).任务及Segments配置

任务及Segments主要配置生产segment的大小,合并任务进程数

    "tuningConfig": {
        "type": "kafka",
        "maxRowsPerSegment": 500000,
        "workerThreads": 2,
        "reportParseExceptions": false
    },

Ⅲ).数据接入信息

数据接入信息主要包括:kafka consumer相关配置和任务执行间隔

    "ioConfig": {
        "topic": "kafka_topic_name",
        "consumerProperties": {
            "bootstrap.servers": "hostname:9092"
        },
        "useEarliestOffset": false,
        "taskCount": 3,
        "replicas": 1,
        "taskDuration": "PT1H"
    }

Ⅳ).后聚合配置

主要使用在查询时,根据业务场景需求,需要配置在度量指标基础上运算获得二级指标

"aggregations":[
      {
         "type":"count",
         "name":"count"
      }
   ]

二.提交任务

任务配置文件kafka-streaming.json,提交命令如下

curl -XPOST -H'Content-Type: application/json' -d @quickstart/tutorial/kafka-streaming.json http://hostname:8081/druid/indexer/v1/supervisor

三.常遇问题

1.offsetOutofRangeException

kafka的offset过期清理 {“auto.offset.reset” : “latest” };导致 auto.offset.reset:None -- “None”表示offset过期不作任何处理,只抛出异常,即offsetOutofRangeException

解决办法:
    清空元信息库中druid_dataSource表, 表中记录了所有消费的Kafka topic对应的partition以及offset信息, 同时重启MiddleManager节

2.时差问题

默认:UTC,需要修改配置

a).各角色配置文件jvm.config

-Duser.timezone=UTC+0800

b).middleManager配置文件runtime.properties

# Task launch parameters
druid.indexer.runner.javaOpts=-server -Xmx8g -Duser.timezone=UTC+0800 -Dfile.encoding=UTF-8 -Djava.util.logging.manager=org.apache.logging.log4j.jul.LogManager

3.补跑数据

有时候任务失败,导致需要补录kafka数据,则修改数据接入中的配置信息

useEarliestOffset:true
目录
相关文章
|
1月前
|
存储 缓存 分布式计算
Apache Hudi数据跳过技术加速查询高达50倍
Apache Hudi数据跳过技术加速查询高达50倍
38 2
|
1月前
|
分布式计算 测试技术 Apache
如何不加锁地将数据并发写入Apache Hudi?
如何不加锁地将数据并发写入Apache Hudi?
30 0
|
1月前
|
消息中间件 存储 大数据
Apache Kafka: 强大消息队列系统的介绍与使用
Apache Kafka: 强大消息队列系统的介绍与使用
|
3月前
|
消息中间件 JSON druid
Druid:通过 Kafka 加载流数据
Druid:通过 Kafka 加载流数据
36 0
|
5天前
|
消息中间件 存储 算法
深入了解Kafka的数据持久化机制
深入了解Kafka的数据持久化机制
24 0
|
2月前
|
消息中间件 Kafka Apache
Flink 提供了与 Kafka 集成的官方 Connector,使得 Flink 能够消费 Kafka 数据
【2月更文挑战第6天】Flink 提供了与 Kafka 集成的官方 Connector,使得 Flink 能够消费 Kafka 数据
69 2
|
1月前
|
消息中间件 存储 缓存
Kafka【基础知识 02】集群+副本机制+数据请求+物理存储+数据存储设计(图片来源于网络)
【2月更文挑战第20天】Kafka【基础知识 02】集群+副本机制+数据请求+物理存储+数据存储设计(图片来源于网络)
25 1
|
1月前
|
Apache 开发者
揭秘!Apache Hudi社区发展数据盘点
揭秘!Apache Hudi社区发展数据盘点
29 0
|
1月前
|
分布式计算 Java 数据管理
使用Apache Hudi + Amazon EMR进行变化数据捕获(CDC)
使用Apache Hudi + Amazon EMR进行变化数据捕获(CDC)
87 0
|
1月前
|
分布式计算 大数据 测试技术
查询时间降低60%!Apache Hudi数据布局黑科技了解下
查询时间降低60%!Apache Hudi数据布局黑科技了解下
22 0

热门文章

最新文章

推荐镜像

更多