摘要: 摘自:https://www.cnblogs.com/qingyunzong/p/9007107.html,部分做修改 一、Kafka在zookeeper中存储结构图 二、分析 2.1 topic注册信息 /brokers/topics/[topic] : 存储某个topic的partitions所 阅读全文
posted @ 2019-03-05 22:50 kpsmile 阅读(1275) 评论(0) 推荐(0) 编辑
摘要: 摘自:https://www.cnblogs.com/qingyunzong/p/9004703.html 一、高可用的由来 1.1 为何需要Replication 在Kafka在0.8以前的版本中,是没有Replication的,一旦某一个Broker宕机,则其上所有的Partition数据都不可 阅读全文
posted @ 2019-03-05 22:38 kpsmile 阅读(362) 评论(0) 推荐(0) 编辑
摘要: 一 解压 配置 1 上传解压缩 2 修改配置文件 进入kafka的安装配置目录 主要关注:server.properties 这个文件即可,我们可以发现在目录下: 有很多文件,这里可以发现有Zookeeper文件,我们可以根据Kafka内带的zk集群来启动,但是建议使用独立的zk集群 server. 阅读全文
posted @ 2019-03-05 20:30 kpsmile 阅读(237) 评论(0) 推荐(0) 编辑
摘要: 一、Kafka的架构 如上图所示,一个典型的Kafka集群中包含若干Producer(可以是web前端产生的Page View,或者是服务器日志,系统CPU、Memory等),若干broker(Kafka支持水平扩展,一般broker数量越多,集群吞吐率越高),若干Consumer Group,以及 阅读全文
posted @ 2019-03-05 20:18 kpsmile 阅读(229) 评论(0) 推荐(0) 编辑
摘要: 转自:https://www.cnblogs.com/qingyunzong/p/9004509.html 一、简介 1.1 概述 Kafka是最初由Linkedin公司开发,是一个分布式、分区的、多副本的、多订阅者,基于zookeeper协调的分布式日志系统(也可以当做MQ系统),常见可以用于we 阅读全文
posted @ 2019-03-05 19:40 kpsmile 阅读(387) 评论(0) 推荐(0) 编辑
摘要: 1 foreachRDD output operation算子,必须对抽取出来的RDD执行action类算子,代码才能执行。 代码:见上个随笔例子 2 transform transformation类算子 可以通过transform算子,对Dstream做RDD到RDD的任意操作。 代码: 3 u 阅读全文
posted @ 2019-03-05 11:23 kpsmile 阅读(1057) 评论(0) 推荐(0) 编辑
摘要: 1、SparkCore、SparkSQL和SparkStreaming的类似之处 2 SparkStreaming简介 SparkStreaming是流式处理框架,是Spark API的扩展,支持可扩展、高吞吐量、容错的实时数据流处理,实时数据的来源可以是:Kafka, Flume, Twitter 阅读全文
posted @ 2019-03-04 19:42 kpsmile 阅读(278) 评论(0) 推荐(0) 编辑
摘要: 1.Shark Shark是基于Spark计算框架之上且兼容Hive语法的SQL执行引擎,由于底层的计算采用了Spark,性能比MapReduce的Hive普遍快2倍以上,当数据全部load在内存的话,将快10倍以上,因此Shark可以作为交互式查询应用服务来使用。除了基于Spark的特性外,Sha 阅读全文
posted @ 2019-03-03 18:34 kpsmile 阅读(511) 评论(0) 推荐(1) 编辑
摘要: 摘自:https://www.cnblogs.com/qingyunzong/p/8973857.html 一、概述 垃圾收集 Garbage Collection 通常被称为“GC”,它诞生于1960年 MIT 的 Lisp 语言,经过半个多世纪,目前已经十分成熟了。 jvm 中,程序计数器、虚拟 阅读全文
posted @ 2019-03-03 16:02 kpsmile 阅读(251) 评论(0) 推荐(0) 编辑
摘要: 摘自:https://www.cnblogs.com/qingyunzong/p/8973748.html 一、JVM的结构图 1.1 Java内存结构 JVM内存结构主要有三大块:堆内存、方法区和栈。 堆内存是JVM中最大的一块由年轻代和老年代组成,而年轻代内存又被分成三部分,Eden空间、Fro 阅读全文
posted @ 2019-03-03 15:55 kpsmile 阅读(143) 评论(0) 推荐(0) 编辑