Storm 单词计数

Apache Storm是一个免费的开源分布式实时计算系统。Storm可以非常容易地实时处理无限的流数据。所谓实时处理是指在每条数据的产生时刻不确定的情况下,一旦有数据产生,系统就会立刻对该条数据进行处理。

单词计数

Storm WordCount与Hadoop WordCount有很多不同之处

依靠Storm的实时性以及大规模数据的特点,在Spout中随机发送内置的语句作为消息源;使用一个Bolt进行语句切分,将句子切分成单词发射出去;使用一个Bolt订阅切分的单词Tuple,并且选择使用按字段分组的策略进行单词统计,将统计结果发射出去;最后使用一个Bolt订阅统计结果,词频实时排序,把前10个单词打印到log中。

整个单词计数统计的流程如图所示

 

依赖:

<dependency>
    <groupId>org.apache.storm</groupId>
    <artifactId>storm-core</artifactId>
    <version>1.1.0</version>
</dependency>

 

 

书籍:Hadoop大数据技术开发实战 13.6 案例分析:单词计数

https://gitee.com/caoyeoo0/xc-springboot/tree/hadoopApi/src/main/java/com/xc/xcspringboot/test/storm

 

posted @   草木物语  阅读(53)  评论(0编辑  收藏  举报
相关博文:
阅读排行:
· 震惊!C++程序真的从main开始吗?99%的程序员都答错了
· 【硬核科普】Trae如何「偷看」你的代码?零基础破解AI编程运行原理
· 单元测试从入门到精通
· 上周热点回顾(3.3-3.9)
· winform 绘制太阳,地球,月球 运作规律
点击右上角即可分享
微信分享提示