Hadoop 上使用C 语言编程【转】
转自:https://www.linuxidc.com/Linux/2012-04/58991.htm
今天尝试用C语言在Hadoop上编写统计单词的程序,具体过程如下:
一、编写map和reduce程序
mapper.c
- #include <stdio.h>
- #include <stdlib.h>
- #include <string.h>
- #define BUF_SIZE 2048
- #define DELIM '\n'
- int main(int argc, char * argv[])
- {
- char buffer[BUF_SIZE];
- while(fgets(buffer,BUF_SIZE-1,stdin))
- {
- int len = strlen(buffer);
- if(buffer[len-1] == DELIM) // 将换行符去掉
- buffer[len-1] = 0;
- char *query = NULL;
- query = strtok(buffer, " ");
- while(query)
- {
- printf("%s\t1\n",query);
- query = strtok(NULL," ");
- }
- }
- return 0;
- }
- #include <stdio.h>
- #include <stdlib.h>
- #include <string.h>
- #define BUFFER_SIZE 1024
- #define DELIM "\t"
- int main(int argc, char * argv[])
- {
- char str_last_key[BUFFER_SIZE];
- char str_line[BUFFER_SIZE];
- int count = 0;
- *str_last_key = '\0';
- while( fgets(str_line,BUFFER_SIZE-1,stdin) )
- {
- char * str_cur_key = NULL;
- char * str_cur_num = NULL;
- str_cur_key = strtok(str_line,DELIM);
- str_cur_num = strtok(NULL,DELIM);
- if(str_last_key[0] =='\0')
- {
- strcpy(str_last_key,str_cur_key);
- }
- if(strcmp(str_cur_key, str_last_key))// 前后不相等,输出
- {
- printf("%s\t%d\n",str_last_key,count);
- count = atoi(str_cur_num);
- }else{// 相等,则加当前的key的value
- count += atoi(str_cur_num);
- }
- strcpy(str_last_key,str_cur_key);
- }
- printf("%s\t%d\n",str_last_key,count);
- return 0;
- }
gcc mapper.c -o mapper
gcc reducer.c -o reducer
三、运行
(一)启动hadoop后将待统计单词的输入文件放到 input文件夹中:bin/hadoop fs -put 待统计文件 input
(二)使用contrib/streaming/下的jar工具调用上面的mapper\reducer:
bin/hadoop jar /home/huangkq/Desktop/hadoop/contrib/streaming/hadoop-streaming-0.20.203.0.jar -mapper /home/huangkq/Desktop/hadoop2/mapper -reducer /home/huangkq/Desktop/hadoop2/reducer -input input -output c_output -jobconf mapred.reduce.tasks=2
说明:hadoop-streaming-0.20.203.0.jar是一个管道工具
(三)查看结果:bin/hadoop fs -cat c_output/*
【作者】sky
本文版权归作者和博客园共有,欢迎转载,但未经作者同意必须保留此段声明,且在文章页面明显位置给出原文连接,否则保留追究法律责任的权利.
【推荐】国内首个AI IDE,深度理解中文开发场景,立即下载体验Trae
【推荐】编程新体验,更懂你的AI,立即体验豆包MarsCode编程助手
【推荐】抖音旗下AI助手豆包,你的智能百科全书,全免费不限次数
【推荐】轻量又高性能的 SSH 工具 IShell:AI 加持,快人一步
· .NET Core 中如何实现缓存的预热?
· 从 HTTP 原因短语缺失研究 HTTP/2 和 HTTP/3 的设计差异
· AI与.NET技术实操系列:向量存储与相似性搜索在 .NET 中的实现
· 基于Microsoft.Extensions.AI核心库实现RAG应用
· Linux系列:如何用heaptrack跟踪.NET程序的非托管内存泄露
· TypeScript + Deepseek 打造卜卦网站:技术与玄学的结合
· 阿里巴巴 QwQ-32B真的超越了 DeepSeek R-1吗?
· 【译】Visual Studio 中新的强大生产力特性
· 【设计模式】告别冗长if-else语句:使用策略模式优化代码结构
· AI与.NET技术实操系列(六):基于图像分类模型对图像进行分类
2017-05-24 OpenCV实践之路——人脸检测(C++/Python) 【转】
2017-05-24 40行代码的人脸识别实践【转】
2016-05-24 Linux下的Backlight子系统(二)【转】
2016-05-24 Linux内核设计与实现读书笔记(8)-内核同步方法【转】
2016-05-24 request threaded-only IRQs with IRQF_ONESHOT【转】
2016-05-24 Linux kernel中断子系统之(五):驱动申请中断API【转】