Hadoop streaming详细介绍--1号站长-站长学院|资讯交流平台

Hadoop streaming

Hadoop为MapReduce提供了不同的API，可以方便我们使用不同的编程语言来使用MapReduce框架，而不是只局限于Java。这里要介绍的就是Hadoop streaming API。Hadoop streaming 使用Unix的standard streams作为我们mapreduce程序和MapReduce框架之间的接口。所以你可以用任何语言来编写MapReduce程序，只要该语言可以往standard input/output上进行读写。

streamming是天然适用于文字处理的（text processing），当然，也仅适用纯文本的处理，对于需要对象和序列化的场景，hadoop streaming无能为力。它力图使我们能够快捷的通过各种脚本语言，快速的处理大量的文本文件。以下是steaming的一些特点：

Map函数的输入是通过stand input一行一行的接收数据的。（不像Java API，通过InputFormat类做预处理，使得Map函数的输入是有Key和value的）
Map函数的output则必须限定为key-value pair，key和value之间用/t分开。（MapReduce框架在处理intermediate的Map输出时，必须做sort和partition，即shuffle）
Reduce函数的input是Map函数的output也是key-value pair，key和value之间用/t分开。

常用的Streaming编程语言：

bash shell
ruby
python

Ruby

下面是一个Ruby编写的MapReduce程序的示例：

map

max_temperature_map.rb：

ruby #!/usr/bin/env ruby STDIN.each_line do |line| val = line year, temp, q = val[15,4], val[87,5], val[92,1] puts "#{year}/t#{temp}" if (temp != "+9999" && q =~ /[01459]/) end