查看“测试”的源代码

== 利用 Cloudera 部署 Hadoop<br>  ==

=== 前言<br>  ===

Hadoop 是一个实现了 MapReduce 计算模型的开源分布式并行编程框架。MapReduce的概念来源于Google实验室，它是一个简化并行计算的编程模型，适用于大规模集群上的海量数据处理，目前最成功的应用是分布式搜索引擎。随着2007年底该模式Java开源实现项目Apache Hadoop的出现，使得程序员可以轻松地编写分布式并行程序，并将其运行于计算机集群上，完成海量数据的计算。近两年尤其是今年国内外采用MapReduce模型的应用也逐渐丰富起来，如像NTT KDDI和中国移动这类的电信公司采用该模型分析用户信息，优化网络配置；美国供电局采用该模型来分析电网现状；包括VISA和JP摩根在内的金融公司采用该模型来分析股票数据；包括Amazon和ebay在内的零售商和电子商务公司也开始采用该模型；甚至部分生物公司也采用该模型来进行DNA测序和分析。然而Hadoop安装、部署、管理的难度非常大，这使用很多用户对Hadoop望而却步，好在这种情况不久就得到了改善，Cloudera提供了非常简单的Hadoop的发布版本，能够十分方便地对Hadoop进行安装、部署和管理，这导致目前大约有75％的Hadoop新用户使用Cloudera。<br>

=== 安装  ===

使用Cloudera的Hadoop发布版安装Hadoop十分的方便，首先当然是需要一个干净的操作系统（我用的是Ubuntu 8.04，其它的版本应该差不多），安装步骤可以归纳为以下几个步骤：<br>