【大数据基础】hadoop怎么用_Hadoop

2条回答

张成秀 - 快乐开心每一天

2楼 · 2021-02-02 15:31

Hadoop是由java语言编写的，在分布式服务器集群上存储海量数据并运行分布式分析应用的开源框架，其核心部件是HDFS与MapReduce。

HDFS是一个分布式文件系统：引入存放文件元数据信息的服务器Namenode和实际存放数据的服务器Datanode，对数据进行分布式储存和读取。

　　MapReduce是一个分布式计算框架：MapReduce的核心思想是把计算任务分配给集群内的服务器里执行。通过对计算任务的拆分（Map计算/Reduce计算）再根据任务调度器（JobTracker）对任务进行分布式计算。

征戰撩四汸

3楼 · 2021-12-17 15:30

Hadoop使用主/从（Master/Slave）架构，主要角色有NameNode，DataNode，secondary NameNode，JobTracker，TaskTracker组成。

其中NameNode，secondary NameNode，JobTracker运行在Master节点上，DataNode和TaskTracker运行在Slave节点上。

1、NameNode

NameNode是HDFS的守护程序，负责记录文件是如何分割成数据块的，以及这些数据块被存储到哪些数据节点上。它的功能是对内存及I/O进行集中管理。

2、DataNode

集群中每个从服务器都运行一个DataNode后台程序，后台程序负责把HDFS数据块读写到本地文件系统。需要读写数据时，由NameNode告诉客户端去哪个DataNode进行具体的读写操作。

3、Secondary NameNode

Secondary NameNode是一个用来监控HDFS状态的辅助后台程序，如果NameNode发生问题，可以使用Secondary NameNode作为备用的NameNode。

4、JobTracker

JobTracker后台程序用来连接应用程序与Hadoop，用户应用提交到集群后，由JobTracker决定哪个文件处理哪个task执行，一旦某个task失败，JobTracker会自动开启这个task。

5、TaskTracker

TaskTracker负责存储数据的DataNode相结合，位于从节点，负责各自的task。

相关问题推荐

hadoop集群中每台都必须启动DataNode Hadoop 2021-02-25 19:20

回答 1

/data/hadoop-2.7.0/logsgedit hadoop-neworigin-datanode-s100.log查看clusterID发现datanode和namenode之间的ID不一致进入hdfs-site.xml 配置文件查看：[hdfs-site.xml]dfs.namenode.name.dir/home/neworigin/hadoop/hdfs/namedfs.data......
回答 spark on yarn模式部署，spa Hadoop 2021-02-25 19:18

回答 1

Kafka是一个高吞吐量分布式消息系统。linkedin开源的kafka。 Kafka就跟这个名字一样，设计非常独特。首先，kafka的开发者们认为不需要在内存里缓存什么数据，操作系统的文件缓存已经足够完善和强大，只要你不搞随机写，顺序读写的性能是非常高效的。kafka的数...
java程序怎么向远程的hadoop提交mapre Hadoop 2021-02-02 19:22

回答 3

将 hadoop执行job命令写到shell脚本中。类似 hadoop jar x.jar ×××.MainClassName inputPath outputPath这种命令。hadoop客户机在本地，使用 Process执行shell脚本，java执行本地shell脚本的代码 1234Process process =null;String command1 ...
hadoop集群中每台都必须启动DataNode吗 Hadoop 2021-02-02 19:19

回答 1

1
hadoop集群配置了kerberos后，如何使用 Hadoop 2021-02-02 19:19

回答 1

public static void test1(String user, String keytab, String dir) throws Exception { Configuration conf = new Configuration(); // conf.set(fs.defaultFS, hdfs://hadoop01:8020); c...
【Hadoop基础】openSOC环境具体如何搭建 Hadoop 2021-02-02 19:18

回答 1

Hello, world! ]]>
【大数据基础】hadoop的核心组件及作用是什么 Hadoop 2021-01-29 20:44

回答 2

Hadoop的三大核心组件分别是：HDFS（Hadoop Distribute File System）：hadoop的数据存储工具。YARN（Yet Another Resource Negotiator,另一种资源协调者）：Hadoop 的资源管理器。Hadoop MapReduce:分布式计算框架...
【大数据基础】hadoop能处理哪些类型数据 Hadoop 2021-01-28 21:01

回答 8

选择开始菜单中→程序→【managementsqlserver2008】→【sqlservermanagementstudio】命令，打开【sqlservermanagementstudio】窗口，并使用windows或sqlserver身份验证建立连接。在【对象资源管理器】窗口中展开服务器，然后选择【数据库】节点右键单击【数...
【大数据基础】hadoop安装详细步骤是怎么样的 Hadoop 2021-01-08 20:19

回答 1
【大数据基础】hadoop的三大组件及其作用是什么 Hadoop 2020-12-27 15:27

回答 7

Hadoop的三大核心组件分别是：1、HDFS(Hadoop Distribute File System)：hadoop的数据存储工具。2、YARN(Yet Another Resource Negotiator,另一种资源协调者)：Hadoop 的资源管理器。3、Hadoop MapReduce:分布式计算框架。HDFS是一个高度容错性的系统，适合部...
【大数据基础】hadoop的三大组件有什么 Hadoop 2020-12-27 15:27

回答 11

Hadoop的三大核心组件分别是：1、HDFS(Hadoop Distribute File System)：hadoop的数据存储工具。2、YARN(Yet Another Resource Negotiator,另一种资源协调者)：Hadoop 的资源管理器。3、Hadoop MapReduce:分布式计算框架。...
【大数据基础】hadoop重要组件有什么 Hadoop 2020-12-27 14:54

回答 4

hadoop有三个主要的核心组件：HDFS(分布式文件存储)、MAPREDUCE(分布式的计算)、YARN(资源调度)。
【大数据基础】hadoop是做什么的 Hadoop 2020-12-27 14:54

回答 5

Hadoop主要是分布式计算和存储的框架，所以Hadoop工作过程主要依赖于HDFS(Hadoop Distributed File System)分布式存储系统和Mapreduce分布式计算框架。
【大数据基础】hadoop主要优点有什么 Hadoop 2020-12-27 14:52

回答 7

1.高可靠性。Hadoop按位存储和处理数据的能力值得人们信赖;2.高扩展性。Hadoop是在可用的计算机集簇间分配数据并完成计算任务的,这些集簇可以方便地扩展到数以千计的节点中。3.高效性。Hadoop能够在节点之间动态地移动数据,并保证各个节点的动态平衡,因此处理...
【大数据基础】hbase和hadoop的区别 Hadoop HBase 2020-12-05 14:16

回答 6

1.Hbase即 HadoopDatabase 的简称，也就是基于Hadoop数据库，是一种NoSQL数据库，主要适用于海量明细数据（十亿、百亿）的随机实时查询，如交易清单、日志明细、轨迹行为等。2. Hive是Hadoop的数据仓库，严格地讲并非数据库，主要是让开发人员能够通过SQL来计...

没有解决我的问题，去提问

【Hadoop】【大数据基础】hadoop怎么用

相关问题推荐

等你来答

热门问答

相关文章

【Hadoop】【大数据基础】hadoop怎么用

相关问题推荐

等你来答

热门问答

相关文章

采纳回答

编辑标签

举报内容

检举类型

检举原因

检举说明(必填)

打开微信“扫一扫”，打开网页后点击屏幕右上角分享按钮

付费偷看金额在0.1-10元之间