Hive安装2.1 Hive 安装地址1)Hive 官网地址 http://hive.apache.org/2)文档查看地址 https://cwiki.apache.org/confluence/display/Hive/GettingStarted3)下载地址 http://archive.apache.org/dist/hive/4)github 地址 https://github.com/apache/hive
2.2Hive 安装部署 2.2.1 安装 Hive1)把 apache-hive-3.1.2-bin.tar.gz 上传到 linux 的/opt/software 目录下2)解压 apache-hive-3.1.2-bin.tar.gz 到/opt/module/目录下面3)修改 apache-hive-3.1.2-bin.tar.gz 的名称为 hive4)修改/etc/profile.d/my_env.sh,添加环境变量 [andrw@hadoop101 software]$ ...
大数据概念大数据(big data):指无法在一定时间范围内用常规软件工具进行捕捉、管理和处理的数据集合,是需要新处理模式才能具有更强的决策力、洞察发现力和流程优化能力的海量、高增长率和多样化的信息资产。
主要解决,海量数据的存储和海量数据的分析计算问题。
大数据技术生态体系当然,目前这个生态是越来越大了,但是它的本质还是在二个方面 计算 和 存储
开源生态
Sqoop:sqoop是一款开源的工具,主要用于在Hadoop(Hive)与传统的数据库(mysql)间进行数据的传递,可以将一个关系型数据库(例如:MySQL ,Oracle 等)中的数据导进到Hadoop的HDFS中,也可以将HDFS的数据导进到关系型数据库中。
Flume:Flume是Cloudera提供的一个高可用的,高可靠的,分布式的海量日志采集、聚合和传输的系统,Flume支持在日志系统中定制各类数据发送方,用于收集数据;同时,Flume提供对数据进行简单处理,并写到各种数据接受方(可定制)的能力。
Kafka:Kafka是一种高吞吐量的分布式发布订阅消息系统,有如下特性:
通过O(1)的磁盘数据结构提供消 ...
2.1 HBase 安装部署2.1.1 Zookeeper 正常部署首先保证 Zookeeper 集群的正常部署,并启动之:
123[andrew@hadoop101 zookeeper-3.4.10]$ bin/zkServer.sh start [andrew@hadoop101 zookeeper-3.4.10]$ bin/zkServer.sh start [andrew@hadoop101 zookeeper-3.4.10]$ bin/zkServer.sh start
2.1.2 Hadoop 正常部署 Hadoop 集群的正常部署并启动:12[andrew@hadoop101 hadoop-2.7.2]$ sbin/start-dfs.sh [andrew@hadoop103 hadoop-2.7.2]$ sbin/start-yarn.sh
2.1.3 HBase 的解压 解压 Hbase 到指定目录:1[andrew@hadoop101 software]$ tar -zxvf hbase-1.3.1-bin.tar.gz -C /opt/module
2. ...
k8s-安装Kubernetes是什么?Kubernetes是容器集群管理系统,是一个开源的平台,可以实现容器集群的自动化部署、自动扩缩容、维护等功能。 通过Kubernetes你可以:
快速部署应用快速扩展应用无缝对接新的应用功能节省资源,优化硬件资源的使用Kubernetes 特点可移植: 支持公有云,私有云,混合云,多重云(multi-cloud)可扩展: 模块化, 插件化, 可挂载, 可组合自动化: 自动部署,自动重启,自动复制,自动伸缩/扩展使用Kubernetes能做什么?多个进程(作为容器运行)协同工作。(Pod)存储系统挂载Distributing secrets应用健康检测应用实例的复制Pod自动伸缩/扩展Naming and discovering负载均衡滚动更新资源监控日志访问调试应用程序提供认证和授权Kubernetes 组件K8s是由许多个的组件组成的 分为Master组件和节点(Node)组件
Master组件Master组件提供集群的管理控制中心。 Master组件可以在集群中任何节点上运行。但是为了简单起见,通常在一台VM/ ...
<%= wordcount(post.content) %><%= min2read(post.content) %><%= totalcount(site) %>
图数据库的对比
图数据库
是否分布式
开发语言
支持的节点数量
原生图存储
multi_model
查询语言
支持开发的语言
开发公司
落地的公司
是否开源
使用场景
开源地址
文档地址
neo4j
社区单机版/商业是伪分布式
java
百亿
是
否
cypher
java/python
neo4j
使用非常广泛
否
OLAP
nebula graph
分布式
java
千亿个
是
否
nsql
java
京东 /360/携程/oppo/各种银行
OLAP
https://github.com/vesoft-inc/nebula-graph
ultipa
分布式
是
否
北京同心尚科技发展有限公司
金融行业
否
HTAP
janusgraph
分布 ...
HBase简介什么是HBaseHBASE是一个高可靠性、高性能、面向列、可伸缩的分布式存储系统,利用HBASE技术可在廉价PC Server上搭建起大规模结构化存储集群。HBASE的目标是存储并处理大型的数据,更具体来说是仅需使用普通的硬件配置,就能够处理由成千上万的行和列所组成的大型数据。HBASE是Google Bigtable的开源实现,但是也有很多不同之处。比如:Google Bigtable利用GFS作为其文件存储系统,HBASE利用HadoopHDFS作为其文件存储系统;Google运行MAPREDUCE来处理Bigtable中的海量数据,HBASE同样利用Hadoop MapReduce来处理HBASE中的海量数据;Google Bigtable利用Chubby作为协同服务,HBASE利用Zookeeper作为对应。
HBase中的角色HMaster功能:
监控RegionServer
处理RegionServer故障转移
处理元数据的变更
处理region的分配或移除
在空闲时间进行数据的负载均衡
通过Zookeeper发布自己的位置给客户端
RegionServe ...
12345yum install -y gdiskfdisk /dev/sdbmgw
123mkfs -t ext4 /dev/sdbmkdir /datamounr /dev/sdb /data
123456789101112131415161718192021222324base) [root@gpu004:7 /]# fdisk /dev/sdbWARNING: fdisk GPT support is currently new, and therefore in an experimental phase. Use at your own discretion.欢迎使用 fdisk (util-linux 2.23.2)。更改将停留在内存中,直到您决定将更改写入磁盘。使用写入命令前请三思。命令(输入 m 获取帮助):dNo partition is defined yet!命令(输入 m 获取帮助):gBuilding a new GPT disklabel (GUID: 8BC566A3-7EC7-4A20-887C-107BB9D3D01D)命令(输入 m 获取帮助 ...
Hadoop 下载地址:https://archive.apache.org/dist/hadoop/common/hadoop-3.1.3/
cd /opt/software/
解压安装文件到/opt/module 下面[andrew@hadoop101 software]$ tar -zxvf hadoop-3.1.3.tar.gz -C /opt/module/
将 Hadoop 添加到环境变量vim ~/.bashrc
#HADOOP_HOMEexport HADOOP_HOME=/opt/module/hadoop-3.1.3export PATH=$PATH:$HADOOP_HOME/binexport PATH=$PATH:$HADOOP_HOME/sbin
source ~/.bashrc
修改以下文件vim mapred-site.xml
12345678910111213141516 ...
Spark简介
一、简介
二、特点
三、集群架构
四、核心组件
3.1 Spark SQL
3.2 Spark Streaming
3.3 MLlib
3.4 Graphx
一、简介Spark 于 2009 年诞生于加州大学伯克利分校 AMPLab,2013 年被捐赠给 Apache 软件基金会,2014 年 2 月成为 Apache 的顶级项目。相对于 MapReduce 的批处理计算,Spark 可以带来上百倍的性能提升,因此它成为继 MapReduce 之后,最为广泛使用的分布式计算框架。
二、特点Apache Spark 具有以下特点:
使用先进的 DAG 调度程序,查询优化器和物理执行 ...
Kafka简介
一、Kafka简介
二、Kafka核心概念
2.1 Messages And Batches
2.2 Topics And Partitions
2.3 Producers And Consumers
2.4 Brokers And Clusters
一、简介ApacheKafka 是一个分布式的流处理平台。它具有以下特点:
支持消息的发布和订阅,类似于 RabbtMQ、ActiveMQ 等消息队列;
支持数据实时处理;
能保证消息的可靠性投递;
支持消息的持久化存储,并通过多副本分布式的存储方案来保证消息的容错;
高吞吐率,单 Broker 可以轻松处理数千个分区以及每秒百万级的消息量。
二、基本概念2.1 Messages And BatchesKafka 的基本数据单元被称为 message(消息),为减少网络开销,提高效率,多个消息会被放入同一批次 (Batch ...