贾永琪的技术博客

spark--RDD

spark--RDD1. RDD2. RDD操作2.1 转化操作2.1.1 filter2.1.2 union2.1.3 map2.1.4 flatMap2.2 行动操作2.2.1 count2.2.23. 惰性求值4. 函数传递1. RDDspark中的RDD就是一个不可变的分布式对象集合。每个RDD都被分为多个分区,这些分区运行在集群中的不同节点上。存在两种方式创建RDD:读取程序外部数据集程序内构建RDD举例:RDD支持两种操作:转化操作和行动操作。转化操作和行动操作最大的区别_在spark中,个操作会触发实际的数据计算

spark入门

spark 入门1. 下载2. 二进制包目录3. 配置4. 启动5. 体验5.1 数据准备5.2 spark-shell5.3 加载数据5.4 简单体验6. spark UI6.1 UI 入口6.2 作业汇总6.3 作业计算过程6.4 作业DAG6.5 作业描述指标6.6 作业调度6.7 作业拆分6.8 作业执行6.9 任务执行详细6.10 任务日志1. 下载在spark下载地址,下载spark二进制包。http://spark.apache.org/downloads.html这里不仅仅需要选择_put a spark

hadoop安装

hadoop安装1.下载2.配置2.1 Java2.2 site配置2.3 hdfs工作模式2.4 yarn配置2.5 hdfs副本数3. 设置免密登录4. 启动4.1 格式化hdfs4.2 启动hdfs4.3 启动yarn5. 验证6. 各节点免密登录7. 子节点加入集群7.1 hdfs7.2 yarn8.简单使用8.1 hdfs1.下载https://www.apache.org/dyn/closer.cgi/hadoop/common/hadoop-2.10.0/hadoop-2.10.0.ta_紅帽子 hadoop最小集群安裝