关于大数据的冷知识(关于大数据的冷知识有哪些)(大数据相关话题)

佚名 2023-09-09 16:11:19 -

其实关于大数据的冷知识的问题并不复杂，但是又很多的朋友都不太了解关于大数据的冷知识有哪些，因此呢，今天小编就来为大家分享关于大数据的冷知识的一些知识，希望可以帮助到大家，下面我们一起来看看这个问题的分析吧！

本文目录

五分钟看懂大数据技术
大数据测试需要掌握哪些知识
大数据基础知识大汇总

大数据技术涉及：数据的采集、预处理、和分布式存储、以及数据仓库、机器学习、并行计算和可视化等方面。

对于大数据技术，应用广泛的是以hadoop和spark为核心的生态系统。hadoop提供一个稳定的共享存储和分析系统，存储由hdfs实现，分析由mapreduce实现，

1、hdfs：Hadoop分布式文件系统，运行与大型商用机集群

hdfs是gfs的开源实现，提供了在廉价服务器集群中进行大规模分布式文件存储的能力。

2、hbase：分布式的列存储数据库。hbase将hdfs作为底层存储，同时支持mapreduce的批量计算和点查询（随机读取）

hbase是一个建立在hdfs之上，面向列的nosql数据库。它可用于快速读写大量数据，是一个高可靠、高并发读写、高性能、面向列、可伸缩和易构建的分布式存储系统。hbase具有海量数据存储、快速随机访问和大量写操作等特点。

在kudu出现之前，hadoop生态环境的存储主要依赖hdfs和hbase。在追求高吞吐、批处理的场景中，使用hdfs,在追求低延时且随机读取的场景中，使用hbase,而kudu正好能兼容这两者。

3、批处理计算的基石：mapreduce

批处理计算主要解决大规模数据的批量处理问题，是日常数据分析中常见的一类数据处理需求。业界常用的大数据批处理框架有mapreduce\spark\tez\pig等。其中mapdeduce是比较有影响力和代表性的大数据批处理计算框架。它可以并发执行大规模数据处理任务，即用于大规模数据集（大于1tb）的并行计算。mapreduce的核心思想：将一个大数据集拆分成多个小数据集，然后在多台机器上并行处理。

4、hive:分布式数据仓库，管理hdfs中存储的数据，并提供基于sql的查询语言用于查询数据

1.什么是大数据

大数据是一个大的数据集合，通过传统的计算技术无法进行处理。这些数据集的测试需要使用各种工具、技术和框架进行处理。大数据涉及数据创建、存储、检索、分析，而且它在数量、多样性、速度方法都很出色，是需要新处理模式才能具有更强的决策力、洞察发现力和流程优化能力的海量、高增长率和多样化的信息资产。

2.大数据测试类型

测试大数据应用程序更多的是验证其数据处理，而不是测试软件产品的个别功能。当涉及到大数据测试时，性能和功能测试是关键。处理可以是三种类型：

批量

实时

交互在测试应用程序之前，有必要检查数据的质量，并将其视为数据库测试的一部分。它涉及检查各种字段，如一致性，准确性，重复，一致性，有效性，数据完整性等。

3.容错性测试

可从部分失效中自动恢复，而且不会验证的影响整体性能，特别地，当故障发生时，大数据分析系统应该在进行恢复的同时继续以可接受的方式进行操作，在发生错误时某种程度上可以继续操作，需根据应用场景来设计解决方案和具体部署，然后手动测试。

4.可用性测试

高可用性已是大数据分析不可或缺的特性之一，从而保证数据应用业务的连续性.大数据高可用性对很多应用非常关键，需要严格进行测试和验证，以手动测试为主。