Imagem de fundo

O Apache SPARK é uma plataforma de computação com um conjunto de bibliotecas para proce...

O Apache SPARK é uma plataforma de computação com um conjunto de bibliotecas para processamento paralelo de dados em clusters de computadores. Para resolver a maioria dos desafios computacionais, ele disponibiliza um conjunto de formatos de arquivos especiais nativos e conectores de fontes externas. Diante do exposto, analise as afirmativas abaixo.


I. CSV é o formato de arquivo padrão (default) do Spark, ele é simples de entender e não requer ferramentas para visualização dos dados, pois os dados não estão em formato binário.

II. Parquet é formato de armazenamento de dados proprietário orientado a colunas que oferece uma variedade de otimizações de armazenamento, especialmente para cargas de trabalho analíticas. Ele oferece compactação em colunas, o que economiza espaço de armazenamento e permite a leitura de colunas individuais em vez de arquivos inteiros. A leitura de um arquivo Parquet é menos eficiente do que JSON ou CSV.

III. O formato JSON apresenta vantagens se for delimitado por linha, esse formato é muito mais estável pois permite anexar um novo registro a um arquivo, em vez de ter que ler um arquivo inteiro e depois escrevê-lo.


Estão corretas as afirmativas:


A

I e II apenas


B

III apenas


C

I, II e III


D

II apenas