

Seu próximo nível começa aqui
Seu desenvolvimento não pode ter limites. Garanta sua Assinatura Ilimitada e libere uma preparação completa com os melhores professores do Brasil.
O Apache SPARK é uma plataforma de computação com um conjunto de bibliotecas para processamento paralelo de dados em clusters de computadores. Para resolver a maioria dos desafios computacionais, ele disponibiliza um conjunto de formatos de arquivos especiais nativos e conectores de fontes externas. Diante do exposto, analise as afirmativas abaixo.
I. CSV é o formato de arquivo padrão (default) do Spark, ele é simples de entender e não requer ferramentas para visualização dos dados, pois os dados não estão em formato binário.
II. Parquet é formato de armazenamento de dados proprietário orientado a colunas que oferece uma variedade de otimizações de armazenamento, especialmente para cargas de trabalho analíticas. Ele oferece compactação em colunas, o que economiza espaço de armazenamento e permite a leitura de colunas individuais em vez de arquivos inteiros. A leitura de um arquivo Parquet é menos eficiente do que JSON ou CSV.
III. O formato JSON apresenta vantagens se for delimitado por linha, esse formato é muito mais estável pois permite anexar um novo registro a um arquivo, em vez de ter que ler um arquivo inteiro e depois escrevê-lo.
Estão corretas as afirmativas:
I e II apenas
III apenas
I, II e III
II apenas