Imagem de fundo

Antes de processar em produção uma consulta com muitos dados que são recebidos em tempo...

Antes de processar em produção uma consulta com muitos dados que são recebidos em tempo real, um Analista de Sistemas gerou o código do Apache Spark abaixo para processar um teste de 1000 (mil) registros.


streamingDataFrame =

spark.readStream.schema(staticSchema).optio

n("maxFilesPerTrigger",

1).format("csv").option("header",

"true").load("/FileStore/tables/*.csv")

spark.conf.set("spark.sql.shuffle.partitions", "500")

retornoConsulta =

streamingDataFrame.selectExpr(--consulta--)

retornoConsulta.writeStream.format("memory").qu

eryName("tResultado").outputMode("complete

").start()


I. A função maxFilesPerTrigger especifica o número de arquivos que são lidos por vez, no formato CSV com cabeçalho e especifica a rota.

II. spark.conf.set define o tamanho de memória para um nó único.

III. O resultado da consulta pode ser acessado pelo nome da tabela “tResultado” na memória com o comando spark.sql("""SELECT * FROM tResultado""").show(5).


Estão corretas as afirmativas:


A

I, II e III


B

II e III apenas


C

I e III apenas


D

I e II apenas