

Seu próximo nível começa aqui
Seu desenvolvimento não pode ter limites. Garanta sua Assinatura Ilimitada e libere uma preparação completa com os melhores professores do Brasil.
Antes de processar em produção uma consulta com muitos dados que são recebidos em tempo real, um Analista de Sistemas gerou o código do Apache Spark abaixo para processar um teste de 1000 (mil) registros.
streamingDataFrame =
spark.readStream.schema(staticSchema).optio
n("maxFilesPerTrigger",
1).format("csv").option("header",
"true").load("/FileStore/tables/*.csv")
spark.conf.set("spark.sql.shuffle.partitions", "500")
retornoConsulta =
streamingDataFrame.selectExpr(--consulta--)
retornoConsulta.writeStream.format("memory").qu
eryName("tResultado").outputMode("complete
").start()
I. A função maxFilesPerTrigger especifica o número de arquivos que são lidos por vez, no formato CSV com cabeçalho e especifica a rota.
II. spark.conf.set define o tamanho de memória para um nó único.
III. O resultado da consulta pode ser acessado pelo nome da tabela “tResultado” na memória com o comando spark.sql("""SELECT * FROM tResultado""").show(5).
Estão corretas as afirmativas:
I, II e III
II e III apenas
I e III apenas
I e II apenas