Imagem de fundo

Uma equipe de auditoria possui uma tabela de NF-e com mais de 1 bilhão de registros em ...

Uma equipe de auditoria possui uma tabela de NF-e com mais de 1 bilhão de registros em um pyspark.sql.DataFrame chamado df. A auditora deseja inspecionar apenas 1.000 registros localmente em seu notebook, usando funcionalidades avançadas de pandas para buscar inconsistências. Nesse cenário, a abordagem em PySpark mais apropriada para gerar esses registros em um pandas. DataFrames, minimizando o risco de estouro de memória no ambiente local é :


A

pdf = df.topandas ()

pdf_sample = pdf.sample (n=1000, random state=42)


B

sample_df df = df.samplelFalse, 0.001, seed=42)

pdf_sample = sample_df.toPandas ()


C

pdf_sample = df.limit (1000) .toPandas ()


D

rows = df.collect ()

pdf_sample = pd.DataFrame(rows[:1000])


E

pdf_sample = spark.createDataFrame (df. head (10001)) .toFandas()