

Seu próximo nível começa aqui
Seu desenvolvimento não pode ter limites. Garanta sua Assinatura Ilimitada e libere uma preparação completa com os melhores professores do Brasil.
Uma equipe de auditoria possui uma tabela de NF-e com mais de 1 bilhão de registros em um pyspark.sql.DataFrame chamado df. A auditora deseja inspecionar apenas 1.000 registros localmente em seu notebook, usando funcionalidades avançadas de pandas para buscar inconsistências. Nesse cenário, a abordagem em PySpark mais apropriada para gerar esses registros em um pandas. DataFrames, minimizando o risco de estouro de memória no ambiente local é :
pdf = df.topandas ()
pdf_sample = pdf.sample (n=1000, random state=42)
sample_df df = df.samplelFalse, 0.001, seed=42)
pdf_sample = sample_df.toPandas ()
pdf_sample = df.limit (1000) .toPandas ()
rows = df.collect ()
pdf_sample = pd.DataFrame(rows[:1000])
pdf_sample = spark.createDataFrame (df. head (10001)) .toFandas()