

Seu próximo nível começa aqui
Com a Assinatura Ilimitada, você tem tudo que precisa para sua aprovação.
Com a Assinatura Ilimitada, você combina prática, teoria e método em uma única assinatura com tudo que você precisa para sua aprovação.
Observe o seguinte trecho de código R.

A partir do código R apresentado, deseja-se como resultado a matriz a seguir.

Para obter o resultado apresentado, deve-se completar o código R com a função:
c(df1 + df2)
dim(df1, df2)
array(df1, df2)
cbind(df1, df2)
frame(df1, df2)
Ainda em relação à situação apresentada no texto 2A2-II, na arquitetura analítica do projeto de combate à pesca ilegal, a integração entre consultas em SQL e o uso de linguagens como Python e R seria tecnicamente justificável porque essa integração
limita a escalabilidade da análise ao volume máximo suportado pelo banco relacional.
concentra as etapas do processo analítico exclusivamente no banco de dados.
reduz a necessidade de modelagem e saneamento da base de dados.
viabiliza a extração estruturada dos dados e a aplicação de métodos estatísticos, modelagem e automação.
transfere a lógica de persistência e integridade dos dados para as linguagens de programação.
Considere o trecho de código a seguir, em linguagem R.

A execução desse trecho de código terá o seguinte resultado.
![]()
Certo
Errado
O analista de dados Junior acessou o banco de dados e recuperou os seguintes valores que representam o tempo (em dias) de conclusão de cinco processos.
![]()
No R, para calcular a média do tempo de conclusão entre esses processos, deve-se utilizar o comando:
mode(tempos_processos)
mean(tempos_processos)
median(tempos_processos)
which.max(table(tempos_processos))
sum(tempos_processos)*length(tempos_processos)/5
Avalie as seguintes sentenças em relação à análise e visualização de dados, empregando o Microsoft Power BI e o Sistema R, que é uma linguagem e um ambiente para gráficos e computação estatística:
I.Avaliação de outliers, empregando o sistema R pode ser apoiada pelo uso do gráfico O3 (Overview Of Outliers), que mostra quais casos são identificados frequentemente como outliers, quais são identificados em dimensões únicas e quais são identificados apenas em dimensões superiores.
II.O sistema R permite a construção de gráficos com o pacote shiny e criação de dashboards interativos exclusivamente com o pacote ggplot2.
III.Na construção de dashboards em Microsoft Power BI Desktop, é possível usar o R para visualizar seus dados.
Estão corretas as afirmativas:
I e III apenas.
I e II apenas.
I, II e III.
II e III apenas.


Seu próximo nível começa aqui

Seu próximo nível começa aqui
Destrave a preparação completa para sua aprovação. Com a Assinatura Ilimitada, você estuda com os melhores professores do Brasil e todos os recursos Gran.
O comando x + 1 e o comando c(x,1) produzem o mesmo resultado.
Certo
Errado
Se, em uma simulação, for necessário preencher um vetor grande, será mais eficiente usar a linguagem R para alocar e preencher o vetor inteiro, em vez de criar um vetor unitário e redimensioná-lo.
Certo
Errado
Considere o seguinte data.frame em R:
dados <– data.frame(
grupo = c("A", "A", "B", "B", "C", "C"),
valor = c(10, 15, 8, 22, 17, 19),
aprovado = c(FALSE, TRUE, TRUE, FALSE, FALSE, TRUE))
Qual é o comando que retorna apenas as linhas em que o grupo é "B" ou "C" , o valor é maior que 15, e o aprovado é FALSE?
subset(dados, grupo %in% c("B","C") & valor > 15 & aprovado == FALSE, select = aprovado)
subset(dados, grupo == "B" | grupo == "C" & valor > 15 & aprovado == FALSE, select = –aprovado)
subset(dados, grupo %in% c("B","C") & (valor > 15 & aprovado == FALSE), select = –aprovado)
subset(dados, grupo %in% c("B","C") & valor > 15 & aprovado)
subset(dados, (grupo == "B" | grupo == "C") & valor > 15 & aprovado == FALSE)
Em R, a função lm( ) é utilizada para realizar regressão linear, permitindo modelar a relação entre variáveis dependentes e independentes.
Certo
Errado
No software R, o pacote dplyr oferece uma sintaxe intuitiva e ágil para manipulação de dados. Considere que uma base de dados contendo as quatro variáveis listadas a seguir foi armazenada no objeto processos:
• ID: identificador único do processo.
• Status: status do processo (“em andamento”, “finalizado” ou “arquivado”).
• Numero Decisoes: número de decisões ou despachos no processo.
• Data Conclusao: data de conclusão do processo (se o status for “finalizado”), no formato AAAA-MM-DD.
Nesse contexto, considere que um analista deseja calcular a soma total de decisões ou despachos proferidas nos processos “finalizados” para cada ano de conclusão. Qual das alternativa a seguir realiza essa operação corretamente, utilizando funções dplyr, e salva o resultado no objeto Soma_Decisoes?
processos %>% filter(Status == "finalizado") %>%
mutate(Ano_Conclusao = format(Data_Conclusao, "%Y")) %>%
group_by(Ano_Conclusao) %>%
summarise(Soma_Decisoes = sum(Numero_Decisoes))
processos %>% filter(Status == "finalizado") %>%
group_by(Data_Conclusao) %>%
summarise(Soma_Decisoes = sum(Numero_Decisoes)) %>%
mutate(Ano_Conclusao = format(Data_Conclusao, "%Y"))
processos %>% filter(Status = "finalizado") %>%
group_by(Ano_Conclusao = format(Data_Conclusao, "%Y")) %>%
summarise(Soma_Decisoes = sum(Numero_Decisoes))
processos %>% filter(Status == "finalizado") %>%
summarise(Ano_Conclusao = format(Data_Conclusao, "%Y")) %>%
group_by(Data_Conclusao) %>%
mutate(Soma_Decisoes = sum(Numero_Decisoes))
processos %>% mutate(Ano_Conclusao = format(Data_Conclusao, "%Y")) %>%
filter(Status == "finalizado") %>%
group_by(Ano_Conclusao)
summarise(Soma_Decisoes = sum(Numero_Decisoes))


Seu próximo nível começa aqui
Seu desenvolvimento não pode ter limites. Garanta sua Assinatura Ilimitada e libere uma preparação completa com os melhores professores do Brasil.
No R com o pacote dplyr carregado, o comando a seguir pode ser usado para exibir o conteúdo de df por ordem decrescente de produtividade.
df %>% arrange(desc(produtividade))
Certo
Errado
No que diz respeito às Redes Neurais Artificiais (ANN, Artificial Neural Network):
I.Os Métodos de regularização por penalização com normas L1 e L2, correspondem respectivamente à Regressão Ridge e à Regressão Lasso (Least Absolute Shrinkage and Selection Operator Regression).
II.Métodos de regularização por Dropout, regularizam as redes neurais, descartando aleatoriamente nós, juntamente com suas conexões de entrada e saída, da rede durante o treinamento.
III.Métodos de regularização por Early Stopping interrompem o treinamento quando as atualizações de parâmetros não começam mais a produzir melhorias em um conjunto de validação em redes neurais profundas
IV.Para manejo de redes neurais com R, pode ser utilizado o pacote neuralnet, que permite treinamento de redes neurais usando a retropropagação, retropropagação resiliente com ou sem retrocesso de peso ou a versão globalmente convergente modificada.
Estão corretas as afirmativas:
I, II, III e IV.
II, III e IV apenas.
I e II apenas.
I e III apenas.
Com relação às linguagens de programação para ciência de dados, linguagem Python e R, avalie cada afirmativa a seguir e assinale (V) para a verdadeira e (F) para a falsa.
( ) No Oracle R Enterprise, a execução do R incorporado (ou Embedded R) possibilita a chamada de scripts do R em sessões do R executadas no servidor do Oracle Database.
( ) A interoperabilidade entre Python e R pode ser estabelecida pelo pacote reticulate do R, que possibilita que no código R sejam utilizadas ambas as abordagens, em documentos R Markdown e no IDE RStudio.
( ) Os principais pacotes para manipulação de dados são o dplyr, para o R, e o Scikit-learn, para o Python.
As afirmativas são, respectivamente,
F – F – F.
V – F – F.
V – V – F.
F – V – V.
V – V – V.
O pacote dplyr do software R traz uma sintaxe intuitiva e eficiente para manipulação de dados, permitindo a filtragem, transformação, agrupamento e resumo de grandes conjuntos de dados de forma concisa e rápida. Considere uma base de dados (armazenada no objeto dados) que contém informações sobre processos judiciais e possui as seguintes variáveis:
• ID: identificador único do processo;
• Data_Abertura: data em que o processo foi iniciado;
• Status: status do processo (“Em andamento”, “Finalizado” ou “Arquivado”); e
• Valor_Controversia: valor monetário em disputa no processo.
Com base nesse contexto, considere o interesse de encontrar o número total de processos que têm valor de controvérsia superior a R$ 1.000.000,00 em cada um dos três tipos de status possíveis. Se esse resultado for armazenado no objeto Total_Controversia, qual das alternativas a seguir faz essa operação com funções do dplyr?
dados %>% filter(Valor_Controversia > 1000000) %>%
group_by(Status) %>%
summarise(Total_Controversia = count())
dados %>% summarise(Total_Controversia = count()) %>%
filter(Valor_Controversia > 1000000) %>%
group_by(Status)
dados %>% group_by(Status) %>%
summarise(Total_Controversia = count()) %>%
filter(Valor_Controversia > 1000000)
dados %>% filter(Valor_Controversia > 1000000) %>%
group_by(Status) %>%
summarise(Total_Controversia = n())
dados %>% summarise(Total_Controversia = n()) %>%
filter(Valor_Controversia > 1000000) %>%
group_by(Status)
Considere os dois trechos de código a seguir, ambos escritos na Linguagem R. O primeiro utiliza o pacote tidyverse, enquanto o segundo utiliza caret para o mesmo propósito.
Código 1(tidyverse):
library(tidyverse)
set.seed(123)
dados <- tibble(
X1 = rnorm(100),
X2 = rnorm(100),
Y = sample(c("A", "B"), 100, replace = TRUE)
)
dados_treino <- dados %>% sample_frac(0.7)
dados_teste <- anti_join(dados, dados_treino)
Código2(caret):
library(caret)
set.seed(123)
dados <- data.frame(
X1 = rnorm(100),
X2 = rnorm(100),
Y = sample(c("A", "B"), 100, replace = TRUE)
)
indices <- createDataPartition(dados$Y, p = 0.7,
list = FALSE)
dados_treino <- dados[indices, ]
dados_teste <- dados[-indices, ]
Em relação aos códigos apresentados, assinale a alternativa correta.
Ambos os códigos garantem que a proporção da variável de saída seja mantida na divisão entre treino e teste, evitando possíveis desbalanceamentos.
O primeiro código seleciona uma parte dos dados de maneira totalmente aleatória, sem se preocupar com a distribuição da variável de saída, enquanto o segundo código faz a divisão garantindo que as proporções da variável de saída sejam mantidas nos dois conjuntos.
Os dois códigos realizam a divisão dos dados utilizando a mesma estratégia, sem diferenças na forma como as observações são separadas entre treino e teste.
O primeiro código apresenta uma inconsistência na forma como o conjunto de teste é gerado, podendo resultar na seleção de observações duplicadas ou na omissão de algumas delas.
O segundo código realiza uma divisão aleatória simples, sem nenhuma preocupação com a distribuição da variável de saída entre os conjuntos de treino e teste.


Seu próximo nível começa aqui

Seu próximo nível começa aqui
Destrave a preparação completa para sua aprovação. Com a Assinatura Ilimitada, você estuda com os melhores professores do Brasil e todos os recursos Gran.
A combinação entre grandes modelos de linguagem (LLMs) e mecanismos de recuperação de informação tem viabilizado sistemas mais atualizados e contextualizados, como no caso da Recuperação-Augmentada por Geração (RAG). Nesse cenário, a engenharia de prompt também assume papel central, atuando como técnica de refinamento das instruções dadas ao modelo para guiar sua saída com mais precisão. Diante do exposto, assinale a alternativa correta.
A Engenharia de Prompt modifica os pesos dos modelos LLMs para gerar respostas mais precisas
O RAG integra busca de documentos com modelos generativos, ampliando a relevância e atualidade das respostas
O uso de RAG impede a atualização em tempo real dos modelos
Modelos RAG não são compatíveis com mecanismos de busca vetorial
Em programas escritos em linguagem R, é comum utilizar estruturas de repetição e condições para controlar o fluxo da execução, e realizar cálculos de forma automatizada. Observe o trecho de código abaixo:
x <- 1
soma <- 0
while (x <= 5) {
if (x %% 2 == 0) {
soma <- soma + x
}
x <- x + 1
}
print(soma)
Após a execução do programa, qual será o valor exibido no console?
Nenhuma saída, pois o loop é infinito.
6.
5.
2.
0.
O comando t(y) produz o traço da matriz y, ou seja, a soma dos elementos da diagonal principal da matriz y.
Certo
Errado
Linguagem e ambiente para computação estatística e gráficos utilizada para análise estatística, manipulação e visualização de dados. A descrição apresentada refere-se à linguagem:
SQL
C#
JavaScript
R
Um pesquisador realizou um ajuste de modelo de regressão linear simples. Abaixo está a saída do código executado no software R:

De acordo com a saída do código, qual a alternativa CORRETA?
A média do resíduo é - 0,175.
O modelo de regressão ajustado é y = 2,94753 + 0,05675x.
O R quadrado Múltiplo de 0,8859, significa que 88,59% da variável y é explicada pela variável x.
O modelo de regressão não é significativo ao nível de 5%.
Valor-p=0,923 significa que o intercepto é significativo ao nível de 5%.