Questões de Concurso sobre R

 
 
Disciplina
Assunto 1
Banca
Instituição
Cargo
Ano
Carreira
Área de formação
Escolaridade
Dificuldade
 
Comentários:
Professores
Alunos
Meus Comentários
Vídeo
 
Minhas questões:
Resolvidas
Não resolvidas
Certas
Erradas
 
Tipo de questão:
Certo e errado
Múltipla escolha
Incluir questões:
Anuladas
Desatualizadas
 
Questões:
Todas as questões
 
Filtro simplificado
 
Questões
Todas as questões
 
111 questões encontradas
Questões por página
20
Mais recentes
 

Observe o seguinte trecho de código R.


Imagem associada para resolução da questão


A partir do código R apresentado, deseja-se como resultado a matriz a seguir.


Imagem associada para resolução da questão


Para obter o resultado apresentado, deve-se completar o código R com a função:


A

c(df1 + df2)


B

dim(df1, df2)


C

array(df1, df2)


D

cbind(df1, df2)


E

frame(df1, df2)

Ainda em relação à situação apresentada no texto 2A2-II, na arquitetura analítica do projeto de combate à pesca ilegal, a integração entre consultas em SQL e o uso de linguagens como Python e R seria tecnicamente justificável porque essa integração


A

limita a escalabilidade da análise ao volume máximo suportado pelo banco relacional.


B

concentra as etapas do processo analítico exclusivamente no banco de dados.


C

reduz a necessidade de modelagem e saneamento da base de dados.


D

viabiliza a extração estruturada dos dados e a aplicação de métodos estatísticos, modelagem e automação.


E

transfere a lógica de persistência e integridade dos dados para as linguagens de programação.

O analista de dados Junior acessou o banco de dados e recuperou os seguintes valores que representam o tempo (em dias) de conclusão de cinco processos.


Imagem associada para resolução da questão


No R, para calcular a média do tempo de conclusão entre esses processos, deve-se utilizar o comando:


A

mode(tempos_processos)


B

mean(tempos_processos)


C

median(tempos_processos)


D

which.max(table(tempos_processos))


E

sum(tempos_processos)*length(tempos_processos)/5

Avalie as seguintes sentenças em relação à análise e visualização de dados, empregando o Microsoft Power BI e o Sistema R, que é uma linguagem e um ambiente para gráficos e computação estatística:


I.Avaliação de outliers, empregando o sistema R pode ser apoiada pelo uso do gráfico O3 (Overview Of Outliers), que mostra quais casos são identificados frequentemente como outliers, quais são identificados em dimensões únicas e quais são identificados apenas em dimensões superiores.

II.O sistema R permite a construção de gráficos com o pacote shiny e criação de dashboards interativos exclusivamente com o pacote ggplot2.

III.Na construção de dashboards em Microsoft Power BI Desktop, é possível usar o R para visualizar seus dados.


Estão corretas as afirmativas:


A

I e III apenas.


B

I e II apenas.


C

I, II e III.


D

II e III apenas.

Se, em uma simulação, for necessário preencher um vetor grande, será mais eficiente usar a linguagem R para alocar e preencher o vetor inteiro, em vez de criar um vetor unitário e redimensioná-lo.


C

Certo


E

Errado

Considere o seguinte data.frame em R:


dados <– data.frame(

grupo = c("A", "A", "B", "B", "C", "C"),

valor = c(10, 15, 8, 22, 17, 19),

aprovado = c(FALSE, TRUE, TRUE, FALSE, FALSE, TRUE))


Qual é o comando que retorna apenas as linhas em que o grupo é "B" ou "C" , o valor é maior que 15, e o aprovado é FALSE?


A

subset(dados, grupo %in% c("B","C") & valor > 15 & aprovado == FALSE, select = aprovado)


B

subset(dados, grupo == "B" | grupo == "C" & valor > 15 & aprovado == FALSE, select = –aprovado)


C

subset(dados, grupo %in% c("B","C") & (valor > 15 & aprovado == FALSE), select = –aprovado)


D

subset(dados, grupo %in% c("B","C") & valor > 15 & aprovado)


E

subset(dados, (grupo == "B" | grupo == "C") & valor > 15 & aprovado == FALSE)

Em R, a função lm( ) é utilizada para realizar regressão linear, permitindo modelar a relação entre variáveis dependentes e independentes.


C

Certo


E

Errado

No software R, o pacote dplyr oferece uma sintaxe intuitiva e ágil para manipulação de dados. Considere que uma base de dados contendo as quatro variáveis listadas a seguir foi armazenada no objeto processos:


ID: identificador único do processo.

Status: status do processo (“em andamento”, “finalizado” ou “arquivado”).

Numero Decisoes: número de decisões ou despachos no processo.

Data Conclusao: data de conclusão do processo (se o status for “finalizado”), no formato AAAA-MM-DD.


Nesse contexto, considere que um analista deseja calcular a soma total de decisões ou despachos proferidas nos processos “finalizados” para cada ano de conclusão. Qual das alternativa a seguir realiza essa operação corretamente, utilizando funções dplyr, e salva o resultado no objeto Soma_Decisoes?


A

processos %>% filter(Status == "finalizado") %>%

mutate(Ano_Conclusao = format(Data_Conclusao, "%Y")) %>%

group_by(Ano_Conclusao) %>%

summarise(Soma_Decisoes = sum(Numero_Decisoes))


B

processos %>% filter(Status == "finalizado") %>%

group_by(Data_Conclusao) %>%

summarise(Soma_Decisoes = sum(Numero_Decisoes)) %>%

mutate(Ano_Conclusao = format(Data_Conclusao, "%Y"))


C

processos %>% filter(Status = "finalizado") %>%

group_by(Ano_Conclusao = format(Data_Conclusao, "%Y")) %>%

summarise(Soma_Decisoes = sum(Numero_Decisoes))


D

processos %>% filter(Status == "finalizado") %>%

summarise(Ano_Conclusao = format(Data_Conclusao, "%Y")) %>%

group_by(Data_Conclusao) %>%

mutate(Soma_Decisoes = sum(Numero_Decisoes))


E

processos %>% mutate(Ano_Conclusao = format(Data_Conclusao, "%Y")) %>%

filter(Status == "finalizado") %>%

group_by(Ano_Conclusao)

summarise(Soma_Decisoes = sum(Numero_Decisoes))

No R com o pacote dplyr carregado, o comando a seguir pode ser usado para exibir o conteúdo de df por ordem decrescente de produtividade.

df %>% arrange(desc(produtividade))


C

Certo


E

Errado

No que diz respeito às Redes Neurais Artificiais (ANN, Artificial Neural Network):


I.Os Métodos de regularização por penalização com normas L1 e L2, correspondem respectivamente à Regressão Ridge e à Regressão Lasso (Least Absolute Shrinkage and Selection Operator Regression).

II.Métodos de regularização por Dropout, regularizam as redes neurais, descartando aleatoriamente nós, juntamente com suas conexões de entrada e saída, da rede durante o treinamento.

III.Métodos de regularização por Early Stopping interrompem o treinamento quando as atualizações de parâmetros não começam mais a produzir melhorias em um conjunto de validação em redes neurais profundas

IV.Para manejo de redes neurais com R, pode ser utilizado o pacote neuralnet, que permite treinamento de redes neurais usando a retropropagação, retropropagação resiliente com ou sem retrocesso de peso ou a versão globalmente convergente modificada.


Estão corretas as afirmativas:


A

I, II, III e IV.


B

II, III e IV apenas.


C

I e II apenas.


D

I e III apenas.

Com relação às linguagens de programação para ciência de dados, linguagem Python e R, avalie cada afirmativa a seguir e assinale (V) para a verdadeira e (F) para a falsa.

( ) No Oracle R Enterprise, a execução do R incorporado (ou Embedded R) possibilita a chamada de scripts do R em sessões do R executadas no servidor do Oracle Database.

( ) A interoperabilidade entre Python e R pode ser estabelecida pelo pacote reticulate do R, que possibilita que no código R sejam utilizadas ambas as abordagens, em documentos R Markdown e no IDE RStudio.

( ) Os principais pacotes para manipulação de dados são o dplyr, para o R, e o Scikit-learn, para o Python.

As afirmativas são, respectivamente,


A

F – F – F.


B

V – F – F.


C

V – V – F.


D

F – V – V.


E

V – V – V.

O pacote dplyr do software R traz uma sintaxe intuitiva e eficiente para manipulação de dados, permitindo a filtragem, transformação, agrupamento e resumo de grandes conjuntos de dados de forma concisa e rápida. Considere uma base de dados (armazenada no objeto dados) que contém informações sobre processos judiciais e possui as seguintes variáveis:

ID: identificador único do processo;

Data_Abertura: data em que o processo foi iniciado;

Status: status do processo (“Em andamento”, “Finalizado” ou “Arquivado”); e

Valor_Controversia: valor monetário em disputa no processo.


Com base nesse contexto, considere o interesse de encontrar o número total de processos que têm valor de controvérsia superior a R$ 1.000.000,00 em cada um dos três tipos de status possíveis. Se esse resultado for armazenado no objeto Total_Controversia, qual das alternativas a seguir faz essa operação com funções do dplyr?


A

dados %>% filter(Valor_Controversia > 1000000) %>%

group_by(Status) %>%

summarise(Total_Controversia = count())


B

dados %>% summarise(Total_Controversia = count()) %>%

filter(Valor_Controversia > 1000000) %>%

group_by(Status)


C

dados %>% group_by(Status) %>%

summarise(Total_Controversia = count()) %>%

filter(Valor_Controversia > 1000000)


D

dados %>% filter(Valor_Controversia > 1000000) %>%

group_by(Status) %>%

summarise(Total_Controversia = n())


E

dados %>% summarise(Total_Controversia = n()) %>%

filter(Valor_Controversia > 1000000) %>%

group_by(Status)

Considere os dois trechos de código a seguir, ambos escritos na Linguagem R. O primeiro utiliza o pacote tidyverse, enquanto o segundo utiliza caret para o mesmo propósito.


Código 1(tidyverse):


library(tidyverse)


set.seed(123)

dados <- tibble(

X1 = rnorm(100),

X2 = rnorm(100),

Y = sample(c("A", "B"), 100, replace = TRUE)

)


dados_treino <- dados %>% sample_frac(0.7)

dados_teste <- anti_join(dados, dados_treino)


Código2(caret):

library(caret)


set.seed(123)

dados <- data.frame(

X1 = rnorm(100),

X2 = rnorm(100),

Y = sample(c("A", "B"), 100, replace = TRUE)

)


indices <- createDataPartition(dados$Y, p = 0.7,

list = FALSE)

dados_treino <- dados[indices, ]

dados_teste <- dados[-indices, ]


Em relação aos códigos apresentados, assinale a alternativa correta.


A

Ambos os códigos garantem que a proporção da variável de saída seja mantida na divisão entre treino e teste, evitando possíveis desbalanceamentos.


B

O primeiro código seleciona uma parte dos dados de maneira totalmente aleatória, sem se preocupar com a distribuição da variável de saída, enquanto o segundo código faz a divisão garantindo que as proporções da variável de saída sejam mantidas nos dois conjuntos.


C

Os dois códigos realizam a divisão dos dados utilizando a mesma estratégia, sem diferenças na forma como as observações são separadas entre treino e teste.


D

O primeiro código apresenta uma inconsistência na forma como o conjunto de teste é gerado, podendo resultar na seleção de observações duplicadas ou na omissão de algumas delas.


E

O segundo código realiza uma divisão aleatória simples, sem nenhuma preocupação com a distribuição da variável de saída entre os conjuntos de treino e teste.

A combinação entre grandes modelos de linguagem (LLMs) e mecanismos de recuperação de informação tem viabilizado sistemas mais atualizados e contextualizados, como no caso da Recuperação-Augmentada por Geração (RAG). Nesse cenário, a engenharia de prompt também assume papel central, atuando como técnica de refinamento das instruções dadas ao modelo para guiar sua saída com mais precisão. Diante do exposto, assinale a alternativa correta.


A

A Engenharia de Prompt modifica os pesos dos modelos LLMs para gerar respostas mais precisas


B

O RAG integra busca de documentos com modelos generativos, ampliando a relevância e atualidade das respostas


C

O uso de RAG impede a atualização em tempo real dos modelos


D

Modelos RAG não são compatíveis com mecanismos de busca vetorial

Em programas escritos em linguagem R, é comum utilizar estruturas de repetição e condições para controlar o fluxo da execução, e realizar cálculos de forma automatizada. Observe o trecho de código abaixo:


x <- 1

soma <- 0


while (x <= 5) {

if (x %% 2 == 0) {

soma <- soma + x

}

x <- x + 1

}

print(soma)


Após a execução do programa, qual será o valor exibido no console?


A

Nenhuma saída, pois o loop é infinito.


B

6.


C

5.


D

2.


E

0.

Linguagem e ambiente para computação estatística e gráficos utilizada para análise estatística, manipulação e visualização de dados. A descrição apresentada refere-se à linguagem:


A

SQL


B

C#


C

JavaScript


D

R

Um pesquisador realizou um ajuste de modelo de regressão linear simples. Abaixo está a saída do código executado no software R:


Imagem associada para resolução da questão


De acordo com a saída do código, qual a alternativa CORRETA?


A

A média do resíduo é - 0,175.


B

O modelo de regressão ajustado é y = 2,94753 + 0,05675x.


C

O R quadrado Múltiplo de 0,8859, significa que 88,59% da variável y é explicada pela variável x.


D

O modelo de regressão não é significativo ao nível de 5%.


E

Valor-p=0,923 significa que o intercepto é significativo ao nível de 5%.

 
 
Gerar simulado