Questões de Concurso sobre Regressão

 
 
Disciplina
Assunto 1
Banca
Instituição
Cargo
Ano
Carreira
Área de formação
Escolaridade
Dificuldade
 
Comentários:
Professores
Alunos
Meus Comentários
Vídeo
 
Minhas questões:
Resolvidas
Não resolvidas
Certas
Erradas
 
Tipo de questão:
Certo e errado
Múltipla escolha
Incluir questões:
Anuladas
Desatualizadas
 
Questões:
Todas as questões
 
Filtro simplificado
 
Questões
Todas as questões
 
145 questões encontradas
Questões por página
20
Mais recentes
 

O conjunto de valores não aleatórios que permite estimar o erro padrão em uma regressão linear utilizada na modelagem de custos logísticos com base no preço do combustível e no peso do frete consiste no intervalo de confiança.


C

Certo


E

Errado

Uma empresa de governança em TI implementou uma rotina de verificação de segurança em um sistema que depende de uma cadeia de módulos numerados de 1 a 23. O analista de sistema responsável percebeu que o módulo 23 estava funcionando corretamente, e que se qualquer módulo N0 funciona corretamente, então o módulo anterior também funciona. Com este cenário, o analista de sistemas pode concluir que todos os módulos funcionam corretamente. Essa metodologia de verificação é conhecida como Princípio da Regressão, o qual:


A

assume o funcionamento do módulo de maior número e demonstra, por implicação reversa, que os anteriores também funcionam, até alcançar o primeiro.


B

estabelece que, se um módulo inicial funciona e todos os sucessores também funcionam, então todos os módulos seguintes são válidos.


C

é uma prova com características indutivas matematicamente, mostrando a unicidade de cada teste de forma independente.


D

parte do princípio de que se um módulo n qualquer funciona, conclui-se diretamente que todos os módulos N > n também funcionam.


E

por conta da indução matemática no conjunto dos números naturais, torna essa propriedade válida apenas para conjuntos infinitos.

Os Modelos de Equações de Estimação Generalizadas (Generalized Estimating Equations – GEE) não exigem a suposição de esfericidade, pois permitem especificar diretamente a estrutura de correlação entre medidas repetidas. A matriz de correlação de trabalho (working correlation matrix) é uma estimativa dessa estrutura de dependência, utilizada para ajustar corretamente os erros padrão e gerar estimativas robustas dos efeitos populacionais. No SPSS, ao realizar uma análise GEE, é possível escolher entre cinco opções de matrizes de correlação para ajuste dos modelos. Nesse contexto, relacione a Coluna 1 à Coluna 2, associando as seguintes matrizes às suas respectivas características.


Coluna 1

1. Independente.

2. AR-1 (Autoregressive de 1ª ordem).

3. Troca (Exchangeable).

4. Dependente de ordem m.

5. Não estruturada.


Coluna 2

( ) Assume que a correlação entre quaisquer dois elementos é nula.

( ) Permite uma correlação diferente para cada par de medidas repetidas.

( ) Assume que cada medida repetida só é correlacionada com as m medições anteriores dentro do mesmo sujeito.

( ) Assume que todas as medidas dentro de um sujeito têm a mesma correlação m entre si (correlação homogênea).

( ) A correlação entre quaisquer dois elementos é igual a m para elementos adjacentes, m² para elementos separados por um terceiro e assim por diante, tal que –1 < m < 1.


A ordem correta de preenchimento dos parênteses, de cima para baixo, é:


A

1 – 5 – 2 – 3 – 4.


B

1 – 5 – 3 – 2 – 4.


C

1 – 5 – 4 – 3 – 2.


D

5 – 2 – 4 – 3 – 1.


E

5 – 3 – 1 – 4 – 2.

A figura apresenta parte do resultado do ajuste de um modelo de regressão linear realizado através da função lm() do software R.



De acordo com os dados fornecidos e as propriedades do modelo de regressão linear, assinale a afirmativa INCORRETA.


A

A análise foi baseada em uma amostra de tamanho 8.


B

O quadrado médio dos resíduos é, aproximadamente, igual a 0,673.


C

As probabilidades Pr(>|t|) foram calculadas com base em uma distribuição t de Student com 5 graus de liberdade.


D

A variável resposta y irá reduzir –2,6062 unidades quando ambas as variáveis explicativas x1 e x2 forem acrescidas de uma unidade.

Regressão espúria é quando tentamos relacionar variáveis que, por possuírem propriedades estatísticas semelhantes, apresentam correlação alta e significativa mesmo que não faça sentido. A respeito de regressão espúria, analise as afirmativas a seguir.


I. A regressão espúria é bastante comum em séries temporais. Isso ocorre porque séries que apresentam tendência ao longo do tempo são não estacionárias. Essa característica de não estacionariedade pode levar à obtenção de uma correlação significativa entre as séries somente por crescerem com o tempo, sem que haja uma relação entre elas.

II. Uma relação espúria é a relação estatística existente entre duas variáveis, mas onde não existe nenhuma relação causa e feito entre elas. Essa relação estatística pode ocorrer por pura coincidência ou por causa de uma terceira variável.

III. São exemplos de relação espúria: a quantidade de calor em uma sala pode fazer com que ela se torne mais húmida; a quantidade de luz solar recebida por uma planta pode afetar o seu crescimento; o stress a que uma pessoa está sujeita pode afetar seu desempenho no trabalho.


Está correto o que se afirma em


A

I, apenas.


B

I e II, apenas.


C

I e III, apenas.


D

II e III, apenas.


E

I, II e III.

O modelo de Regressão com Descontinuidade (RDD) é uma técnica estatística usada para avaliar o impacto causal de uma variável independente em uma variável dependente, quando essa variável independente ultrapassa um certo limite ou ponto de corte.

Suponha que se esteja investigando o efeito do número de horas de estudo (variável independente) no desempenho em um teste (variável dependente). Assumindo-se que haja um ponto de corte de 5 horas de estudo e que se deseje verificar se há algum efeito no resultado do teste ao se ultrapassar esse ponto de corte.


A equação para esse modelo pode ser expressa da seguinte forma:


Yi = 60 + 5Xi + 8Di + ϵi ,


onde


• Yi é o desempenho no teste para o indivíduo i;

• Xi é o número de horas de estudo para o indivíduo i;

• Di é uma variável indicadora que vale 1 se Xi > 5 horas e 0 caso contrário para o indivíduo i;

• ϵi é o termo de erro para o indivíduo i.


Ao se comparar um estudante que estuda 6 horas para um teste com um outro que estuda 4 horas, de acordo com o modelo RDD apresentado acima, verifica-se que o


A

estudante que estudou 6 horas provavelmente teve um desempenho melhor no teste, devido ao aumento no tempo de estudo além de 5 horas.


B

estudante que estudou 4 horas, provavelmente teve um desempenho melhor no teste devido ao equilíbrio entre estudo e descanso.


C

desempenho no teste para ambos os estudantes, provavelmente foi semelhante, já que a diferença no tempo de estudo não é suficientemente grande para impactar os resultados.


D

desempenho no teste para ambos os estudantes foi afetado por fatores não considerados no modelo, tornando difícil prever com precisão o impacto do tempo de estudo.


E

aumento no tempo de estudo para o aluno que estudou 6 horas não influenciou seu desempenho no teste.

A regressão logística pode ser compreendida como um modelo estatístico pelo qual infere-se a probabilidade de ocorrência de certo evento. A previsão de aplicação em amostras de tamanho massivo é uma de suas premissas de aplicação, sendo que outra afirma que o resultado mais indesejado é entendido como sendo:


A

1.


B

2.


C

0,8.


D

0.


E

0,7.

Para modelar a quantidade de notificações recebidas sobre a existência de trabalho escravo em algumas regiões brasileiras, determinado analista do Ministério Público do trabalho ajustou um modelo de regressão Poisson, considerando a função de ligação canônica. Sobre esse modelo, assinale a afirmativa INCORRETA.


A

A variável resposta do modelo deve seguir uma distribuição Poisson e os dados devem possuir equidispersão, ou seja, a média e variância da variável resposta devem ser iguais.


B

Se a superdispersão é detectada no modelo ajustado, o modelo de regressão que utiliza a variável binomial negativa como variável resposta pode acomodar esse comportamento.


C

Offset é uma componente incluída no modelo em escala logarítmica, que pode ser utilizada para denotar o período de exposição sob estudo e possui um coeficiente de regressão igual a 1.


D

Se a função Deviance for utilizada como medida de qualidade de ajuste do modelo proposto, quanto menor o seu valor, maior a discrepância entre os ajustes dos modelos proposto e saturado, ou seja, maior evidência de falta de ajuste do modelo proposto.


E

Um método utilizado para estimar os valores dos coeficientes da regressão do modelo é conhecido como método escore de Fisher para maximização da função de verossimilhança, que coincide com o método de Newton-Raphson quando a função de ligação é a canônica.

Com relação à equação da reta de regressão, podemos usá-la para diversas estimativas. Se o fizermos para x = 60, obteremos o correspondente y. Dos valores a seguir, o que mais se aproxima de y é:


A

25.


B

28.


C

20.


D

30.


E

35.

Considere a regressão de Y por X, duas variáveis não nulas. Chame de R os resíduos da regressão de Y por X estimada por mínimos quadrados ordinários. Se estimarmos uma regressão de R por X pelo método dos mínimos quadrados ordinários, o coeficiente angular dessa última regressão será:


A

positivo.


B

negativo.


C

do mesmo sinal que o coeficiente angular da primeira regressão.


D

do mesmo sinal que o coeficiente de correlação entre X e Y.


E

zero.

Em modelos de regressão linear, afirma-se que há heterocedasticidade quando


A

os valores dos critérios de informação BIC e AIC são exatamente iguais.


B

a medida da influência de uma observação calculada por meio da distância de Cook é igual a zero.


C

a ausência de pontos aberrantes, de pontos de alavanca e de pontos influentes é percebida.


D

os parâmetros do modelo estatístico são estimados por máxima verossimilhança.


E

a variância dos erros não é a mesma em todas as observações feitas.

Considere uma regressão y = α + βx + ε que tem R2 (coeficiente de determinação) igual a A. A seguir, é acrescentada uma variável irrelevante z, de modo que a regressão y = α + βx + γz + ε tenha R2 igual a B.


É correto afirmar que


A

o valor esperado de B será menor que o de A.


B

B será sempre menor do que A.


C

B será menor do que A, se a estatística t de γ for menor do que um.


D

A e B serão iguais.


E

B nunca será menor do que A.

Durante a verificação das suposições do modelo de regressão linear, os resíduos externamente studentizados (do inglês externally studentized residual) (𝑡) são apresentados graficamente com os valores preditos na figura a seguir.

Fonte: MONTGOMERY, Douglas C.; PECK, Elizabeth A.; VINING, G. Geoffrey. Introduction to linear regression analysis. John Wiley & Sons, 2012.

Qual violação das suposições do modelo linear pode ser verificada na figura?


A

Os erros são correlacionados.


B

Os erros não apresentam média zero.


C

Os erros não apresentam variância constante.


D

Os erros não apresentam distribuição normal.

As variáveis número de horas de treinamento preventivo e número de acidentes de trabalho foram analisadas e forneceram a seguinte equação de regressão linear: Y previsto = 8,5 – 0,006X. Esta equação permite afirmar que:


A

independentemente do número de acidentes, a quantidade de horas de treinamento preventivo deve ser 8,5


B

a cada acidente ocorrido, deve-se diminuir o número de horas de treinamento preventivo em 0,006 hora


C

a cada hora a mais de programa de treinamento preventivo, deve-se esperar um aumento de 0,006 acidente


D

a cada hora a mais de programa de treinamento preventivo, deve-se esperar uma diminuição de 0,006 acidente


E

a cada acidente ocorrido, deve-se aumentar o número de horas de treinamento preventivo em 0,006 hora

Dentre os diversos testes estatísticos utilizados na análise de resíduos de um modelo de regressão linear múltipla, encontra-se o Teste de Levene. Sobre esse teste, analise as afirmativas a seguir.


I. É utilizado para testar a homocedasticidade das variâncias dos erros.

II. A rejeição da hipótese nula do teste é baseada na distribuição F.

III. Antes de realizar testes paramétricos, como o teste t de Student, ele é usado para garantir que as suposições subjacentes desses testes estão sendo atendidas.


Está correto o que se afirma em


A

I, II e III.


B

I, apenas.


C

II, apenas.


D

I e III, apenas.

 
 
Gerar simulado