Questões de Concurso sobre Análise de Regressão Logística

 
 
Disciplina
Assunto 1
Banca
Instituição
Cargo
Ano
Carreira
Área de formação
Escolaridade
Dificuldade
 
Comentários:
Professores
Alunos
Meus Comentários
Vídeo
 
Minhas questões:
Resolvidas
Não resolvidas
Certas
Erradas
 
Tipo de questão:
Certo e errado
Múltipla escolha
Incluir questões:
Anuladas
Desatualizadas
 
Questões:
Todas as questões
 
Filtro simplificado
 
Questões
Todas as questões
 
20 questões encontradas
Questões por página
20
Mais recentes
 

Em uma avaliação de impacto de um novo programa de atenção primária à saúde, um gestor público modela a probabilidade de óbito em até 30 dias (variável resposta binária: 1 = óbito, 0 = sobrevida) usando regressão logística binária, com variáveis explicativas: idade, índice de comorbidades, adesão ao protocolo e condição socioeconômica. Em relação à teoria e prática da regressão logística, julgue os itens a seguir:


I. O modelo de regressão logística estima a probabilidade 𝑃(𝑌 = 1 ∣ 𝑋) = sendo que os parâmetros 𝛽 são obtidos por máxima verossimilhança (MV), e diferentemente do modelo linear de probabilidade (MLP), os valores preditos ficam restritos ao intervalo [0,1].

II. Se o coeficiente estimado para idade for 𝛽idade = 0,05, a interpretação é que um aumento de uma unidade na idade está associado a um aumento de 5% na probabilidade de óbito, mantendo as demais variáveis constantes.

III. O modelo logístico não requer normalidade dos resíduos nem homocedasticidade, mas exige independência das observações e ausência de multicolinearidade perfeita ou quase perfeita.

IV. A área sob a curva ROC (AUC) é uma medida de acurácia discriminativa do modelo: valores próximos a 0,5 indicam discriminação aleatória, enquanto valores acima de 0,8 sugerem bom poder discriminativo.

V. O teste de Hosmer-Lemeshow é frequentemente usado para avaliar a calibração do modelo logístico, ou seja, se as probabilidades preditas correspondem às frequências observadas. Um resultado não significativo (p > 0,05) indica boa calibração.


Assinale a alternativa com a sequência CORRETA (V/F):


A

V – F – V – V – V


B

V – V – F – V – F


C

F – V – V – F – V


D

V – F – V – F – F


E

F – F – V – V – V

A função de probabilidade utilizada por um modelo probit para estimar, por exemplo, a probabilidade de ocorrência de um acidente de trânsito é a distribuição logística, e seus resultados são expressos como razões de chances.


C

Certo


E

Errado

Um tribunal deseja prever o tempo de tramitação (em dias) de processos de uma determinada classe, desde a distribuição até a sentença em 1ª instância. Um cientista de dados ajustou um modelo de regressão usando variáveis como tipo de ação, vara, quantidade de partes e histórico de movimentações, e avaliou o modelo no conjunto de teste.


Como métrica principal, ele calculou a soma das diferenças absolutas dividida pelo número de observações, ou:


Imagem associada para resolução da questão

obtendo Erro = 18, que foi interpretado como: “em média, o modelo erra em 18 dias o tempo de tramitação dos processos”.


A métrica utilizada pelo cientista de dados é:


A

Erro Médio Absoluto (MAE);


B

Erro Quadrático Médio (MSE);


C

Coeficiente de Determinação (R²);


D

Raiz do Erro Quadrático Médio (RMSE);


E

Erro Percentual Absoluto Médio (MAPE).

A probabilidade estimada de redução de sintomas para pacientes tratados com a droga B e dose de 25 mg é dada por:


A

–6 + 0,5 x Dose


B

e–6 + 0,5 x Dose


C

e–6 + 0,6 x Dose


D


E

Os Modelos Lineares Generalizados (MLG) estendem o escopo da regressão linear para variáveis resposta que não seguem uma distribuição normal. A estrutura de um MLG é definida por uma distribuição da família exponencial, um preditor linear e uma função de ligação. Acerca desses modelos, registre V, para as afirmativas verdadeiras, e F, para as falsas:


(__)A principal característica de um MLG é que ele transforma a variável resposta (Y) para que ela siga uma distribuição normal, permitindo então o ajuste de um modelo de regressão linear padrão.

(__)A função de ligação (link function) é o componente que conecta o preditor linear (η = β0 + β1X1 + ...) à média da variável resposta (E[Y] = μ), de forma que g(μ) = η.

(__)A Regressão de Poisson, um tipo de MLG, é adequada para modelar dados de contagem e assume que a variância da variável resposta é sempre maior que sua média, um fenômeno conhecido como subdispersão.

(__)A Regressão Logística para dados binários é um caso especial de MLG onde a variável resposta segue uma distribuição de Bernoulli (ou Binomial) e a função de ligação canônica é a função logit.


Após análise, assinale a alternativa que apresenta a sequência correta dos itens acima, de cima para baixo:


A

V − F − V − F.


B

F − F − V − F.


C

F − V − V − F.


D

F − V − F − V.


E

V − F − F − V.

Um pesquisador de marketing deseja prever a probabilidade de um cliente adquirir ou não um novo serviço (variável resposta binária: "compra" vs. "não compra"), com base em um conjunto de variáveis preditoras contínuas e categóricas (idade, renda, histórico de compras, etc.). Além disso, ele quer interpretar como cada variável preditora afeta as chances de compra. Qual técnica estatística multivariada é a mais adequada para este problema de classificação e interpretação?


A

Análise Discriminante Linear, pois é o método clássico para classificar observações em grupos pré-definidos, sendo mais robusto que a regressão logística quando a suposição de normalidade multivariada dos preditores é violada.


B

Análise de Componentes Principais (ACP), para reduzir o número de variáveis preditororas a um conjunto menor de componentes não correlacionados antes de prever a compra.


C

Regressão Logística, pois é um modelo projetado especificamente para prever uma variável dependente categórica (neste caso, binária) a partir de um conjunto de preditores independentes, e seus coeficientes podem ser interpretados em termos de "odds ratio" (razão de chances).


D

Correlação Canônica, pois o objetivo é encontrar a associação linear máxima entre o conjunto de variáveis preditoras e a variável resposta binária.


E

Análise de Agrupamento (Cluster Analysis), para identificar grupos naturais de clientes ("compradores" e "não compradores") com base em suas características.

Considere um problema de classificação binária onde deseja-se prever se um cliente comprará ou não um determinado produto, com base em características como idade, renda e histórico de compras. Em relação aos algoritmos de Machine Learning a seguir, assinale a alternativa que apresenta o algoritmo mais adequado para começar a abordagem desse problema de forma interpretável e eficiente em termos computacionais.


A

Q-Learning.


B

K-Means.


C

Regressão Logística.


D

PCA (Principal Component Analysis).


E

Algoritmo Apriori.

Com base no Estudo sobre Diabetes Tipo 2 e nos resultados observados, assinale a alternativa INCORRETA.


A

O significado de um coeficiente de regressão logística não é tão simples quanto o de um coeficiente de regressão linear. Enquanto B é conveniente para testar a utilidade de preditores, Exp(B) é mais fácil de interpretar.


B

Como o intervalo de confiança para Exp(B) da variável sexo não inclui o valor 1, conclui-se que o efeito é estatisticamente significativo. Em outras palavras, indivíduos do sexo feminino apresentam aproximadamente 3,26 vezes mais chances de desenvolver diabetes tipo 2.


C

A cada aumento de 10 anos na idade, as chances do evento aumentam aproximadamente 30%.


D

O intercepto negativo indica que, para um indivíduo de sexo masculino com idade zero, a chance de ocorrência do evento é muito baixa, servindo como ponto de partida matemático do modelo.


E

O valor de -2 Log Likelihood serve para medir a qualidade do modelo (quanto maior, melhor o ajuste relativo).

Com base no Estudo sobre Diabetes Tipo 2, considere o seguinte:


O _____________________ é utilizado para avaliar o ajuste global de um modelo de regressão logística, comparando os valores observados e previstos da variável dependente. A interpretação é direta: _______ indica um _____ ajuste. O teste é fácil de interpretar, amplamente usado em artigos científicos e fornece uma visão global do ajuste do modelo, mas tem limitações: em amostras grandes, pode detectar diferenças muito pequenas (excesso de sensibilidade) e, em amostras pequenas, pode não identificar problemas de ajuste, sendo recomendado combiná-lo com outras métricas e a análise de resíduos.


Assinale a alternativa que preenche, correta e respectivamente, as lacunas do trecho acima.


A

Teste de Hosmer-Lemeshow – p-valor >0,05 – bom


B

Teste de Hosmer-Lemeshow – p-valor >0,05 – mau


C

R² de Nagelkerke – p-valor >0,05 – bom


D

R² de Nagelkerke – valores >1 – bom


E

R² de Nagelkerke – valores <1 – mau

A regressão logística é uma técnica fundamental para modelar a relação entre um conjunto de variáveis preditoras e uma variável resposta categórica binária. A interpretação de seus coeficientes e a avaliação do modelo requerem métricas específicas. Considerando a aplicação e a interpretação de um modelo de regressão logística, analise as afirmativas a seguir.


I.O coeficiente (β) de uma variável preditora contínua no modelo logístico representa a mudança no logaritmo da razão de chances (log odds) para cada aumento de uma unidade na variável preditora, mantendo as outras variáveis constantes.

II.A exponencial do coeficiente (exp(β)), conhecida como "odds ratio" ou razão de chances, indica o fator pelo qual as chances de ocorrência do evento de interesse são multiplicadas para cada aumento de uma unidade na variável preditora.

III.A avaliação do ajuste de um modelo logístico não utiliza o R² da regressão linear, mas sim pseudo-R² (como o de McFadden ou Nagelkerke) e a estatística de Hosmer-Lemeshow, que compara as probabilidades previstas com as observadas em grupos.


Está correto o que se afirma em:


A

I, II e III.


B

II apenas.


C

III apenas.


D

I e II apenas.


E

I e III apenas.

Um modelo de regressão logística tem a função de ligação dada por:



Em que xi é o valor da variável explicativa, são parâmetros do modelo de regressão logística, e é a probabilidade de sucesso do evento de interesse associado ao valor da variável xi. pode ser escrito como:


A


B


C


D


E

A regressão logística é uma técnica recomendada para situações em que a variável dependente é de natureza dicotômica ou binária, podendo as variáveis independentes ser categóricas ou não.


As características da regressão logística incluem as a seguir listadas, à exceção de uma. Assinale-a.


A

Facilidade para lidar com variáveis independentes categóricas.


B

Fornece resultados probabilísticos.


C

Requer número expressivo de suposições.


D

Apresenta alto grau de confiabilidade.

Técnica de análise multivariada que permite estabelecer a probabilidade de ocorrência de determinado evento para situações em que a variável dependente é qualitativa e de natureza dicotômica. Pode ser utilizada mesmo quando alguns dos pressupostos da análise discriminante não forem atendidos. Com base nesse conceito, assinale a alternativa correta


A

Análise de Cluster.


B

Regressão Logística.


C

Análise Fatorial.


D

MDS.


E

Regressão Múltipla.

Um departamento de recursos humanos está conduzindo um estudo sobre a probabilidade de os funcionários serem promovidos. Foram coletados dados sobre o desempenho, nível educacional e anos de experiência de uma amostra de funcionários. Ao realizar uma análise estatística, eles identificaram que a técnica mais apropriada para prever a probabilidade de promoção é a Regressão Logística.


Nesse contexto, essa técnica é utilizada para:


A

calcular a média de promoções nos últimos anos dentro da empresa;


B

prever o salário dos funcionários com base em suas características pessoais;


C

calcular a correlação entre variáveis como desempenho, educação e experiência;


D

identificar funcionários mais antigos na empresa com chances elevadas de promoção;


E

prever a probabilidade de promoção dos funcionários, considerando variáveis independentes.

Um modelo de regressão logística só aceita variáveis categóricas; um modelo de regressão linear só aceita variáveis quantitativas.


C

Certo


E

Errado

O método de Newton Raphson é uma forma numérica que pode ser utilizada para estimar os parâmetros em um modelo de regressão logística, visto que os estimadores não possuem forma fechada. O mesmo pode ser feito em um modelo de regressão linear, apesar de a forma deste ser fechada para o estimador dos parâmetros.


C

Certo


E

Errado

Os parâmetros de um modelo de regressão linear e logística podem ser estimados por meio da técnica de máxima verossimilhança.


C

Certo


E

Errado

Dado um determinado modelo de regressão logística com função de ligação logit, em que:

_

_

_

Qual a probabilidade de Y=1, dado que X1=5 e X2=0 ?


A

0,1


B

0,2


C

0,3


D

0,4


E

0,5

Em um modelo de regressão logística, o que indica se o modelo se ajusta bem aos dados é a(o)


A

função logito


B

função probito


C

razão de chances


D

estatística deviance


E

coeficiente de determinação

 
 
Gerar simulado