

Seu próximo nível começa aqui
Com a Assinatura Ilimitada, você tem tudo que precisa para sua aprovação.
Com a Assinatura Ilimitada, você combina prática, teoria e método em uma única assinatura com tudo que você precisa para sua aprovação.
Em um modelo de regressão múltipla estimado por mínimos quadrados ordinários, observa-se que duas variáveis explicativas apresentam correlação muito alta entre si. Adicionalmente, um dos coeficientes estimados apresenta sinal contrário ao esperado pela teoria, e os erros-padrão dos coeficientes são substancialmente elevados.
A partir dessa situação hipotética, é correto concluir que o modelo em questão apresenta
endogeneidade, o que viola o pressuposto de exogeneidade das variáveis explicativas e gera estimativas inconsistentes que não convergem para os valores verdadeiros mesmo com amostras grandes.
autocorrelação dos resíduos, o que provoca perda da propriedade de eficiência dos estimadores e invalida completamente a capacidade preditiva do modelo ajustado.
erro de especificação por omissão de variável relevante, sendo necessário identificar e incluir a variável faltante para corrigir os sinais inesperados dos coeficientes.
multicolinearidade, o que resulta em estimativas com variância inflada e interpretações individuais dos coeficientes pouco confiáveis.
heterocedasticidade, o que implica estimativas viesadas dos coeficientes e torna os testes de hipótese não confiáveis para inferências sobre os parâmetros populacionais.
Um modelo de regressão linear múltipla com n observações e p variáveis explicativas (além do intercepto) é estimado por meio do método dos mínimos quadrados ordinários (com p < n). O coeficiente de determinação ajustado é substancialmente menor que o coeficiente de determinação não ajustado e a soma dos quadrados dos resíduos é numericamente próxima à soma de quadrados total. Adicionalmente, nenhum dos testes t individuais para os coeficientes apresentam significância estatística ao nível de 5%, embora o teste F global indique que o modelo como um todo é significativo ao mesmo nível.
Nessa situação hipotética,
a aparente contradição resulta de heterocedasticidade severa nos resíduos, que afeta os testes t individuais, mas não o teste F global; a análise de resíduos studentizados revelaria padrões de variância crescente, e o uso de erros-padrão robustos de White corrigiria os testes t, tornando-os consistentes com o teste F.
os resultados indicam violação grave do pressuposto de normalidade dos erros, pois, sob normalidade, os testes t e F devem sempre concordar em suas conclusões; a solução apropriada envolve a aplicação de transformações Box-Cox na variável resposta para restaurar a normalidade e reconciliar os testes.
os resultados demonstram que o estimador de máxima verossimilhança seria mais apropriado que o estimador de mínimos quadrados para o conjunto de dados, pois, sob normalidade dos erros, ambos os métodos produzem estimativas idênticas, mas com propriedades de teste diferentes, sendo a verossimilhança mais robusta a estruturas de correlação complexas.
a contradição entre os testes indica que os graus de liberdade foram calculados incorretamente, provavelmente devido à presença de observações duplicadas no conjunto de dados; a correção requer que se identifiquem e removam as duplicatas antes de se reestimar o modelo e recalcular todas as estatísticas de teste.
os resultados sugerem presença de multicolinearidade substancial entre as variáveis explicativas; embora o conjunto de regressores tenha poder explicativo (teste F significativo), a alta correlação entre eles impede a identificação precisa das contribuições individuais (testes t não significativos), o que resulta em variâncias infladas dos estimadores individuais, mas não afeta a capacidade preditiva conjunta do modelo.
Considere o modelo de regressão linear múltipla 𝑦 = 𝛽0 + 𝛽1𝑋1 + 𝛽2𝑋2 + 𝛽3𝑋3, ajustado a um conjunto de 15 observações. Sabe-se que os coeficientes de correlação linear entre as variáveis explicativas são:
𝑟12 = 0,75(correlação entre 𝑋1e 𝑋2),
𝑟13 = 0,60(correlação entre 𝑋1e 𝑋3),
𝑟23 = 0,70(correlação entre 𝑋2 e 𝑋3).
Assinale a opção que apresenta corretamente o coeficiente de correlação parcial entre 𝑋1e 𝑋2 mantendo 𝑿𝟑 constante.
0,333
0,452
0,578
0,624
0,752
Durante uma auditoria de desempenho operacional, uma equipe pretende construir um modelo preditivo para explicar o tempo de processamento de operações fiscais (Y) a partir de 27 variáveis explicativas relacionadas a carga de trabalho, complexidade dos casos, perfil dos auditores e uso de sistemas internos. Como há suspeita de multicolinearidade elevada entre algumas variáveis, o auditor decide comparar dois métodos de regularização: Ridge e Lasso. Nesse contexto,
o método Ridge tende a zerar coeficientes de variáveis redundantes, realizando seleção automática; o Lasso apenas reduz magnitudes.
ambos os métodos sempre zeram coeficientes de variáveis colineares, resultando na exclusão automática de variáveis.
ambos os métodos geram modelos mais complexos do que a regressão linear simples, independentemente dos dados.
os métodos Lasso e Ridge utilizam exclusivamente penalização L2 para reduzir variáveis irrelevantes.
o método Lasso tende a realizar seleção de variáveis, reduzindo alguns coeficientes a zero; o Ridge apenas encolhe coeficientes, mas não os elimina.
A modelagem preditiva por regressão linear assume que existe uma relação linear entre as variáveis independentes e a variável-alvo, o que a torna adequada para qualquer tipo de dado, até mesmo séries temporais com sazonalidade acentuada e dados com relações altamente não lineares.
Certo
Errado
Um modelo de regressão linear múltipla foi desenvolvido para prever o tempo de tramitação de processos judiciais (em dias), com base na quantidade de páginas do processo e no número de partes envolvidas. Durante a análise de resíduos do modelo, o analista decide calcular a distância de Cook para identificar possíveis observações influentes. Nesse contexto, assinale a afirmativa correta.
A remoção de observações com alta distância de Cook sempre melhora a precisão do modelo de regressão linear.
A distância de Cook é usada apenas para identificar outliers e não considera a influência das observações nas estimativas dos coeficientes do modelo.
Uma observação com valor elevado para a distância de Cook pode ser considerada influente, sugerindo que sua remoção pode causar uma mudança nos coeficientes do modelo.
Qualquer processo que possua um número elevado tanto de páginas quanto de partes envolvidas terá um valor elevado de distância de Cook, devendo ser removida para melhorar o ajuste do modelo.
A remoção de observações com distância de Cook elevada deve ser realizada de forma imediata e deliberada, sem realizar uma análise mais aprofundada da sua origem ou representatividade no contexto dos dados.
Em modelos de regressão linear múltipla, ocorre multicolinearidade quando duas ou mais variáveis explicativas apresentam alta correlação linear entre si, o que pode aumentar a variância das estimativas dos coeficientes e dificultar a interpretação dos efeitos individuais das variáveis. Com base nesse conceito, assinale a alternativa correta.
Quanto menor for o valor do Fator de Inflação da Variância (VIF), mais severa será a multicolinearidade.
Se o teste F global e os testes t individuais forem simultaneamente significativos, conclui-se que há multicolinearidade entre as variáveis explicativas.
O Fator de Inflação da Variância (VIF) é uma medida amplamente utilizada para verificar a presença e a intensidade da multicolinearidade entre as variáveis explicativas.
A presença de multicolinearidade não afeta as estimativas dos coeficientes, mas pode aumentar a variância dessas estimativas, tornando-as menos precisas.
A multicolinearidade pode ser eliminada apenas aumentando o tamanho da amostra, sem necessidade de ajustes nas variáveis explicativas.
A presença de multicolinearidade severa entre as variáveis independentes pode distorcer os coeficientes estimados em uma regressão linear múltipla.
Certo
Errado
Sobre a análise de regressão múltipla, marque a alternativa correta:
A regressão múltipla avalia a relação entre uma variável dependente e várias variáveis independentes.
A análise de resíduos não é relevante na validação de um modelo de regressão múltipla.
A presença de multicolinearidade aumenta a precisão dos coeficientes estimados.
O coeficiente de determinação R2R^2R2 indica sempre a relação causal entre variáveis.
A regressão linear múltipla permite avaliar o efeito de diversas variáveis independentes sobre uma variável dependente, ao mesmo tempo.
Certo
Errado
Um modelo de regressão linear não pode ser ajustado a conjuntos de dados com alta dimensionalidade (muitas variáveis preditoras), uma vez que será inviável calcular a matriz de estimação do modelo.
Certo
Errado
A regressão linear múltipla é uma técnica de análise multivariada usada para modelar a relação entre uma variável dependente e múltiplas variáveis independentes.
Certo
Errado
Um modelo de regressão linear múltipla foi ajustado para prever o tempo de tramitação de processos judiciais (em dias), com base nas variáveis explicativas X1 = número de partes envolvidas no processo e X2 = quantidade de páginas do processo. Parte dos resultados obtidos após ajustar o modelo com base em uma amostra de tamanho 100 são apresentados na tabela a seguir:

Além disso, o Fator de Inflação da Variância (VIF) associado à variável X1 foi calculado, retornando o valor 5,0. Com base nas informações fornecidas, assinale a afirmativa correta.
O VIF associado à variável X2 também será igual a 5,0.
O coeficiente de correlação linear de Pearson entre as variáveis X1 e X2 é menor que 0,80.
O intercepto no modelo é irrelevante e deve ser removido, pois o seu valor estimado não é interpretável no contexto da análise.
Para qualquer processo, a cada aumento de uma unidade no número de partes envolvidas, o tempo de tramitação aumenta 3,25 dias.
Saber que a variável X2 é estatisticamente significativa não é suficiente para se concluir que a variável X1 também será significativa para um mesmo nível de significância.
Quando vemos uma relação em um diagrama de dispersão, podemos usar uma reta para resumir essa relação nos dados. Também podemos usar esta reta para fazer previsões a partir dos dados. Este processo é chamado de regressão linear. A verificação de multicolinealidade na execução da regressão linear, implica em
verificar se existe uma relação linear entre as variáveis independentes e a variável dependente.
identificar que os outliers podem afetar significativamente o modelo de regressão linear.
se duas ou mais variáveis independentes são altamente correlacionadas, pois isso pode afetar negativamente o modelo de regressão linear.
verificar se a distribuição dos resíduos é normal, pois isso é uma suposição importante da regressão linear.
escolher as variáveis independentes apropriadas para incluir no modelo, o que pode ser feito por meio de métodos estatísticos.
Assinale a opção que apresenta a fórmula para o cálculo do coeficiente de correlação múltipla.
Rijk=1−r2 jkr2ij+r2ik−2rijrikrjk
Rijk=1−r2 jkr2ij+r2ik+2rijrikrjk
Rijk=1+r2 jkr2ij+r2ik−2rijrikrjk
Rijk=1−r2 jkr2ij−r2ik−2rijrikrjk
Rijk=1+r2 jkr2ij+r2ik+2rijrikrjk
Em um modelo de regressão linear múltipla, onde há uma variável dependente Y e k variáveis independentes X, o estimador não viesado para a variância do modelo com n observações é dado por:
Obs. O chapéu em Y^l indica valor estimado e o traço em Yl indica a média.
∑in=1(Yl^−Yl)2/(n−k−1);
∑in=1(Yl^−Yl)2/(n−k);
∑in=1(Yi−Yl)2/(n−k−1);
∑in=1(Yi−Y^l)2/(n−k−1);
∑in=1(Yi−Y^l)2/(n−k).
É uma técnica amplamente utilizada em Ciência de Dados para modelar e compreender relações entre variáveis. No que se refere ao conceito apresentado, assinale a alternativa correta.
Teoria Bayesiana.
Distribuição Uniforme.
Regressão Linear.
Distribuição Exponencial.
Nenhuma das alternativas.
Sabe-se que os modelos estatísticos de regressão foram construídos com base em algumas suposições.
Dessa forma, assinale a opção que apresenta a suposição que se aplica aos modelos de regressão múltipla e não está presente nos modelos de regressão simples.
A ausência de multicolinearidade.
Os resíduos são normalmente distribuídos.
Os resíduos são homocedásticos.
Os resíduos são não-autocorrelacionados.
A variável ou as variáveis independentes não são estocásticas.
O diretor-geral de uma grande rede de escolas deseja estudar a relação entre a nota dos alunos do ensino médio em uma determinada prova de conhecimentos gerais (Y, em pontos) com o sexo do aluno (X1 = 0, se feminino; X1 = 1, se masculino), a idade do aluno (X2, em anos) e a sua renda familiar per capita (X3, em reais). O estatístico contratado pra resolver esse problema selecionou uma amostra aleatória de alunos, ajustou um modelo de regressão linear múltipla usando as variáveis explicativas X1, X2, X3 e Y como a variável resposta. Ele apresentou ao diretor as seguintes conclusões:
I. A nota média do aluno cresce linearmente com relação a sua idade.
II. A nota média do aluno cresce linearmente com relação a sua renda familiar per capita.
III. A média da nota do aluno difere entre os dois sexos.
IV. O efeito linear da renda familiar per capita na nota não é o mesmo para qualquer idade, e vive-versa.
V. O efeito linear do sexo do aluno na nota é o mesmo para qualquer idade e renda familiar per capita.
Considerando as conclusões anteriores, marque a alternativa que corresponde a uma possível representação da estrutura do modelo final apresentado ao diretor-geral.
Y = β0 + β1 X1 + β2 X2 + β3 X3 + erro
Y = β0 + β1 X2 + β2 X3 + β3 X2 X3 + erro
Y = β0 + β1 X1 + β2 X2 + β3 X3 + β4 X2 X3 + erro
Y = β0 + β1 X1 + β2 X2 + β3 X3 + β4 X1 X2 + β5 X1 X3 + β6 X2 X3 + erro
Em modelos de regressão linear múltipla, um grande problema é a multicolinearidade na qual as variáveis independentes possuem relações lineares exatas ou aproximadamente exatas (correlação alta) entre elas mesmas, indicando que duas ou mais variáveis fornecem a mesma informação sobre a variável resposta. Para encontrar esse problema em modelos de regressão linear múltipla, deve ser utilizada qual medida de diagnóstico?
Distância de Cook.
Erro padrão residual.
Matriz de alavanca H.
Fator de inflação da variância.