

Seu próximo nível começa aqui
Com a Assinatura Ilimitada, você tem tudo que precisa para sua aprovação.
Com a Assinatura Ilimitada, você combina prática, teoria e método em uma única assinatura com tudo que você precisa para sua aprovação.
A máquina de vetores de suporte (SVM - Support Vector Machine) se popularizou, por exemplo, devido ao sucesso em aplicações envolvendo reconhecimento de padrões. Escolha a alternativa abaixo que representa uma limitação da SVM.
Interpretabilidade.
Classificação binária.
Relações não lineares.
Modelagem de dados contínuos.
Na técnica de regressão descontínua (RDD), para estudo de inferência causal,
utiliza-se o pareamento como fator principal.
ajusta-se o viés de seleção e de tendência.
considera-se um ponto de corte que define o tratamento.
estima-se o efeito causal de uma intervenção.
utiliza-se, normalmente, a abordagem polinomial.
A respeito de métodos de análise quantitativa e qualitativa de dados aplicados à avaliação e ao monitoramento, julgue o item a seguir.
Na análise quantitativa de monitoramento, modelos de regressão podem ser usados para identificar a força da correlação entre variáveis e prever comportamentos futuros de indicadores.
Certo
Errado
Durante uma auditoria de desempenho operacional, uma equipe pretende construir um modelo preditivo para explicar o tempo de processamento de operações fiscais (Y) a partir de 27 variáveis explicativas relacionadas a carga de trabalho, complexidade dos casos, perfil dos auditores e uso de sistemas internos. Como há suspeita de multicolinearidade elevada entre algumas variáveis, o auditor decide comparar dois métodos de regularização: Ridge e Lasso. Nesse contexto,
o método Lasso tende a realizar seleção de variáveis, reduzindo alguns coeficientes a zero; o Ridge apenas encolhe coeficientes, mas não os elimina.
o método Ridge tende a zerar coeficientes de variáveis redundantes, realizando seleção automática; o Lasso apenas reduz magnitudes.
ambos os métodos sempre zeram coeficientes de variáveis colineares, resultando na exclusão automática de variáveis.
ambos os métodos geram modelos mais complexos do que a regressão linear simples, independentemente dos dados.
os métodos Lasso e Ridge utilizam exclusivamente penalização L2 para reduzir variáveis irrelevantes.
O aprendizado supervisionado requer que os dados de treinamento sejam previamente rotulados com as respostas corretas, de maneira a permitir que o modelo aprenda a relação entre as variáveis de entrada e a variável-alvo; o aprendizado não supervisionado, por sua vez, busca padrões nos dados sem nenhuma indicação prévia de resultado esperado.
Certo
Errado
A análise de regressão e correlação em estatística não pode ser aplicada
na determinação das variáveis genéricas em comparação aos termos de resultados de variáveis de maior peso.
na análise entre duas variáveis, por exemplo, redução do número de manutenções e gastos com campanhas informativas.
na previsão ou estimativa de números futuros de uma variável, verificando‑se os valores conhecidos de variáveis relacionadas.
na avaliação da dependência de uma variável – variável dependente, em relação a outras variáveis – variáveis independentes ou explicativas.
Conforme descrito e ilustrado por Guimarães e Hirakata (2012), em modelos correlacionados é comum se observar um “efeito principal”, que é o efeito direto de uma variável independente sobre a variável dependente e um “efeito de interação”, que é o efeito conjunto de duas ou mais variáveis independentes sobre a variável dependente (Fonte: GUIMARÃES, Luciano Santos Pinto; HIRAKATA, Vânia Naomi. Uso do modelo de equações de estimativas generalizadas na análise de dados longitudinais. Revista HCPA, Porto Alegre, v. 32, n. 4, p. 503-511, 2012). Considerando um exemplo genérico, onde se deseja avaliar o efeito do grupo (A ou B) e do tempo (pré, durante e pós intervenção) na variável escore de ansiedade, relacione a Coluna 1 à Coluna 2, associando as ilustrações gráficas abaixo aos seus respectivos efeitos.
Coluna 1

Coluna 2
( ) Efeito somente do tempo.
( ) Efeito somente do grupo.
( ) Efeito do grupo e do tempo.
( ) Efeito do grupo e do tempo com o efeito da interação.
A ordem correta de preenchimento dos parênteses, de cima para baixo, é:
1 – 2 – 3 – 4.
1 – 3 – 2 – 4.
2 – 3 – 1 – 4.
4 – 3 – 2 – 1.
4 – 2 – 3 – 1.
A equação de regressão resultante do método de mínimos quadrados é igual a y^=2.934+38,56x.
Certo
Errado
Um pesquisador está construindo um modelo de regressão múltipla para prever o nível de glicose no sangue (Y) a partir das seguintes variáveis explicativas: idade (X1), IMC (X2), horas de atividades físicas (X3), horas de sono (X4) e consumo diário de açúcar (X5).
Sobre os métodos de seleção de variáveis, assinale a alternativa correta.
O método stepwise (regressão em etapas) combina as etapas de adição e remoção de variáveis, podendo incluir uma variável em um passo e removê-la em outro.
O método forward (seleção progressiva) inicia com o modelo simples do tipo y = β0 + βixi em que xi é qualquer uma das cinco variáveis explicativas, escolhida pelo pesquisador.
O modelo global, y = β0 + β1x1 + β2x2 + β3x3 + β4x4 + β5x5, será sempre o melhor modelo a ser selecionado, pois terá sempre o maior R².
No método backward (eliminação regressiva), o modelo começa vazio e as variáveis são adicionadas uma a uma, escolhendo sempre aquele com melhor ajuste do modelo.
O critério de informação de Akaike (AIC) não penaliza modelos com muitos parâmetros, portanto, modelos com maior valor de AIC são preferíveis.
Um estatístico está construindo um modelo preditivo com um número muito grande de variáveis preditoras (p > n), muitas das quais são provavelmente irrelevantes e correlacionadas entre si. O objetivo é criar um modelo parcimonioso, que realize a seleção de variáveis e a regularização simultaneamente para evitar o superajuste (overfitting). Qual das seguintes técnicas de modelagem é a mais adequada para este propósito específico?
Análise de Variância (ANOVA), pois ela permite testar a significância de cada variável individualmente, selecionando apenas aquelas com p-valor abaixo de 0,05 para o modelo final.
Análise de Componentes Principais (ACP) seguida de regressão, pois a ACP seleciona as variáveis originais mais importantes, descartando as demais.
Seleção "stepwise" (passo a passo), pois este método garante a descoberta do melhor subconjunto de preditores sem o risco de superajuste, sendo computacionalmente eficiente em cenários com mais variáveis que observações (p > n).
Regressão LASSO (Least Absolute Shrinkage and Selection Operator), pois sua penalidade L1 (soma dos valores absolutos dos coeficientes) tem a propriedade de encolher os coeficientes de variáveis irrelevantes exatamente para zero, efetivamente removendo-as do modelo e realizando a seleção de variáveis.
Regressão Ridge, pois sua penalidade L2 (soma dos quadrados dos coeficientes) é mais eficaz na seleção de variáveis, zerando os coeficientes dos preditores menos importantes.
O comando p <- x * y produzirá a variável p, que é a matriz produto resultante da multiplicação do vetor-linha x pela matriz y.
Certo
Errado
Considerando-se uma variável dependente binária, igual a 1 se a família é pobre e igual a 0 se a família é não pobre, define-se um modelo linear que contém variáveis, agrupadas em X, que caracterizam a família e a sua pessoa de referência, tal que:
E(Y|X) = P(Y=1|X) = Xβ + ε
Nesse contexto, conclui-se o seguinte:
se esse modelo for estimado por Mínimos Quadrados Ordinários, Modelo de Probabilidade Linear, não serão gerados estimadores consistentes para os β, pois apenas valores de Y = 1 são considerados.
se o termo de erro tem distribuição normal padrão, pode-se estimar o modelo por Mínimos Quadrados Ordinários, MQO, e fazer inferência clássica da forma usual está correto.
como a Var(Y|X) é constante, o estimador de Mínimos Quadrados Ordinários, MQO, é o melhor estimador linear não viesado.
o modelo pode ser estimado por Mínimos Quadrados Ponderados, e os pesos utilizados devem ser positivos.
a estimação robusta à heterocedasticidade não pode ser usada, pois não garante que a probabilidade estará entre zero e 1.
Em um modelo de regressão polinomial de segundo grau, a relação entre a variável dependente Y e a variável independente X é modelada como:
Y=β0+β1 X+β2 X²+ε
Diante disto, assinale a alternativa que apresenta uma afirmação correta sobre esta regressão polinomial.
A análise de regressão polinomial de segundo grau não é útil para modelar relações não-lineares entre a variável dependente e a variável independente.
As regressões polinomiais de grau dois sempre geram resultados mais adequados e confiáveis do que modelos logarítmicos.
O coeficiente β2 em um modelo de regressão polinomial de segundo grau não afeta a forma da curva de ajuste, apenas a inclinação da reta de regressão.
A regressão polinomial de segundo grau sempre produzirá uma linha reta.
A inclusão de termos polinomiais em um modelo de regressão pode melhorar o ajuste aos dados, mas também pode aumentar o risco de sobreajuste (overfitting), especialmente se o grau do polinômio for muito alto.
A equação de regressão fornece a base para determinar várias estimativas por ponto, ou seja, um intervalo de predição completo.
Certo
Errado
A regressão logística é usada para fazer uma previsão sobre uma variável categórica comparada a uma contínua; assim como a regressão linear, a regressão logística também pode ser usada para estimar o relacionamento entre uma variável dependente e uma ou mais variáveis independentes.
Certo
Errado
Num problema de logística para predizer o tempo de cada viagem, em horas, como função das variáveis DISTÂNCIA (distância total a percorrer, em km) e ENTREGAS (número de entregas), foram feitas n = 40 observações independentes e sob as mesmas condições do vetor aleatório (TEMPO, DISTÂNCIA, ENTREGAS). A análise de regressão linear levou aos seguintes resultados:
Coeficiente | Erro padrão | |
(Intercept) | 4,46 | 2,03 |
DISTÂNCIA | 0,20 | 0,04 |
ENTREGAS | 1,11 | 0,03 |
Soma de quadrado total: SQT = 2,0
Soma de quadrado dos erros: SQE = 0,5
Com base nesses resultados, é correto afirmar:
O coeficiente de determinação, R2, é igual a 0,25.
Para testar se a variável ENTREGAS é significante, o valor da estatística de teste t é igual a 6,4.
Para testar se cada coeficiente é significante, deve-se usar graus de liberdade igual a 40.
Se fizer testes t, ao nível de significância de 5%, para testar a significância de cada variável individualmente, verifica-se que DISTÂNCIA é significante. Verifica-se, também, que ENTREGAS é significante.
Para testar conjuntamente a significância das variáveis ENTREGAS e DISTÂNCIA, deve-se usar um teste t.
De acordo com a equação de regressão, se mantiverem a mesma alimentação, qual indivíduo precisará fazer mais horas de atividade física para que sua taxa de glicose fique dentro do aceitável (100 ou menos)?
I.
II.
III.
IV.
Nenhum.
Suponha que um modelo de regressão múltipla foi ajustado para prever o salário de um indivíduo com base em sua idade, gênero e nível de educação. O modelo é dado por:
Salário = 20.000 + 500 * Idade + 5.000 * Gênero (mas
culino) - 10.000 * Ensino Médio - 5.000 * Graduação.
Neste modelo, a variável dependente é o salário do indivíduo. As variáveis independentes são a idade, o gênero e o nível de educação. A idade é uma variável contínua que representa a idade do indivíduo em anos. O gênero é uma variável dummy que tem valor 1 para indivíduos do sexo masculino e 0 para indivíduos do sexo feminino. O nível de educação é representado por duas variáveis dummy: Ensino Médio e Graduação. A variável dummy Ensino Médio tem valor 1 para indivíduos que completaram o ensino médio e 0 caso contrário. A variável dummy Graduação tem valor 1 para indivíduos que completaram a graduação e 0 caso contrário. A categoria de referência para o nível de educação é a pós-graduação, que não está incluída no modelo como uma variável dummy.
Com base nessas informações, assinale a afirmação verdadeira.
A diferença salarial prevista entre um homem e uma mulher com as mesmas características (idade e nível de educação) é de R$ 25.000.
O salário previsto para um homem de 40 anos com ensino médio é de R$ 50.000.
O salário previsto para uma mulher de 30 anos com pós-graduação é de R$ 35.000.
A diferença salarial prevista entre alguém com ensino médio e alguém com graduação é de R$ 10.000.
A diferença salarial prevista entre um homem com graduação e uma mulher com pós-graduação é de R$ 5.000.
De acordo com a equação de regressão, quais indivíduos têm o mesmo valor esperado de glicose?
I e II.
I e III.
I, II e III.
II e III.
III e IV.
Um pesquisador deseja calcular de forma direta como uma variação percentual de x (variável explicativa) afeta a variável y (variável dependente), em termos de variação percentual, ou seja, a elasticidade constante.
Assinale a alternativa que apresenta, corretamente, o modelo que o pesquisador deve estimar.
log-log
log-nível
nível-log
nível-nível
nível-exponencial