Questões de Concurso sobre Modelagempreditiva

 
 
Disciplina
Assunto 1
Banca
Instituição
Cargo
Ano
Carreira
Área de formação
Escolaridade
Dificuldade
 
Comentários:
Professores
Alunos
Meus Comentários
Vídeo
 
Minhas questões:
Resolvidas
Não resolvidas
Certas
Erradas
 
Tipo de questão:
Certo e errado
Múltipla escolha
Incluir questões:
Anuladas
Desatualizadas
 
Questões:
Todas as questões
 
Filtro simplificado
 
Questões
Todas as questões
 
60 questões encontradas
Questões por página
20
Mais recentes
 

Considere um cenário em que se deseja prever o valor de imóveis a partir de características como área, localização e número de quartos, utilizando um conjunto de dados históricos contendo o valor de venda de cada imóvel. Nesse caso, o problema e o tipo de modelo mais adequados são, respectivamente:


A

agrupamento e modelo não supervisionado.


B

classificação e modelo não supervisionado.


C

associação e modelo supervisionado.


D

regressão e modelo supervisionado.


E

redução de dimensionalidade e modelo supervisionado.

No modelo de referência CRISP-DM, a fase de preparação de dados ocorre estritamente após a conclusão da fase de modelagem, com o objetivo de formatar as saídas preditivas geradas.


C

Certo


E

Errado

Uma equipe de ciência de dados está desenvolvendo um modelo de risco para identificar empresas envolvidas na emissão de notas frias, usando dados de NF-e, escriturações fiscais digitais, cadastros, histórico de autuações e cruzamentos bancários. Foram definidas as seguintes atividades:


1.Definir objetivos de negócio (ex.: aumentar em 10% a recuperação de crédito em operações com notas frias, mantendo o número de fiscalizações).

2.Mapear as fontes de dados disponíveis (NF-e, cadastros, autuações) e avaliar sua qualidade e completude.

3.Selecionar técnicas de modelagem (ex.: redes neurais) e definir a estratégia de validação.

4.Definir métricas técnicas de avaliação (ex.: recall em top-k contribuintes, precisão por faixa de risco) alinhadas aos objetivos de negócio.

5.Planejar a integração do score ao sistema de seleção de contribuintes, incluindo monitoramento e possíveis recalibrações.


A correlação mais consistente dessas atividades às fases do modelo CRISP-DM está em:


A


1

2

3

4

5

Business Understanding

Data Understanding

Modeling

Evaluation

Deployment


B


1

2

3

4

5

Data Understanding

Data Preparation

Modeling

Evaluation

Deployment


C


1

2

3

4

5

Business Understanding

Data Preparation

Modeling

Deployment

Evaluation


D


1

2

3

4

5

Business Understanding

Data Understanding

Data Preparation

Modeling

Evaluation


E


1

2

3

4

5

Business Understanding

Data Understanding

Evaluation

Modeling

Deployment

Uma equipe de ciência de dados está desenvolvendo um modelo de classificação de inadimplência em um conjunto de dados tabular com informações numéricas e categóricas de clientes (renda, idade, histórico de crédito, limite etc.).

O conjunto está fortemente desbalanceado: apenas 3% dos registros pertencem à classe denominada inadimplente. O time deseja aumentar a quantidade de exemplos da classe minoritária sem simplesmente duplicar registros existentes, gerando novas amostras sintéticas entre os pontos reais da classe positiva, para reduzir o risco de overfitting associado ao oversampling ingênuo.


A técnica de balanceamento de classes adequada para esse cenário é:


A

SMOTE;


B

oversampling aleatório da classe minoritária;


C

undersampling aleatório da classe majoritária;


D

data augmentation baseada em ruído gaussiano na classe minoritária;


E

ajuste de pesos de classe (class weights) no algoritmo de aprendizado.

No contexto apresentado pelo texto CG1A12-I, uma ferramenta importante é o analytics. Em analytics, a análise preditiva é responsável por


A

prever o que provavelmente acontecerá e analisar as potenciais implicações de diferentes desdobramentos.


B

processar dados aprofundados e(ou) detalhados para o entendimento do motivo de algo ter acontecido.


C

avaliar as potenciais implicações de diferentes escolhas e recomendar o melhor plano de ação.


D

utilizar dados históricos para fazer previsões precisas sobre tendências futuras.


E

coletar dados para o entendimento do que aconteceu ou do que está acontecendo no ambiente de dados.

A regressão logística é um modelo muito popular na ciência de dados, ele é muito utilizado em diversos projetos da ALEGO. Com relação às características da regressão logística, analise as afirmativas a seguir.


I. É um modelo de regressão linear e dentro do contexto do aprendizado de máquina, a regressão logística pertence à família de modelos de aprendizado de máquina supervisionado.

II. Representa dois grupos de interesse como uma variável binária com valores 0 e 1, não importando qual o grupo é designado com os valores o versus 1, mas a designação de como dever ser observada interpretação dos coeficientes.

III. A função logística é representada pelas seguintes fórmulas:


a) Logit(pi) = 1/(1+ ln(-pi))

b) exp(pi/(1-pi)) = β_0 + β _1*X_1 + … + β _k*K_k.


onde:


logit(pi) é a variável dependente ou de resposta, e x é a variável independente.


Está correto o que se afirma em


A

II e III, apenas.


B

I e III, apenas.


C

I e II, apenas.


D

II, apenas.


E

I, apenas.

No zero-shot prompting, é fornecido ao modelo apenas a instrução inicial, sem exemplos adicionais, a fim de se explorar a capacidade do modelo de fazer generalizações a partir do conhecimento obtido no treinamento.


C

Certo


E

Errado

Os analistas de Ciência de Dados da ALEGO reconhecem que a abordagem tradicional de análise de dados envolve um ciclo composto por diversas etapas e uma vez que tenham definidos seus modelos preditivos, eles podem ser aplicados a novos conjuntos de dados. A figura criada pelos analistas representa um ciclo de análise preditiva e score de dados. Analise a figura e relacione a numeração indicada nas etapas com as suas respectivas operações.


Imagem associada para resolução da questão


A relação correta, na ordem dada, é:


A

1 = Operações de Integração de Dados,

2 = Operações de Extração de Dados,

3 = Operações de Preparação de Dados,

4 = Operações de Construção de Modelos e Score.


B

1 = Operações de Preparação de Dados,

2 = Operações de Extração de Dados,

3 = Operações de Construção de Modelos e Score,

4 = Operações de Integração de Dados.


C

1 = Operações de Construção de Modelos e Score,

2 = Operações de Preparação de Dados,

3 = Operações de Integração de Dados,

4 = Operações de Extração de Dados.


D

1 = Operações de Extração de Dados,

2 = Operações de Integração de Dados,

3 = Operações de Construção de Modelos e Score,

4 = Operações de Preparação de Dados.


E

1 = Operações de Extração de Dados,

2 = Operações de Integração de Dados,

3 = Operações de Preparação de Dados,

4 = Operações de Construção de Modelos e Score.

Uma equipe de um Tribunal Regional do Trabalho está desenvolvendo um modelo preditivo para avaliar o tempo de tramitação de processos trabalhistas. Os dados estão armazenados em um arquivo CSV chamado “processos.csv”, com as seguintes colunas:


- id_processo: Identificador único do processo.

- data_abertura: Data em que o processo foi aberto.

- data_encerramento: Data em que o processo foi encerrado.


A equipe deseja calcular o tempo de tramitação (em dias) de cada processo e inseri-lo em uma nova coluna chamada tempo_tramitacao. Considerando que o arquivo foi carregado em um dataframe chamado dados, o comando R que realiza corretamente esta tarefa é:


A

dados$tempo_tramitacao <- (as.Date (dados$data_encerramento) -

as.Date (dados$data_abertura)).days


B

dados$tempo_tramitacao <- difftime(dados$data_abertura, dados$data_encerramento, units = “days”)


C

dados$tempo_tramitacao <- as.numeric(as.Date(dados$data_encerramento) - as.Date (dados$data_abertura))


D

dados <- transform(dados, tempo_tramitacao = dados$data_encerramento - dados$data_abertura)


E

dados <- mutate(dados, tempo_tramitacao = dados$data_abertura - dados$data_encerramento)

A técnica de validação cruzada k-fold contribui para a avaliação de modelos preditivos, reduzindo a variabilidade decorrente da segmentação do conjunto de dados em partes de treinamento e teste.


C

Certo


E

Errado

Julgue os itens seguintes, relativos a inteligência artificial (IA).


A análise preditiva é uma aplicação da IA em que são utilizadas técnicas de aprendizado de máquina para a previsão de resultados futuros com base em dados históricos.


C

Certo


E

Errado

O programa AlphaFold realiza a predição da estrutura terciária de proteínas a partir de sua estrutura primária utilizando técnicas de inteligência artificial e oferece modelos computacionais comparáveis com as estruturas resolvidas experimentalmente.


C

Certo


E

Errado

Que tipo de análise utiliza Big Data para prever comportamentos futuros com base em padrões históricos e tendências, ajudando as organizações a tomar decisões mais informadas e de forma mais assertiva, todavia, sem gerar recomendações de ações ou soluções automaticamente?


A

Descritiva.


B

Diagnóstica.


C

Prescritiva.


D

Preditiva.


E

Cognitiva.

A análise preditiva utiliza algoritmos estatísticos e modelos de machine learning para identificar padrões históricos nos dados e projetar tendências futuras, de forma a guiar decisões proativas e permitir a antecipação de cenários críticos para o negócio.


C

Certo


E

Errado

Assinale a opção que apresenta corretamente a tarefa de mineração de dados adequada a ser utilizada caso um banco deseje prever, a partir de variáveis como renda, idade e histórico de pagamentos, o valor do limite de crédito que deve conceder a um cliente.


A

clusterização


B

regras de associação


C

detecção de anomalias


D

regressão


E

classificação

Durante o desenvolvimento de um sistema preditivo para auxiliar na gestão de processos judiciais em um Tribunal do Trabalho, uma equipe de analistas treinou dois modelos distintos para resolver problemas diferentes:


• O modelo A prevê se um processo será encerrado em até 6 meses (1) ou não (0), com base em dados como tipo de ação, número de audiências e histórico de partes envolvidas.

• O modelo B estima o número de dias até o encerramento do processo, utilizando variáveis como a vara do trabalho, grau de complexidade e duração média de tramitação por tipo de causa.


Após o treinamento, os seguintes resultados foram obtidos:


• O modelo A apresentou alta acurácia (92%), mas AUC-ROC de 0.61.

• O modelo B apresentou R2 de 0.83 no treino e 0.42 no teste, além de MAE (Mean Absolute Error) de 120 dias.


Com base nos resultados e considerando as boas práticas de avaliação preditiva quanto à qualidade e confiabilidade,


A

a acurácia elevada no modelo A e o R2 consistente no modelo B indicam que ambos têm desempenho adequado; embora a AUC do modelo A esteja próxima de 0.5 e haja queda no R2 do modelo B no teste, essas variações são normais em projetos preditivos e não comprometem a confiabilidade dos modelos.


B

o modelo A sofre com possível desbalanceamento de classes, o que reduz a confiabilidade da acurácia, mesmo estando elevada; já o modelo B mostra sinais de sobreajuste, evidenciado pela diferença expressiva entre R2 de treino e teste. É necessário reavaliar ambos antes de avançar.


C

o modelo À apresenta excelente desempenho, pois uma acurácia superior a 90% indica que a maior parte das previsões foi correta, tornando a AUC irrelevante neste caso.


D

o modelo B pode ser considerado adequado, pois o erro médio de 120 dias está dentro de uma margem aceitável em processos judiciais, mesmo que o R2 no teste tenha caído.


E

o modelo A é adequado para produção, pois mesmo com AUC moderada, a taxa de acerto geral garante sua aplicabilidade em classificações binárias.

Ano: 2025
Prova: CESPE/CEBRASPE - PCDF - Gestor de Apoio - Área: Analista de Informática Desenvolvimento de Sistemas . - 2025

Modelos discriminativos classificam dados conhecidos em categorias, enquanto modelos generativos preveem características completas a partir de um rótulo, explorando probabilidades conjuntas.


C

Certo


E

Errado

A regressão linear é um modelo preditivo supervisionado que estabelece uma relação entre variáveis independentes e uma variável dependente de natureza contínua.


C

Certo


E

Errado

Suponha que a Prefeitura de São Paulo deseje implementar um sistema de análise de dados para prever demandas de transporte público e identificar padrões de deslocamento em diferentes horários e regiões. Os dados disponiveis incluem registros históricos de viagens, horários de pico, informações demográficas e localizações geográficas. Para prever o aumento na demanda em horários específicos e identificar agrupamentos de regiões com padrões semelhantes de uso, deve-se


A

utilizar um modelo de Regressão Logística para prever as demandas de transporte público e Redes Neurais Convolucionais (CNN) para identificar padrões de deslocamento em horários de pico.


B

aplicar Regressão Linear para prever a demanda futura com base em variáveis como horário e histórico de viagens e utilizar o algoritmo não supervisionado K-Means para identificar agrupamentos de regiões com padrões similares de uso.


C

treinar um modelo não supervisionado de Support Vector Machine (SVM) para prever a demanda em horários específicos e Redes Neurais Recorrentes (RNN) para identificar padrões de deslocamento ao longo do tempo.


D

usar Árvores de Decisão para prever demandas futuras é treinar um modelo supervisionado de clusterização hierárquica para identificar padrões de deslocamento em horários específicos, através de dendogramas.


E

aplicar Regressão Logística para prever a demanda futura com base em histórico de viagens e utilizar o método ARIMA (Autoregressive Integrated Moving Average) para identificar agrupamentos de regiões para segmentação de dados geográficos.

 
 
Gerar simulado