

Seu próximo nível começa aqui
Com a Assinatura Ilimitada, você tem tudo que precisa para sua aprovação.
Com a Assinatura Ilimitada, você combina prática, teoria e método em uma única assinatura com tudo que você precisa para sua aprovação.
Considere um cenário em que se deseja prever o valor de imóveis a partir de características como área, localização e número de quartos, utilizando um conjunto de dados históricos contendo o valor de venda de cada imóvel. Nesse caso, o problema e o tipo de modelo mais adequados são, respectivamente:
agrupamento e modelo não supervisionado.
classificação e modelo não supervisionado.
associação e modelo supervisionado.
regressão e modelo supervisionado.
redução de dimensionalidade e modelo supervisionado.
No modelo de referência CRISP-DM, a fase de preparação de dados ocorre estritamente após a conclusão da fase de modelagem, com o objetivo de formatar as saídas preditivas geradas.
Certo
Errado
Uma equipe de ciência de dados está desenvolvendo um modelo de risco para identificar empresas envolvidas na emissão de notas frias, usando dados de NF-e, escriturações fiscais digitais, cadastros, histórico de autuações e cruzamentos bancários. Foram definidas as seguintes atividades:
1.Definir objetivos de negócio (ex.: aumentar em 10% a recuperação de crédito em operações com notas frias, mantendo o número de fiscalizações).
2.Mapear as fontes de dados disponíveis (NF-e, cadastros, autuações) e avaliar sua qualidade e completude.
3.Selecionar técnicas de modelagem (ex.: redes neurais) e definir a estratégia de validação.
4.Definir métricas técnicas de avaliação (ex.: recall em top-k contribuintes, precisão por faixa de risco) alinhadas aos objetivos de negócio.
5.Planejar a integração do score ao sistema de seleção de contribuintes, incluindo monitoramento e possíveis recalibrações.
A correlação mais consistente dessas atividades às fases do modelo CRISP-DM está em:
1 | 2 | 3 | 4 | 5 |
Business Understanding | Data Understanding | Modeling | Evaluation | Deployment |
1 | 2 | 3 | 4 | 5 |
Data Understanding | Data Preparation | Modeling | Evaluation | Deployment |
1 | 2 | 3 | 4 | 5 |
Business Understanding | Data Preparation | Modeling | Deployment | Evaluation |
1 | 2 | 3 | 4 | 5 |
Business Understanding | Data Understanding | Data Preparation | Modeling | Evaluation |
1 | 2 | 3 | 4 | 5 |
Business Understanding | Data Understanding | Evaluation | Modeling | Deployment |
Uma equipe de ciência de dados está desenvolvendo um modelo de classificação de inadimplência em um conjunto de dados tabular com informações numéricas e categóricas de clientes (renda, idade, histórico de crédito, limite etc.).
O conjunto está fortemente desbalanceado: apenas 3% dos registros pertencem à classe denominada inadimplente. O time deseja aumentar a quantidade de exemplos da classe minoritária sem simplesmente duplicar registros existentes, gerando novas amostras sintéticas entre os pontos reais da classe positiva, para reduzir o risco de overfitting associado ao oversampling ingênuo.
A técnica de balanceamento de classes adequada para esse cenário é:
SMOTE;
oversampling aleatório da classe minoritária;
undersampling aleatório da classe majoritária;
data augmentation baseada em ruído gaussiano na classe minoritária;
ajuste de pesos de classe (class weights) no algoritmo de aprendizado.
Modelos de regressão linear são métodos estocásticos para modelagem da relação entre variáveis aleatórias e uma função polinomial.
Certo
Errado


Seu próximo nível começa aqui

Seu próximo nível começa aqui
Destrave a preparação completa para sua aprovação. Com a Assinatura Ilimitada, você estuda com os melhores professores do Brasil e todos os recursos Gran.
No contexto apresentado pelo texto CG1A12-I, uma ferramenta importante é o analytics. Em analytics, a análise preditiva é responsável por
prever o que provavelmente acontecerá e analisar as potenciais implicações de diferentes desdobramentos.
processar dados aprofundados e(ou) detalhados para o entendimento do motivo de algo ter acontecido.
avaliar as potenciais implicações de diferentes escolhas e recomendar o melhor plano de ação.
utilizar dados históricos para fazer previsões precisas sobre tendências futuras.
coletar dados para o entendimento do que aconteceu ou do que está acontecendo no ambiente de dados.
A regressão logística é um modelo muito popular na ciência de dados, ele é muito utilizado em diversos projetos da ALEGO. Com relação às características da regressão logística, analise as afirmativas a seguir.
I. É um modelo de regressão linear e dentro do contexto do aprendizado de máquina, a regressão logística pertence à família de modelos de aprendizado de máquina supervisionado.
II. Representa dois grupos de interesse como uma variável binária com valores 0 e 1, não importando qual o grupo é designado com os valores o versus 1, mas a designação de como dever ser observada interpretação dos coeficientes.
III. A função logística é representada pelas seguintes fórmulas:
a) Logit(pi) = 1/(1+ ln(-pi))
b) exp(pi/(1-pi)) = β_0 + β _1*X_1 + … + β _k*K_k.
onde:
logit(pi) é a variável dependente ou de resposta, e x é a variável independente.
Está correto o que se afirma em
II e III, apenas.
I e III, apenas.
I e II, apenas.
II, apenas.
I, apenas.
No zero-shot prompting, é fornecido ao modelo apenas a instrução inicial, sem exemplos adicionais, a fim de se explorar a capacidade do modelo de fazer generalizações a partir do conhecimento obtido no treinamento.
Certo
Errado
Os analistas de Ciência de Dados da ALEGO reconhecem que a abordagem tradicional de análise de dados envolve um ciclo composto por diversas etapas e uma vez que tenham definidos seus modelos preditivos, eles podem ser aplicados a novos conjuntos de dados. A figura criada pelos analistas representa um ciclo de análise preditiva e score de dados. Analise a figura e relacione a numeração indicada nas etapas com as suas respectivas operações.

A relação correta, na ordem dada, é:
1 = Operações de Integração de Dados,
2 = Operações de Extração de Dados,
3 = Operações de Preparação de Dados,
4 = Operações de Construção de Modelos e Score.
1 = Operações de Preparação de Dados,
2 = Operações de Extração de Dados,
3 = Operações de Construção de Modelos e Score,
4 = Operações de Integração de Dados.
1 = Operações de Construção de Modelos e Score,
2 = Operações de Preparação de Dados,
3 = Operações de Integração de Dados,
4 = Operações de Extração de Dados.
1 = Operações de Extração de Dados,
2 = Operações de Integração de Dados,
3 = Operações de Construção de Modelos e Score,
4 = Operações de Preparação de Dados.
1 = Operações de Extração de Dados,
2 = Operações de Integração de Dados,
3 = Operações de Preparação de Dados,
4 = Operações de Construção de Modelos e Score.
Uma equipe de um Tribunal Regional do Trabalho está desenvolvendo um modelo preditivo para avaliar o tempo de tramitação de processos trabalhistas. Os dados estão armazenados em um arquivo CSV chamado “processos.csv”, com as seguintes colunas:
- id_processo: Identificador único do processo.
- data_abertura: Data em que o processo foi aberto.
- data_encerramento: Data em que o processo foi encerrado.
A equipe deseja calcular o tempo de tramitação (em dias) de cada processo e inseri-lo em uma nova coluna chamada tempo_tramitacao. Considerando que o arquivo foi carregado em um dataframe chamado dados, o comando R que realiza corretamente esta tarefa é:
dados$tempo_tramitacao <- (as.Date (dados$data_encerramento) -
as.Date (dados$data_abertura)).days
dados$tempo_tramitacao <- difftime(dados$data_abertura, dados$data_encerramento, units = “days”)
dados$tempo_tramitacao <- as.numeric(as.Date(dados$data_encerramento) - as.Date (dados$data_abertura))
dados <- transform(dados, tempo_tramitacao = dados$data_encerramento - dados$data_abertura)
dados <- mutate(dados, tempo_tramitacao = dados$data_abertura - dados$data_encerramento)


Seu próximo nível começa aqui
Seu desenvolvimento não pode ter limites. Garanta sua Assinatura Ilimitada e libere uma preparação completa com os melhores professores do Brasil.
A técnica de validação cruzada k-fold contribui para a avaliação de modelos preditivos, reduzindo a variabilidade decorrente da segmentação do conjunto de dados em partes de treinamento e teste.
Certo
Errado
Julgue os itens seguintes, relativos a inteligência artificial (IA).
A análise preditiva é uma aplicação da IA em que são utilizadas técnicas de aprendizado de máquina para a previsão de resultados futuros com base em dados históricos.
Certo
Errado
O programa AlphaFold realiza a predição da estrutura terciária de proteínas a partir de sua estrutura primária utilizando técnicas de inteligência artificial e oferece modelos computacionais comparáveis com as estruturas resolvidas experimentalmente.
Certo
Errado
Que tipo de análise utiliza Big Data para prever comportamentos futuros com base em padrões históricos e tendências, ajudando as organizações a tomar decisões mais informadas e de forma mais assertiva, todavia, sem gerar recomendações de ações ou soluções automaticamente?
Descritiva.
Diagnóstica.
Prescritiva.
Preditiva.
Cognitiva.
A análise preditiva utiliza algoritmos estatísticos e modelos de machine learning para identificar padrões históricos nos dados e projetar tendências futuras, de forma a guiar decisões proativas e permitir a antecipação de cenários críticos para o negócio.
Certo
Errado


Seu próximo nível começa aqui

Seu próximo nível começa aqui
Destrave a preparação completa para sua aprovação. Com a Assinatura Ilimitada, você estuda com os melhores professores do Brasil e todos os recursos Gran.
Assinale a opção que apresenta corretamente a tarefa de mineração de dados adequada a ser utilizada caso um banco deseje prever, a partir de variáveis como renda, idade e histórico de pagamentos, o valor do limite de crédito que deve conceder a um cliente.
clusterização
regras de associação
detecção de anomalias
regressão
classificação
Durante o desenvolvimento de um sistema preditivo para auxiliar na gestão de processos judiciais em um Tribunal do Trabalho, uma equipe de analistas treinou dois modelos distintos para resolver problemas diferentes:
• O modelo A prevê se um processo será encerrado em até 6 meses (1) ou não (0), com base em dados como tipo de ação, número de audiências e histórico de partes envolvidas.
• O modelo B estima o número de dias até o encerramento do processo, utilizando variáveis como a vara do trabalho, grau de complexidade e duração média de tramitação por tipo de causa.
Após o treinamento, os seguintes resultados foram obtidos:
• O modelo A apresentou alta acurácia (92%), mas AUC-ROC de 0.61.
• O modelo B apresentou R2 de 0.83 no treino e 0.42 no teste, além de MAE (Mean Absolute Error) de 120 dias.
Com base nos resultados e considerando as boas práticas de avaliação preditiva quanto à qualidade e confiabilidade,
a acurácia elevada no modelo A e o R2 consistente no modelo B indicam que ambos têm desempenho adequado; embora a AUC do modelo A esteja próxima de 0.5 e haja queda no R2 do modelo B no teste, essas variações são normais em projetos preditivos e não comprometem a confiabilidade dos modelos.
o modelo A sofre com possível desbalanceamento de classes, o que reduz a confiabilidade da acurácia, mesmo estando elevada; já o modelo B mostra sinais de sobreajuste, evidenciado pela diferença expressiva entre R2 de treino e teste. É necessário reavaliar ambos antes de avançar.
o modelo À apresenta excelente desempenho, pois uma acurácia superior a 90% indica que a maior parte das previsões foi correta, tornando a AUC irrelevante neste caso.
o modelo B pode ser considerado adequado, pois o erro médio de 120 dias está dentro de uma margem aceitável em processos judiciais, mesmo que o R2 no teste tenha caído.
o modelo A é adequado para produção, pois mesmo com AUC moderada, a taxa de acerto geral garante sua aplicabilidade em classificações binárias.
Modelos discriminativos classificam dados conhecidos em categorias, enquanto modelos generativos preveem características completas a partir de um rótulo, explorando probabilidades conjuntas.
Certo
Errado
A regressão linear é um modelo preditivo supervisionado que estabelece uma relação entre variáveis independentes e uma variável dependente de natureza contínua.
Certo
Errado
Suponha que a Prefeitura de São Paulo deseje implementar um sistema de análise de dados para prever demandas de transporte público e identificar padrões de deslocamento em diferentes horários e regiões. Os dados disponiveis incluem registros históricos de viagens, horários de pico, informações demográficas e localizações geográficas. Para prever o aumento na demanda em horários específicos e identificar agrupamentos de regiões com padrões semelhantes de uso, deve-se
utilizar um modelo de Regressão Logística para prever as demandas de transporte público e Redes Neurais Convolucionais (CNN) para identificar padrões de deslocamento em horários de pico.
aplicar Regressão Linear para prever a demanda futura com base em variáveis como horário e histórico de viagens e utilizar o algoritmo não supervisionado K-Means para identificar agrupamentos de regiões com padrões similares de uso.
treinar um modelo não supervisionado de Support Vector Machine (SVM) para prever a demanda em horários específicos e Redes Neurais Recorrentes (RNN) para identificar padrões de deslocamento ao longo do tempo.
usar Árvores de Decisão para prever demandas futuras é treinar um modelo supervisionado de clusterização hierárquica para identificar padrões de deslocamento em horários específicos, através de dendogramas.
aplicar Regressão Logística para prever a demanda futura com base em histórico de viagens e utilizar o método ARIMA (Autoregressive Integrated Moving Average) para identificar agrupamentos de regiões para segmentação de dados geográficos.