

Seu próximo nível começa aqui
Com a Assinatura Ilimitada, você tem tudo que precisa para sua aprovação.
Com a Assinatura Ilimitada, você combina prática, teoria e método em uma única assinatura com tudo que você precisa para sua aprovação.
Um pesquisador do IFCE está treinando um modelo de classificação com o algoritmo CART para identificar possíveis fraudes em pedidos de auxílio estudantil.
Durante o treinamento, observa que, em determinado nó, todos os registros pertencem à classe “Fraude”, resultando em impureza igual a 0,0. Ele relembra que o CART utiliza uma métrica baseada na probabilidade de um elemento ser classificado incorretamente, considerando a distribuição das classes no nó.
Com base nisso, assinale a alternativa que apresenta corretamente a métrica de impureza utilizada pelo algoritmo CART.
Entropia.
Índice Gini.
Ganho de Informação.
Erro de Classificação.
Informação Mútua.
No desenvolvimento de um robô autônomo para classificação de objetos por colorimetria, os dados devem ser armazenados em um servidor remoto, sendo necessário garantir uma comunicação eficiente e uma interface que atenda aos princípios de acessibilidade universal (focada em usuários com discromatopsia/daltonismo).
Para atender a essa necessidade, as ações técnicas adequadas incluem
modelar o banco de dados de forma não relacional para otimizar o tempo de resposta e acelerar o processamento de camadas de realidade aumentada na interface.
configurar o banco de dados SQL com o comando UPDATE para cada item catalogado e, no front-end utilizar padrões geométricos ou ícones além das cores.
estabelecer uma licença de propriedade intelectual restrita que bloqueie tecnicamente a conexão do robô e o envio de pacotes de dados para redes WI-FI públicas.
implementar scripts em JavaScript para desabilitar o hardware de captura sempre que o acesso ao dashboard ocorrer via dispositivos móveis (Design Responsivo).
utilizar apenas sensores ultrassônicos na leitura de objetos, uma vez que esses componentes operam por emissão de ondas sonoras, ignorando variações cromáticas e focando na densidade dos materiais.
A classificação automática de culturas agrícolas e espécies vegetais, conforme descrita no texto 2A2-I, corresponde, do ponto de vista da mineração de dados, a uma tarefa de classificação porque
reduz a dimensionalidade dos dados para a visualização.
agrupa dados sem rótulos previamente definidos.
identifica exceções raras em grandes volumes de dados.
descobre relações frequentes entre atributos independentes.
associa instâncias a classes previamente definidas a partir de exemplos.
Em um problema de classificação binária, P representa a classe positiva e N representa a classe negativa. A matriz de confusão a seguir apresenta as linhas como classes reais e as colunas como classes preditas, com o número de instâncias (amostras) em cada caso.

Os valores de precisão e recall para a classe P, nessa ordem, são
0,6 e 0,75.
0,75 e 0,6.
0,7 e 0,65.
0,65 e 0,7.
0,75 e 0,65.
Um Ministério Público deseja testar o uso de Processamento de Linguagem Natural (NLP) para classificar automaticamente textos, como forma de triagem preliminar de documentos recebidos. Para isso, uma analista desenvolveu o código em Python abaixo.
from sklearn.feature_extraction.text import TfidfVectorizer
from sklearn.linear_model import LogisticRegression
from sklearn.model_selection import train_test_split
from sklearn.metrics import classification_report, accuracy_score
import numpy as np
texts = [
# Jurídico
"Petição inicial com pedido de tutela de urgência e documentos anexos.",
"Despacho determinando a intimação das partes para audiência de instrução.",
"Autos conclusos ao juiz para análise de mérito e sentença.",
"Recurso de apelação interposto contra decisão de primeira instância.",
"Requerimento de sigilo de peças processuais por proteção de dados pessoais.",
# Não-jurídico
"Relatório financeiro do trimestre com receitas e despesas consolidadas.",
"Convite para reunião estratégica entre equipes de tecnologia e produto.",
"Artigo científico sobre redes neurais e aprendizado profundo.",
"Manual de procedimentos internos para manutenção de servidores.",
"E-mail de boas-vindas aos novos colaboradores do setor administrativo."
]
labels = np.array([1, l, 1, 1, 1, 0, 0, 0, 0, 0])
X_train, X_test, y_train, y_test = train_test_split(
texts, labels, test_size=0.3, random_state=42, stratify=labels
)
vectorizer = TfidfVectorizer(ngram_range=(1,2), max_features=2000)
X_train_tfidf = vectorizer.fit_transform(X_train)
X_test_tfidf = vectorizer.transform(X_test)
model = LogisticRegression(max_iter=200)
model.fit(X_train_tfidf, y_train)
y_pred = model.predict (X_test_tfidf)
print("Acurácia no conjunto de teste:", round (accuracy_score(y_test, y_pred), 3))
print("\nRelatório de classificação:\n")
print(classification_report(y_test,y_pred,target_names=["não-jurídico","jurídico"]))
Considerando que este será executado em condições ideais, pode-se afirmar que o código
utiliza TF-IDF para transformar os textos em vetores numéricos e treina uma Regressão Logistica para distinguir automaticamente documentos jurídicos de não jurídicos, gerando métricas como acurácia e relatório de classificação.
treina um classificador Naive Bayes baseado em Logistic Regression que prevê probabilidades de classes e calcula automaticamente embeddings de palavras com o uso de TF-IDF.
aplica técnicas de clustering não supervisionado para agrupar documentos por similaridade sobre os vetores de texto, estimando valores contínuos que depois são convertidos em classes jurídicas e não jurídicas.
implementa um pipeline com deep learning, utilizando embeddings word2vec e camadas LSTM para classificação de sentenças jurídicas e não jurídicas.
utiliza TF-IDF para gerar vetores numéricos e, em seguida, aplica um Logistic Regression baseado em Support Vector Machine (SVM) para separar documentos jurídicos e não jurídicos, retornando margens de decisão.
O cerne da obra de Mark Monmonier, “Como mentir com mapas”, decorre de escolhas cartográficas, seja por omissão, simplificação ou classificação, necessárias para representar fenômenos complexos, mas que podem influenciar a interpretação do mapa. No caso dos mapas temáticos, isso inclui a classificação de valores numéricos ao longo de um intervalo contínuo.
Assinale a opção que indica o critério de classificação que divide as feições em classes que possuem a mesma frequência de registros.
Quantis.
Desvio Padrão.
Intervalos Iguais.
Quebras Naturais.
Escala Logarítmica.
Considere um modelo supervisionado cuja função objetivo minimize o erro entre valores reais contínuos e valores preditos, bem como outro modelo cuja função objetivo minimize o erro de atribuição entre classes discretas. Esses dois problemas correspondem, respectivamente, às tarefas de:
Regressão e Classificação.
Classificação e Regressão.
Regressão Logística e Regressão Linear.
Regressão Linear e Regressão Logística.
No campo da mineração de dados existem alguns problemas fundamentais que costumam aparecer com frequência em variados cenários de aplicação. O estudo desses problemas fornece ferramentas ao analista de dados que são aplicáveis em diferentes projetos de mineração de dados. Nesse conjunto se encontram os problemas de determinação de padrões, classificação de dados, segmentação de dados (clustering) e detecção de valores discrepantes (outliers).
Considerando os problemas citados, analise as afirmativas a seguir.
I. Em uma tabela binária esparsa, que representa uma base de dados de transações de clientes, em que as colunas representam cada produto e as linhas cada transação, verifica-se que, frequentemente, três das colunas apresentam simultaneamente o valor 1 para vários registros. Este tipo de análise é um problema de detecção de valores discrepantes.
II. A identificação de consumidores que são similares entre si, para uso no contexto de aplicação de promoções orientadas, constitui um problema de segmentação de dados.
III. O problema de classificação de dados pode ser considerado como supervisionado, pelo fato das relações entre as classes definidas e os demais atributos dos dados serem “aprendidas” pelo modelo.
Está correto o que se afirma em
I, apenas.
I e II, apenas.
I e III, apenas.
II e III, apenas.
I, II e III.
Sobre o algoritmo Naive Bayes, é correto afirmar que:
É um dos algoritmos probabilísticos mais flexíveis, porque permite dependências entre os atributos.
A superfície de decisão de um classificador Naive Bayes em um problema de duas classes definido por atributos booleanos é uma curva, ou seja, nesse caso, a superfície de decisão traçada é não linear.
O teorema de Bayes é usado para calcular a probabilidade a posteriori de um evento, dada sua probabilidade a priori e a verossimilhança entre o novo dado.
O termo “naive” (ingênuo) vem da hipótese de que os valores dos atributos de um exemplo são dependentes de sua classe.
Todas as probabilidades necessárias para a obtenção do classificador Naive Bayes são computadas a posterori partir dos dados de teste.
Analise as seguintes assertivas sobre o algoritmo K-NN:
I. É um algoritmo baseado em memória, ou um algoritmo preguiçoso, porque toda computação é adiada até a fase de classificação, já que o processo de aprendizado consiste apenas em memorizar objetos.
II. O valor de k mais apropriado para um problema de decisão é definido pelo usuário. Existem duas estratégias principais: estimar o k por validação cruzada e associar um peso à contribuição de cada vizinho.
III. Em problemas de classificação, em que a classe toma valores em um conjunto discreto, cada vizinho vota em uma classe. O objeto de teste é classificado na classe mais votada.
Quais estão corretas?
Apenas I.
Apenas III.
Apenas I e II.
Apenas II e III.
I, II e III.
A análise discriminante procura maximizar a separação entre classes que definem a qualidade do ar (boa, moderada ou ruim) e utiliza combinações lineares dos níveis de poluentes e fatores meteorológicos.
Certo
Errado
Em redes neurais artificiais, as funções de ativação permitem que a rede aprenda e represente padrões complexos nos dados. Para tarefas de classificação binária, onde o objetivo é distinguir entre duas classes. Qual das seguintes funções de ativação é mais adequada para problemas de classificação binária?
Linear.
Sigmoide.
Função Softmax.
ReLU (Rectified Linear Unit).
Um cientista de dados utiliza validação cruzada k-fold para avaliar o desempenho de um classificador. Sobre a razão de usar essa técnica, é correto afirmar que a validação cruzada
elimina totalmente o risco de overfitting.
substitui a necessidade de separar conjuntos de treino e teste.
garante que todos os modelos treinados terão a mesma acurácia.
reduz a dependência de uma única divisão treino/teste, permitindo uma estimativa mais robusta de generalização.
é usada apenas para algoritmos de regressão, não de classificação.
Na classificação de imagens, o objetivo principal é atribuir um rótulo (classe) a cada pixel da imagem, delimitando e identificando diferentes objetos ou regiões, ao passo que, na segmentação de imagens, o objetivo é atribuir um único rótulo à imagem como um todo, indicando seu conteúdo principal.
Certo
Errado
Uma equipe de ciência de dados de uma prefeitura está utilizando um modelo de classificação binária para prever a aprovação de projetos de mobilidade urbana. O desempenho do modelo é avaliado com base em algumas métricas. Considere o seguinte código em Python, que foi executado para calcular as métricas a partir dos rótulos verdadeiros e previstos.

Com os dados fornecidos, o código gerou os seguintes resultados: Precisão: 0,80, Recall: 0,80, Fi-Score: 0,80. Com base nessas métricas, o modelo
apresenta alta precisão, mas o recall é insuficiente, indicando que ele detecta a maioria dos casos positivos, mas também faz muitas classificações incorretas.
apresenta um bom equilíbrio entre precisão e recall, indicando que ele identifica bem os casos positivos e evita erros ao classificar dados negativos.
apresenta baixa precisão e recall, indicando que ele frequentemente erra tanto ao prever positivos quanto ao evitar falsos negativos.
ótimo para cenários em que precisão não é tão importante quanto recall, como em problemas de emergência pública, pois F1-score é alto.
tem precisão aceitável, mas o baixo F1-score sugere um desempenho desequilibrado, com recall bem superior à precisão.
Para avaliar o desempenho de um classificador em problemas de classificação com classes significativamente desbalanceadas, a métrica acurácia é a mais adequada, pois considera a proporção de previsões corretas em relação ao total de amostras.
Certo
Errado
A classificação de informações fornece às pessoas que lidam com a informação organizacional
uma indicação concisa de como manusear e proteger a informação organizacional.
um arcabouço jurídico completo para lidar com incidentes de segurança da informação.
uma relação de pessoas da organização capazes de prover as informações necessárias aos processos.
uma estrutura organizacional apropriada para lidar com a tecnologia e a segurança da informação.
um método de classes sobre como decriptar informações sensíveis da organização previamente criptografadas.
A classificação da informação deve considerar critérios como nível de sigilo, impacto em caso de vazamento e público autorizado ao acesso.
Certo
Errado
Um desenvolvedor de sistemas de informação está utilizando um algoritmo de Data mining que é um algoritmo não paramétrico de classificação por pontos de dados, com base em sua proximidade e associação com outros dados disponíveis, pressupondo que os pontos de dados semelhantes são encontrados próximos uns dos outros. Esse algoritmo é o:
ARGP
Decision Tree
KNN
Neural Net
O aprendizado por reforço é utilizado principalmente em tarefas de classificação supervisionada, nas quais o agente aprende com base em dados rotulados fornecidos previamente.
Certo
Errado