Questões de Concurso sobre Mineração de Texto

 
 
Disciplina
Assunto 1
Banca
Instituição
Cargo
Ano
Carreira
Área de formação
Escolaridade
Dificuldade
 
Comentários:
Professores
Alunos
Meus Comentários
Vídeo
 
Minhas questões:
Resolvidas
Não resolvidas
Certas
Erradas
 
Tipo de questão:
Certo e errado
Múltipla escolha
Incluir questões:
Anuladas
Desatualizadas
 
Questões:
Todas as questões
 
Filtro simplificado
 
Questões
Todas as questões
 
16 questões encontradas
Questões por página
20
Mais recentes
 

Suponha que uma secretaria de fazenda pretenda empregar técnicas de processamento de linguagem natural (PLN) para automatizar a análise de justificativas textuais apresentadas por contribuintes em processos administrativos fiscais, buscando identificar padrões de argumentação e indícios de inconsistências. Nesse caso, a abordagem mais adequada para capturar relações semânticas contextuais em textos extensos e gerar representações vetoriais de alta qualidade para classificação automatizada é


A

aplicar técnicas de topic modeling não supervisionado (como LDA – latent Dirichlet allocation), uma vez que esse método é voltado exclusivamente para compreensão contextual e desambiguação semântica em textos individuais.


B

aplicar modelos baseados em bag-of-words com vetores esparsos e frequência de termos ponderada por TF-IDF, suficientes para captar relações sintáticas e semânticas profundas entre palavras.


C

implementar modelos Word2Vec baseados apenas em coocorrência estática de palavras, que mantêm a mesma representação vetorial independentemente do contexto semântico.


D

empregar algoritmos de análise sintática tradicional, como part-of-speech tagging e stemming, sem incorporar aprendizado profundo, por esses algoritmos serem suficientes para detectar relações semânticas complexas.


E

utilizar embeddings pré-treinados com modelos de linguagem contextualizados, como BERT ou suas variantes, capazes de representar o significado de uma palavra de acordo com o contexto em que ocorre.

Assinale a opção correta acerca do modelo LDA (latent dirichlet allocation), amplamente utilizado para extração de tópicos em tarefas de mineração de textos.


A

O LDA assume que cada documento é gerado por uma combinação de tópicos, e que cada tópico corresponde a uma distribuição de probabilidade sobre palavras.


B

O LDA é um modelo supervisionado que aprende tópicos por meio de documentos previamente rotulados.


C

No LDA, cada documento pertence a um único tópico, que deve ser explicitamente indicado pelo modelo.


D

O LDA utiliza variáveis latentes que podem ser estimadas diretamente a partir das frequências observadas, sem necessidade de inferência probabilística.


E

O LDA gera automaticamente o número ideal de tópicos com base em máxima verossimilhança, sem necessidade de definição prévia.

Na mineração de texto, a técnica TF-IDF (term frequency-inverse document frequency) atribui maior peso às palavras que aparecem com mais frequência em todos os documentos da coleção, pois, quanto mais uma palavra se repete no corpus inteiro, mais relevante ela é para distinguir o conteúdo de um documento específico.


C

Certo


E

Errado

Modelos supervisionados de reconhecimento de entidades nomeadas dependem de textos previamente anotados com categorias como pessoa, organização e local para que o algoritmo aprenda a identificar esses tipos de informação em novos textos.


C

Certo


E

Errado

Um colaborador da CODERN está utilizando uma ferramenta de chat baseada em Inteligência Artificial Generativa (IAG) para auxiliar na extração de dados de relatórios portuários. No entanto, ele notou que a IAG está gerando respostas muito “criativas” e, por vezes, inventando informações que não estão no texto original. Para corrigir esse problema e tornar as respostas mais precisas, exatas e com enfoque somente nos dados reais, o colaborador precisa ajustar o parâmetro da IAG responsável por controlar o nível de aleatoriedade do texto gerado. Assinale a alternativa que apresenta corretamente o nome desse parâmetro e sua respectiva função.


A

Tabela de Dados, que resume automaticamente os textos e dados técnicos inseridos no chat.


B

Limite de Tokens, que restringe a inteligência artificial de usar termos estrangeiros no texto.


C

Temperatura, que controla o grau de criatividade e a aleatoriedade das respostas geradas.


D

Restrição da Resposta, que impede a geração de dados falsos e bloqueia invasões durante o uso do chat.


E

Formatação da Saída, que automatiza a formatação e a padronização das respostas do relatório gerado.

Se o objetivo de um modelo de machine learning for identificar os clientes que possuem maior chance de cancelar o contrato no próximo mês, a partir de variáveis como tempo de permanência, valor gasto mensal e histórico de reclamações, então, nesse caso, a tarefa de mineração de dados adequada para atender ao objetivo previsto será


A

a detecção de anomalias.


B

a regressão.


C

a classificação.


D

a clusterização.


E

as regras de associação.

Para verificar ocorrências importantes em documentos processuais de municípios, tais como possíveis informações com petições e arrazoados incoerentes nos processos, a equipe de Analistas de uma Prefeitura aplicou a técnica de text mining utilizando, adequadamente, os métodos de


A

Tokenização e Análise de Imagens.


B

Word-recognize e Análise de Sentimentos.


C

Word-Recognize e Verifying Skills.


D

Redes Nominais e Tokenização.


E

Topic Modeling e Análise de Sentimentos.

Para analisar um grande volume de respostas textuais de uma pesquisa de satisfação e identificar os temas mais recorrentes, qual instrução para uma IA seria mais adequada para categorizar e quantificar os resultados de forma eficiente?


A

Analise as seguintes [número] respostas. Identifique e agrupe as respostas em 5 a 7 categorias temáticas principais. Para cada categoria, forneça um nome, uma breve descrição e a contagem de respostas que se enquadram nela.


B

Leia estas respostas e me diga o que as pessoas acharam.


C

Faça um resumo das respostas da pesquisa.


D

Quais são os problemas mencionados nas respostas?


E

Liste todas as palavras-chave das respostas e suas frequências.

Na mineração de dados em um data warehouse é necessário que a informação textual seja codificada e extraída de forma que ferramentas preditivas possam utilizá-la. Nesse contexto, para que o texto seja codificado utiliza-se:


A

XML;


B

datamart;


C

KPI;


D

dashboard;


E

query de negócio.

Para permitir que computadores processem a linguagem humana na forma de dados de texto, ou de voz, entendendo seu significado integral, o processamento de linguagem natural combina linguística computacional, modelagem com base em regras da linguagem humana, com modelos estatísticos, de machine learning e de deep learning.


C

Certo


E

Errado

Como parte do processo de desenvolvimento de uma aplicação para analisar grandes volumes de textos, diversas tarefas de Processamento de Linguagem Natural (NLP, sigla em inglês) estão sendo implementadas para melhorar a eficácia e a precisão dessa aplicação.


Diante disso, para a aplicação dessas tarefas, é necessário


A

aplicar as técnicas de similaridade textual para realizar a rotulação de partes do discurso (POS-tagging), atribuindo uma etiqueta gramatical a cada palavra com base em sua posição no texto.


B

empregar a extração de informação para identificar e classificar as relações entre as entidades em um corpus de documentos, e em seguida aplicar a sumarização de texto para criar resumos automáticos do conteúdo.


C

executar a tradução automática para transformar um texto em outro idioma, utilizando NER para determinar a similaridade entre os textos traduzidos e os originais.


D

implementar a classificação de texto para categorizar automaticamente os documentos, utilizando POS-tagging para melhorar a precisão da rotulação gramatical e a consistência das classes atribuídas.


E

utilizar a análise de sentimento para identificar e extrair entidades nomeadas (NER) dos textos, facilitando a categorização automática das informações extraídas.

Eriberto, analista de dados do TRF-1, desenvolve um aplicativo que gera resumos das sentenças do Tribunal em linguagem coloquial, mantendo a coerência e a coesão textuais.


O aplicativo de Eriberto realiza a tarefa de:


A

análise de sentimentos;


B

classificação de textos;


C

modelagem de tópicos;


D

sumarização abstrativa;


E

sumarização extrativa.

Considerada uma evolução da área de recuperação de informações, mineração de textos é um processo de descoberta de conhecimento, que utiliza técnicas de análise e extração de dados a partir de textos, frases ou apenas palavras. A primeira etapa do processo de descoberta de conhecimento em textos, a qual envolve a seleção dos dados que constituem a base de textos de interesse e o trabalho inicial para tentar selecionar o núcleo que melhor expressa o conteúdo destes textos é:


A

Análise semântica.


B

Seleção dos termos.


C

Preparação dos dados.


D

Indexação e normalização.


E

Cálculo da relevância dos termos.

Na mineração de texto, o processo utilizado para remover os prefixos e sufixos de palavras, de modo a permanecer somente a raiz delas, com a finalidade de melhorar o armazenamento, é conhecido como


A

stemming.


B

análise léxica.


C

remoção de stop-words.


D

criação de tesauros.


E

determinação de pesos.

 
 
Gerar simulado