

Seu próximo nível começa aqui
Com a Assinatura Ilimitada, você tem tudo que precisa para sua aprovação.
Com a Assinatura Ilimitada, você combina prática, teoria e método em uma única assinatura com tudo que você precisa para sua aprovação.
No contexto de Qualidade de Dados, o auditor de contas públicas João deverá analisar a consistência dos dados da base de dados AUD_CONTAS identificando variações sobre os valores dos atributos, como:
∙ 30% das entradas de dados na coluna CD_FUNCIONARIO estão marcadas com o caractere “espaço”
∙ existem 200 linhas na tabela TBL_PROCESSO contendo dados sobre processos sem nenhuma linha contendo os seus detalhes
Para isso, a técnica de diagnóstico sobre a qualidade de dados que João deverá utilizar é:
profiling;
matching;
deduplicação;
data cleansing;
enriquecimento.
Os Sistemas de Suporte à Decisão (SSDs) contribuem para gestores na tomada de decisões, utilizando dados, análises e algoritmos sofisticados. Eles auxiliam a enfrentar diferentes tipos de problemas, desde os muito bem definidos até os que exigem uma certa intuição e julgamento humano.
Assinale a opção que representa corretamente a capacidade dos SSDs de lidar com diferentes tipos de problemas e decisões:
Os SSDs são adequados apenas para problemas estruturados, com procedimentos claramente definidos e automatizáveis.
Os SSDs são ideais para problemas não estruturados, em que a intuição e o julgamento humano são fundamentais.
Os SSDs são mais eficazes em problemas semiestruturados, combinando elementos estruturados e não estruturados.
Os SSDs podem ser aplicados a problemas estruturados, semiestruturados e não estruturados, oferecendo flexibilidade para apoiar decisões em diversos contextos.
Os SSDs são limitados a problemas específicos de uma única área funcional e não se aplicam a outros setores empresariais.
Na modelagem dimensional, as métricas estão contidas na tabela de fatos, enquanto o caráter quantitativo das informações descritivas está armazenado na tabela dimensões.
Certo
Errado
No armazenamento de dados em Big Data, valor é o critério que observa a integração de informações coletadas em diferentes fontes, com vistas a enriquecer as análises.
Certo
Errado
O Big Data é um conceito recente, sendo normalmente definido por um conjunto de termos, definidos como 5 “V”s. Relacione os termos a seguir com suas respectivas representações.
1. Volume.
2. Variedade.
3. Veracidade.
4. Velocidade.
( ) É um termo cunhado pela IBM que está sendo usado como o quarto “V” para descrever Big Data. Refere-se à conformidade com os fatos: precisão, qualidade ou
confiabilidade dos dados. Ferramentas e técnicas são frequentemente usadas para lidar com Big Data, transformando os dados em insights de qualidade e confiáveis.
( ) Significa a celeridade com que os dados estão sendo produzidos e com que presteza os dados devem ser processados (ou seja, capturados, armazenados e analisados) para atender a necessidade ou demanda. Talvez seja a característica mais negligenciada do Big Data.
( ) É a característica mais comum do Big Data. Muitos fatores contribuíram ao aumento exponencial na quantidade de dados, como dados baseados em transações armazenados ao longo dos anos, os dados das mídias sociais, aumentando a quantidade de dados de sensores, dados RFID e GPS gerados automaticamente e assim por diante.
( ) Atualmente os dados hoje possuem diversos e tipos e formatos, desde bancos de dados relacionais aos XML e dados capturados por sensores, vídeo, áudio. Segundo estimativas, 80 a 85 por cento de todos os dados das organizações estão em algum tipo de formato não estruturado ou semiestruturado.
A relação correta, na ordem dada, é
4 – 2 – 3 – 1.
3 – 1 – 4 – 2.
4 – 3 – 2 – 1.
3 – 4 – 1 – 2.
2 – 3 – 1 – 4.
Você foi contratado como analista de dados em uma empresa que está implementando um sistema de Business Intelligence (BI). Durante uma reunião com a equipe de TI, discute-se sobre a importância dos metadados no projeto.
Nesse contexto, em um sistema de BI, o principal objetivo dos metadados é
armazenar os dados brutos coletados de diversas fontes, como bancos de dados e planilhas.
descrever e fornecer informações sobre os dados, facilitando sua compreensão, localização e uso pelos usuários do sistema de BI.
executar consultas complexas e gerar relatórios personalizados para os usuários do sistema de BI.
substituir a necessidade de um data warehouse, centralizando o armazenamento e gerenciamento de todos os dados da empresa.
garantir a segurança dos dados, controlando o acesso e protegendo contra acessos não autorizados.
“...é um termo que descreve o grande volume de dados, estruturados e não estruturados, que inundam os negócios diariamente. Mas não é a quantidade de dados que é importante. O que importa é o que as organizações fazem com os dados.”
(https://www.questionpro.com/blog/pt-br)
O texto acima está relacionado ao conceito de
Big Data.
Femea.
Hazop.
Roadmap.
Streaming.
Considere um conjunto de dados estruturados composto por colunas, que refletem as características desses dados, e por linhas, que combinam essas características.
No tratamento desses dados, o processo de enriquecimento consiste em
adicionar dados externos ao conjunto de dados.
expandir ou adernar os dados de um conjunto, sem interferência externa.
verificar a integridade dos relacionamentos entre as colunas.
normalizar os dados, mitigando a diferença de escala entre as colunas.
imputar dados em linhas de dados que apresentem valores ausentes.
Random Forest são algoritmos de aprendizado de máquina utilizados para classificação ou regressão, sendo vantajoso em relação às árvores de decisão no caso de
custo computacional reduzido.
conjunto de dados com propensão a overfitting.
conjunto de dados reduzido.
número elevado de classes.
O Hadoop MapReduce permite que os arquivos de entrada e saída sejam armazenados em um sistema de arquivos distribuído, de modo que várias máquinas leiam e gravem dados em paralelo.
Certo
Errado
Uma das desvantagens do sistema de arquivos distribuído Hadoop File System é a impossibilidade de conectá-lo ao sistema de arquivos local de uma máquina.
Certo
Errado
Uma das principais características de sistemas gerenciadores de bancos de dados (SGBD) NoSQL, quando comparados aos sistemas gerenciadores bancos de dados relacionais (SGBDR), é que seu esquema é considerado flexível ou não existente (schemaless).
O esquema de um SGBD NoSQL ser flexível ou não existente tem como consequência o fato de que
a qualidade de dados pode ser mais difícil de ser garantida, quando comparado a um SGBDR.
a realização de adaptações para persistir conteúdos distintos é mais demorada do que em um SGBDR.
o desempenho de uma consulta aos dados é maior do que em um SGBDR.
os formatos de data são padronizados, da mesma forma que em SGBDR.
dados binários de qualquer natureza podem ser persistidos, o que um SGBDR não consegue fazer.
A biblioteca Scikit-Learn emprega o algoritmo Classification And Regression Tree (CART) para treinar Árvores de Decisão. O algoritmo CART baseia-se na recursividade e na estratégia de divisão binária para construir uma árvore de decisão. Inicialmente, a árvore é representada por um único nó, que contém todos os dados de treinamento. A cada passo, o algoritmo busca a melhor maneira de dividir o conjunto de dados. A recursividade continua até que uma condição de parada seja atendida, como atingir uma profundidade máxima da árvore. Uma vez construída a árvore, a fase de predição ocorre ao percorrer a estrutura da árvore de acordo com as condições estabelecidas nos nós, levando a uma predição (inferência) para uma determinada entrada.
Considerando-se que n corresponde ao número de features e m ao número de instâncias, qual é a complexidade computacional assintótica de predição para árvores de decisão treinadas com o algoritmo CART?
O(m)
O(m2)
O(n × m log(m))
O(n2 × m log(m))
O(log2(m))
O Business Intelligence envolve a coleta, a análise e a transformação de dados em informações significativas e úteis, a fim de que se apoie a tomada de decisão nas organizações.
Certo
Errado
A fase do CRISP-DM em que se dá a aplicação das técnicas de mineração de dados propriamente ditas é denominada
preparação dos dados.
entendimento dos dados.
implantação.
modelagem.
avaliação.
Para auditores de controle externo na especialidade de analista de sistemas, o conhecimento de Business Intelligence e Data Warehouses é essencial. Essas tecnologias suportam várias funcionalidades, desde a análise de dados até a segurança da informação, incluindo o planejamento, orientação, supervisão e desenvolvimento de sistemas de computação aplicáveis às atividades do Tribunal.
Nesse contexto, analise as seguintes afirmações sobre o emprego da Engenharia de Dados no contexto de Business Intelligence e Data Warehouses.
I. O uso de Business Intelligence permite a coleta e análise de grandes volumes de dados de diversas fontes, sendo essencial para auditores identificarem tendências, padrões e anomalias que possam indicar fraudes ou ineficiências.
II. As atividades dos sistemas de computação aplicados aos tribunais podem se beneficiar do uso de Data Warehouses. Além de realizar operações de consulta e exclusão, essas tecnologias permitem a modificação de dados, possibilitando a correção de possíveis inconsistências em informações previamente inseridas no sistema.
III. Em relação à orientação e coordenação das atividades, as ferramentas de Business Intelligence permitem a criação de dashboards e relatórios que facilitam a comunicação de resultados e insights, enquanto os Data Warehouses centralizam os dados, garantindo que todos os membros da equipe tenham acesso às mesmas informações atualizadas.
Está correto o que se afirma em
I, apenas.
I e II, apenas.
I e III, apenas.
II e III, apenas.
I, II e III.
Os sistemas OLAP (Online Analytical Processing, ou Processamento Analítico Online) oferecem uma alternativa aos sistemas transacionais, proporcionando uma visão dos dados orientada à análise, além de uma navegação rápida e flexível. Marque a alternativa correta que apresente uma característica OLAP.
as perguntas realizadas a um OLAP não permitem a utilização interativa com os usuários.
os bancos de dados OLAP apresentam um esquema otimizado para que as perguntas realizadas pelos usuários sejam respondidas rapidamente.
é o processo de identificar informações relevantes, tais como padrões, associações, mudanças, anomalias e estruturas, em grandes conglomerados de dados.
um conjunto de métodos e conceitos que podem ser implementados através de softwares com o intuito de utilizar os dados importantes da organização para auxiliar no processo de tomada de decisões.
É na fase de mineração do data mining que são definidos os metadados dos dados manipulados.
Certo
Errado
Um dos objetivos de uma POSIN é assegurar a disponibilidade e a integridade dos dados de uma organização.
Certo
Errado
Um pesquisador iniciante em aprendizado de máquina trabalhava com um modelo de classificação binário com as duas classes equilibradas. Inicialmente, ele fez a avaliação de seu modelo, separando 20% dos dados disponíveis para a avaliação, e o treinou com 80% dos dados, fazendo o processo apenas uma vez. Depois, a pedido de seu chefe, ele trocou a forma de avaliação, separando o conjunto de dados em 10 partes e escolhendo, em 10 rodadas, uma parte diferente para avaliação e as outras para treinamento.
Essas duas formas de avaliar um modelo são conhecidas, respectivamente, como
estratificação e hold-out
hold-out e k-fold
leave-one-out e estratificação
leave-one-out e k-fold
Monte Carlo e leave-p-out