Questões de Concurso sobre Conceitos estatísticos

 
 
Disciplina
Assunto 1
Banca
Instituição
Cargo
Ano
Carreira
Área de formação
Escolaridade
Dificuldade
 
Comentários:
Professores
Alunos
Meus Comentários
Vídeo
 
Minhas questões:
Resolvidas
Não resolvidas
Certas
Erradas
 
Tipo de questão:
Certo e errado
Múltipla escolha
Incluir questões:
Anuladas
Desatualizadas
 
Questões:
Todas as questões
 
Filtro simplificado
 
Questões
Todas as questões
 
52 questões encontradas
Questões por página
20
Mais recentes
 

A utilização de storytelling em dashboards do Qlik dispensa validações estatísticas e técnicas, pois o foco narrativo substitui a necessidade de rigor analítico.


C

Certo


E

Errado

O profiling de dados é uma etapa analítica realizada sobre conjuntos de dados com o objetivo de compreender sua estrutura, qualidade e distribuição antes de iniciar processos de transformação ou carga em camadas analíticas. A realização adequada do profiling permite identificar problemas de qualidade e orientar as regras de tratamento a serem aplicadas no pipeline. Diante disso, analise as afirmativas a seguir sobre profiling básico de dados:


I. A análise de cardinalidade em uma coluna consiste em identificar o número de valores distintos presentes, sendo útil para reconhecer possíveis chaves candidatas e detectar colunas com baixa variabilidade que podem indicar problemas de qualidade.

II. O profiling de nulidade verifica a proporção de valores ausentes em cada coluna, fornecendo informações relevantes para decisões sobre estratégias de tratamento, como imputação, exclusão de registros ou criação de indicadores de ausência.

III. A análise de distribuição de frequência permite identificar quais valores ocorrem com maior regularidade em uma coluna e é aplicável exclusivamente a colunas com tipos de dados numéricos, não sendo útil para colunas do tipo texto ou categórico.

IV. O profiling básico, por ser uma análise estática realizada antes da ingestão, elimina a necessidade de validações de qualidade posteriores durante as fases de transformação e carga, desde que o dataset analisado não sofra alterações estruturais.


Estão CORRETAS:


A

I e lII, apenas.


B

I e ll, apenas.


C

II e lV, apenas


D

I, II e III, apenas.


E

III e IV, apenas.

Uma Secretaria Estadual que modela o número mensal de autos de infração por contribuinte, observou variância condicional sistematicamente maior que a média após controle por covariáveis, optando por substituir Poisson por binomial negativa. A diferença estrutural que justifica essa escolha no cenário descrito consiste no fato de que a regressão binomial negativa


A

remove a necessidade de independência entre contribuintes ao estimar a função de verossimilhança.


B

introduz um parâmetro adicional de dispersão que permite variância condicional maior que a média.


C

Impõe um limite superior previamente definido para a contagem, compatível com o teto operacional de autuações.


D

substitui a função de ligação logarítmica por ligação identidade para estabilizar a variância.


E

passa a assumir distribuição normal condicional para a contagem quando há muitos contribuintes.

Em uma avaliação de larga escala pretende-se utilizar a Teoria de Resposta ao Item (TRI). Quanto à dimensionalidade dos itens (questões) a serem aplicados é necessário que estes sejam


A

unidimensionais, isto é, tenham um único conteúdo (proficiência).


B

bidimensionais, isto é, tenham dois parâmetros (dificuldade e proficiência).


C

tridimensionais, isto é, tenham três parâmetros (dificuldade, proficiência e chute).


D

tetradimensionais, isto é, tenham quatro parâmetros (habilidade, dificuldade, proficiência, chute).

Um analista de uma Secretaria da Fazenda precisa apresentar um relatório sobre a arrecadação média de ICMS de um setor comercial. Para que o relatório tenha validade técnica, ele decide utilizar uma amostra aleatória e construir um intervalo de confiança para a média populacional. Visando a otimizar a precisão da fiscalização, garantindo a correta aplicação dos fundamentos de inferência, e a reduzir a margem de erro, mantendo um nível de confiança elevado, o analista deve


A

interpretar o intervalo de confiança como uma garantia de que qualquer nota fiscal selecionada individualmente no futuro apresentará um valor de ICMS situado entre os limites inferior e superior estabelecidos pela amostra atual.


B

restringir a utilização da média aritmética da amostra como valor absoluto de arrecadação, variando a moda na construção do intervalo de confiança sempre que a população de contribuintes for considerada finita e conhecida pela base de dados da Secretaria.


C

reduzir o nível de confiança de 99% para 90% caso o objetivo seja obter uma faixa de valores mais estreita e precisa, aceitando um risco maior de que a verdadeira média populacional não esteja contida no intervalo calculado.


D

aumentar o tamanho da amostra quando desejar reduzir a margem de erro da estimativa sem precisar abrir mão de um nivel de confiança elevado, garantindo assim uma estimativa mais robusta para o orçamento estadual.


E

considerar a média ponderada durante o cálculo do erro padrão, uma vez que, em auditorias de grandes volumes de dados (Big Data), a variabilidade dos valores declarados deixa de influenciar a largura do intervalo de confiança.

Analise as afirmativas abaixo com relação a dados, informação e conhecimento.


1. Os dados consistem em fatos brutos, como o número de funcionários, horas totais trabalhadas em uma semana ou números de peças no estoque.

2. Informação é uma coleção de fatos organizados e processados de modo que tenham valor adicional, que se estende além do valor dos fatos individuais.

3. Transformar os dados em informação é um processo, ou um conjunto de tarefas logicamente relacionadas realizadas para alcançar um resultado definido. O processo de definir relações entre os dados para criar informações úteis requer conhecimentos.


Assinale a alternativa que indica todas as afirmativas corretas.


A

É correta apenas a afirmativa 1.


B

É correta apenas a afirmativa 3.


C

São corretas apenas as afirmativas 1 e 2.


D

São corretas apenas as afirmativas 1 e 3.


E

São corretas as afirmativas 1, 2 e 3.

Em um box-plot, se um valor for menor que o primeiro quartil menos 1,5 vezes o intervalo interquartil, esse valor deve ser tratado como um outlier e removido da base de dados antes de qualquer análise adicional.


C

Certo


E

Errado

Certa companhia de abastecimento de água organiza as informações da empresa em três conjuntos de dados: clientes (idCliente, nomeCliente), com dados dos clientes; imoveis (idImovel, idCliente, endereco), com dados de imóveis; e contas (idConta, idImovel, consumo), com dados do histórico de pagamento de contas e do consumo, em metros cúbicos, de cada conta. Essa organização leva em consideração que cada cliente pode ter vários imóveis (chave estrangeira: idCliente em imoveis) e que cada imóvel pode ter várias contas (chave estrangeira: idImovel em contas). Os conjuntos de dados (clientes, imoveis e contas) foram carregados para um DataFrame no Pandas.


Com base nas informações da situação hipotética precedente, assinale a opção que corresponde ao trecho de código que, caso seja executado, exibirá corretamente o total de consumo por cliente na variável totalConsumo.


A

totalConsumo =

contas.groupby('idCliente')['consumo'] .sum()


B

imoveisContas

= pd.merge(imoveis, contas, on='idImovel')

totalConsumo = imoveisContas.groupby('idCliente')

['consumo'].sum()


C

totalConsumo = clientes.merge(contas, on =

'idCliente')

.groupby('idCliente')['consumo'].sum()


D

totalConsumo = contas.groupby('idImovel')

['consumo'].sum()


E

imoveisContas = pd.merge(contas, imoveis, on='idCliente')

totalConsumo = imoveisContas.groupby('idImovel')

['consumo'] .sum()

No contexto de análises estatísticas, os dados podem estar disponíveis em diferentes tipos de organização. Dependendo da forma de definição e armazenamento, os conjuntos de dados são tipicamente caracterizados como estruturados, semiestruturados e não estruturados. Diante do exposto, analise as afirmativas a seguir.


I. Enquanto dados não estruturados são normalmente armazenados em seu formato nativo (como vídeos, imagens ou documentos de texto), dados estruturados são armazenados em linhas e colunas e podem ser mapeados para campos predefinidos.

II. Ao contrário dos dados estruturados, que podem ser organizados e acessados por meio de bancos de dados relacionais, dados não estruturados não têm um modelo rígido de organização predefinido.

III. Conjuntos de dados semiestruturados usam tags e marcadores (ou seja, metadados) em vez de exigir um esquema predefinido em tabelas, linhas e colunas, como nos dados estruturados.

IV. Os data lakes podem ser projetados para armazenar dados semiestruturados juntamente com dados estruturados, permitindo a coexistência de dados de ambos os tipos.


Está correto o que se afirma em


A

I, II, III e IV.


B

I e III, apenas.


C

II e IV, apenas.


D

I, II e III, apenas.


E

I, III e IV, apenas.

Um perito criminal necessita investigar qual alimento em uma festa estava contaminado com alguma substância tóxica. Ele suspeita que pode ter havido contaminação no bolo ou no bolinho de bacalhau, para isso conduziu uma pesquisa na qual obteve os resultados abaixo:


bolo

adoeceu 0 1

0 21 15

1 23 32

bolinho_bacalhau

adoeceu 0 1

0 25 11

1 24 31


Para analisar os dados, ele fez um teste de quiquadrado em que obteve os seguintes resultados para Bolo:


Imagem associada para resolução da questão


E para o Bolinho de Bacalhau:


Imagem associada para resolução da questão



Diante do exposto, analise as afirmativas abaixo.


I. Pessoas que consumiram bolo e adoeceram estão em maior quantidade na comparação com pessoas que consumiram bolinho de bacalhau e adoeceram, por isso a conclusão é que o bolo estava contaminado.

II. O resultado do p-valor do bolinho de bacalhau no teste de qui-quadrado rejeita a hipótese de nulidade de que não há associação entre consumo de bolinho de bacalhau e adoecer.

III. O resultado do p-valor do bolo no teste de quiquadrado rejeita a hipótese de nulidade de que não há associação entre consumo de bolo e adoecer.

IV. O odds ratio do bolo inclui o valor 1 no intervalo de confiança IC=95%, mostra que não há evidência estatística de associação entre adoecer e comer bolo.


Estão corretas as afirmativas:


A

IV apenas


B

I, II e III apenas


C

I apenas


D

II e IV apenas

Uma empresa está analisando a eficácia de seu programa de treinamento para novos funcionários. Historicamente, 1/3 dos novos funcionários completam o treinamento com sucesso. A empresa decide monitorar um grupo de 6 novos funcionários e assume-se uma distribuição binomial para os dados.

Qual a probabilidade de exatamente 3 funcionários completarem o treinamento com sucesso?


A

1/27


B

6/27


C

8/729


D

20/27


E

160/729

Avaliou-se o tempo de atendimento de dois Call Centers por meio das populações de atendentes do Call Center A e do Call Center B, com o Boxplot dado pelo gráfico abaixo:


Imagem associada para resolução da questão


De acordo com o Boxplot, qual a alternativa CORRETA?


A

A distribuição do Call Center A contém um outlier.


B

A mediana da distribuição do Call Center B está em torno de 8 minutos.


C

A mediana da distribuição do Call Center A é maior que a mediana da distribuição do Call Center B.


D

A distribuição do Call Center A tem tempos de atendimentos mais consistentes em relação à distribuição do Call Center B.


E

A distribuição do Call Center B apresenta o terceiro quartil em torno de 10 minutos.

Matheus é um professor que precisa identificar padrões de utilização de LLMs (Large Language Models) em um grupo de estudantes. Ele utilizou como dados as notas finais da avaliação da disciplina de Estatística Básica (com distribuição das notas variando 0 a 100) e correlacionou esses dados à quantidade de horas dedicadas ao uso de LLMs pelos estudantes durante o semestre. O professor construiu um modelo para prever a pontuação de um aluno (Y), em função do número de horas dedicadas ao LLMs durante o último semestre (X), obtendo o modelo a seguir.


= 𝟏𝟎𝟎 − 𝟎, 𝟐𝟓𝒙


Matheus certificou-se que o modelo atende a todas as premissas do modelo de regressão linear. As pontuações esperadas para dois alunos que dedicaram 300 horas e 50 horas ao uso de LLMs no último semestre são, respectivamente,


A

0 e 100.


B

10 e 95,5.


C

25 e 87,5.


D

50 e 12,5.


E

75 e 90.

O uso de técnicas de análise de regressão são amplamente utilizadas na estatística para prever resultados com base em um conjunto de variáveis de entrada.


Com relação às características da Regressão linear e da Regressão logística, analise os itens a seguir:


I. As duas técnicas buscam modelar a relação entre variáveis dependentes e independentes, no entanto, apresentam como principal diferença o tipo de variável que elas são capazes de prever.

II. A regressão linear minimiza as discrepâncias entre os valores de saída previstos e reais ao ajustar uma probabilidade, onde a variável dependente é limitada entre 0 e 1.

III. Ambos os tipos de regressões requerem um tamanho de amostra adequado e grande, de mesma dimensão, para representar valores em todas as categorias de resposta produzindo modelo com poder estatístico suficiente para detectar efeito significativo.


Está correto o que se afirma em


A

I, apenas.


B

I e II, apenas


C

II e III, apenas


D

I e III, apenas


E

III, apenas

Sobre probabilidade e teste de hipótese, é correto afirmar que:


A

Dois eventos E e F são independentes se, quando E ocorre, dá informações sobre quando F ocorre (e vice-versa).


B

Uma variável associada é a variável cujos valores possíveis possuem uma distribuição de probabilidades associadas. A distribuição associada dá as probabilidades que a variável possui em cada um de seus valores possíveis.


C

A hipótese nula H0 representa a hipótese de pesquisa formulada, isto é, corresponde ao que se quer provar. A hipótese alternativa H1 representa o contrário do que queremos provar, isto é, é aceita como verdadeira até que se prove estatisticamente o contrário.


D

A distribuição normal é representada por uma curva em forma de sino e é determinada por dois parâmetros: média e desvio padrão. A média indica onde o sino é centralizado e o desvio padrão indica a largura do sino.


E

Dois eventos E e F são dependentes se a probabilidade de eles acontecerem é o produto da probabilidade de que cada um deles aconteça.

Leia o trecho a seguir.


A adoção preditiva nos processos de trabalho das Entidades Fiscalizados Superiores (EFS), e em particular nas ações de controle, abre um novo mundo de possibilidades e pode potencializar a efetividade e o alcance da ação institucional. Mas, para obter sucesso nesse tipo de iniciativa, é preciso lidar com diversos desafios inerentes à prática da Ciência de Dados.


BALANIUK, Remis. In OLIVEIRA, Aroldo Cedraz de. O Controle Da Administração Pública Na Era Digital. 2ª Edição. Belo Horizonte: Fórum, 2017. P. 314


A análise de dados, também chamada de cruzamento eletrônico de dados, é uma técnica aplicada em auditorias com múltiplas finalidades e em diferentes fases do trabalho.


A esse respeito, avalie os procedimentos descritos a seguir.


I. Consiste na análise preliminar dos registros armazenados em uma base de dados, podendo apoiar o processo de planejamento da auditoria ou a instrução preliminar de um processo.

II. Refere-se à verificação da conformidade dos registros com as regras do negócio.


Assinale a opção que indica corretamente a que procedimentos se referem as afirmativas I e II, respectivamente.


A

Análise exploratória; Teste e Avaliação de controles.


B

Análise de trilhas de auditoria; Detecção de fraudes.


C

Avaliação de controles; Análise exploratória.


D

Análise exploratória; Detecção de fraudes.


E

Análise de logs de acesso; Avaliação de controles.

 
 
Gerar simulado