Em mineração de texto, a tokenização divide o texto em unidades menores (palavras ou frases), stopwords são palavras de alta frequência e baixo valor semântico, que são removidas, e stemming reduz as palavras à sua raiz morfológica, podendo gerar formas que não sejam palavras válidas no idioma.