A escolha do método de amostragem constitui uma das etapas mais importantes no planejamento de uma pesquisa, pois influencia diretamente a qualidade, a precisão, a confiabilidade e a possibilidade de generalização dos resultados obtidos. Conforme amplamente discutido na literatura clássica de amostragem, especialmente nas obras de William G. Cochran, Sharon L. Lohr, Richard L. Scheaffer, Carl-Erik Särndal e colaboradores, a seleção adequada da amostra é essencial para garantir estimativas representativas da população e reduzir vieses decorrentes do processo de seleção.
Na prática, frequentemente torna-se inviável ou desnecessário coletar informações de todos os elementos da população, seja por limitações de tempo, custo, recursos humanos ou logística. Nesses casos, recorre-se à seleção de uma amostra que represente, da melhor forma possível, as características da população de interesse, permitindo que conclusões sejam obtidas com menor esforço operacional e elevado grau de confiabilidade.
Os métodos de amostragem podem ser classificados em dois grandes grupos: probabilísticos e não probabilísticos. Na amostragem probabilística, a seleção dos elementos é realizada por meio de mecanismos aleatórios, garantindo que todos os indivíduos da população possuam uma probabilidade conhecida e diferente de zero de serem escolhidos. Essa característica possibilita a estimação do erro amostral, a construção de intervalos de confiança e a realização de inferências estatísticas para a população, princípios amplamente estabelecidos na teoria da amostragem desenvolvida por Cochran, Lohr, Scheaffer e Särndal.
Por outro lado, na amostragem não probabilística, a escolha dos elementos não depende de um processo aleatório, mas de critérios definidos pelo pesquisador, como conveniência, acessibilidade, julgamento ou estabelecimento de cotas. Embora esses métodos sejam frequentemente mais rápidos, econômicos e adequados para estudos exploratórios ou qualitativos, apresentam limitações quanto à representatividade da amostra e à possibilidade de generalização dos resultados para a população, aspectos discutidos em obras de metodologia científica e pesquisa aplicada, como as de John W. Creswell, Earl Babbie e Uma Sekaran.
Nas seções seguintes, serão apresentados os principais tipos de amostragem empregados em pesquisas científicas, destacando seus fundamentos teóricos, características, vantagens, limitações e exemplos práticos de aplicação, bem como os critérios para escolha do método mais adequado em diferentes contextos de investigação.
3.2 Tipos de Amostragem
A amostragem é o processo de selecionar um subconjunto de indivíduos de uma população para estimar características do todo. A principal diferença entre os métodos reside na forma como os elementos são escolhidos.
3.2.1 Amostragem Probabilística
Na amostragem probabilística, todos os elementos da população têm uma probabilidade conhecida e diferente de zero de serem selecionados. Isso permite a generalização dos resultados com rigor estatístico.
Amostragem Aleatória Simples (AAS): Todos os itens têm a mesma chance de seleção. É como um sorteio de nomes em uma urna.
Exemplo: Sortear 10 números de matrícula em uma lista de 100 alunos.
Amostragem Estratificada: A população é dividida em grupos (estratos) com características semelhantes, e uma amostra é coletada de cada estrato.
Exemplo: Dividir uma empresa por departamentos e selecionar funcionários de cada área proporcionalmente.
Amostragem Sistemática: Os elementos são escolhidos seguindo um intervalo fixo (o enésimo termo).
Exemplo: Selecionar cada 10ª peça que sai de uma linha de produção.
Amostragem por Conglomerados (Clusters): A população é dividida em grupos heterogêneos (conglomerados), e alguns desses grupos são escolhidos para estudo integral.
Exemplo: Selecionar aleatoriamente 5 bairros de uma cidade e entrevistar todos os moradores desses bairros.
3.2.2 Amostragem Não Probabilística
Aqui, a seleção depende do julgamento do pesquisador ou de critérios de conveniência. Não é possível calcular o erro amostral, e os resultados não podem ser extrapolados para toda a população com precisão estatística.
Amostragem por Conveniência: Os dados são coletados de pessoas que estão “à mão”.
Exemplo: Entrevistar pessoas que passam na porta de um shopping em um determinado horário.
Amostragem por Cotas: Semelhante à estratificada, mas a escolha dos indivíduos dentro de cada grupo não é aleatória.
Exemplo: O pesquisador precisa entrevistar 50 homens e 50 mulheres, escolhendo os primeiros que encontrar.
Amostragem por Julgamento (ou Intencional): O pesquisador escolhe casos que considera “típicos” ou especialistas no assunto.
Exemplo: Entrevistar apenas diretores de RH para entender tendências de contratação.
3.3 Aplicações em R
library(dplyr) # carregando o pacote dplyrset.seed(123) # Para reprodutibilidade# Gerando os dados da populaçãopopulacao <-data.frame( id =1:1000, departamento =rep(c("TI", "RH", "Vendas", "Finanças"), each =250), experiencia =rnorm(1000, mean =5, sd =2) )# Amostragem probabilísticas# Amostragem aleatória simplesamostra_simples <- populacao %>% dplyr::slice_sample(n =100) # Seleciona 100 funcionários ao acaso# Amostragem estratificadaamostra_estratificada <- populacao %>% dplyr::group_by(departamento) %>% dplyr::slice_sample(prop =0.1) # Seleciona 10% de cada departamento# Amostragem sistemáticaN <-nrow(populacao)n <-100salto <- N / n inicio <-sample(1:salto, 1)indices <-seq(from = inicio, to = N, by = salto) amostra_sistematica <- populacao[indices, ]# Amostragem por conglomerados# --- Amostragem por Conglomerados (Cluster Sampling) ---# Definimos nossos conglomerados (neste caso, os Departamentos)conglomerados_disponiveis <-unique(populacao$departamento)# Sorteamos quais conglomerados farão parte da amostra# Vamos sortear 2 departamentos dos 4 existentesset.seed(456) conglomerados_sorteados <-sample(conglomerados_disponiveis, size =2)# Incluímos TODOS os indivíduos dos departamentos sorteadosamostra_conglomerados <- populacao %>% dplyr::filter(departamento %in% conglomerados_sorteados)# Verificação:cat("Departamentos sorteados:", conglomerados_sorteados, "\n")
Departamentos sorteados: TI Finanças
table(amostra_conglomerados$departamento)
Finanças TI
250 250
# Amostras não probabilísticas# Amostragem por conveniênciaamostra_conveniencia <- populacao %>%head(50)# Amostragem por cotasamostra_cotas <- dplyr::bind_rows( populacao %>% dplyr::filter(departamento =="TI") %>% dplyr::slice_head(n =20), populacao %>% dplyr::filter(departamento =="Vendas") %>% dplyr::slice_head(n =20) )# Comparação das médias das amostras geradasdata.frame( Metodo =c("População Total", "Aleatória Simples", "Estratificada", "Conveniência"), Media_Exp =c( mean(populacao$experiencia),mean(amostra_simples$experiencia), mean(amostra_estratificada$experiencia),mean(amostra_conveniencia$experiencia) ) )
Metodo Media_Exp
1 População Total 5.032256
2 Aleatória Simples 5.137247
3 Estratificada 4.825907
4 Conveniência 5.068807
3.4 O Duelo dos Grupos: Estratificada vs. Conglomerados
Embora ambas dividam a população em subgrupos, a lógica de funcionamento é inversa. A escolha entre uma ou outra depende do seu objetivo: precisão estatística ou economia logística.
Amostragem Estratificada: “Um pouco de cada”
Aqui, o objetivo é a precisão. Queremos garantir que nenhum subgrupo importante (estrato) fique de fora.
Composição: Os estratos são homogêneos internamente (as pessoas dentro do grupo são parecidas, ex: apenas mulheres) e heterogêneos entre si (os grupos são bem diferentes uns dos outros).
O Sorteio: Todos os estratos participam. O sorteio (AAS) acontece dentro de cada um deles.
Exemplo: Para entender a renda de um país, dividimos a população por classes sociais (A, B, C…). Sorteamos pessoas de todas as classes para garantir que a classe A não seja esquecida.
Amostragem por Conglomerados: “Tudo de alguns”
Aqui, o objetivo é a eficiência e baixo custo. É ideal quando a população está muito dispersa.
Composição: Os conglomerados são heterogêneos internamente (cada grupo é uma “mini população” com diversidade) e homogêneos entre si (um grupo é muito parecido com o outro).
O Sorteio: O sorteio acontece na unidade do grupo. Selecionamos alguns conglomerados e estudamos todos os indivíduos dentro deles.
Exemplo: Para pesquisar a saúde de alunos em uma cidade, sorteamos 10 escolas (conglomerados) e entrevistamos todos os alunos dessas 10 escolas, em vez de viajar a todas as centenas de escolas da cidade.
3.4.1 Comparação entre Métodos de Amostragem
No Quadro 1, apresentamos a distinção técnica entre os dois principais métodos de seleção por grupos, focando na composição interna e na lógica de sorteio.
Quadro 1. Amostragem estratificada e amostragem por conglomerados
Característica
Amostragem Estratificada
Amostragem por Conglomerados
Dentro do Grupo
Elementos homogêneos (parecidos entre si)
Elementos heterogêneos (diversos entre si)
Entre os Grupos
Grupos heterogêneos (diferentes entre si)
Grupos homogêneos (parecidos entre si)
Unidade de Sorteio
O indivíduo (dentro de cada estrato)
O conglomerado (o grupo como um todo)
Presença na Amostra
Todos os estratos são representados
Apenas alguns conglomerados são sorteados
Objetivo Principal
Aumentar a precisão dos estimadores
Reduzir custos e facilitar a logística da coleta
3.5 Dimensionamento da Amostra e Estimativa do Erro Amostral
A determinação do tamanho da amostra é uma etapa essencial no planejamento de qualquer pesquisa. Uma amostra inadequadamente dimensionada pode produzir estimativas imprecisas ou elevar desnecessariamente os custos da coleta de dados. Além disso, a possibilidade de estimar o erro amostral depende diretamente do método de amostragem adotado.
De maneira geral, apenas as amostragens probabilísticas permitem calcular o erro amostral e construir intervalos de confiança, uma vez que cada elemento da população possui uma probabilidade conhecida de seleção. Nas amostragens não probabilísticas, essa probabilidade é desconhecida, impossibilitando a obtenção de estimativas estatisticamente válidas para o erro de amostragem.
3.5.1 Dimensionamento da Amostra em Amostragens Probabilísticas
O cálculo do tamanho da amostra depende do objetivo da pesquisa, do tipo de variável analisada e da precisão desejada.
3.5.2 População Infinita ou Muito Grande
Quando a população é muito grande (ou desconhecida), utiliza-se a seguinte expressão:
\[
n=\frac{Z^2pq}{E^2}
\]
em que
\(n\): tamanho da amostra;
\(Z\): valor crítico da distribuição Normal correspondente ao nível de confiança;
\(p\): proporção esperada da característica de interesse;
\(q=1-p\);
\(E\): erro máximo admissível (margem de erro).
Quando não existe informação prévia sobre a proporção populacional, adota-se
\[
p=q=0,5,
\]
pois essa escolha produz a maior variabilidade possível e, consequentemente, o maior tamanho amostral.
3.5.2.1 Correção para População Finita
Quando o tamanho da população é conhecido e relativamente pequeno, aplica-se a correção para população finita:
\[
n_f=\frac{nN}{N+n-1}
\]
em que
\(N\): tamanho da população;
\(n\): tamanho obtido para população infinita;
\(n_f\): tamanho corrigido da amostra.
Essa correção reduz o tamanho necessário da amostra quando uma parcela significativa da população será investigada.
3.5.3 Dimensionamento nos Principais Tipos de Amostragem Probabilística
3.5.3.1 Amostragem Aleatória Simples (AAS)
O tamanho amostral é obtido diretamente pelas fórmulas apresentadas anteriormente.
Nesse caso, o dimensionamento depende da homogeneidade existente dentro dos conglomerados.
Utiliza-se frequentemente o efeito do desenho (Design Effect):
\[
n'=n\times Deff
\]
em que
\(n\): tamanho obtido para AAS;
\(Deff\): efeito do plano amostral.
Quanto maior a semelhança entre os indivíduos de um mesmo conglomerado, maior será o valor de \(Deff\) e, consequentemente, maior deverá ser a amostra.
Supondo que o tamanho calculado para AAS tenha sido 100 indivíduos e que o efeito do desenho seja igual a 1,8.
n <-100Deff <-1.8n_corrigido <- n*Deffn_corrigido
[1] 180
3.5.3.7 Estimativa do Erro Amostral nas Amostragens Probabilísticas
A margem de erro de uma estimativa é obtida por
\[
E=Z\times EP.
\]
Assim, um intervalo de confiança para a média populacional é dado por
\[
\bar{x}\pm Z\times EP(\bar{x}),
\]
enquanto, para proporções,
\[
\hat p\pm Z\times EP(\hat p).
\]
Tabela 1: Os valores mais utilizados para o nível de confiança.
Nível de confiança
Valor de (Z)
90%
1,645
95%
1,96
99%
2,576
3.6 Dimensionamento da Amostra em Amostragens Não Probabilísticas
Nas amostragens não probabilísticas não existe um mecanismo aleatório de seleção dos elementos da população. Dessa forma, não é possível determinar matematicamente a probabilidade de inclusão de cada unidade.
Consequentemente,
não existe fórmula estatística para obtenção do tamanho ótimo da amostra;
não é possível calcular erro amostral;
não podem ser construídos intervalos de confiança válidos para inferência à população.
Nesses casos, o tamanho da amostra é determinado principalmente por critérios metodológicos, práticos ou operacionais.
3.6.1 Amostragem por Conveniência
O número de participantes depende da disponibilidade dos indivíduos e dos recursos disponíveis para a pesquisa.
Em estudos exploratórios, frequentemente utilizam-se entre 30 e 100 participantes, embora esse número possa variar substancialmente.
3.6.2 Amostragem por Cotas
Inicialmente definem-se as proporções desejadas para cada grupo.
Por exemplo,
60% mulheres;
40% homens.
Se a amostra possuir 500 indivíduos,
\[
300 \text{ mulheres}
\]
e
\[
200 \text{ homens}.
\]
A escolha dos participantes dentro de cada grupo continua sendo não aleatória.
3.6.3 Amostragem por Julgamento (Intencional)
O pesquisador seleciona indivíduos considerados especialistas ou representativos do fenômeno investigado.
O tamanho da amostra normalmente depende da experiência do pesquisador e da saturação das informações coletadas, especialmente em pesquisas qualitativas.
3.6.4 Existe erro amostral nas amostragens não probabilísticas?
Embora qualquer pesquisa esteja sujeita a erros, o chamado erro amostral, definido como a variabilidade decorrente da seleção aleatória da amostra, não pode ser estimado em amostragens não probabilísticas.
Os principais problemas observados nessas amostras são:
viés de seleção;
viés de cobertura;
viés de resposta;
falta de representatividade.
Assim, os resultados devem ser interpretados com cautela, restringindo-se, em geral, ao grupo efetivamente estudado, sem extrapolações estatísticas para toda a população.
No próximo capítulo, daremos início, de fato, a análise descritiva dos dados.
Exercicio 1
Defina população e amostra. Explique por que a utilização de uma amostra é, na maioria das pesquisas, preferível ao estudo de toda a população.
Explique a diferença entre amostragem probabilística e amostragem não probabilística.
Exercício 2
Entre os métodos apresentados, identifique quais são probabilísticos e quais são não probabilísticos.
a) Amostragem Aleatória Simples
b) Amostragem Estratificada
c) Amostragem Sistemática
d) Amostragem por Conglomerados
e) Amostragem por Conveniência
f) Amostragem por Cotas
g) Amostragem por Julgamento
Exercício 3
Uma empresa possui funcionários distribuídos em quatro departamentos. O pesquisador deseja garantir que todos os departamentos sejam representados na pesquisa.
Qual método de amostragem é o mais indicado? Justifique.
Explique a diferença entre amostragem estratificada e amostragem por conglomerados quanto:
a) à composição dos grupos;
b) à unidade de sorteio;
c) ao objetivo principal.
Exercício 4
Explique por que a amostragem por conveniência não permite inferências estatísticas para toda a população.
Considere as situações abaixo. Indique o método de amostragem mais adequado.
a) Selecionar cada 20º cliente de um supermercado.
b) Escolher aleatoriamente cinco escolas e entrevistar todos os alunos.
c) Selecionar proporcionalmente alunos de cada curso universitário.
d) Entrevistar pessoas que passam em frente a uma estação de metrô.
Exercício 5
Cite duas vantagens e duas limitações da amostragem aleatória simples.
Em uma pesquisa eleitoral, o pesquisador deseja entrevistar exatamente 200 homens e 200 mulheres, escolhendo os primeiros eleitores encontrados.
Esse procedimento caracteriza qual tipo de amostragem?
Justifique.
Explique por que o erro amostral pode ser estimado apenas em amostragens probabilísticas.
Exercício 6
Uma universidade deseja realizar uma pesquisa sobre satisfação dos alunos.
Considere que existem quatro cursos:
Estatística;
Administração;
Engenharia;
Direito.
Elabore um plano de amostragem respondendo:
Qual método de amostragem você utilizaria?
Justifique sua escolha.
Como seria realizado o sorteio?
Qual seria a unidade amostral?
Quais seriam as vantagens desse método?
Quais seriam suas limitações?
Escreva um código em R simulando esse processo de amostragem.