sexta-feira, 9 de outubro de 2026

O que o Titanic ensina sobre dados (e sobre modelos que parecem melhores do que são)

O que o Titanic ensina sobre dados (e sobre modelos que parecem melhores do que são)

O que o Titanic ensina sobre dados (e sobre modelos que parecem melhores do que são)

2026-10-09

Quem começa em ciência de dados quase sempre passa pelo Titanic. Abre o arquivo, treina um algoritmo, obtém uns 80% de acerto e segue em frente. Eu preparei um material para a pergunta que fica no ar depois disso: o que esses 80% significam, e o que eles não dizem?

O resultado é um conjunto de três peças abertas, em português, para aula e estudo individual: uma página com o código e os resultados comentados, um notebook Python que reproduz tudo e um artigo que liga cada passo à teoria. Os links estão no fim do texto; antes, vale contar o que os dados mostram.

O desafio do Kaggle

O Titanic: Machine Learning from Disaster é a competição de entrada do Kaggle, a plataforma de desafios de ciência de dados. Cada participante recebe 891 passageiros com o desfecho conhecido (sobreviveu ou não) e deve prever o desfecho de outros 418. A base é pequena o bastante para ser lida linha a linha e, ao mesmo tempo, traz quase todos os problemas de um projeto real: dados ausentes (a idade falta em 20% dos casos e a cabine em 77%), texto no nome e no bilhete, variáveis numéricas e categóricas misturadas e relações que só aparecem quando se cruzam duas variáveis.

Quatro coisas que os dados mostram

1. O sexo pesou mais que tudo. Das 314 mulheres do arquivo, 74,2% sobreviveram; dos 577 homens, 18,9%. A razão de chances bruta é 12,4 (intervalo de confiança de 95%: 8,9 a 17,1).

2. A classe mudou o tamanho desse efeito. Entre as mulheres, sobreviveram 97% na 1ª classe, 92% na 2ª e 50% na 3ª. Entre os homens, 37%, 16% e 14%. O teste de interação entre sexo e classe tem χ²(2) = 32,7 (p < 0,001): a vantagem de ser mulher não foi a mesma em todos os convés.

Taxa de sobrevivência por sexo e classe, e número de passageiros em cada célula
Taxa de sobrevivência por sexo e classe (esquerda) e número de passageiros por célula (direita).

3. O porto de embarque era, em boa parte, a classe disfarçada. Quem embarcou em Cherbourg sobreviveu mais que quem embarcou em Southampton (razão de chances 2,44). Mas 51% dos passageiros de Cherbourg viajavam na 1ª classe, contra 20% em Southampton. Ao controlar classe e sexo, a razão cai para 1,81; no modelo completo, para 1,36 (p = 0,21). A associação bruta enganava sobre a causa, e esse é um bom exemplo de confusão para a sala de aula.

4. Modelos sofisticados quase não superam uma regra de uma linha. Em validação cruzada, cinco classificadores (regressão logística, KNN, SVM, floresta aleatória e gradient boosting) ficaram entre 81,1% e 83,2% de acurácia. A regra "mulher sobrevive, homem morre" acerta 78,7% do arquivo. No conjunto de teste, com 179 passageiros, a diferença entre o modelo escolhido e essa regra não foi estatisticamente distinguível (McNemar exato, p = 0,44). O recado é medir sempre contra uma linha de base e informar a incerteza: com um teste tão pequeno, 1 acerto a mais muda a acurácia em 0,56 ponto percentual.

O que há no repositório

Tudo está em um repositório aberto, com licença MIT para o código e CC BY 4.0 para textos e figuras:

Como usar

Na aula, a página pode ser apresentada de cima para baixo. Depois, o aluno copia as caixas de código na ordem para um notebook vazio (ou usa o botão "Copiar todo o código") e reproduz os mesmos resultados, já que a semente aleatória é fixa. A página traz ainda seis exercícios, como comparar estratégias de imputação da idade ou provocar um vazamento de dados de propósito para ver o que acontece.

Limites

São 891 passageiros de um navio com cerca de 2.200 pessoas, e os números descrevem associações, não causas. A ausência de idade e de cabine tem relação com a classe, e a imputação por título e classe reduz a variância da idade (o desvio-padrão cai de 14,5 para 13,5). Os modelos preditivos esbarram num teto de acurácia perto de 83%, e o que falta explicar (posição no navio, acesso aos botes, decisões individuais) não está no arquivo.

Se você usar o material em aula, vou gostar de saber como foi. Sugestões e correções entram pelas issues do repositório.

Como citar: COIMBRA, Paulo C. Titanic: da análise exploratória à predição de sobrevivência: material didático (página de aula, notebook e artigo). Juiz de Fora: UFJF, 2026. Disponível em: https://github.com/pauloccoimbra/titanic-eda-ml-aula.

Material elaborado com assistência de IA (Claude, da Anthropic) e revisado pelo autor.

Pesquisas do 2º turno em um só lugar: linha do tempo, projeção e a metodologia de cada pesquisa

Pesquisas do 2º turno em um só lugar: linha do tempo, projeção e a metodologia de cada pesquisa

Pesquisas do 2º turno em um só lugar: linha do tempo, projeção e a metodologia de cada pesquisa

2026-10-09

A partir de 4/10, quase todo dia sai uma pesquisa nova para o 2º turno. Cada uma vem de um instituto, com amostra, método de coleta e margem de erro próprios, e chega ao leitor como um número solto. Publiquei uma página que junta essas pesquisas e mostra o que elas dizem em conjunto: pauloccoimbra.github.io/pesquisas-eleitorais.

Por que reunir as pesquisas

Uma pesquisa isolada carrega o erro amostral e o jeito de cada instituto. A média de várias reduz parte do ruído, desde que os pesos sejam conhecidos e possam ser questionados. Por isso a página mostra os pesos e deixa o leitor mexer neles.

O que a página faz

  • Linha do tempo. Cada pesquisa aparece como um ponto, com sua margem de erro, e a projeção para 25/10 é refeita a cada dia.
  • Filtros. Dá para ligar e desligar institutos, escolher o período de campo, definir uma amostra mínima, separar por método (presencial, internet, telefone) ou ficar só com as feitas depois do 1º turno. Há um atalho para as pesquisas mais aguardadas pelo mercado e a opção de desmarcar levantamentos um a um.
  • Projeção como em. Uma barra de data mostra o que as pesquisas indicavam em cada dia, usando só o que já tinha sido divulgado até ali.
  • Aba Metodologia. O leitor escolhe o instituto e a data da pesquisa e recebe a ficha: contratante, registro no TSE, amostra, margem de erro, forma de coleta, ponderação, ressalvas e links. O que as fontes não informam aparece como "não informado".
  • Atualização. A página confere a lista de pesquisas a cada 5 minutos. As incluídas por rotina automática levam o selo "automática" até serem revisadas, e há um filtro para deixá-las de fora da conta.

Como a página trata os dois candidatos

Flávio Bolsonaro e Lula aparecem em ordem alfabética, com o mesmo destaque e sem cores partidárias. Cada pesquisa vira a participação de cada um entre os dois, e a chance de vitória é mostrada para os dois lados.

Há uma escolha de modelagem que merece atenção. Nas últimas pesquisas de véspera do 1º turno, seis de sete institutos deram a Lula uma margem maior do que a das urnas (47,03% para Flávio e 45,16% para Lula nos válidos). Corrigir as pesquisas por esse erro supõe que ele se repete no 2º turno, o que é uma hipótese. Por isso a correção vem desligada e o resultado com ela aparece como cenário, ao lado da estimativa principal.

O que ela mostra em 9/10

Com as pesquisas selecionadas até agora, a média ponderada é de 50,6% para Flávio e 49,4% para Lula entre os dois candidatos. O intervalo de 90% vai de 46,7% a 54,5% para Flávio, e o modelo atribui 61% de chance de vitória a Flávio e 39% a Lula. Com a correção de 50% pelo erro do 1º turno, o cenário seria 51,5% e 48,5%. Em outras palavras, o modelo não separa os dois. Esses números mudam a cada pesquisa nova, e vale o que a página mostrar quando você abri-la.

As duas mais recentes na base são a do Datafolha, de 6 e 7/10 (Flávio 49%, Lula 45%), e a do Poder/Aya, de 5 a 7/10 (Flávio 53%, Lula 47% nos votos válidos). Os percentuais não são comparáveis diretamente, porque um é sobre o total de entrevistados e o outro só sobre os válidos. A página converte todos para a mesma medida.

O que a página não é

Pesquisa mede a opinião no período de campo e não prevê o resultado. O intervalo inclui o erro amostral, um erro sistemático dos institutos e a mudança da opinião até o dia 25, mas não cobre tudo: comparecimento, abstenção e fatos novos ficam de fora. Os dados vêm de reportagens e relatórios, e não do sistema de registro do TSE, então confira cada resultado no registro antes de citar. A Veritá ficou fora da base porque suas rodadas nacionais não informam o método de coleta e os dados de registro divergem entre as republicações; a aba Metodologia explica o caso. Qualquer pesquisa pode ser acrescentada pelo leitor, só para teste, em formulário próprio.

Como usar em três passos

  1. Abra a página e leia o painel da projeção, com os dois candidatos lado a lado.
  2. Em "Quais pesquisas entram", filtre do jeito que achar mais razoável e veja a projeção mudar.
  3. Na aba Metodologia, escolha um instituto e uma data para ver como aquela pesquisa foi feita.