Bases 5

Ciência de Dados

Autor

Douglas Braga

Data de Publicação

13/09/2026

Bem-vindo

Este é o material de apoio da disciplina Bases 5 — Ciência de Dados, do curso de Ciência da Computação da UnDF.

Sobre a Disciplina

Ciência de dados é o trabalho de tirar resposta de dado: obter, limpar e entender o que se tem em mãos, escolher um modelo que sirva à pergunta, ajustá-lo e — a parte que mais se pula — descobrir se ele merece confiança.

Esta disciplina percorre esse caminho inteiro, com código executável em cada passo. Os temas são:

  • Fundamentos — Python para dados, visualização, álgebra linear e gradiente descendente
  • O trabalho com dados — obter, limpar, transformar e explorar
  • Aprendizado supervisionado — regressão e classificação, e como avaliar um modelo honestamente
  • Aprendizado não supervisionado — encontrar estrutura sem rótulo

Cronograma

As aulas são às quartas-feiras, de 19 de agosto a 23 de dezembro de 2026. As três últimas são avaliativas, e a aula 9 é um horário protegido para estudo (HPE), reservado ao trabalho dos grupos no seminário — cujas instruções saem na aula anterior.

Cronograma do semestre 2.2026
Aula Data Conteúdo
1 19/08 Apresentação da disciplina · 1 — Introdução
2 26/08 2 — Um Curso Rápido de Python · notebook com onboarding do Colab
3 02/09 3 — Visualizando Dados
4 09/09 4 — Álgebra Linear · 5 — Gradiente Descendente
5 16/09 6 — Dados: Tipos, Dados Retangulares e pandas · entrega da lista 1
6 23/09 a definir
7 30/09 a definir
8 07/10 a definir · instruções do seminário
9 14/10 HPE — trabalho dos grupos no seminário
10 21/10 a definir
11 28/10 a definir
12 04/11 a definir
13 11/11 a definir
14 18/11 a definir
15 25/11 a definir
16 02/12 a definir · revisão para a prova
17 09/12 entrega da lista 2 · Prova
18 16/12 Seminário — apresentação dos grupos
19 23/12 Revisão da prova
20 30/12 Sem aula

Avaliação

Quatro instrumentos, somando 100%:

Instrumento Peso Quando
Lista 1 — revisão de pré-requisitos 10% entrega até 16/09/2026 (aula 5)
Lista 2 — conteúdo da disciplina 10% entrega até 09/12/2026 (aula 17)
Prova individual 40% 09/12/2026 (aula 17)
Seminário em grupo 40% apresentação em 16/12/2026 (aula 18)

A lista 1 já está disponível, e é cedo de propósito. Ela é de revisão e cobre álgebra linear, cálculo e estatística — o que este material assume e não ensina. Os 10% são o de menos: ela existe para mostrar, ainda na aula 5, o que precisa ser retomado antes de o conteúdo ficar pesado. Descobrir na semana da prova que derivada parcial ficou para trás é tarde; descobrir em setembro ainda dá tempo.

As duas listas são entregues manuscritas, com as contas à vista. Uma resposta certa sem desenvolvimento vale menos que uma errada com o raciocínio visível — é no desenvolvimento que dá para ver onde está a dúvida.

A lista 2 cobre a disciplina e é entregue no dia da prova, também de propósito: ela é o estudo dirigido para ela, não uma tarefa empilhada em cima do estudo.

O seminário parte de um problema real, tirado do Kaggle. Cada grupo escolhe uma competição, entende o problema e os dados, aplica o que foi visto aqui e apresenta o que aprendeu — inclusive o que não funcionou.

A nota do seminário não é a posição no leaderboard.

O que se avalia é o raciocínio: por que este modelo e não outro, o que os dados sustentam, onde o resultado pode estar enganando. Um grupo que fica em último lugar e sabe explicar por que ficou aprende mais — e vale mais — do que um grupo que copia um notebook campeão e não sabe dizer o que ele faz.

Essa distinção é a disciplina inteira em uma frase.

As instruções do seminário saem em 07/10 (aula 8), e a aula seguinte, em 14/10, é um HPE — horário protegido para estudo, reservado ao trabalho dos grupos com acompanhamento em sala.

A prova é individual e cobre os fundamentos e os modelos vistos ao longo do semestre. A última aula, em 23/12, é a devolutiva: correção coletiva das questões, com retomada do que a turma errou mais.

Referências

  • Grus (2019) — ISBN 978-1-492-04113-9. Há tradução brasileira, publicada pela Alta Books como Data Science do Zero: noções fundamentais com Python. O código e os exemplos estão em github.com/joelgrus/data-science-from-scratch, sob licença MIT, e vêm reproduzidos neste repositório no diretório scratch/.

Outras referências entram aqui conforme os temas avançam.

Como Usar Este Material

Cada capítulo traz:

  • Os conceitos, com o código que os põe para rodar
  • Conjuntos de dados reais, todos incluídos no repositório — nada é baixado na hora
  • Exemplos executáveis, feitos para você mexer e rodar de novo

Rodando o código

Cada capítulo tem um notebook com o código dele, e um link no topo da página do capítulo para abri-lo no Google Colab — que roda no navegador, sem instalar nada. A primeira célula de todo notebook baixa o material da disciplina e ajusta o diretório de trabalho; rode-a antes das outras.

Se você nunca usou o Colab, ou quer entender de onde vêm o pacote scratch/ e os dados, o notebook do Capítulo 2 abre com dez minutos de onboarding antes do conteúdo:

📓 Colab e o ambiente da disciplina ↗ — dez minutos, feito para a aula 2.

Para rodar na sua máquina, o ambiente completo (Python, bibliotecas e Quarto) está empacotado em um container Docker — veja o README.md.

Licença

Material disponibilizado para fins educacionais. O código reproduzido no diretório scratch/ é de autoria de Joel Grus (Grus 2019), sob licença MIT.

Grus, Joel. 2019. Data Science from Scratch: First Principles with Python. 2nd ed. O’Reilly Media.