Introdução
Este capítulo corresponde ao capítulo 1 de Grus (2019).
📓 Abrir o notebook deste capítulo no Colab ↗ — só o código, pronto para rodar.
— Dados! Dados! Dados! — exclamou ele, impaciente. — Não posso fazer tijolos sem argila.
— Arthur Conan Doyle
Você provavelmente já treinou um modelo sem saber o que ele fez. Chamou um .fit(), chamou um .predict(), e uma resposta apareceu. Talvez tenha sido boa. Talvez você nem tenha tido como saber.
Esta disciplina existe para abrir essas caixas. Daqui em diante, todo algoritmo que aparecer será construído do zero — em Python puro, sem numpy, sem scikit-learn, sem nada que esconda a mecânica. O código vai ser mais lento e mais verboso do que qualquer coisa que se use em produção, e isso é proposital: o que se ganha em troca é enxergar o que acontece por dentro.
Este primeiro capítulo não constrói nada ainda. Ele responde a três perguntas: por que há tanto dado no mundo, o que é ciência de dados afinal, e como é o trabalho de quem faz isso. A última pergunta é respondida do único jeito honesto — resolvendo problemas de verdade, com código de verdade, antes de você ter aprendido as ferramentas.
Ao final deste capítulo, você será capaz de:
- Explicar por que a abundância de dados é um fenômeno recente e o que a produziu
- Discutir o que é ciência de dados sem depender de uma definição única, e reconhecer que ela não existe
- Identificar usos da área que ajudam pessoas e usos que as manipulam — e perceber que a técnica é a mesma nos dois
- Ler código Python que você ainda não sabe escrever, extraindo dele a ideia em vez da sintaxe
- Reconhecer, num problema concreto, os temas que os próximos dezesseis capítulos vão desenvolver
Seções
| Seção | Tópico |
|---|---|
| 1.1 | A Ascensão dos Dados |
| 1.2 | O que é Ciência de Dados? |
| 1.3 | Hipótese Motivadora: DataSciencester |