Introdução

Autor

Douglas Braga

Nota

Este capítulo corresponde ao capítulo 1 de Grus (2019).

📓 Abrir o notebook deste capítulo no Colab ↗ — só o código, pronto para rodar.

— Dados! Dados! Dados! — exclamou ele, impaciente. — Não posso fazer tijolos sem argila.

— Arthur Conan Doyle

Você provavelmente já treinou um modelo sem saber o que ele fez. Chamou um .fit(), chamou um .predict(), e uma resposta apareceu. Talvez tenha sido boa. Talvez você nem tenha tido como saber.

Esta disciplina existe para abrir essas caixas. Daqui em diante, todo algoritmo que aparecer será construído do zero — em Python puro, sem numpy, sem scikit-learn, sem nada que esconda a mecânica. O código vai ser mais lento e mais verboso do que qualquer coisa que se use em produção, e isso é proposital: o que se ganha em troca é enxergar o que acontece por dentro.

Este primeiro capítulo não constrói nada ainda. Ele responde a três perguntas: por que há tanto dado no mundo, o que é ciência de dados afinal, e como é o trabalho de quem faz isso. A última pergunta é respondida do único jeito honesto — resolvendo problemas de verdade, com código de verdade, antes de você ter aprendido as ferramentas.

Ao final deste capítulo, você será capaz de:

Seções

Seção Tópico
1.1 A Ascensão dos Dados
1.2 O que é Ciência de Dados?
1.3 Hipótese Motivadora: DataSciencester
Grus, Joel. 2019. Data Science from Scratch: First Principles with Python. 2nd ed. O’Reilly Media.