Princípios de Ciência de Dados › O Que É Ciência de Dados e os Dados Que Ela Usa · aula de amostra
Toda vez que você reproduz uma música, toca no mapa para pedir direções ou recebe um alerta de fraude do seu banco, um pipeline de dados e algoritmos está trabalhando silenciosamente nos bastidores. Ciência de dados é a disciplina que constrói esses pipelines: ela combina estatística, computação e conhecimento do domínio para extrair dos dados insights confiáveis e colocá-los em uso. Um cientista de dados não apenas calcula médias; ele formula uma pergunta, reúne e limpa os dados relevantes, explora-os, modela-os e comunica uma resposta sobre a qual alguém possa agir.
O que torna este momento diferente de um século de estatística é a escala e a velocidade. Hoje as organizações registram dados sobre quase tudo o que fazem, o armazenamento barato os conserva e computadores rápidos nos permitem analisá-los. A matéria-prima é abundante; a habilidade escassa é saber fazer boas perguntas a esses dados e evitar enganar a si mesmo com as respostas. É essa habilidade que este curso desenvolve.
Projetos reais raramente seguem em linha reta, mas costumam passar por um conjunto reconhecível de etapas. Pense nelas como um ciclo que você pode percorrer mais de uma vez:
Faça uma pergunta. Transforme um objetivo vago ("reduzir a evasão de clientes") em algo que um conjunto de dados possa de fato responder.
Colete os dados. Decida o que medir e como obter uma amostra que represente a população que lhe interessa.
Limpe e trate. Corrija valores ausentes, formatos inconsistentes e erros — geralmente a etapa mais demorada de todas.
Explore e visualize. Resuma os dados e faça gráficos para enxergar padrões, anomalias e relações antes de se comprometer com um modelo.
Modele e infira. Use probabilidade, estatística e machine learning para estimar quantidades, testar ideias ou fazer previsões.
Comunique. Relate o resultado com honestidade, incluindo sua incerteza, às pessoas que tomarão uma decisão.
Uma regra prática comum é que coletar e limpar dados pode consumir a maior parte do tempo de um projeto. Iniciantes muitas vezes imaginam a ciência de dados como uma modelagem engenhosa; os profissionais sabem que a modelagem só funciona quando as etapas anteriores, mais modestas, foram feitas com cuidado.
A ciência de dados situa-se na interseção de três áreas. A estatística fornece a linguagem da incerteza — como amostrar, estimar e evitar ser enganado pelo ruído. A computação fornece as ferramentas para armazenar, transformar e realizar cálculos sobre dados em escala, e é por isso que Python é a linguagem de trabalho deste curso. E o conhecimento do domínio — entender a medicina, o negócio ou a física por trás dos números — é o que separa um resultado significativo de uma correlação sem sentido. A fraqueza em qualquer um dos três tende a afundar um projeto.
Eis o campo inteiro em miniatura. Suponha que um serviço de streaming queira saber quais novos usuários têm probabilidade de cancelar. Um cientista de dados definiria "probabilidade de cancelar" de forma precisa, extrairia uma amostra de usuários antigos com seus desfechos, limparia os registros, exploraria quais comportamentos acompanham o cancelamento, ajustaria um modelo que atribui uma pontuação a cada novo usuário e entregaria à equipe de marketing uma lista ordenada — junto com uma observação honesta sobre a frequência com que o modelo erra. Cada lição deste curso desenvolve uma parte desse percurso.
Você não precisa ser um programador ou estatístico experiente para começar. Familiaridade com álgebra básica e um pouco de Python levarão você longe, e as ideias importam mais do que a sintaxe. Mantenha uma pergunta em mente o tempo todo: não apenas "o que os dados dizem?", mas "quanto devo confiar naquilo que eles parecem dizer?"
Currículo alinhado a Principles of Data Science da OpenStax; todo o texto das lições é original do Syllabus.
Esta é uma aula da matéria completa.
Leve todos os módulos, aulas e questionários — grátis agora, seus para sempre.