Principios de la ciencia de datos › Qué es la ciencia de datos y los datos que utiliza · lección de muestra
Cada vez que reproduces una canción en streaming, tocas un mapa para obtener indicaciones o recibes una alerta de fraude de tu banco, una canalización de datos y algoritmos trabaja discretamente entre bastidores. La ciencia de datos es la disciplina que construye esas canalizaciones: combina la estadística, la computación y el conocimiento del área para extraer de los datos información fiable y ponerla en práctica. Quien se dedica a la ciencia de datos no se limita a calcular promedios; plantea una pregunta, reúne y limpia los datos pertinentes, los explora, los modela y comunica una respuesta sobre la que alguien pueda actuar.
Lo que distingue a este momento de un siglo de estadística es la escala y la velocidad. Hoy las organizaciones registran datos sobre casi todo lo que hacen, el almacenamiento barato los conserva y los ordenadores rápidos nos permiten analizarlos. La materia prima es abundante; la habilidad escasa consiste en saber formularle buenas preguntas y en evitar engañarse a uno mismo con las respuestas. Esa es la habilidad que este curso desarrolla.
Los proyectos reales rara vez avanzan en línea recta, pero suelen atravesar un conjunto reconocible de etapas. Piénsalas como un ciclo que quizá recorras más de una vez:
Plantea una pregunta. Convierte un objetivo vago ("reducir la pérdida de clientes") en algo que un conjunto de datos pueda responder realmente.
Reúne los datos. Decide qué medir y cómo obtener una muestra que represente a la población que te interesa.
Limpia y transforma. Corrige valores faltantes, formatos inconsistentes y errores: suele ser la etapa que más tiempo consume de todas.
Explora y visualiza. Resume los datos y represéntalos gráficamente para ver patrones, anomalías y relaciones antes de comprometerte con un modelo.
Modela e infiere. Usa la probabilidad, la estadística y el aprendizaje automático para estimar cantidades, contrastar ideas o hacer predicciones.
Comunica. Informa el hallazgo con honestidad, junto con su incertidumbre, a las personas que tomarán una decisión.
Una regla general habitual es que recopilar y limpiar los datos puede consumir la mayor parte del tiempo de un proyecto. Quienes empiezan suelen imaginar la ciencia de datos como un modelado ingenioso; quienes la practican saben que el modelado solo funciona cuando las etapas previas, más humildes, se hicieron con cuidado.
La ciencia de datos se sitúa en la intersección de tres áreas. La estadística aporta el lenguaje de la incertidumbre: cómo muestrear, estimar y no dejarse engañar por el ruido. La computación aporta las herramientas para almacenar, transformar y procesar datos a gran escala, y por eso Python es el lenguaje de trabajo de este curso. Y el conocimiento del dominio —entender la medicina, el negocio o la física que hay detrás de los números— es lo que separa un resultado significativo de una correlación sin sentido. La debilidad en cualquiera de las tres suele hundir un proyecto.
Aquí está toda la disciplina en miniatura. Supongamos que un servicio de streaming quiere saber qué usuarios nuevos tienen probabilidad de cancelar. Quien trabaja en ciencia de datos definiría con precisión qué significa "con probabilidad de cancelar", extraería una muestra de usuarios anteriores con sus resultados, limpiaría los registros, exploraría qué comportamientos se asocian con la cancelación, ajustaría un modelo que puntúa a cada usuario nuevo y entregaría al equipo de marketing una lista ordenada, junto con una nota honesta sobre la frecuencia con que el modelo se equivoca. Cada lección de este curso desarrolla una parte de ese recorrido.
No necesitas ser experto en programación ni en estadística para empezar. La soltura con el álgebra básica y un poco de Python te llevarán muy lejos, y las ideas importan más que la sintaxis. Ten presente una pregunta a lo largo de todo el curso: no solo "¿qué dicen los datos?", sino "¿cuánto debería fiarme de lo que parecen decir?"
Plan de estudios alineado con Principles of Data Science de OpenStax; todo el texto de las lecciones es original de Syllabus.
Esta es una lección de la materia completa.
Llevate todos los módulos, lecciones y cuestionarios — gratis ahora, tuyos para siempre.