Logo

Matemáticas para Big Data

Código: 45562
Créditos: 6
2026/2027
Titulación Tipo Curso
Modelling for Science and Engineering OP 1

Profesor/a de contacto

Nombre :
Amanda Fernandez Fontelo
Correo electrónico :
amanda.fernandez@uab.cat

Equipo docente

Sundus Zafar
Víctor Navas Portella

Idiomas de los grupos

Puede consultar esta información al final del documento.

Prerrequisitos

Los estudiantes deben tener conocimientos básicos de álgebra lineal, probabilidad, inferencia estadística y modelos lineales. La experiencia previa con los programas R y Python es muy recomendable.

 

Objetivos

Actualmente, se generan grandes volúmenes de datos en ámbitos muy diversos como el ámbito de la salud, la ingeniería, las ciencias sociales, la economía, etc. Este crecimiento exponencial de los datos representa, al mismo tiempo, un reto y una gran oportunidad para extraer información relevante que permita tomar decisiones fundamentadas, optimizar procesos o generar nuevo conocimiento. El objetivo principal de este curso es proporcionar al estudiante los conocimientos matemáticos, estadísticos y computacionales, así como las herramientas necesarias para procesar, analizar y modelizar grandes conjuntos de datos. Además, se hace énfasis en la interpretación y uso de la información obtenida, con el fin de transformar los datos en conocimiento útil que permita extraer conclusiones más precisas y tomar decisiones más acertadas. El curso se centra especialmente en el aprendizaje y la aplicación de algunos métodos matemáticos, estadísticos y computacionales para identificar patrones, tendencias y relaciones en conjuntos de datos masivos y complejos.

Resultados de aprendizaje

  • CA27 (Aplicar las herramientas matemáticas del análisis de las grandes bases de datos a la resolución de problemas en el ámbito empresarial o de la investigación) Aplicar las herramientas matemáticas del análisis de las grandes bases de datos a la resolución de problemas en el ámbito empresarial o de la investigación
  • CA28 (Integrar las herramientas matemáticas del análisis de las grandes bases de datos a otras herramientas en entornos de trabajo multidisciplinares) Integrar las herramientas matemáticas del análisis de las grandes bases de datos a otras herramientas en entornos de trabajo multidisciplinares
  • CA29 (Comunicar a un público especializado y no especializado los resultados obtenidos al aplicar los métodos estadísticos de análisis de grandes bases de datos en distintos ámbitos) Comunicar a un público especializado y no especializado los resultados obtenidos al aplicar los métodos estadísticos de análisis de grandes bases de datos en distintos ámbitos
  • CA30 (Trabajar en equipos multidisciplinares en el desarrollo de proyectos donde se apliquen técnicas de deep learning) Trabajar en equipos multidisciplinares en el desarrollo de proyectos donde se apliquen técnicas de deep learning
  • KA21 (Describir las técnicas de aprendizaje automático profundo (Deep Learning) usadas en el análisis de grandes bases de datos) Describir las técnicas de aprendizaje automático profundo (Deep Learning) usadas en el análisis de grandes bases de datos
  • KA22 (Describir las herramientas matemáticas empleadas en el análisis de grandes bases y volúmenes de datos) Describir las herramientas matemáticas empleadas en el análisis de grandes bases y volúmenes de datos
  • SA27 (Aplicar técnicas matemáticas de tratamiento de grandes bases de datos para analizar fenómenos particulares, como patrones de comportamiento del consumidor, tendencias de mercado o análisis de redes sociales.) Aplicar técnicas matemáticas de tratamiento de grandes bases de datos para analizar fenómenos particulares, como patrones de comportamiento del consumidor, tendencias de mercado o análisis de redes sociales.
  • SA28 (Interpretar los resultados obtenidos después de analizar una base de datos de gran tamaño) Interpretar los resultados obtenidos después de analizar una base de datos de gran tamaño

Contenidos

Consultar la Guía Docente en inglés.

Actividades formativas y Metodología

Título Horas ECTS Resultados de aprendizaje
Sesiones de problemas y prácticas 11 0,44 CA27, CA28, CA29, CA30, SA27, SA28
Ampliación de conceptos introducidos en las sesiones de teoria 43 1,72 CA28, KA21, KA22, SA28
Sesiones de teoría 19 0,76 CA28, CA29, KA21, KA22
Sesiones de problemas y prácticas 8 0,32 CA27, CA28, CA29, CA30, SA27, SA28
Tareas para trabajar los conceptos introducidos en las sesiones presenciales 50 2 CA27, CA28, CA29, CA30, KA21, KA22, SA27

La asignatura se organiza en tres bloques independientes, cada uno impartido por un profesor diferente. Mientras que el primer bloque de la asignatura (10 horas) introduce conceptos relacionados con la minería de datos, generalmente aplicados a conjuntos de datos de gran tamaño, el segundo bloque (18 horas) se centra en los métodos estadísticos y los conocimientos necesarios para modelizar este tipo de datos. Se pone un especial énfasis en los métodos de agregación de datos, incluyendo los estadísticos suficientes, el metaanálisis y los métodos para combinar diferentes estimaciones, así como en los métodos estadísticos escalables, entre los que destacan los métodos divide-and-conquer, las técnicas de submuestreo y los métodos de optimización estocástica, como el descenso por gradiente estocástico (Stochastic Gradient Descent, SGD). Estos métodos se estudiarán mediante aplicaciones con datos reales, especialmente en el contexto de los modelos lineales y los modelos lineales generalizados. Finalmente, el tercer bloque de la asignatura (10 horas) introduce a los estudiantes en algunos de los métodos más relevantes del aprendizaje profundo (deep learning), con especial atención a las redes neuronales y sus aplicaciones.

En general, cada bloque combina sesiones teóricas y de introducción de conceptos por parte del profesorado con sesiones prácticas, que pueden ser sesiones dirigidas o bien sesiones de trabajo autónomo. Las sesiones teóricas podrán ir acompañadas de diapositivas, las que se compartirán a través del Moodle del curso. Las sesiones de problemas y las prácticas dirigidas podrán incluir ejemplos prácticos con R y/o Python, que, en general, también estarán disponibles en el Moodle del curso. El profesorado, si lo considera oportuno, podrá compartir a través de Moodle material adicional que deberá ser trabajado de forma autónoma por el alumnado con el fin de profundizar en los conceptos introducidos en clase.

Sobre el uso de la IA: En esta asignatura se permite el uso de tecnologías de Inteligencia Artificial (IA) como parte integrante del desarrollo del trabajo, siempre que el resultado final refleje una contribución significativa del estudiante en el análisis y la reflexión personal. El estudiante deberá identificar claramente qué partes han sido generadas con esta tecnología, especificar las herramientas utilizadas e incluir una reflexión crítica sobre cómo estas han influido en el proceso y en el resultado final de la actividad. La falta de transparencia en el uso de la IA se considerará una falta de honestidad académica y podrá conllevar una penalización en la calificación de la actividad o, en los casos de mayor gravedad, sanciones adicionales.

Nota: se reservarán 15 minutos de una clase dentro del calendario establecido por el centro o por la titulación para que el alumnado rellene las encuestas de evaluación de la actuación del profesorado y de evaluación de la asignatura o módulo.

Evaluación

Actividades de evaluación continuada

Título Peso Horas ECTS Resultados de aprendizaje
Proyectos Bloque 3 26 5 0,2 CA27, CA28, CA29, CA30, KA21, KA22, SA27, SA28
Proyectos Bloque 2 48 9 0,36 CA27, CA28, CA29, KA22, SA27, SA28
Proyectos Bloque 1 26 5 0,2 CA27, CA28, CA29, KA22, SA27, SA28

La evaluación del curso se realiza de forma independiente en cada uno de los bloques descritos. El peso de cada bloque en la calificación final coincide con el número de horas de ese bloque en relación con el total de horas del curso. En general, en cada bloque se propondrá un conjunto de proyectos que podrán desarrollarse de forma individual o en grupo, y que, en algunos casos, incluirán una pequeña parte en la que se requerirá la presentación oral de contenidos y resultados. Los proyectos de los bloques 1 y 3 tienen un peso del 26% cada uno en la nota final de la asignatura, mientras que los proyectos del bloque 2 tienen un peso del 48%.

Para cada proyecto se publicará en el Moodle del curso un documento con el enunciado y la descripción de lo que se solicita, así como todo el material necesario para desarrollar el proyecto (conjuntos de datos, fuentes de información adicionales, etc.), la fecha de entrega, el mecanismo de entrega, y otros detalles que el profesorado considere relevantes. Las calificaciones de cada proyecto, así como las calificaciones finales de cada bloque y del curso, se publicarán también en el Moodle del curso.

Bibliografía

Referencias básicas:

  • B. Efron, T. Hastie. Computer Age Statistical Inference, Cambridge University Press, 2018.
  • https://bibcercador.uab.cat/permalink/34CSUC_UAB/1eqfv2p/alma991010753063206709
  • G. James, D. Witten, T. Hastie and R. Tibshirani. An Introduction to Statistical Learning (with applications in R). Springer, 2013.
  • https://bibcercador.uab.cat/permalink/34CSUC_UAB/1c3utr0/cdi_globaltitleindex_catalog_296006297
  • D. Skillicorn. Understanding Complex Data. Data Mining with Matrix Decomposition. Chapman & Hall, 2007.
  • https://bibcercador.uab.cat/permalink/34CSUC_UAB/1eqfv2p/alma991004136809706709

Referencias complementarias:

  • B. Everitt and T. Hothorn. An introduction to Applied Multivariate Analysis with R. Springer, 2011.
  • B. Everitt. An R and S+ Companion to Multivariate Analysis. Springer, 2005.
  • J. Faraway. Extending de Linear Model with R. Chapman & Hall, Miami, 2006.
  • J. Faraway. Linear Models with R. Chapman & Hall, Boca Raton, 2005.
  • W. Härdle and L. Simar. Applied Multivariate Statistical Analysis. Springer. 2007.
  • B. Ripley. Pattern Recognition and Neural Networks. Cambridge University Press, 2002.
  • L. Torgo. Data Mining with R. Learning with Case Studies. Chapman & Hall, Miami. 2010
  • W Venables, B Ripley. Modern Applied Statistics with S-PLUS. Springer, New York.
  • Wang, C., Chen, M.-H., Schifano, E., Wu, J., & Yan, J. (2016). Statistical methods and computing for big data. Statistics and Its Interface, 9(4), 399–409.
  • Chen, X., Cheng, G., & Xie, M. (2021). Divide-and-conquer methods for big data analysis. Statistical Science, 36(4), 582–597.
  • Zhu, R., Ma, P., Mahoney, M. W., & Yu, B. (2015). Optimal Subsampling Approaches for Large Sample Linear Regression. arXiv preprint arXiv:1509.05111.
  • Bottou, L. (2010). Large-scale machine learning with stochastic gradient descent. Proceedings of COMPSTAT 2010, 177–186.

Los profesores podrán proporcionar otras referencias de interés para cada bloque, las cuales estarán disponibles a través de la página de Moodle.

Software

R Core Team (2021). R: A language and environment for statistical computing.
R Foundation for Statistical Computing, Vienna, Austria.
URL https://www.R-project.org/.

Python

Grupos e idiomas de la asignatura

La información proporcionada es provisional hasta el 30 de noviembre. A partir de esta fecha, podrá consultar el idioma de cada grupo a través de este enlace. Para acceder a la información, será necesario introducir el CÓDIGO de la asignatura

Tipo de docencia Grupo Idioma Semestre Turno
(TEm) Teoría (máster) 1 Inglés segundo cuatrimestre tarde