Avís important
La guia docent és provisional.
La versió en PDF de la guia docent pot tardar uns dies en estar disponible al DDD.

Matemàtiques per al Big Data
Codi: 45562Crèdits: 6
| Titulació | Tipus | Curs |
|---|---|---|
| Modelling for Science and Engineering | OP | 1 |
Professor/a de contacte
- Nom :
- Amanda Fernandez Fontelo
- Correu electrònic :
- amanda.fernandez@uab.cat
Equip docent
- Sundus Zafar
- Víctor Navas Portella
Idiomes dels grups
Podeu consultar aquesta informació al final del document.
Prerequisits
Els estudiants han de tenir coneixements bàsics d'àlgebra lineal, probabilitat, inferència estadística i models lineals. L'experiència prèvia amb els programaris R i Python és molt recomanable.
Objectius
Actualment, es generen grans volums de dades en àmbits molt diversos com l'àmbit de la salut, l'enginyeria, les ciències socials, l'economia, etc. Aquest creixement exponencial de les dades representa, alhora, un repte i una gran oportunitat per extreure informació rellevant que permeti prendre decisions fonamentades, optimitzar processos o generar nou coneixement. L'objectiu principal d'aquest curs és dotar l'estudiant dels coneixements matemàtics, estadístics i computacionals, així com de les eines necessàries per processar, analitzar i modelitzar grans conjunts de dades. A més, es posa èmfasi en la interpretació i aprofitament de la informació obtinguda, amb l'objectiu de transformar les dades en coneixement útil que permeti extreure conclusions més precises i prendre decisions més acurades. El curs se centra especialment en l'aprenentatge i aplicació d'alguns mètodes matemàtics, estadístics i computacionals per identificar patrons, tendències i relacions en conjunts de dades massius i complexos.
Resultats d'aprenentatge
- CA27 (Aplicar les eines matemàtiques de l’anàlisi de les grans bases de dades a la resolució de problemes en l’àmbit empresarial o de la recerca.) Aplicar les eines matemàtiques de l’anàlisi de les grans bases de dades a la resolució de problemes en l’àmbit empresarial o de la recerca.
- CA28 (Integrar les eines matemàtiques de l’anàlisi de les grans bases de dades a altres eines en entorns de treball multidisciplinaris.) Integrar les eines matemàtiques de l’anàlisi de les grans bases de dades a altres eines en entorns de treball multidisciplinaris.
- CA29 (Comunicar a un públic especialitzat i no especialitzat els resultats obtinguts d’aplicar els mètodes estadístics d’anàlisi de grans bases de dades en diferents àmbits.) Comunicar a un públic especialitzat i no especialitzat els resultats obtinguts d’aplicar els mètodes estadístics d’anàlisi de grans bases de dades en diferents àmbits.
- CA30 (Treballar en equips multidisciplinaris en el desenvolupament de projectes on s’apliquin tècniques de deep learning.) Treballar en equips multidisciplinaris en el desenvolupament de projectes on s’apliquin tècniques de deep learning.
- KA21 (Descriure les tècniques d'aprenentatge automàtic profund (deep learning) usades en l'anàlisi de grans bases de dades.) Descriure les tècniques d'aprenentatge automàtic profund (deep learning) usades en l'anàlisi de grans bases de dades.
- KA22 (Descriure les eines matemàtiques emprades en l’anàlisi de grans bases i volums de dades.) Descriure les eines matemàtiques emprades en l’anàlisi de grans bases i volums de dades.
- SA27 (Aplicar tècniques matemàtiques de tractament de grans bases de dades per analitzar fenòmens particulars, com patrons de comportament del consumidor, tendències de mercat o anàlisi de xarxes socials.) Aplicar tècniques matemàtiques de tractament de grans bases de dades per analitzar fenòmens particulars, com patrons de comportament del consumidor, tendències de mercat o anàlisi de xarxes socials.
- SA28 (Interpretar els resultats obtinguts després d’analitzar una base de dades de mida molt gran.) Interpretar els resultats obtinguts després d’analitzar una base de dades de mida molt gran.
Continguts
Veure Guia Docent en Anglès.
Activitats formatives i Metodologia
| Títol | Hores | ECTS | Resultats d'aprenentatge |
|---|---|---|---|
| Sessions de problemes i pràctiques | 11 | 0,44 | CA27, CA28, CA29, CA30, SA27, SA28 |
| Ampliació de conceptes introduïts a les sessions de teoria | 43 | 1,72 | CA28, KA21, KA22, SA28 |
| Sessions de teoria | 19 | 0,76 | CA28, CA29, KA21, KA22 |
| Sessions de problemes i pràctiques | 8 | 0,32 | CA27, CA28, CA29, CA30, SA27, SA28 |
| Tasques per treballar els conceptes introduïts a les sessions presencials | 50 | 2 | CA27, CA28, CA29, CA30, KA21, KA22, SA27 |
L'assignatura s'organitza en tres blocs independents, cadascun impartit per un professor diferent. Mentre que el primer bloc de l'assignatura (10 hores) introdueix conceptes relacionats amb la mineria de dades, generalment aplicats a conjunts de dades de gran dimensió, el segon bloc (18 hores) se centra en els mètodes estadístics i els coneixements necessaris per modelitzar aquest tipus de dades. Es posa un èmfasi especial en els mètodes d'agregació de dades, incloent-hi els estadístics suficients, la metaanàlisi i els mètodes per combinar diferents estimacions, així com en els mètodes estadístics escalables, entre els quals destaquen els mètodes divide-and-conquer, les tècniques de submostreig i els mètodes d'optimització estocàstica, com ara el stochastic gradient descent. Aquests mètodes s'estudiaran mitjançant aplicacions amb dades reals, especialment en el context dels models lineals i dels models lineals generalitzats. Finalment, el tercer bloc de l'assignatura (10 hores) introdueix els estudiants en alguns dels mètodes més rellevants de l'aprenentatge profund (deep learning), amb una atenció especial a les xarxes neuronals i a les seves aplicacions.
En general, cada bloc combina sessions de teoria i introducció de conceptes per part del professor amb sessions pràctiques que poden ser sessions dirigides o bé sessions de treball autònom. Les sessions de teoria es poden acompanyar amb diapositives les quals es compartiran al Moodle del curs, mentre que les sessions de problemes i pràctiques dirigides poden acompanyar-se per exemples pràctics amb R i/o Python, els quals generalment també es podran compartir al Moodle del curs. Els professors, si així ho consideren, podran compartir, mitjançant el Moodle del curs, material addicional el qual s'haurà de treballar per part dels alumnes per aprofundir en els conceptes introduïts a classe.
Sobre l'ús de la IA: En aquesta assignatura, es permet l'ús de tecnologies d'Intel·ligència Artificial (IA) com a part integrant del desenvolupament del treball, sempre que el resultat final reflecteixi una contribució significativa de l'estudiant en l'anàlisi i la reflexió personal. L'estudiant haurà d'identificar clarament quines parts han estat generades amb aquesta tecnologia, especificar les eines emprades i incloure una reflexió crítica sobre com aquestes han influït en el procés i el resultat final de l’activitat. La no transparència de l’ús de la IA es considerarà falta d'honestedat acadèmica i pot comportar una penalització en la nota de l'activitat, o sancions majors en casos de gravetat.
Avaluació
Activitats d'avaluació continuada
| Títol | Pes | Hores | ECTS | Resultats d'aprenentatge |
|---|---|---|---|---|
| Projectes Bloc 3 | 26 | 5 | 0,2 | CA27, CA28, CA29, CA30, KA21, KA22, SA27, SA28 |
| Projectes Bloc 2 | 48 | 9 | 0,36 | CA27, CA28, CA29, KA22, SA27, SA28 |
| Projectes Bloc 1 | 26 | 5 | 0,2 | CA27, CA28, CA29, KA22, SA27, SA28 |
L'avaluació del curs es fa independentment en cadascun dels blocs descrits. El pes de cada bloc coincideix amb el número d'hores del bloc en relació amb el total d'hores del curs. En general, en cada bloc es plantejaran un conjunt de projectes que es podran treballar de manera individual o en grups, i que en alguns casos, una petita part del projecte requerirà la comunicació de continguts i resultats oralment. Els projectes dels blocs 1 i 3 tenen un pes de l'assignatura d'un 26% cadascun mentre que els projectes del bloc 2 tenen un pes de l'assignatura d'un 48%.
Per a cada projecte es penjarà al Moodle del curs l'enunciat amb la descripció del que es demana, tot el material necessari per a desenvolupar el projecte (conjunt de dades, fonts addicionals d'informació, etc.), la data i el mecanisme d'entrega del projecte, així com altres detalls que el professor consideri rellevants. Les qualificacions de cada projecte així com les qualificacions finals de cada bloc i del curs es publicaran també al Moodle del curs.
Bibliografia
Referències bàsiques:
- B. Efron, T. Hastie. Computer Age Statistical Inference, Cambridge University Press, 2018.
- https://bibcercador.uab.cat/permalink/34CSUC_UAB/1eqfv2p/alma991010753063206709
- G. James, D. Witten, T. Hastie and R. Tibshirani. An Introduction to Statistical Learning (with applications in R). Springer, 2013.
- https://bibcercador.uab.cat/permalink/34CSUC_UAB/1c3utr0/cdi_globaltitleindex_catalog_296006297
- D. Skillicorn. Understanding Complex Data. Data Mining with Matrix Decomposition. Chapman & Hall, 2007.
- https://bibcercador.uab.cat/permalink/34CSUC_UAB/1eqfv2p/alma991004136809706709
Referències complementàries:
- B. Everitt and T. Hothorn. An introduction to Applied Multivariate Analysis with R. Springer, 2011.
- B. Everitt. An R and S+ Companion to Multivariate Analysis. Springer, 2005.
- J. Faraway. Extending de Linear Model with R. Chapman & Hall, Miami, 2006.
- J. Faraway. Linear Models with R. Chapman & Hall, Boca Raton, 2005.
- W. Härdle and L. Simar. Applied Multivariate Statistical Analysis. Springer. 2007.
- B. Ripley. Pattern Recognition and Neural Networks. Cambridge University Press, 2002.
- L. Torgo. Data Mining with R. Learning with Case Studies. Chapman & Hall, Miami. 2010
- W Venables, B Ripley. Modern Applied Statistics with S-PLUS. Springer, New York.
- Wang, C., Chen, M.-H., Schifano, E., Wu, J., & Yan, J. (2016). Statistical methods and computing for big data. Statistics and Its Interface, 9(4), 399–409.
- Chen, X., Cheng, G., & Xie, M. (2021). Divide-and-conquer methods for big data analysis. Statistical Science, 36(4), 582–597.
- Zhu, R., Ma, P., Mahoney, M. W., & Yu, B. (2015). Optimal Subsampling Approaches for Large Sample Linear Regression. arXiv preprint arXiv:1509.05111.
- Bottou, L. (2010). Large-scale machine learning with stochastic gradient descent. Proceedings of COMPSTAT 2010, 177–186.
Els professors podran proporcionar altres referències d'interès per a cada bloc, les quals estaran disponibles a través de la pàgina de Moodle.
Programari
R Core Team (2021). R: A language and environment for statistical computing.
R Foundation for Statistical Computing, Vienna, Austria.
URL https://www.R-project.org/.
Python
Grups i idiomes de l'assignatura
La informació proporcionada és provisional fins al 30 de novembre. A partir d'aquesta data, podreu consultar l'idioma de cada grup a través d'aquest enllaç. Per accedir a la informació, caldrà introduir el CODI de l'assignatura
| Tipus de docència | Grup | Idioma | Semestre | Torn |
|---|---|---|---|---|
| (TEm) Teoria (màster) | 1 | Anglès | segon quadrimestre | tarda |