Segmentación Supervisada de Solicitantes de Crédito mediante SHAP
| dc.contributor.advisor | Cifuentes Quintero, Jenny Alexandra | es-ES |
| dc.contributor.author | Rodrigues González-Montagut, Sofía | es-ES |
| dc.contributor.other | Universidad Pontificia Comillas, Facultad de Ciencias Económicas y Empresariales | es_ES |
| dc.date.accessioned | 2025-07-08T07:20:33Z | |
| dc.date.available | 2025-07-08T07:20:33Z | |
| dc.date.issued | 2026 | es_ES |
| dc.description | Grado en Análisis de Negocios/Business Analytics y Grado en Relaciones Internacionales | es_ES |
| dc.description.abstract | La gestión del riesgo crediticio constituye una de las funciones fundamentales del sistema financiero, ya que una estimación rigurosa de la probabilidad de incumplimiento contribuye a preservar la solvencia de las entidades financieras, optimizar el capital regulatorio y favorecer una asignación más eficiente del crédito. La adopción de técnicas de aprendizaje automático ha mejorado sustancialmente la capacidad predictiva de los modelos de credit scoring, pero también ha introducido una disyuntiva entre precisión e interpretabilidad que limita su aceptación en un entorno regulatorio que exige transparencia y trazabilidad en la toma de decisiones automatizadas. En este contexto, este Trabajo de Fin de Grado propone una metodología de segmentación supervisada basada en valores SHAP para analizar perfiles de riesgo crediticio. El enfoque combina diversas técnicas en una metodología secuencial. En primer lugar, se entrena un modelo predictivo LightGBM sobre el conjunto de datos German Credit Data (1.000 solicitantes). A continuación, se calculan los valores SHAP para construir un espacio explicativo en el que cada observación queda descrita por la contribución de sus variables a la predicción. Posteriormente, se aplica UMAP para reducir la dimensionalidad y DBSCAN para identifi- car clusters densos de solicitantes con patrones explicativos similares. Finalmente, los grupos resultantes se caracterizan mediante reglas interpretables extraídas con SkopeRules. El modelo predictivo alcanzó un ROC-AUC de 0,686 y una exactitud del 74 % , suficiente para generar explicaciones SHAP estables. La segmentación en el espacio explicativo identificó tres clusters densos y bien separados (coeficiente de Silhouette de 0,802; índice de Davies-Bouldin de 0,307), caracterizados por la combinación de la duración del crédito y el nivel de ahorro: (i) solicitantes de corto plazo con bajo ahorro (20,3 % de incumplimiento), (ii) solicitantes vulnerables de largo plazo (46,4 % ) y (iii) solicitantes con mayor estabilidad de ahorro (22,8 % ). Los resultados muestran que la metodología propuesta permite trasladar las predicciones individuales de riesgo a perfiles homogéneos descritos mediante reglas observables, integrando capacidad predictiva, interpretabilidad y segmentación en un marco analítico coherente con las exigencias de transparencia del sector financiero. | es-ES |
| dc.description.abstract | Credit risk management is one of the core functions of the financial system, as a rigorous estimation of the probability of default helps preserve the solvency of financial institutions, optimise regulatory capital and promote a more efficient allocation of credit. The adoption of machine learning techniques has substantially improved the predictive capacity of credit scoring models, but it has also introduced a trade-off between accuracy and interpretability that limits their acceptance in a regulatory environment that demands transparency and traceability in automated decision-making. Against this background, this Bachelor’s Thesis proposes a supervised segmentation methodology based on SHAP values to analyse credit risk profiles. The approach combines several techniques in a sequential methodology. First, a LightGBM predictive model is trained on the German Credit Data set (1,000 applicants). Next, SHAP values are computed to build an explanatory space in which each observation is described by the contribution of its variables to the prediction. UMAP is then applied to reduce dimensionality, and DBSCAN is used to identify dense clusters of applicants with similar explanatory patterns. Finally, the resulting groups are characterised through interpretable rules extracted with SkopeRules. The predictive model achieved a ROC-AUC of 0.686 and an accuracy of 74 % sufficient to generate stable SHAP explanations. The segmentation in the explanatory space identified three dense and well-separated clusters (Silhouette coefficient of 0.802; Davies Bouldin index of 0.307), characterised by the combination of loan duration and savings level: (i) shortterm applicants with low savings (20.3 % default rate), (ii) vulnerable long-term applicants (46.4 % ) and (iii) applicants with greater savings stability (22.8 % ). The results show that theproposed methodology successfully translates individual risk predictions into homogeneous profiles described by observable rules, integrating predictive performance, interpretability and segmentation within a coherent analytical framework aligned with the transparency requirements of the financial sector. | en-GB |
| dc.format.mimetype | application/pdf | es_ES |
| dc.identifier.uri | http://hdl.handle.net/11531/100144 | |
| dc.keywords | riesgo crediticio, clustering supervisado, valores SHAP, Inteligencia Artificial Explicable (XAI), LightGBM. | es-ES |
| dc.keywords | credit risk, supervised clustering, SHAP values, Explainable Artificial Intelligence (XAI), LightGBM. | en-GB |
| dc.language.iso | es-ES | es_ES |
| dc.rights | Attribution-NonCommercial-NoDerivs 3.0 United States | es_ES |
| dc.rights.accessRights | info:eu-repo/semantics/openAccess | es_ES |
| dc.rights.uri | http://creativecommons.org/licenses/by-nc-nd/3.0/us/ | es_ES |
| dc.subject.other | KBA | es_ES |
| dc.title | Segmentación Supervisada de Solicitantes de Crédito mediante SHAP | es_ES |
| dc.type | info:eu-repo/semantics/bachelorThesis | es_ES |