DOI 10.35381/noesisin.v8i16.812
Modelos predictivos basados en Data Mining para la optimización del
rendimiento académico universitario
Predictive Models Based on Data Mining for Optimizing
Academic Performance at the University Level
Freddy Enrique Triana-Litardo
Universidad César Vallejo, Piura, Piura
Perú
https://orcid.org/0000-0002-3475-9774
Carlos Eduardo Zulueta-Cueva
zcuevac@ucvvirtual.edu.pe
Universidad César Vallejo, Piura, Piura
Perú
https://orcid.org/0000-0003-2525-5440
Revisado: 26 de abril 2026
Aprobación: 15 de mayo 2026
Publicado:01 de julio 2026
El objetivo general de la investigación fue analizar los modelos predictivos basados en Data Mining para la optimización del rendimiento académico universitario. El método de la investigación, fue de corte documental, cuyo desarrollo metodológico comprendió las etapas de recolección, selección, análisis e interpretación de escritos. La presentación coherente de los hallazgos derivados de este proceso contribuyó a la construcción de conocimiento en el ámbito del aprendizaje. Se empleó material documental con relación y pertinencia al tema investigado de fuentes fidedignas, tales como artículos arbitrados. Se concluye que, las investigaciones científicas muestran el potencial de los modelos predictivos basados en minería de datos y aprendizaje automático para mejorar el rendimiento académico en la educación superior. Estas herramientas no solo son muy precisas, sino que además permiten predecir qué estudiantes suspenderán o desertarán hasta dos semestres de anticipación. Este cambio es un gran avance en la administración académica.
Descriptores: Rendimiento escolar; enseñanza superior; inteligencia artificial. (Tesauro UNESCO).
Descriptors: Academic performance; higher education; artificial intelligence. (UNESCO Thesaurus).
Autor(es) |
Investigación |
Nivel de rigurosidad académica |
País de origen |
Principales resultados |
Lou, & Colvin. (2025) |
Performance prediction using educational data mining techniques: a comparative study. |
Alto (Estudio empírico comparativo, protocolo PRISMA implícito, validación con métricas múltiples) |
EE.UU. |
La Regresión Lineal Generalizada (GLR) superó consistentemente a Random Forest y Árbol de Decisión en precisión predictiva (R² más alto, RMSE, MAE, MSE más bajos) para predecir calificaciones en Matemáticas, Lenguaje e Ingeniería/Ciencias. GLR también fue significativamente más rápido computacionalmente y más interpretable para identificar predictores concretos. |
Santoso et al.(2025) |
Students’ performance dataset for using machine learning technique in physics education research. |
Alto (Artículo descriptor de datos validados, uso de instrumentos estandarizados y revisados por la comunidad PER, análisis de validez factorial y confiabilidad) |
Indonesia |
Se presenta el dataset SPHERE, un recurso nuevo y validado para PER. Un modelo de Random Forest entrenado con SPHERE (AUROC: 0.891-0.913) superó significativamente la precisión predictiva de los profesores (AUROC: 0.637). Los puntajes de inventarios conceptuales (FMCI, TCE) y actitudes (CLASS) fueron los predictores más importantes. |
Chang, Chen, & Lee. (2025) |
Developing an early warning system with personalized interventions to enhance academic outcomes for at-risk students in Taiwanese higher education. |
Muy Alto (Diseño mixto en dos fases: modelado predictivo + experimento cuasi-experimental; validación rigurosa con AUC, ANCOVA, tamaños del efecto; marco teórico sólido basado en sistemas socio-técnicos) |
Taiwán |
El modelo predictivo (basado en Árbol de Decisión) logró un AUC balanceado de 0.85, con el rendimiento académico histórico, la asistencia y la entrega de tareas como los predictores más fuertes. La intervención personalizada y culturalmente adaptada resultó en que el 73% de los estudiantes en riesgo aprobaran el curso, con un tamaño del efecto grande para la mejora académica (d de Cohen = 0.91). Se validó empíricamente el ciclo completo (p. 1) |
Alalawi, Athauda, & Chiong. (2025) |
An extended learning analytics framework integrating machine learning and pedagogical approaches for student performance prediction and intervention. |
Alto (artículo revisado por pares en revista indexada) |
Australia |
- Se desarrollaron modelos predictivos de alto rendimiento usando solo datos de evaluaciones continuas.- Se observaron mejoras significativas en tasas de aprobación y calificaciones finales en algunos cursos.- Los académicos valoraron positivamente la usabilidad y utilidad de SPPA.- Se propuso un modelo de mejora continua para iteraciones futuras del curso. |
Taher Mazandarani et al.(2025) |
Predicting student academic performance: A machine learning approach and feature analysis. |
Alto (artículo revisado por pares en revista indexada) |
Irán |
- Modelo CatBoost Regressor logró R² = 0.87.- Los rasgos de personalidad positivos (ej. "Interés en estudiar", "Autoregulación") fueron los más predictivos.- Se identificaron características clave respaldadas por teorías psicológicas como la Teoría de la Autodeterminación. |
Arévalo-Cordovilla, & Peña. (2025) |
Evaluating ensemble models for fair and interpretable prediction in higher education using multimodal data. |
Alto (Estudio empírico cuantitativo con validación cruzada y evaluación de equidad algorítmica) |
Ecuador |
1. LightGBM fue el modelo individual de mejor rendimiento (AUC = 0.953), superando ligeramente a Random Forest y XGBoost.2. El modelo de stacking no mejoró significativamente el rendimiento y mostró alta inestabilidad.3.Las calificaciones tempranas fueron los predictores más importantes.4. El modelo final demostró alta equidad en género, etnia y nivel socioeconómico (Consistencia = 0.907). |
Vargas Agudelo et al.(2024) |
Modelo basado en Machine Learning para la clasificación de transacciones bancarias realizadas a través de PSE. |
Medio-alto. Se trata de un estudio de corte experimental que utiliza una metodología estructurada para minería de datos, evalúa múltiples algoritmos y emplea conjuntos de datos diferenciados para entrenamiento y validación. |
Colombia |
Tras el preprocesamiento lingüístico y la aplicación de técnicas como la lematización y TF-IDF, se entrenaron y compararon cuatro modelos predictivos.Entre los algoritmos evaluados, el de K-Vecinos más Cercanos (KNN) demostró el mejor desempeño, alcanzando una precisión cercana al 96.5%.Sobre modelos de Árbol de Decisión y Regresión Logística presentaron los resultados menos favorables para esta tarea específica.La investigación valida el uso de técnicas de PLN y aprendizaje automático para automatizar la clasificación de operaciones financieras, un avance que agiliza y enriquece el análisis del comportamiento económico personal. |
Ramos-Pulido, Hernández-Gress, & Torres-Delgado. (2024) |
Exploring the relationship between career satisfaction and university learning using data science models. |
Alto (Artículo de investigación original, revisión por pares, publicado en revista indexada, uso de métodos cuantitativos avanzados y validación cruzada) |
México |
1. El modelo de Gradient Boosting fue ligeramente superior (2-3% más de precisión y AUC) que los modelos de regresión logística y ordinal.2. La satisfacción con la vida y los ingresos son los predictores más importantes para una alta satisfacción profesional.3. La frecuencia con la que se aplican los conocimientos, habilidades y herramientas tecnológicas de la formación académica es un factor clave: los graduados que menos los aplican muestran menor satisfacción.4. Otras características importantes incluyen el estatus laboral, los años trabajando como director general y la publicación de artículos o libros. |
Alturki, Cohausz, & Stuckenschmidt.(2022) |
Predicting Master’s students’ academic performance: An empirical study in Germany. |
Alto (revisión por pares, metodología cuantitativa, validación cruzada) |
Alemania |
- Características más influyentes: notas del semestre (14–36%), distancia a la universidad (6–18%) y cultura (7–17%).- Mejor modelo: Random Forest (precisión 0.77–0.94).- SMOTE mejora significativamente la predicción de clases minoritarias.- La predicción es más precisa tras el segundo semestre y con dos clases (Completado/No Completado). |
Kumar, Nidhi, Quteishat, & Qtaishat. (2022) |
Performance comparison of the optimized ensemble model with existing classifier models. |
Medio-Alto (revista indexada, metodología experimental clara, uso de datasets públicos y múltiples algoritmos) |
India |
- Mejor algoritmo: Decision Table (precisión hasta 83.33%).-Técnicas de selección de características: Correlation Attribute Evaluator, Information Gain y Gain Ratio mejoran la precisión entre 5% y 12%.-Dataset: Matemáticas y Portugués (UCI).-Conclusión principal: La selección de características mejora significativamente la precisión de los modelos predictivos. |
Ayala Franco, López Martínez, & Menéndez Domínguez. (2021) |
Modelos predictivos de riesgo académico en carreras de computación con minería de datos educativos. |
Alto – Revisión por pares, uso de metodología KDD y validación cruzada. |
México |
El algoritmo LMT mostró el mejor desempeño predictivo (75.42% de precisión; AUC ROC = 0.805). Los atributos más relevantes fueron los resultados del examen de admisión (Exani-II), especialmente las pruebas DIAG e ICNE, seguidos por la carrera, preparatoria de origen, edad y responsable económico. |
No monetario
A la Universidad César Vallejo, por el apoyo en el desarrollo de la investigación.
Alalawi, K., Athauda, R., & Chiong, R. (2025). An extended learning analytics framework integrating machine learning and pedagogical approaches for student performance prediction and intervention. International Journal of Artificial Intelligence in Education, 35(3), 1239–1287. https://doi.org/10.1007/s40593-024-00429-7
Alturki, S., Cohausz, L., & Stuckenschmidt, H. (2022). Predicting Master’s students’ academic performance: An empirical study in Germany. Smart Learning Environments, 9(1), 38. https://doi.org/10.1186/s40561-022-00220-y
Arévalo-Cordovilla, F. E., & Peña, M. (2025). Evaluating ensemble models for fair and interpretable prediction in higher education using multimodal data. Scientific Reports, 15, 29420. https://doi.org/10.1038/s41598-025-15388-9
Arias, F. (2012). El Proyecto de Investigación. Introducción a la metodología científica. https://n9.cl/1z1ij
Ayala Franco, E., López Martínez, R. E., & Menéndez Domínguez, V. H. (2021). Modelos predictivos de riesgo académico en carreras de computación con minería de datos educativos. Revista De Educación a Distancia (RED), 21(66). https://doi.org/10.6018/red.463561
Bakhshinategh, B., Zaiane, O.R., ElAtia, S. et al. (2018). Educational data mining applications and tasks: A survey of the last 10 years. Educ Inf Technol 23, 537–553. https://doi.org/10.1007/s10639-017-9616-z
Castro Rojas, L. F., Espitia Peña, E., y Romero Cuero, E. (2023). Análisis de características que influyen en la deserción estudiantil en el contexto de una universidad latinoamericana. Revista EIA, 20(40),1–28. https://doi.org/10.24050/reia.v20i40.1628
Chang, Y.-H., Chen, F.-C., & Lee, C.-I. (2025). Developing an early warning system with personalized interventions to enhance academic outcomes for at-risk students in Taiwanese higher education. Education Sciences, 15(1321). https://doi.org/10.3390/educsci15101321
Díaz Peralta, Christian. (2008). Modelo conceptual para la deserción estudiantil universitaria chilena. Estudios pedagógicos (Valdivia), 34(2),65-86. https://dx.doi.org/10.4067/S0718-07052008000200004
Engel Rocamora, A., & Coll Salvador, C. (2022). Entornos híbridos de enseñanza y aprendizaje para promover la personalización del aprendizaje. RIED-Revista Iberoamericana de Educación a Distancia, 25(1),225–242. https://doi.org/10.5944/ried.25.1.31489
Kumar, M., Nidhi, Quteishat, A., & Qtaishat, A. (2022). Performance comparison of the optimized ensemble model with existing classifier models. International Journal of Modern Education and Computer Science, 14(3),76–87. https://doi.org/10.5815/ijmecs.2022.03.05
Lou, Y., & Colvin, K. F. (2025). Performance prediction using educational data mining techniques: a comparative study. Discover Education, 4, 112. https://doi.org/10.1007/s44217-025-00502-w
Organisation for Economic Co-operation and Development. (2019). Education at a Glance 2019. OECD Publishing. https://doi.org/10.1787/f8d7880d-en
Palella-Stracuzzi, S. y Martins-Pestana, F. (2012). Metodología de la investigación cuantitativa. Fondo editorial de la Universidad Pedagógica Libertador. Caracas, Venezuela.
Ramos-Pulido, S., Hernández-Gress, N., & Torres-Delgado, G. (2024). Exploring the relationship between career satisfaction and university learning using data science models. Informatics, 11(1), 6. https://doi.org/10.3390/informatics11010006
Santoso, P. H., Setiaji, B., Kurniawan, Y., Wahyudi, Bahri, S., Fathurrahman, Kusuma, M., Wusgo, I. U., Muldayanti, N. D., Kurniawan, A. D., & Syahbrudin, J. (2025). Students’ performance dataset for using machine learning technique in physics education research. Scientific Data, 12(987). https://doi.org/10.1038/s41597-025-04913-0
Sghir, N., Adadi, A., & Lahmer, M. (2023). Recent advances in predictive learning analytics: A decade systematic review (2012–2022). Education and Information Technologies, 28(7), 8299–8333. https://doi.org/10.1007/s10639-022-11536-0
Taher Mazandarani, M., Zand, Z., Khodabandelou, M. H., Mozaffari, F., & Sohrabi, B. (2025). Predicting student academic performance: A machine learning approach and feature analysis. Interdisciplinary Journal of Management Studies, 18(3), 425–440. http://doi.org/10.22059/ijms.2025.362506.676053
UNESCO. (2021). Education in Latin America and the Caribbean: Inclusion and mobility in times of pandemic. https://n9.cl/ldyjd
Urbina-Nájera, A. B., Camino-Hampshire, J. C., & Cruz Barbosa, R. (2020). Deserción escolar universitaria: Patrones para prevenirla aplicando minería de datos educativa. RELIEVE - Revista Electrónica de Investigación y Evaluación Educativa, 26(1). https://doi.org/10.7203/relieve.26.1.16061
Vargas Agudelo, F., Soto Durán, D., Urrego Álvarez, M., Yepes Sánchez, E., & Delgado González, I. (2024). Modelo basado en Machine Learning para la clasificación de transacciones bancarias realizadas a través de PSE. Salud, Ciencia y Tecnología, 4, .910. https://doi.org/10.56294/saludcyt2024.1358
©2026 por los autores. Este artículo es de acceso abierto y distribuido según los términos y condiciones de la licencia Creative Commons Atribución-NoComercial-CompartirIgual 4.0 Internacional (CC BY-NC-SA 4.0) (https://creativecommons.org/licenses/by-nc-sa/4.0/)