Investigaciones en curso
Proyectos liderados por Carlos Diego, sus grupos de investigación y estudiantes de grado y posgrado.
Integridad, Sesgo, Datos Sintéticos y Procedencia
Toward a Data-Centric Trust Pipeline for Trustworthy AI. Investiga cómo la integridad, el sesgo, la generación de datos sintéticos y la procedencia forman un ecosistema interdependiente para construir una IA confiable.
Objetivo
Proponer el Data-Centric Trust Pipeline como modelo unificado para elevar la transparencia, la interpretabilidad y la rendición de cuentas a lo largo del ciclo de vida de los datos.
Líneas de problemas
- ¿Cómo asegurar consistencia, contextualización y completitud cuando los datasets carecen de metadatos y estandarización?
Justificación. Los fallos de integridad comprometen la reproducibilidad y la auditabilidad, amplificando errores aguas abajo. - ¿Qué enfoques mitigan disparidades entre grupos demográficos cuando las métricas de equidad son incompletas?
Justificación. Los estudios muestran variaciones de 20–35% de error entre grupos: la equidad exige tratamiento continuo. - ¿Cómo validar la autenticidad y los límites de uso de datos sintéticos, que pueden reproducir sesgos estructurales?
Justificación. Sin trazabilidad, los datos sintéticos distorsionan la interpretación en análisis sensibles. - ¿Cómo evolucionan los sistemas de procedencia de repositorios pasivos a registros interpretativos de decisiones?
Justificación. La procedencia es esencial para la explicabilidad y la auditoría en pipelines de IA.
Referencias
- D. Schwabe et al., "The METRIC-framework for assessing data quality for trustworthy AI in medicine: A systematic review," npj Digit. Med., vol. 7, no. 1, art. no. 11, 2024, doi: 10.1038/s41746-024-01196-4.
- J. Buolamwini and T. Gebru, "Gender shades: Intersectional accuracy disparities in commercial gender classification," in Proc. 1st Conf. Fairness, Accountability and Transparency, in Proceedings of Machine Learning Research, vol. 81, 2018, pp. 77–91.
- M. A. S. Hameed, A. M. Qureshi, and A. Kaushik, "Bias mitigation via synthetic data generation: A review," Electronics, vol. 13, no. 19, art. no. 3909, 2024, doi: 10.3390/electronics13193909.
- M. Ahmed et al., "Data provenance in healthcare: Approaches, challenges, and future directions," Sensors, vol. 23, no. 14, art. no. 6495, 2023, doi: 10.3390/s23146495.
- S. Longpre et al., "A large-scale audit of dataset licensing and attribution in AI," Nature Mach. Intell., vol. 6, no. 8, pp. 975–987, Aug. 2024, doi: 10.1038/s42256-024-00878-8.
C2PF — Planificación de Capacidad Consciente de la Arquitectura
An Architecture-Aware Conceptual Framework for Cloud Capacity Planning. Integra características arquitectónicas, semántica de cargas de trabajo y objetivos operativos (SLO, PLO, RLO) en un modelo conceptual unificado.
Objetivo
Proponer C2PF como un marco consciente de la arquitectura capaz de producir decisiones de capacidad proactivas, explicables y repetibles.
Líneas de problemas
- ¿Cómo superar los modelos reactivos basados solo en métricas históricas, que no capturan variación y concurrencia?
Justificación. La ausencia de contexto arquitectónico lleva a previsiones imprecisas y sobreaprovisionamiento. - ¿Cómo combinar componentes arquitectónicos, clasificación de cargas de trabajo y objetivos de rendimiento?
Justificación. Existen brechas semánticas y cognitivas entre arquitectos, operadores y planificadores. - ¿Cómo cuantificar los efectos de los patrones (microservicios, event-driven, serverless) en el consumo de capacidad?
Justificación. Los factores arquitectónicos pueden añadir hasta un 30% de sobrecarga, alterando escalabilidad y latencia.
Referencias
- C. D. Cavalcanti Pereira, "Capacity planning of cloud computing workloads," Doctoral dissertation, CESAR School, Recife, Brazil, 2023, doi: 10.2139/ssrn.5754002.
- C. D. Cavalcanti Pereira, "Capacity planning of cloud computing workloads," in Cloud Computing — Applications and Sustainable Developments. London, U.K.: IntechOpen, 2025, doi: 10.5772/intechopen.1011100.
- M. Richards and N. Ford, Fundamentals of Software Architecture: An Engineering Approach. Sebastopol, CA, USA: O’Reilly Media, 2020.
- R. Lichtenthäler, J. Fritzsch, and G. Wirtz, "Cloud-native architectural characteristics and their impacts on software quality: A validation survey," in Proc. IEEE Int. Conf. Service-Oriented System Eng. (SOSE), 2023, arXiv:2306.12532.
- N. J. Gunther, Guerrilla Capacity Planning: A Tactical Approach to Planning for Highly Scalable Applications and Services. Berlin, Germany: Springer, 2010, doi: 10.1007/978-3-540-31010-5.
La Economía del Ecosistema de la IA Generativa
Capital Intensity, Market Dynamics, and Competitive Differentiation Across the Value Chain. Analiza cómo las capas — semiconductores, nube, modelos, inferencia, plataformas y aplicaciones — organizan la competencia, la inversión y la captura de valor.
Objetivo
Proponer un modelo conceptual de la cadena de valor de la IA generativa y evaluar hipótesis sobre intensidad de capital, concentración de infraestructura, difusión de capacidades e impactos de productividad.
Líneas de problemas
- Estructura económica e intensidad de capital — cómo la distribución de capital entre capas moldea la competencia.
- Concentración de infraestructura — hasta qué punto la oferta presenta concentración estructural.
- Difusión de capacidades — con qué velocidad se difunden las capacidades de frontera.
- Barreras de entrada en aplicaciones — cómo las APIs y plataformas influyen en el desarrollo.
- Impactos de productividad — evidencia de ganancias en el trabajo del conocimiento.
Referencias
- Y. LeCun, Y. Bengio, and G. Hinton, "Deep learning," Nature, vol. 521, no. 7553, pp. 436–444, May 2015, doi: 10.1038/nature14539.
- J. Kaplan et al., "Scaling laws for neural language models," 2020, arXiv:2001.08361.
- J. Hoffmann et al., "Training compute-optimal large language models," 2022, arXiv:2203.15556.
- E. Brynjolfsson, D. Li, and L. R. Raymond, "Generative AI at work," Nat. Bureau Econ. Res., Cambridge, MA, USA, Working Paper 31161, 2023, doi: 10.3386/w31161.
Programación Optimizada para Kubernetes
Una revisión sistemática de la literatura. Analiza críticamente algoritmos de programación optimizados para Kubernetes, con foco en aplicabilidad, beneficios y desafíos en computación general, IA y edge.
Líneas de problemas
- ¿Cómo se comportan los algoritmos optimizados en producción frente a las pruebas experimentales de la literatura?
Justificación. La mayoría de los estudios ocurre en entornos controlados; hay una brecha sobre la aplicabilidad práctica. - ¿Cómo mejoran los algoritmos multicriterio la asignación en clústeres heterogéneos (CPU/GPU, edge/cloud)?
Justificación. La eficacia combinada de latencia, GPU y energía aún es incierta. - ¿Qué modelos de ML son más eficaces para prever la demanda y adaptar la programación?
Justificación. Faltan comparaciones sistemáticas de QoS y coste-beneficio.
Referencias
- G. El Haj Ahmed, F. Gil-Castiñeira, and E. Costa-Montenegro, "KubCG: A dynamic Kubernetes scheduler for heterogeneous clusters," Softw. Pract. Exp., vol. 51, no. 2, pp. 213–234, 2021, doi: 10.1002/spe.2898.
- I. Harichane, S. A. Makhlouf, and G. Belalem, "KubeSC-RTP: Smart scheduler for Kubernetes platform on CPU-GPU heterogeneous systems," Concurrency Comput. Pract. Exp., vol. 34, no. 21, art. no. e7108, 2022, doi: 10.1002/cpe.7108.
- M. Carvalho and D. F. Macedo, "Container scheduling in co-located environments using QoE awareness," IEEE Trans. Netw. Serv. Manage., vol. 20, no. 3, pp. 3247–3260, 2023, doi: 10.1109/TNSM.2023.3244090.
- T. Menouer, "KCSS: Kubernetes container scheduling strategy," J. Supercomput., vol. 77, no. 5, pp. 4267–4293, 2021, doi: 10.1007/s11227-020-03427-3.