I + D · En curso

Investigaciones en curso

Proyectos liderados por Carlos Diego, sus grupos de investigación y estudiantes de grado y posgrado.

01

Integridad, Sesgo, Datos Sintéticos y Procedencia

Toward a Data-Centric Trust Pipeline for Trustworthy AI. Investiga cómo la integridad, el sesgo, la generación de datos sintéticos y la procedencia forman un ecosistema interdependiente para construir una IA confiable.

Objetivo

Proponer el Data-Centric Trust Pipeline como modelo unificado para elevar la transparencia, la interpretabilidad y la rendición de cuentas a lo largo del ciclo de vida de los datos.

Líneas de problemas

  • ¿Cómo asegurar consistencia, contextualización y completitud cuando los datasets carecen de metadatos y estandarización?
    Justificación. Los fallos de integridad comprometen la reproducibilidad y la auditabilidad, amplificando errores aguas abajo.
  • ¿Qué enfoques mitigan disparidades entre grupos demográficos cuando las métricas de equidad son incompletas?
    Justificación. Los estudios muestran variaciones de 20–35% de error entre grupos: la equidad exige tratamiento continuo.
  • ¿Cómo validar la autenticidad y los límites de uso de datos sintéticos, que pueden reproducir sesgos estructurales?
    Justificación. Sin trazabilidad, los datos sintéticos distorsionan la interpretación en análisis sensibles.
  • ¿Cómo evolucionan los sistemas de procedencia de repositorios pasivos a registros interpretativos de decisiones?
    Justificación. La procedencia es esencial para la explicabilidad y la auditoría en pipelines de IA.

Referencias

  • D. Schwabe et al., "The METRIC-framework for assessing data quality for trustworthy AI in medicine: A systematic review," npj Digit. Med., vol. 7, no. 1, art. no. 11, 2024, doi: 10.1038/s41746-024-01196-4.
  • J. Buolamwini and T. Gebru, "Gender shades: Intersectional accuracy disparities in commercial gender classification," in Proc. 1st Conf. Fairness, Accountability and Transparency, in Proceedings of Machine Learning Research, vol. 81, 2018, pp. 77–91.
  • M. A. S. Hameed, A. M. Qureshi, and A. Kaushik, "Bias mitigation via synthetic data generation: A review," Electronics, vol. 13, no. 19, art. no. 3909, 2024, doi: 10.3390/electronics13193909.
  • M. Ahmed et al., "Data provenance in healthcare: Approaches, challenges, and future directions," Sensors, vol. 23, no. 14, art. no. 6495, 2023, doi: 10.3390/s23146495.
  • S. Longpre et al., "A large-scale audit of dataset licensing and attribution in AI," Nature Mach. Intell., vol. 6, no. 8, pp. 975–987, Aug. 2024, doi: 10.1038/s42256-024-00878-8.
02

C2PF — Planificación de Capacidad Consciente de la Arquitectura

An Architecture-Aware Conceptual Framework for Cloud Capacity Planning. Integra características arquitectónicas, semántica de cargas de trabajo y objetivos operativos (SLO, PLO, RLO) en un modelo conceptual unificado.

Objetivo

Proponer C2PF como un marco consciente de la arquitectura capaz de producir decisiones de capacidad proactivas, explicables y repetibles.

Líneas de problemas

  • ¿Cómo superar los modelos reactivos basados solo en métricas históricas, que no capturan variación y concurrencia?
    Justificación. La ausencia de contexto arquitectónico lleva a previsiones imprecisas y sobreaprovisionamiento.
  • ¿Cómo combinar componentes arquitectónicos, clasificación de cargas de trabajo y objetivos de rendimiento?
    Justificación. Existen brechas semánticas y cognitivas entre arquitectos, operadores y planificadores.
  • ¿Cómo cuantificar los efectos de los patrones (microservicios, event-driven, serverless) en el consumo de capacidad?
    Justificación. Los factores arquitectónicos pueden añadir hasta un 30% de sobrecarga, alterando escalabilidad y latencia.

Referencias

  • C. D. Cavalcanti Pereira, "Capacity planning of cloud computing workloads," Doctoral dissertation, CESAR School, Recife, Brazil, 2023, doi: 10.2139/ssrn.5754002.
  • C. D. Cavalcanti Pereira, "Capacity planning of cloud computing workloads," in Cloud Computing — Applications and Sustainable Developments. London, U.K.: IntechOpen, 2025, doi: 10.5772/intechopen.1011100.
  • M. Richards and N. Ford, Fundamentals of Software Architecture: An Engineering Approach. Sebastopol, CA, USA: O’Reilly Media, 2020.
  • R. Lichtenthäler, J. Fritzsch, and G. Wirtz, "Cloud-native architectural characteristics and their impacts on software quality: A validation survey," in Proc. IEEE Int. Conf. Service-Oriented System Eng. (SOSE), 2023, arXiv:2306.12532.
  • N. J. Gunther, Guerrilla Capacity Planning: A Tactical Approach to Planning for Highly Scalable Applications and Services. Berlin, Germany: Springer, 2010, doi: 10.1007/978-3-540-31010-5.
03

La Economía del Ecosistema de la IA Generativa

Capital Intensity, Market Dynamics, and Competitive Differentiation Across the Value Chain. Analiza cómo las capas — semiconductores, nube, modelos, inferencia, plataformas y aplicaciones — organizan la competencia, la inversión y la captura de valor.

Objetivo

Proponer un modelo conceptual de la cadena de valor de la IA generativa y evaluar hipótesis sobre intensidad de capital, concentración de infraestructura, difusión de capacidades e impactos de productividad.

Líneas de problemas

  • Estructura económica e intensidad de capital — cómo la distribución de capital entre capas moldea la competencia.
  • Concentración de infraestructura — hasta qué punto la oferta presenta concentración estructural.
  • Difusión de capacidades — con qué velocidad se difunden las capacidades de frontera.
  • Barreras de entrada en aplicaciones — cómo las APIs y plataformas influyen en el desarrollo.
  • Impactos de productividad — evidencia de ganancias en el trabajo del conocimiento.

Referencias

  • Y. LeCun, Y. Bengio, and G. Hinton, "Deep learning," Nature, vol. 521, no. 7553, pp. 436–444, May 2015, doi: 10.1038/nature14539.
  • J. Kaplan et al., "Scaling laws for neural language models," 2020, arXiv:2001.08361.
  • J. Hoffmann et al., "Training compute-optimal large language models," 2022, arXiv:2203.15556.
  • E. Brynjolfsson, D. Li, and L. R. Raymond, "Generative AI at work," Nat. Bureau Econ. Res., Cambridge, MA, USA, Working Paper 31161, 2023, doi: 10.3386/w31161.
04

Programación Optimizada para Kubernetes

Una revisión sistemática de la literatura. Analiza críticamente algoritmos de programación optimizados para Kubernetes, con foco en aplicabilidad, beneficios y desafíos en computación general, IA y edge.

Líneas de problemas

  • ¿Cómo se comportan los algoritmos optimizados en producción frente a las pruebas experimentales de la literatura?
    Justificación. La mayoría de los estudios ocurre en entornos controlados; hay una brecha sobre la aplicabilidad práctica.
  • ¿Cómo mejoran los algoritmos multicriterio la asignación en clústeres heterogéneos (CPU/GPU, edge/cloud)?
    Justificación. La eficacia combinada de latencia, GPU y energía aún es incierta.
  • ¿Qué modelos de ML son más eficaces para prever la demanda y adaptar la programación?
    Justificación. Faltan comparaciones sistemáticas de QoS y coste-beneficio.

Referencias

  • G. El Haj Ahmed, F. Gil-Castiñeira, and E. Costa-Montenegro, "KubCG: A dynamic Kubernetes scheduler for heterogeneous clusters," Softw. Pract. Exp., vol. 51, no. 2, pp. 213–234, 2021, doi: 10.1002/spe.2898.
  • I. Harichane, S. A. Makhlouf, and G. Belalem, "KubeSC-RTP: Smart scheduler for Kubernetes platform on CPU-GPU heterogeneous systems," Concurrency Comput. Pract. Exp., vol. 34, no. 21, art. no. e7108, 2022, doi: 10.1002/cpe.7108.
  • M. Carvalho and D. F. Macedo, "Container scheduling in co-located environments using QoE awareness," IEEE Trans. Netw. Serv. Manage., vol. 20, no. 3, pp. 3247–3260, 2023, doi: 10.1109/TNSM.2023.3244090.
  • T. Menouer, "KCSS: Kubernetes container scheduling strategy," J. Supercomput., vol. 77, no. 5, pp. 4267–4293, 2021, doi: 10.1007/s11227-020-03427-3.