Un índice de sensibilidad para errores categóricos (ISEC): un índice ordinal preventivo para errores irrecuperables en los sistemas de entrada de datos
Palabras clave:
calidad de datos ex ante, texto generado por usuarios, similitud semánticaResumen
Los sistemas de entrada de datos siguen siendo estructuralmente vulnerables a clasificaciones erróneas categóricas, especialmente en las pequeñas y medianas empresas (pymes). Cuando las categorías nominales exhiben proximidad semántica o morfológica, la interacción hombre-máquina puede producir errores que son irrecuperables ex post. En ausencia de controles de entrada, la entrada manual genera frecuentemente distorsiones categóricas irrecuperables que se propagan a los indicadores clave de rendimiento (KPI) desinformando así la toma de decisiones gerenciales. Las herramientas de normalización de última generación suelen evaluar las dimensiones semánticas y morfológicas de forma aislada y dependen en gran medida de diccionarios estándar, lo que las vuelve ineficaces para los datos maestros de las pymes ricos en SKU personalizados, abreviaturas y jerga técnica específica del dominio. Este artículo presenta el Índice de Sensibilidad al Error Categórico (ISEC), un índice compuesto ordinal diseñada para ordenar pares de categorías según su susceptibilidad estructural a la confusión. El ISEC integra la distancia semántica (a través de incrustaciones de palabras), costos de transformaciones morfológica ponderadas personalizadas (utilizando Damerau-Levenshtein adaptado) y la frecuencia empírica en un marco preventivo unificado y matemáticamente sólido. Al aprovechar las arquitecturas de bases de datos vectoriales, ISEC también reduce la complejidad computacional, logrando aproximadamente una mejora de rendimiento de 195 veces con respecto a métodos de fuerza bruta. Validado en tres conjuntos de datos heterogéneos: registros judiciales gubernamentales, inventario minorista y códigos de la ISO-1832, el ISEC proporciona un instrumento de gobernanza de datos escalable y proactivo para la pyme.
Descargas
Referencias
Aliero, A. A., Adebayo, B. S., Aliyu, H. O., Tafida, A. G., Kangiwa, B. U., & Dankolo, N. M. (2023). Systematic review on text normalization techniques and its approach to non-standard words. International Journal of Computer Applications, 185(33), 44–55.
Alsousi, A., & Shah, A. (2022). Data governance for sme: Systematic literature review. Journal of Information Systems and Digital Technologies, 4(2), 2022.
Berger, B., Waterman, M. S., & Yu, Y. W. (2021). Levenshtein distance, sequence comparison and biological database search. IEEE Transactions on Information Theory, 67(6), 3287–3294.
Cichy, C., & Rass, S. (2019). An overview of data quality frameworks. IEEE Access, 7, 24634–24648.
de F. Mendes Sampaio, S., Dong, C., & Sampaio, P. (2015). Dq2s – a framework for data quality-aware information management. Expert Systems with Applications, 42(21), 8304–8326.
Feit, A. M., Weir, D., & Oulasvirta, A. (2016). How we type. Proceedings of the 2016 CHI Conference on Human Factors in Computing Systems, 4262–4273.
Ghasemaghaei, M., Ebrahimi, S., & Hassanein, K. (2018). Data analytics competency for improving firm decision making performance. The Journal of Strategic Information Systems, 27(1), 101–113.
Günther, L. C., Colangelo, E., Wiendahl, H.-H., & Bauer, C. (2019). Data quality assessment for improved decision-making: A methodology for small and medium-sized enterprises. Procedia Manufacturing, 29, 583–591.
Ji, G. Z., & Singh, J. S. K. (2023). Digitalization and its impact on small and medium-sized enterprises (smes): An exploratory study of challenges and proposed solutions. International Journal of Business and Technology Management, 5 (4).
Johnson, S. J., Murty, M. R., & Navakanth, I. (2024). A detailed review on word embedding techniques with emphasis on word2vec. Multimedia Tools and Applications, 83(13), 37979–38007.
Lorena, A. C., Garcia, L. P. F., Lehmann, J., Souto, M. C. P., & Ho, T. K. (2019). How complex is your classification problem? a survey on measuring classification complexity. ACM Computing Surveys, 52 (5), 107:1–107:34.
Malkov, Y. A., & Yashunin, D. A. (2020). Efficient and robust approximate nearest neighbor search using hierarchical navigable small world graphs. IEEE Transactions on Pattern Analysis and Machine Intelligence, 42 (4), 824–836.
Miller, R., Chan, S. H. M., Whelan, H., & Gregório, J. (2025). A comparison of data quality frameworks: A review. Big Data and Cognitive Computing, 9(4), 93.
Navarro, G. (2001). A guided tour to approximate string matching. ACM Computing Surveys, 33 (1), 31–88.
Po, D. K. (2020). Similarity based information retrieval using levenshtein distance algorithm. International Journal of Advances in Scientific Research and Engineering, 6 (4), 6–10.
Reimers, N., & Gurevych, I. (2019). Sentence-bert: Sentence embeddings using siamese bert-networks. Proceedings of the 2019 Conference on Empirical Methods in Natural Language Processing and the 9th International Joint Conference on Natural Language Processing (EMNLP-IJCNLP), 3982–3992.
Shrestha, Y. R., Krishna, V., & von Krogh, G. (2021). Augmenting organizational decision-making with deep learning algorithms: Principles, promises, and challenges. Journal of Business Research, 123, 588–603.
Simard, V., Rönnqvist, M., Lebel, L., & Lehoux, N. (2019). A general framework for data uncertainty and quality classification. IFAC-PapersOnLine, 52(13), 277–282.
Unterkalmsteiner, M., & Abdeen, W. (2023). A compendium and evaluation of taxonomy quality attributes. Expert Systems, 40(1), e13098.
van de Velden, M., D’Enza, A. I., Markos, A., & Cavicchia, C. (2024). A general framework for implementing distances for categorical variables. Pattern Recognition, 153, 110547.
van der Goot, R., & van Noord, G. (2017). Monoise: Modeling noise using a modular normalization system. arXiv preprint arXiv:1710.03476.
Wand, Y., & Wang, R. Y. (1996). Anchoring data quality dimensions in ontological foundations. Communications of the ACM, 39 (11), 86–95.
Wang, R. Y., & Strong, D. M. (1996). Beyond accuracy: What data quality means to data consumers. Journal of Management Information Systems, 12 (4), 5–33.
Xie, X., Liu, H., Hou, W., & Huang, H. (2023). A brief survey of vector databases. 2023 9th International Conference on Big Data and Information Analytics (BigDIA), 364–371.
Zhao, C., & Sahni, S. (2019). String correction using the damerau-levenshtein distance. BMC Bioinformatics, 20 (11), 277.
Descargas
Publicado
Número
Sección
Licencia
Derechos de autor 2026 Ricardo Raúl Palma, Mauro Anibal Benetti, Fabricio Orlando Sanchez Varretti

Esta obra está bajo una licencia internacional Creative Commons Atribución-NoComercial-CompartirIgual 4.0.
Acorde a estos términos, el material se puede compartir (copiar y redistribuir en cualquier medio o formato) y adaptar (remezclar, transformar y crear a partir del material otra obra), siempre que a) se cite la autoría y la fuente original de su publicación (revista y URL de la obra), b) no se use para fines comerciales y c) se mantengan los mismos términos de la licencia.














