

El académico de la Escuela de Fonoaudiología de la Universidad Austral de Chile, Dr. Patricio Vergara Ponce, participó como integrante del Cross-linguistic POS Tagging Consortium, iniciativa que reunió a 105 lingüistas de 42 países para evaluar herramientas de procesamiento automático del lenguaje en 58 variedades lingüísticas.
La investigación fue liderada por Loretta Gasparini, de The University of Melbourne, Australia, y dio origen al artículo “Automated parts-of-speech tagging in 52 language varieties: Benchmarking towards establishing suitability for multilingual clinical language analysis”, publicado recientemente en Natural Language Processing Journal.
Evaluar cómo la inteligencia artificial analiza distintas lenguas
El estudio se centró en evaluar sistemas automatizados capaces de identificar categorías gramaticales dentro de un texto, como sustantivos, verbos, adjetivos y pronombres. Para determinar su precisión, los resultados de estas herramientas fueron comparados con anotaciones lingüísticas realizadas manualmente por especialistas.
Como material común se utilizaron distintas versiones lingüísticas de la fábula “El viento del norte y el sol”, un texto ampliamente utilizado en investigación lingüística. Los integrantes del consorcio revisaron o elaboraron las traducciones y realizaron el etiquetado utilizando el marco internacional Universal Dependencies (UD). Estas anotaciones fueron utilizadas posteriormente como referencia para evaluar el desempeño de los sistemas de procesamiento automático del lenguaje.
De esta manera, la investigación permitió observar cómo distintas herramientas responden frente a las características propias de cada lengua y variedad lingüística.
El español de Chile en la investigación
Uno de los aportes del trabajo fue incorporar cinco variedades del español: Argentina, Chile, Cuba, México y España. La participación del Dr. Vergara Ponce permitió incluir específicamente el español de Chile, contribuyendo con datos lingüísticos correspondientes a esta variedad.
En el caso del español de Chile, se evaluaron herramientas de procesamiento automático como Stanza, spaCy y FreeLing. El material utilizado correspondió a una traducción de la fábula desde el inglés, realizada por dos hablantes nativos de Chile.
Los resultados mostraron un 98,08% de coincidencia en la tokenización del español chileno, mientras que los modelos evaluados alcanzaron niveles de concordancia de entre 84,85% y 91,95% respecto de las anotaciones lingüísticas de referencia, dependiendo del sistema utilizado.
Para el Dr. Vergara Ponce, incorporar el español de Chile permitió aportar evidencia sobre el funcionamiento de estas herramientas en una variedad lingüística que cuenta con características propias.
“Participar en este consorcio fue una oportunidad para aportar datos del español de Chile a una evaluación que reúne distintas lenguas y variedades. Este tipo de trabajo permite identificar qué tan bien funcionan las herramientas disponibles y, al mismo tiempo, qué aspectos necesitamos seguir desarrollando para que puedan utilizarse de manera adecuada en nuestro contexto”, señaló el académico.
Implicancias para las ciencias del lenguaje y la fonoaudiología
El desarrollo de herramientas automatizadas de procesamiento del lenguaje natural puede facilitar el análisis de grandes cantidades de información lingüística y contribuir al desarrollo de nuevas metodologías para estudiar el lenguaje. En el ámbito de la fonoaudiología, estas tecnologías podrían tener aplicaciones en investigación, evaluación del lenguaje y análisis de muestras lingüísticas.
Uno de los principales hallazgos del trabajo es que los sistemas de inteligencia artificial no necesariamente presentan el mismo nivel de precisión al analizar diferentes lenguas o variedades. Por ello, los autores plantean la importancia de contar con datos lingüísticos confiablemente etiquetados y de continuar evaluando estas herramientas en distintos contextos lingüísticos.
Sin embargo, los resultados muestran que el desempeño de estos sistemas puede variar entre lenguas y variedades. Por esta razón, su utilización en investigación o contextos clínicos requiere contar con datos lingüísticos de referencia y procesos de evaluación que consideren las particularidades de cada comunidad.
Para las ciencias del lenguaje, esto plantea el desafío de avanzar en herramientas que incorporen una mayor diversidad lingüística y que hayan sido evaluadas con datos representativos de las variedades en las que serán utilizadas.
Participación de la UACh en una investigación internacional
El Cross-linguistic POS Tagging Consortium reunió a investigadores y lingüistas de diversas instituciones y países, para desarrollar una evaluación comparativa de herramientas de procesamiento automático del lenguaje.
En los materiales asociados a la investigación, el Dr. Patricio Vergara Ponce figura como integrante del consorcio, con afiliación a la Universidad Austral de Chile y vinculación al proyecto FONDECYT N.º 11230656, financiado por la Agencia Nacional de Investigación y Desarrollo (ANID).
La contribución del consorcio fue reconocida en el artículo en labores relacionadas con el análisis formal, además de la revisión y edición del manuscrito. En este marco, la participación del académico permitió incorporar información correspondiente al español de Chile a una investigación que reúne datos de distintas partes del mundo.
Artículo disponible en acceso abierto
El artículo se encuentra disponible en acceso abierto y puede ser consultado por investigadores, estudiantes y público interesado.
Leer el artículo completo:
https://doi.org/10.1016/j.nlp.2026.100226
Referencia:
Gasparini, L., Shaw, D., Kathiresan, T., Borysiewicz, D., Stuart, G. W., Cross-linguistic POS Tagging Consortium, & Vogel, A. P. (2026). Automated parts-of-speech tagging in 52 language varieties: Benchmarking towards establishing suitability for multilingual clinical language analysis. Natural Language Processing Journal, 16, 100226.