Investigación · PLN de bajos recursos

YAIS Aymara Research

Investigación abierta y reproducible en procesamiento de lenguaje natural para el aymara, una lengua hablada por cerca de dos millones de personas en Bolivia, Perú y Chile.

Proyectos y experimentos
Problema
El aymara tiene solo unos pocos cientos de miles de palabras digitalizadas frente a miles de millones en español, quedando fuera de la mayoría de herramientas de lenguaje que se construyen hoy.
Solución
Un sistema medido de búsqueda y respuesta de preguntas sobre la Wikipedia en aymara, con un benchmark público, experimentos fallidos documentados y un pipeline de validación que requiere revisión humana.
Mi rol
Líder de investigación e ingeniero
Resultado
De 1/10 a 7/10 de precisión de recuperación en seis iteraciones documentadas, con un sitio público y un pipeline reproducible.

Resumen

YAIS Aymara Research documenta el intento de construir un sistema de búsqueda y respuesta de preguntas para el aymara, midiendo cada paso y publicando los fracasos junto con los avances.

Problema

Las lenguas de bajos recursos quedan fuera de la mayoría de sistemas de PLN porque los datos son escasos. Para el aymara, el riesgo no es solo bajo rendimiento, sino respuestas alucinadas presentadas como hechos.

Mi rol

Líder de investigación e ingeniero. Diseñé el benchmark, ejecuté los experimentos, construí el sitio público y escribí el pipeline reproducible.

Solución

Un pipeline de recuperación sobre 5.469 artículos de Wikipedia en aymara con un benchmark propio de 30 preguntas — 10 respondibles y 20 diseñadas para probar la abstención — más un sitio de investigación público exportado desde un vault de Obsidian.

Enfoque técnico

Pipelines en Python con sentence-transformers, LaBSE, NLLB-200, FAISS y BM25; afinado en GPU gratuita de Kaggle; 63 pruebas automatizadas; y un sitio en TanStack Start con Recharts para las notas publicadas.

Desafíos

El cuello de botella real no es la computación sino los validadores: hablantes nativos que puedan revisar los datos generados por máquina antes de que entren al conjunto de entrenamiento.

Resultados

La precisión de recuperación pasó de 1/10 a 7/10 en el benchmark propio. La lección clave: entrenar con el objetivo equivocado mejoró la métrica propia del modelo un 37 % mientras destruía el rendimiento en la tarea real.

Lo que aprendí

Que la alineación entre el objetivo de entrenamiento y la tarea real importa más que los hiperparámetros, y que los resultados negativos deben publicarse si el campo quiere avanzar con responsabilidad.

Tecnologías

  • Python
  • sentence-transformers
  • LaBSE
  • NLLB-200
  • FAISS
  • BM25
  • TanStack Start
  • Recharts

¿Tienes un problema que resolver?

Estos proyectos empezaron como una restricción, un plazo o una pregunta sin respuesta. Si tienes una, me interesa escucharla.