- Problema
- El aymara tiene solo unos pocos cientos de miles de palabras digitalizadas frente a miles de millones en español, quedando fuera de la mayoría de herramientas de lenguaje que se construyen hoy.
- Solución
- Un sistema medido de búsqueda y respuesta de preguntas sobre la Wikipedia en aymara, con un benchmark público, experimentos fallidos documentados y un pipeline de validación que requiere revisión humana.
- Mi rol
- Líder de investigación e ingeniero
- Resultado
- De 1/10 a 7/10 de precisión de recuperación en seis iteraciones documentadas, con un sitio público y un pipeline reproducible.
Resumen
YAIS Aymara Research documenta el intento de construir un sistema de búsqueda y respuesta de preguntas para el aymara, midiendo cada paso y publicando los fracasos junto con los avances.
Problema
Las lenguas de bajos recursos quedan fuera de la mayoría de sistemas de PLN porque los datos son escasos. Para el aymara, el riesgo no es solo bajo rendimiento, sino respuestas alucinadas presentadas como hechos.
Mi rol
Líder de investigación e ingeniero. Diseñé el benchmark, ejecuté los experimentos, construí el sitio público y escribí el pipeline reproducible.
Solución
Un pipeline de recuperación sobre 5.469 artículos de Wikipedia en aymara con un benchmark propio de 30 preguntas — 10 respondibles y 20 diseñadas para probar la abstención — más un sitio de investigación público exportado desde un vault de Obsidian.
Enfoque técnico
Pipelines en Python con sentence-transformers, LaBSE, NLLB-200, FAISS y BM25; afinado en GPU gratuita de Kaggle; 63 pruebas automatizadas; y un sitio en TanStack Start con Recharts para las notas publicadas.
Desafíos
El cuello de botella real no es la computación sino los validadores: hablantes nativos que puedan revisar los datos generados por máquina antes de que entren al conjunto de entrenamiento.
Resultados
La precisión de recuperación pasó de 1/10 a 7/10 en el benchmark propio. La lección clave: entrenar con el objetivo equivocado mejoró la métrica propia del modelo un 37 % mientras destruía el rendimiento en la tarea real.
Lo que aprendí
Que la alineación entre el objetivo de entrenamiento y la tarea real importa más que los hiperparámetros, y que los resultados negativos deben publicarse si el campo quiere avanzar con responsabilidad.
Tecnologías
- Python
- sentence-transformers
- LaBSE
- NLLB-200
- FAISS
- BM25
- TanStack Start
- Recharts