RAG empresarial: qué es y cuándo tiene sentido usarlo
Cómo funciona la generación aumentada por recuperación, por qué resuelve el problema de que un modelo responda sobre documentos internos y en qué situaciones basta con un enfoque más simple.
Un modelo de lenguaje responde con base en lo que vio durante el entrenamiento. No conoce el manual interno de su empresa, la política de garantía que cambió el mes pasado ni el procedimiento que solo existe en un documento de la red.
RAG, sigla en inglés de generación aumentada por recuperación, es la técnica que resuelve esto. En lugar de esperar que el modelo sepa la respuesta, el sistema busca los fragmentos relevantes en los documentos de la empresa y se los entrega al modelo junto con la pregunta.
Este artículo explica cómo funciona en la práctica, dónde suele fallar el enfoque y cuándo una solución más simple resuelve el mismo problema con menos esfuerzo.
Cómo funciona, sin abstracciones
El proceso tiene dos fases. La primera ocurre antes de cualquier pregunta: los documentos de la empresa se dividen en fragmentos, se convierten en representaciones numéricas y se almacenan de forma que permitan buscar por significado, no solo por palabra exacta.
La segunda ocurre con cada pregunta. El sistema convierte la pregunta de la misma forma, recupera los fragmentos más cercanos en significado y se los envía al modelo junto con la instrucción de responder solo con base en ese material.
La consecuencia más importante de este diseño es que la respuesta queda limitada a lo que se recuperó. Si no se encuentra el fragmento correcto, el modelo no tiene cómo acertar, y un sistema bien construido debe decir que no lo encontró, en lugar de improvisar.
La calidad depende más de la recuperación que del modelo
Es común atribuir una mala respuesta al modelo de lenguaje. En la mayoría de los casos de RAG que fallan, el problema está antes: los fragmentos entregados al modelo no contenían la información necesaria.
Esto ocurre por motivos muy concretos. Documentos divididos en partes que cortan una instrucción por la mitad. Términos internos que la búsqueda no asocia con lo que preguntó el usuario. Versiones antiguas y nuevas del mismo documento en la base, sin indicar cuál es la vigente. Planillas y tablas convertidas en texto corrido, que pierden la estructura que daba sentido a los números.
Por eso, trabajar la base documental suele rendir más que cambiar de modelo. Organizar, eliminar versiones obsoletas y marcar lo que está vigente tiene un efecto directo en la calidad de la respuesta.
Cuándo RAG no es la mejor respuesta
No toda pregunta sobre datos internos necesita esta arquitectura. Conviene considerar alternativas en algunos escenarios:
- La información está estructurada en una base de datos: consultarla directamente es más preciso y barato que recuperar texto sobre ella.
- El conjunto de documentos es pequeño y estable: puede caber completo en el contexto del modelo, sin necesidad de búsqueda.
- Las preguntas son repetitivas y previsibles: las respuestas predefinidas y bien redactadas resuelven con más confiabilidad.
- La respuesta exige cálculo o agregación: los modelos de lenguaje no son la herramienta adecuada para eso, y RAG no cambia esa limitación.
Qué hay que definir antes de empezar
Algunos puntos que, cuando se dejan para después, suelen causar retrabajo:
- Quién puede ver qué: si la base contiene documentos restringidos, el control de acceso debe aplicarse en la recuperación, no solo en la interfaz.
- Cómo se actualiza la base: los documentos cambian, y un sistema que responde con base en una versión derogada es peor que no responder.
- Qué hacer cuando no encuentra: la respuesta correcta es decir que no encontró la información, y eso debe ser explícito en el diseño.
- Si la respuesta cita la fuente: indicar el documento de origen permite que la persona verifique y cambia bastante la confianza en el sistema.
Cómo evaluar si está funcionando
Una impresión de calidad no es una evaluación. Lo mínimo viable es un conjunto de preguntas reales con las respuestas esperadas, definidas por quien conoce el tema, ejecutado periódicamente.
Conviene medir dos cosas por separado: si el sistema recuperó el fragmento correcto y si la respuesta generada es correcta. Separarlas indica dónde actuar: si la recuperación falla, cambiar el modelo no sirve de nada.
También conviene seguir con qué frecuencia el sistema dice que no sabe. Un índice muy bajo puede indicar que está improvisando cuando debería admitir que no tiene la información.
Preguntas frecuentes
- ¿Cuál es la diferencia entre RAG y entrenar un modelo con los datos de la empresa?
- RAG busca la información en el momento de la pregunta, por lo que refleja de inmediato los cambios en los documentos. Entrenar incorpora el conocimiento al modelo, exige repetir el proceso con cada actualización relevante y es considerablemente más caro. Para contenido que cambia, RAG suele ser la opción más adecuada.
- ¿Los documentos de la empresa quedan expuestos al usar RAG?
- Depende de la arquitectura elegida y de los contratos con el proveedor del modelo. El control de acceso debe aplicarse en la etapa de recuperación, para garantizar que cada usuario solo reciba fragmentos de documentos que ya podría leer. Esa definición debe formar parte del proyecto, no ser un ajuste posterior.
- ¿RAG elimina el riesgo de que el modelo invente información?
- Lo reduce de forma significativa, pero no lo elimina. El modelo puede interpretar mal un fragmento recuperado o rellenar vacíos. Por eso importan la instrucción explícita de responder solo con base en el material proporcionado, la cita de la fuente y la evaluación continua con casos reales.
¿Quiere evaluar esto en su operación?
Cuéntenos su contexto y sus objetivos. A partir de ellos, evaluamos dónde la inteligencia artificial tiene sentido en su caso.
Hablar con Fast Task