Diferencias entre RAG, CAG y MAG: cómo funcionan y cuándo usar cada arquitectura
CategoríaInteligencia Artificial

Diferencias entre RAG, CAG y MAG: cómo funcionan y cuándo usar cada arquitectura

Tiempo de lectura: 24 min
0
Diferencias entre RAG, CAG y MAG: cómo funcionan y cuándo usar cada arquitectura - 4F20F6F4 C5FC 477E B1B2 BF76A3021A70 1024x768

RAG (Retrieval-Augmented Generation), CAG (Cache-Augmented Generation) y MAG (Memory-Augmented Generation) resuelven necesidades distintas sobre la información que recibe un sistema de IA. RAG recupera conocimiento externo cuando llega una consulta. CAG precarga un corpus acotado y relativamente estable y reutiliza ese conocimiento sin ejecutar retrieval documental en cada petición. MAG incorpora memoria externa que se conserva, actualiza y recupera a lo largo del tiempo para aportar hechos anteriores, decisiones, preferencias, incidencias, compromisos o experiencia acumulada.

Diferencias entre RAG, CAG y MAG: cómo funcionan y cuándo usar cada arquitectura - FB93AFAA 0AA7 42A6 A826 49FBEBDB6F02 1024x768

Una empresa puede utilizar las tres dentro del mismo proceso. Un agente comercial puede trabajar sobre una guía estable precargada, recuperar mediante RAG el contrato vigente, recordar una objeción planteada meses atrás y consultar el precio actual directamente en el ERP. Si existe un límite de descuento, el código puede aplicarlo sin pedir al modelo que interprete una regla cerrada.

La decisión reside en la información: dónde está, quién tiene autoridad sobre ella, cuánto cambia, quién puede verla, durante cuánto tiempo sigue siendo válida y qué consecuencias tendría utilizar una versión antigua, incompleta o manipulada.

VariableRAGCAGMAG
Pregunta que resuelve¿Qué conocimiento externo necesitamos recuperar para esta consulta?¿Qué corpus acotado podemos precargar y reutilizar entre consultas?¿Qué información de la historia del sistema necesita conservar, actualizar y recuperar?
Fuente habitualDocumentos, contratos, políticas, wikis, repositorios y bases de conocimiento.Corpus previamente seleccionado, relativamente estable y suficientemente manejable para cargarlo completo.Interacciones, acontecimientos, decisiones, preferencias, incidencias, antecedentes y otros elementos de memoria externa.
Cuándo llega al modeloDurante la consulta, después de una fase de búsqueda y selección.El corpus se procesa previamente y su estado puede reutilizarse entre consultas.La memoria se conserva y modifica a lo largo del tiempo y se recupera cuando aporta información a una ejecución posterior.
Encaje habitualColecciones extensas o cambiantes donde interesa seleccionar evidencia y conservar su procedencia.Corpus acotados utilizados repetidamente, con cambios poco frecuentes y una invalidación controlable.Procesos cuya continuidad depende de información procedente de sesiones o ejecuciones anteriores.
ActualizaciónDocumentos, índices, fragmentos, metadatos y versiones deben permanecer sincronizados.El corpus precargado y su caché deben reconstruirse o invalidarse cuando el contenido deja de ser vigente.Los recuerdos necesitan políticas para añadir, corregir, consolidar, caducar o eliminar información.
Riesgo característicoRecuperar evidencia irrelevante, incompleta, antigua o manipulada.Trabajar con un corpus caducado, demasiado grande o incompatible con los permisos de la consulta.Persistir errores, inferencias débiles, información sensible o recuerdos cuya vigencia terminó.
Qué debería resolverse por otra víaDatos vivos cuya fuente oficial puede consultarse directamente.Información muy volátil, corpus enormes o conjuntos que requieren permisos granulares difíciles de precargar como una unidad.Datos actuales que ya poseen una fuente corporativa autorizada y verificable.

Índice de contenidos

Por qué las diferencias entre RAG, CAG y MAG son importantes

Pensemos en una empresa industrial que quiere construir un agente interno para sus comerciales. Antes de una reunión, el sistema prepara la cuenta, responde preguntas sobre producto, consulta documentación, revisa condiciones pactadas y ayuda a preparar una oferta.

Para hacerlo puede necesitar una guía de ventas, catálogo, fichas técnicas, contratos firmados, políticas vigentes, conversaciones anteriores, objeciones, compromisos, precios, existencias, pedidos, facturas, límites de descuento y los permisos del usuario que solicita la información.

Todo ello puede terminar formando parte del contexto entregado al modelo. Arquitectónicamente pertenece a dominios diferentes.

El contrato existe como documento y tiene una versión firmada. La guía comercial puede permanecer estable durante meses. «Volveremos a estudiar la propuesta en septiembre» nació durante una conversación concreta. El precio actual pertenece al ERP o al servicio de pricing. El stock pertenece al ERP o al WMS. El límite de descuento pertenece a una regla. El acceso a la cuenta depende del sistema de identidad.

Copiar indiscriminadamente todo a una base vectorial simplifica el dibujo técnico y empobrece la arquitectura. Acaba tratando de forma parecida una cláusula contractual, una impresión del comercial y un precio que puede cambiar esta tarde.

Esta separación entre datos, conocimiento, memoria, modelos y herramientas forma parte de la arquitectura de IA en la empresa. El modelo recibe información procedente de varias capas; convertirlas todas en «contexto» en el último paso no elimina las diferencias que existen entre ellas.

El Máster en Agentes IA y Automatización No-Code trabaja precisamente con arquitecturas que conectan bases de datos, agentes y flujos de trabajo y dedica una asignatura a arquitectura de datos y memoria del agente. Esa combinación refleja bien el tipo de decisiones que aparecen en un sistema empresarial real.

Primera diferencia: dónde vive la información y qué fuente tiene autoridad

RAG nació para combinar la memoria paramétrica de un modelo con conocimiento externo recuperable. El trabajo de Patrick Lewis y sus coautores de 2020 utilizó un índice denso de Wikipedia y un recuperador neuronal. La práctica posterior ha ampliado mucho aquella arquitectura, aunque mantiene la operación que le da sentido: buscar fuera del modelo y seleccionar información pertinente antes de generar la respuesta.

Un RAG empresarial puede utilizar embeddings, búsqueda léxica, búsqueda híbrida, filtros por metadatos, grafos o reranking. Fragmentar documentos y almacenarlos en una base vectorial es una implementación frecuente. RAG abarca un patrón de recuperación bastante más amplio.

La formulación original puede consultarse en Retrieval-Augmented Generation for Knowledge-Intensive NLP Tasks.

CAG, Cache-Augmented Generation, parte de otra distribución del conocimiento. Brian J. Chan, Chao-Ting Chen, Jui-Hung Cheng y Hen-Hsen Huang proponen precargar todos los recursos relevantes cuando forman un conjunto limitado y manejable y reutilizar el KV cache calculado sobre ese corpus. La consulta posterior trabaja con el conocimiento ya cargado y prescinde del retrieval en tiempo de consulta.

MAG incorpora una memoria externa cuya información puede proceder de interacciones, observaciones, episodios anteriores o datos incorporados al historial del sistema. El agente puede conservar una preferencia, registrar una incidencia, mantener una decisión, recordar un compromiso o utilizar antecedentes que condicionen tareas futuras.

La ubicación física de los datos apenas responde a una parte de la arquitectura. Falta decidir qué fuente ostenta autoridad cuando varias hablan sobre el mismo asunto.

InformaciónFuente de registro o autoridadPapel posible del contexto, RAG o memoria
Precio vigenteERP o servicio oficial de pricingRAG o memoria pueden aportar condiciones y antecedentes, pero el valor actual debe consultarse en la fuente autorizada.
StockERP / WMSLa documentación puede explicar reglas logísticas; la disponibilidad actual procede del sistema operativo.
Propiedades maestras de una cuentaCRM o sistema maestro correspondienteLa memoria puede añadir contexto relacional sin sustituir silenciosamente el dato maestro.
Contrato vigenteRepositorio contractualRAG puede localizar cláusulas y conservar la referencia al documento autorizado.
PermisosIAM / sistema de identidad y autorizaciónEl control debe aplicarse antes de recuperar o entregar información al modelo.
Objeción expresada en una reuniónRegistro verificable de la interacciónLa memoria puede conservar el episodio, su fecha y su relación con la cuenta.

Supongamos que el ERP devuelve un precio de 420 euros y una nota comercial de hace dos semanas habla de 395. Entregar ambos valores al LLM y pedirle que decida introduce una ambigüedad que la arquitectura podía haber resuelto antes. Si el ERP gobierna el precio vigente, la nota sirve como antecedente; carece de autoridad para desplazar el valor actual.

También pueden discrepar dos fuentes con autoridad legítima. En ese caso hace falta una política explícita: prioridad entre sistemas, bloqueo de la operación, conciliación o revisión humana. La discrepancia debe permanecer visible. Resolverla dentro de la generación convertiría un problema de integridad de datos en una elección probabilística.

Estas decisiones pertenecen tanto a IA como a arquitectura de datos. El Máster en Data Science: Big Data e Inteligencia Artificial incluye bases de datos relacionales y NoSQL, SQL, sistemas de almacenamiento, Data Warehouse, APIs y arquitecturas distribuidas, tecnologías directamente relacionadas con la capa donde viven muchas de estas fuentes.

Segunda diferencia: cuándo llega la información al modelo

RAG incorpora una fase selectiva en la ejecución. Llega la consulta, el sistema busca candidatos, aplica filtros y puede reordenarlos antes de construir el contexto final.

La respuesta depende, por tanto, de lo ocurrido antes de generar una sola palabra. Un chunk puede separar una cláusula de su excepción. Un filtro puede excluir el documento correcto. La búsqueda semántica puede recuperar un texto parecido y relegar la evidencia exacta. Un reranker puede ordenar mal los resultados.

El modelo razona sobre el material que consigue atravesar esa cadena.

CAG mueve parte de ese trabajo a una fase anterior. En el diseño descrito por Chan y sus coautores, el corpus se precarga y se reutiliza su KV cache. El paper de Cache-Augmented Generation trabaja expresamente con bases de conocimiento de tamaño limitado y manejable. Sus experimentos muestran resultados competitivos frente a determinadas configuraciones RAG bajo las condiciones evaluadas; esa evidencia permite identificar escenarios interesantes para CAG, no establecer una superioridad general.

MAG extiende el ciclo temporal. La aplicación decide primero qué información merece sobrevivir a la ejecución actual. Cuando transcurren días o meses, debe localizar qué recuerdos siguen siendo pertinentes para una tarea nueva.

Guardar «el cliente prefiere recibir presupuestos en Excel» puede ahorrar fricción durante años. Conservar cada saludo, cada reformulación y cada detalle incidental de sus reuniones genera una colección enorme cuyo valor decrece rápidamente.

En sistemas que ejecutan procesos de varias fases, memoria, contexto y herramientas forman parte del estado operativo del agente. El Máster en Agentes IA y Automatización No-Code incluye fundamentos de RAG, memoria y contexto, además de arquitecturas multi-herramienta y tool calling; son precisamente las piezas que intervienen cuando la información debe llegar al modelo por rutas diferentes.

La arquitectura a prueba

Diferencias entre RAG, CAG y MAG: cómo funcionan y cuándo usar cada arquitectura - 97C4A139 7445 4B06 A898 96D1084D58D7 1024x768

Los ejemplos estáticos esconden una parte sustancial del trabajo. En producción aparecen nuevas versiones de documentos, responsables que cambian, permisos revocados, catálogos sustituidos y recuerdos que dejan de describir la situación actual.

RAG: recuperar la versión correcta

Legal modifica una política de devoluciones. El nuevo PDF entra en el repositorio, pero el índice todavía contiene fragmentos de la versión anterior. Quizá otra copia permanezca alojada en una carpeta distinta. Ante una consulta, las dos versiones pueden ser semánticamente relevantes.

Un RAG bien gobernado necesita metadatos de versión, fecha, procedencia y vigencia. Para determinados procesos también deberá conservar qué documento respaldó cada respuesta.

La procedencia pierde valor si la aplicación cita un documento antiguo con impecable precisión. Recuperar correctamente la fuente equivocada sigue siendo un error.

CAG: invalidar forma parte del diseño

CAG funciona sobre conocimiento precargado. Cuando ese conocimiento cambia, el estado reutilizable debe dejar de representar la versión anterior.

Una guía comercial que se actualiza dos veces al año resulta relativamente sencilla de invalidar. La misma solución puede perder atractivo si acaba dividida en veinte mercados, cambia a diario o incorpora permisos diferentes por región.

También puede crecer hasta romper el supuesto inicial. Un corpus de unas decenas de páginas puede convertirse en una biblioteca de miles. El modelo sigue disponiendo de contexto; la conveniencia de cargarlo entero ha cambiado.

MAG: recordar que algo fue cierto no significa que siga siéndolo

«Ana dirige Finanzas» puede ser correcto en febrero. En agosto, Carlos ocupa ese puesto. Eliminar el primer dato borra historia. Conservar ambos sin temporalidad genera contradicción.

Las preferencias presentan el mismo problema. Durante una negociación, un cliente pide que no le enviemos propuestas sobre una determinada línea. Meses después cambia el interlocutor y la nueva responsable solicita información sobre ella. El episodio anterior sigue siendo parte de la relación; ya no representa necesariamente una preferencia vigente.

La memoria necesita operaciones de mantenimiento. Memory-R1, publicado en ACL 2026, formaliza un gestor de memoria capaz de aprender operaciones como ADD, UPDATE, DELETE y NOOP. La investigación confirma una intuición práctica: persistencia no puede equivaler a acumulación indefinida.

En la guía de IEBS sobre memoria para agentes de IA desarrollamos con mayor detalle esta necesidad de asociar a cada recuerdo fecha, fuente, contexto, vigencia y nivel de confianza.

El Máster en Inteligencia Artificial reúne RAG, memoria, contexto y gobernanza dentro del mismo recorrido, una combinación especialmente pertinente cuando el sistema debe mantener conocimiento actualizado y distinguir qué información continúa siendo válida.

RAG frente a CAG: recuperar documentos o precargar un corpus

RAG resulta razonable cuando la selección reduce mucho el universo de información. Una empresa puede disponer de 300.000 expedientes técnicos y necesitar tres para resolver una incidencia concreta. Recuperarlos por producto, versión, fecha y similitud evita cargar una colección que apenas guarda relación con la petición.

La recuperación también aporta valor cuando los documentos cambian con frecuencia, existen permisos a nivel de elemento o necesitamos preservar la evidencia concreta utilizada.

CAG merece una prueba cuando casi todas las consultas trabajan sobre el mismo conjunto, el corpus cabe con margen dentro de la capacidad disponible, cambia poco y podemos invalidarlo de forma controlada.

Un manual de producto relativamente breve, idéntico para miles de consultas y actualizado de manera esporádica se acerca al escenario estudiado por CAG. Una biblioteca contractual extensa y cambiante se acerca mucho menos.

Las combinaciones también tienen sentido. Un núcleo estable puede utilizar CAG mientras la documentación extensa o reciente llega mediante retrieval.

CAG, contexto largo y prompt caching describen capas diferentes

Las tres ideas suelen mezclarse y esa mezcla acaba produciendo recomendaciones imprecisas.

Long context describe cuánto contenido puede procesar un modelo dentro de su ventana. Una capacidad mayor permite considerar arquitecturas que antes resultaban inviables. Sigue siendo necesario decidir qué información entra, con qué permisos, qué versión tiene validez y qué coste introduce.

Prompt caching o context caching son capacidades de infraestructura para reutilizar cómputo asociado a entradas repetidas. OpenAI documenta su mecanismo específico de prompt caching; Anthropic ofrece prompt caching automático y mediante puntos de caché explícitos; Google mantiene context caching implícito y explícito en Gemini, según la API utilizada.

CAG, en el trabajo de Chan y sus coautores, convierte el corpus precargado y su KV cache en la fuente de conocimiento utilizada por las consultas, evitando retrieval en tiempo real.

  • Una aplicación RAG puede beneficiarse de prompt caching y seguir siendo RAG.
  • Una aplicación puede incluir contenido estable en el prompt y reutilizarlo sin implementar necesariamente la arquitectura CAG propuesta en el paper.
  • Una ventana extensa facilita cargar más conocimiento; por sí misma no resuelve actualización, selección, permisos, procedencia ni economía de la aplicación.

Por tanto, todo CAG trabaja con conocimiento preparado, mientras que contexto preparado es una categoría bastante más amplia que CAG.

El Máster en Inteligencia Artificial incluye dentro de su plan fundamentos de RAG, memoria y contexto, arquitecturas multi-herramienta y tool calling. La proximidad de estos contenidos refleja una realidad de ingeniería: las fronteras se entienden mejor observando el sistema completo.

RAG frente a MAG: documentación y experiencia tienen ciclos distintos

Un manual comercial existía antes de que el agente comenzase a trabajar. La objeción que un cliente plantea durante una reunión aparece como consecuencia de la relación.

Ambas piezas pueden almacenarse en PostgreSQL, un vector store o un grafo. Incluso pueden recuperarse mediante técnicas semánticas parecidas. El parecido de la infraestructura no convierte sus ciclos de vida en equivalentes.

El manual tiene versión, editor y fecha de publicación. La objeción pertenece a una persona, una conversación y un momento. Puede ser decisiva durante la siguiente reunión y completamente irrelevante un año después.

RAG encaja con preguntas como «¿qué establece la política vigente?» o «¿qué especificación corresponde a este producto?». La memoria permite responder «¿qué ocurrió la última vez que negociamos con esta cuenta?» o «¿qué compromiso continúa pendiente?».

MAG, Memory-Augmented Generation, sirve como denominación para sistemas que amplían la generación con memoria externa, aunque la etiqueta tiene menos estabilización que RAG. En proyectos e investigación aparecen también expresiones como agentic memory, long-term memory, persistent memory, episodic memory o semantic memory.

MAGMA, publicado en ACL 2026, ofrece un ejemplo especialmente interesante: representa los elementos de memoria mediante relaciones semánticas, temporales, causales y de entidad y utiliza esas estructuras durante la recuperación. Su diseño muestra por qué una colección monolítica de recuerdos recuperados únicamente por similitud puede perder información importante sobre tiempo y relaciones.

Un recuerdo debe conservar también qué clase de conocimiento contiene

«El cliente rechazó la propuesta» y «el cliente parece sensible al precio» caben perfectamente como texto en la misma base. Su valor probatorio es muy diferente.

Tipo de memoriaEjemploTratamiento razonable
Hecho observado«El cliente rechazó la propuesta el 14 de mayo».Conservar evento, fecha y evidencia original.
Dato importado«El saldo pendiente era de 18.400 € el 3 de junio».Registrar fuente y fecha. Si una decisión depende del saldo actual, volver a consultar el sistema que lo gobierna.
Preferencia declarada«Prefiero recibir las propuestas en Excel».Conservar quién la declaró, cuándo y en qué contexto. Revisar su vigencia cuando afecte a una decisión relevante.
Inferencia del modelo«El cliente parece sensible al precio».Marcarla como inferencia, conservar evidencia y limitar la confianza que puede heredar en ejecuciones futuras.
Resumen generado«La negociación se frenó por plazo y presupuesto».Mantener relación con los episodios resumidos y regenerarlo si cambia la evidencia subyacente.

Guardar estas categorías como texto indiferenciado provoca una degradación difícil de detectar. Una inferencia plausible puede regresar meses después convertida de hecho en una premisa si el sistema perdió su procedencia.

Una memoria empresarial debería poder responder internamente quién originó cada elemento, qué evidencia lo sostiene, cuándo se creó, cuándo se actualizó y qué nivel de autoridad posee.

El Máster en Agentes IA y Automatización No-Code incluye arquitectura de datos y memoria del agente y dedica otra asignatura a RAG, memoria y contexto. Esa relación permite estudiar precisamente cómo persiste la información entre ejecuciones y cómo vuelve después al agente.

RAG, CAG, MAG, APIs y código pueden convivir dentro del mismo proceso

Volvamos al agente comercial y preparemos una oferta para una cuenta estratégica.

La guía de ventas y el catálogo base cambian poco y los utiliza prácticamente todo el equipo. Si forman un corpus suficientemente acotado y cumplen las condiciones anteriores, CAG merece una evaluación.

El contrato vigente tiene 120 páginas, anexos y versiones históricas. El repositorio contiene miles de contratos de otros clientes. RAG puede recuperar las cláusulas pertinentes aplicando filtros por cuenta, tipo de documento y vigencia.

Durante los últimos meses el cliente planteó varias objeciones y el comercial adquirió dos compromisos. Esos episodios pueden persistir en memoria con fecha, procedencia y estado.

El precio, el stock y las facturas proceden del ERP. El límite de descuento se ejecuta como regla. El IAM autoriza o deniega la consulta de esa cuenta.

InformaciónAutoridadVía adecuadaRiesgo de elegir mal
Guía comercial estableDocumentación corporativaCAG si cumple sus condiciones; en otros diseños, contexto directo o reutilizadoMantener una versión antigua o llamar CAG a cualquier prompt largo y estable.
Contrato vigenteRepositorio contractualRAG con versionado y procedenciaRecuperar un contrato sustituido o una cláusula separada de su excepción.
Objeciones y compromisos anterioresRegistro de interaccionesMemoria / MAGTransformar un episodio antiguo en una regla permanente.
PrecioERP / pricingAPIUtilizar un precio recordado, cacheado o indexado que ha perdido vigencia.
StockERP / WMSAPIPrometer una disponibilidad que ya no existe.
Ventas acumuladasData Warehouse / sistema analíticoSQL o capa analíticaPedir al modelo que calcule sobre una muestra incompleta.
Límite de descuentoPolítica comercial formalCódigo / motor de reglasConvertir una restricción determinista en una interpretación probabilística.
PermisosIAMAutorización previa a retrieval, memoria y llamadas a herramientasEntregar información correcta a una persona que carece de acceso.

Esta composición enlaza con los casos de uso y ejemplos prácticos de inteligencia artificial en empresas: un proceso real acaba combinando generación, documentación, datos estructurados, herramientas y reglas en proporciones distintas.

La información recuperada también puede atacar al sistema

Retrieval amplía la superficie de entrada del modelo. Un documento, correo, página web o registro externo puede contener instrucciones dirigidas al LLM en lugar de limitarse a aportar datos.

OWASP incluye la prompt injection indirecta entre los riesgos principales de las aplicaciones con modelos de lenguaje y describe explícitamente el caso de contenido malicioso introducido mediante fuentes externas.

La investigación ya ha llevado el problema a sistemas RAG reales. Overcoming the Retrieval Barrier, presentado en USENIX Security 2026, estudia cómo conseguir que fragmentos adversariales entren efectivamente en los resultados recuperados y demuestra ataques de inyección indirecta en sistemas RAG y agénticos.

La memoria añade persistencia al riesgo. Un agente puede leer hoy contenido manipulado, convertir parte de él en un recuerdo y recuperarlo semanas después. El preprint Hidden in Memory: Sleeper Memory Poisoning in LLM Agents estudia precisamente ataques donde contexto adversarial induce memorias falsas que se activan en conversaciones futuras.

La arquitectura debería distinguir contenido confiable de contenido externo, limitar qué puede escribir memoria, conservar procedencia y aplicar permisos antes de que la información llegue al modelo. En entornos multiusuario o multitenant, retrieval, caché y memoria necesitan respetar el aislamiento entre ámbitos.

El Máster en Inteligencia Artificial incluye una asignatura específica de Ética, Seguridad y Privacidad y trabaja implantación, seguridad y gobernanza de sistemas de IA; una relación directa con los controles que requiere esta capa de contexto.

Cuándo RAG, CAG y MAG complican algo que podía resolverse de forma más simple

Una parte de las arquitecturas innecesariamente complejas nace cuando cualquier necesidad de información se traduce automáticamente en «dar contexto al modelo».

Un documento de veinte páginas que llega con una tarea puntual puede entregarse directamente. Persistirlo, fragmentarlo e indexarlo tiene sentido cuando existe reutilización o alguna necesidad adicional que lo justifique.

El stock de este momento pertenece al sistema de inventario. Una llamada autorizada mantiene el dato unido a su fuente.

Las ventas de ayer pueden calcularse mediante SQL. El modelo puede interpretar posteriormente la desviación, redactar un informe o comparar escenarios.

Una regla que impide superar cierto descuento sin doble aprobación debería vivir en código o en un motor de reglas.

Los permisos pertenecen al sistema de identidad.

Si una decisión depende de un dato exacto y actual, la fuente viva que gobierna ese dato tiene prioridad. RAG, CAG o memoria pueden aportar documentación, antecedentes o explicaciones alrededor del valor; carecen de motivo para sustituir al registro operativo cuando éste puede consultarse.

El Máster en Data Science: Big Data e Inteligencia Artificial incluye SQL, bases de datos, Data Warehouse y servicios web y APIs. Son precisamente las herramientas que permiten conservar determinadas operaciones en la capa estructurada en lugar de trasladarlas innecesariamente al LLM.

IEBS Context Decision Matrix: cómo decidir qué vía debe llevar la información al modelo

Una puntuación acumulativa serviría de poco. Hay condiciones que actúan como restricciones. Un sistema puede ser lento y seguir siendo obligatorio porque contiene el saldo oficial. CAG puede ser barato y quedar descartado si el corpus mezcla permisos incompatibles.

La IEBS Context Decision Matrix funciona como una secuencia de puertas. Cada una elimina caminos antes de comparar RAG, CAG y memoria.

OrdenPreguntaDecisiónSalida
1¿La tarea ejecuta una regla cuyo resultado está definido de antemano?La lógica no necesita interpretación generativa.Código / motor de reglas
2¿La respuesta depende del estado actual de un sistema que gobierna ese dato?El valor se consulta en origen; el modelo puede trabajar después con él.API / SQL / ERP / CRM / IAM
3¿La información llega con la tarea, tiene un tamaño manejable y su uso es puntual?Puede entregarse directamente al modelo.Contexto directo
4¿La información surgió durante interacciones o ejecuciones anteriores y debe influir en las futuras?Necesita persistencia, temporalidad, procedencia y política de actualización.Memoria / MAG
5¿El conocimiento existía previamente en un corpus externo?Hay que decidir si merece cargarse completo o seleccionarse por consulta.RAG o CAG

La salida CAG exige que coincidan varias condiciones

  • El corpus es suficientemente acotado para cargarse completo dentro del contexto disponible.
  • Gran parte de las consultas utiliza esencialmente ese mismo corpus.
  • El contenido cambia con una frecuencia que permite controlar su invalidación.
  • Los permisos permiten utilizar el corpus precargado sin exponer información indebida.
  • La trazabilidad exigida puede mantenerse sin retrieval por consulta.
  • Las pruebas muestran una ventaja real de calidad, latencia, coste o simplicidad frente a las alternativas.

Cuando estas condiciones dejan de cumplirse, RAG o una combinación de ambos patrones suele ofrecer mayor flexibilidad.

La salida RAG aparece cuando seleccionar aporta valor

  • El corpus completo resulta demasiado grande o costoso para mantenerlo cargado.
  • Cada consulta utiliza una fracción pequeña de la colección.
  • Los documentos se incorporan o cambian con frecuencia.
  • La aplicación necesita identificar la evidencia empleada.
  • Los permisos deben aplicarse por documento, entidad, repositorio o usuario.
  • Reducir el corpus antes de generar disminuye ruido y coste.

La salida memoria necesita tres decisiones adicionales

DecisiónPregunta
Escritura¿Este hecho, preferencia, episodio, inferencia o resumen merece sobrevivir a la ejecución actual?
Vigencia¿Cuándo debería actualizarse, caducar, sustituirse o eliminarse?
Autoridad¿Puede utilizarse directamente o debe comprobarse de nuevo contra un sistema de registro antes de decidir?

La matriz puede producir varias salidas para una misma aplicación. El agente comercial del ejemplo utiliza CAG para un núcleo estable si las pruebas lo justifican, RAG para documentación extensa, memoria para antecedentes, APIs para datos vivos y código para restricciones deterministas.

El plan de estudios del Máster en Agentes IA y Automatización No-Code reúne memoria del agente, APIs, condicionales, RAG, contexto y orquestación multi-herramienta. Es un buen ejemplo de por qué estas decisiones terminan encontrándose dentro del mismo proceso.

Qué probar antes de llevar RAG, CAG o MAG a producción

Una evaluación útil necesita reproducir las condiciones bajo las que la aplicación fallará cuando empiece a trabajar con información real.

1. Retrieval: ¿entra la evidencia correcta?

En RAG interesa medir si los documentos o fragmentos necesarios aparecen entre los resultados recuperados. Recall y precisión ayudan a distinguir un fallo de búsqueda de uno ocurrido durante la generación.

Las pruebas deberían incluir preguntas cuya respuesta existe, preguntas sin respuesta, documentos casi duplicados, versiones antiguas, fuentes contradictorias y consultas que exijan filtros por usuario o entidad.

2. Groundedness: ¿la respuesta respeta la evidencia?

Encontrar el documento correcto tampoco garantiza una respuesta fiel. El modelo puede añadir una conclusión que el texto recuperado no sostiene.

RAGAS separa dimensiones relacionadas con recuperación y fidelidad de la generación. Por su parte, un estudio sobre groundedness publicado en Findings of NAACL 2024 encontró respuestas con frases no fundamentadas en los documentos recuperados incluso cuando contenían la respuesta correcta.

3. Procedencia y citas: ¿la fuente respalda realmente la afirmación?

Mostrar enlaces o referencias produce una apariencia de trazabilidad que puede ser falsa. La cita correcta debe sostener la afirmación concreta.

Correctness is not Faithfulness in RAG Attributions distingue entre que una cita sea compatible con una afirmación y que exista una atribución fiel al proceso real utilizado por el modelo. En una aplicación sensible merece evaluar ambas.

4. Vigencia: ¿gana la versión actual?

El conjunto de pruebas debería introducir deliberadamente un documento vigente junto a una edición sustituida, un dato antiguo en una nota frente al actual del ERP, recuerdos contradictorios con fechas distintas y preferencias posteriormente revocadas.

La salida esperada depende de las reglas de autoridad y vigencia definidas antes de la generación.

5. Permisos: ¿dos usuarios reciben únicamente lo que pueden consultar?

Dos personas pueden formular exactamente la misma pregunta y tener derecho a información diferente. Los tests deben cubrir roles, clientes, departamentos y tenants separados, incluidos intentos de recuperar contenido situado fuera del ámbito autorizado.

La autorización debe producirse antes de entregar el material al modelo.

6. Seguridad: ¿el sistema distingue información de instrucciones hostiles?

Un corpus de prueba debería contener documentos con prompt injection indirecta. En sistemas con memoria, merece comprobar si contenido poco fiable puede generar un recuerdo persistente o modificar uno ya existente.

También hay que impedir que una inferencia del modelo adquiera automáticamente el mismo rango que un hecho verificado.

7. Fuentes vivas: ¿qué ocurre cuando desaparecen?

El ERP dejará de responder alguna vez. La aplicación necesita una conducta definida: detener la operación, declarar que el dato no está disponible o utilizar, cuando el proceso lo permita, un último valor conocido acompañado de su fecha.

Continuar la conversación inventando una cifra transforma una caída de infraestructura en un error de negocio.

8. Coste y latencia: medir el recorrido completo

RAG añade retrieval, filtros y quizá reranking. CAG procesa un corpus más amplio y puede aprovechar reutilización del estado. MAG incorpora lectura y escritura de memoria. Las herramientas externas añaden sus propios tiempos.

Las comparaciones deben medir la tarea completa con tráfico representativo: calidad, tiempo hasta respuesta, tokens, cache hits, llamadas externas, almacenamiento, mantenimiento y coste por ejecución correcta.

La observabilidad de agentes de IA permite reconstruir qué documentos, recuerdos, herramientas, prompts y modelos participaron en una ejecución. Sin esa traza sabemos que una respuesta falló; resulta mucho más difícil localizar el punto donde empezó el error.

El Máster en Inteligencia Artificial incluye RAG, memoria, contexto, arquitecturas multi-herramienta y una asignatura de seguridad y gobernanza. Son competencias directamente relacionadas con la evaluación de estos sistemas como conjunto.

Qué debería construir primero una empresa

Empezaría por un proceso delimitado que ya tenga responsable y una forma razonable de medir si funciona.

Después anotaría toda la información que utiliza hoy una persona competente para resolverlo. Para cada pieza registraría su fuente, quién tiene autoridad sobre ella, cuánto ocupa, con qué frecuencia cambia, quién puede consultarla y cuánto tiempo sigue siendo válida.

Ese inventario suele ordenar la arquitectura con bastante rapidez.

  • Una regla cerrada va a código.
  • Un dato vivo vuelve a su sistema de registro.
  • Un documento pequeño y puntual puede viajar en contexto directo.
  • Una colección extensa y selectiva puede justificar RAG.
  • Un corpus estable, completo y repetido puede someterse a una prueba CAG.
  • La experiencia nacida durante el proceso puede requerir memoria.

La primera versión debería incorporar únicamente las capas que mejoran el proceso de forma comprobable. Después llegan las pruebas incómodas: documentos viejos, fuentes contradictorias, permisos diferentes, corpus contaminado, recuerdos falsos y sistemas externos que dejan de responder.

Este recorrido, desde el proceso y las fuentes hasta la conexión con datos, memoria y herramientas, es también el tipo de arquitectura que desarrolla el Máster en Agentes IA y Automatización No-Code cuando trabaja sobre agentes conectados con sistemas y flujos empresariales.

RAG, CAG y MAG son nombres útiles para tres patrones distintos. La decisión empresarial empieza antes, cuando identificamos qué información sostiene una respuesta, quién responde por ella y qué camino permite entregarla al modelo sin perder vigencia, autoridad o control.

FAQ's del artículo

Susana López Blanco

Co-Founder & CEO en IEBS Biztech School | Digitalent Group | Business Angel Leer más

Deja una respuesta

Síguenos en las redes