Para compartir:

Memory Scaling: cómo Databricks demuestra que los agentes de IA mejoran al acumular memoria

Memory Scaling es uno de los conceptos más interesantes que han surgido en el ecosistema de agentes de IA en los últimos tiempos. Databricks acaba de publicar resultados experimentales que muestran cómo los agentes de IA pueden mejorar de forma consistente conforme acumulan memoria, y los números son bastante convincentes. 📊

Pero aquí está el punto que hace todo esto aún más fascinante: más memoria, por sí sola, no garantiza nada. Guardar muchas cosas no significa usar bien lo que se guardó, y ese es exactamente el desafío que Databricks decidió enfrentar de lleno con sus experimentos más recientes.

Durante mucho tiempo, el debate en torno a los AI Agents giró casi exclusivamente alrededor de modelos más potentes, prompts más inteligentes o mayor capacidad de razonamiento durante la inferencia. Lo que Databricks está proponiendo ahora es un eje diferente: ¿y si el agente mejorara simplemente con el uso? No por reentrenamiento, no por ajustes manuales, sino porque aprende de conversaciones reales, feedback de usuarios y contexto organizacional acumulado a lo largo del tiempo. 🤖

Es un cambio de enfoque importante, especialmente para quienes trabajan con IA en entornos corporativos, donde el conocimiento tácito es abundante y un único agente puede atender a cientos de personas con necesidades completamente diferentes. En los siguientes apartados, nos sumergimos en los experimentos, en los tipos de memoria que realmente importan, en la infraestructura necesaria y en lo que todo esto significa para el futuro de los agentes que ya usamos en el día a día.

Qué es Memory Scaling y por qué importa tanto

Memory Scaling es la propiedad de que el rendimiento de un agente de IA mejora a medida que su memoria externa crece. Aquí, memoria no se refiere a los pesos del modelo ni a la ventana de contexto actual, sino a un almacenamiento persistente de información que el agente puede consultar durante la inferencia. Piensa en esto como la diferencia entre alguien que necesita memorizar todo de cabeza y alguien que tiene un cuaderno de notas organizado y sabe exactamente dónde buscar cada dato.

Este concepto se posiciona como un eje complementario al parametric scaling, que básicamente consiste en entrenar modelos cada vez más grandes, y al inference-time scaling, que implica dar más tiempo y recursos al modelo para razonar durante la generación de respuestas. El Memory Scaling aborda lagunas de conocimiento de dominio y fundamentación que ni el tamaño del modelo ni la capacidad de razonamiento pueden llenar por sí solos.

Y los beneficios van más allá de la calidad de las respuestas. Cuando un agente ya tiene memorizados los esquemas relevantes, las reglas de dominio o las acciones exitosas de interacciones pasadas, puede saltarse exploraciones redundantes y resolver consultas más rápido. En los experimentos de Databricks, las mejoras aparecieron tanto en precisión como en eficiencia, lo cual es particularmente relevante para quienes se preocupan por los costos operativos de IA.

Cómo se diferencia del aprendizaje continuo

Una duda natural es: ¿esto no es lo mismo que continual learning? En realidad, no. El aprendizaje continuo se enfoca en actualizar los parámetros del modelo a lo largo del tiempo, lo cual funciona bien en escenarios limitados pero se vuelve computacionalmente costoso y frágil cuando hay muchos usuarios simultáneos, múltiples agentes y proyectos que cambian rápidamente.

El Memory Scaling plantea una pregunta diferente: ¿un agente con miles de usuarios rinde mejor que uno con un único usuario? Al expandir el estado externo compartido del agente mientras se mantienen los pesos del LLM congelados, la respuesta puede ser sí. Un patrón de workflow aprendido con un usuario puede recuperarse y aplicarse para otro de inmediato, sin ningún reentrenamiento. Esa es una propiedad que el aprendizaje continuo, enfocado en actualizaciones de parámetros para un único usuario, simplemente no fue diseñado para ofrecer.

Cómo se diferencia del contexto largo

Las ventanas de contexto grandes pueden parecer un sustituto de la memoria, pero resuelven problemas diferentes. Meter millones de tokens en bruto en un prompt aumenta la latencia, eleva los costos computacionales y degrada la calidad del razonamiento, ya que tokens irrelevantes compiten por atención. El Memory Scaling usa recuperación selectiva, decidiendo no solo cuánto contexto incluir, sino qué incluir, trayendo a la superficie únicamente la información de alta señal relevante para la tarea actual.

Los tipos de memoria que realmente marcan la diferencia

No toda la memoria tiene el mismo peso dentro de un sistema de AI Agents. Databricks identificó dos distinciones fundamentales que importan en la práctica:

Reciba el mejor contenido sobre innovación en su correo electrónico.

Todas las noticias, consejos, tendencias y recursos que buscas, directamente en tu bandeja de entrada.

Al suscribirte al boletín informativo, aceptas recibir comunicaciones de Método Viral. Nos comprometemos a proteger y respetar siempre tu privacidad.

Memoria episódica versus memoria semántica

La memoria episódica consiste en registros brutos de interacciones pasadas: logs de conversaciones, trayectorias de llamadas a herramientas y feedback de usuarios. La memoria semántica son habilidades generalizadas y hechos destilados a partir de esas interacciones. Por ejemplo, una memoria semántica puede registrar que los usuarios de determinado espacio siempre se refieren a trimestre fiscal cuando dicen solo trimestre. Cada tipo requiere estrategias diferentes de almacenamiento, procesamiento y recuperación: memorias episódicas para recuperación directa y memorias semánticas destiladas por un LLM para coincidencia de patrones más amplia.

Memoria personal versus memoria organizacional

Algunas memorias son específicas de las preferencias y flujos de trabajo de un único usuario. Otras representan conocimiento organizacional compartido, como convenciones de nomenclatura, consultas comunes y reglas de negocio. El sistema de memoria necesita dirigir la recuperación y las actualizaciones de forma adecuada: compartir el conocimiento organizacional ampliamente mientras mantiene el contexto individual privado, respetando permisos y controles de acceso. Este equilibrio entre personalización y privacidad es uno de los desafíos más delicados de la arquitectura.

Qué muestran los experimentos de Databricks en la práctica

Databricks utilizó MemAlign, un framework de memoria para agentes de IA, para llevar a cabo sus experimentos. MemAlign almacena interacciones pasadas como memorias episódicas, usa un LLM para destilarlas en reglas y patrones generalizados (memorias semánticas) y recupera las entradas más relevantes durante la inferencia para orientar al agente.

Las pruebas se realizaron en Databricks Genie Spaces, una interfaz de lenguaje natural donde usuarios de negocio hacen preguntas sobre datos en inglés simple y reciben respuestas basadas en SQL. El objetivo era medir cómo el rendimiento del agente escala conforme recibe más memoria, usando dos fuentes de datos: ejemplos curados con etiquetas y logs brutos de conversaciones de usuarios.

Escalando con datos etiquetados

MemAlign fue evaluado en preguntas inéditas distribuidas en 10 Genie Spaces, añadiendo incrementalmente fragmentos de ejemplos anotados de entrenamiento a la memoria del agente. La línea base era un agente usando instrucciones Genie curadas por especialistas, con esquemas de tablas escritos manualmente, reglas de dominio y ejemplos few-shot.

Los resultados mostraron escalado consistente en dos dimensiones:

  • Precisión: Las puntuaciones de prueba aumentaron de forma constante con cada fragmento adicional de memoria, subiendo de casi cero a 70%, superando la línea base curada por especialistas en aproximadamente 5%. En el análisis, los datos etiquetados por humanos resultaron más completos y, por lo tanto, más útiles que los esquemas de tablas y reglas de dominio escritos manualmente.
  • Eficiencia: El número medio de pasos de razonamiento por ejemplo bajó de aproximadamente 20 a cerca de 5 conforme la memoria creció. El agente aprendió a recuperar contexto relevante directamente en lugar de explorar la base de datos desde cero, acercándose a la eficiencia de instrucciones hardcoded, que rondaban los 3,8 pasos.

El efecto es acumulativo: como las muestras memorizadas abarcan 10 Genie Spaces diferentes, cada fragmento aporta información cross-domain que se suma al conocimiento ya acumulado.

Escalando con logs de usuarios sin etiquetas

La siguiente pregunta fue: ¿la memoria puede escalar con datos ruidosos del mundo real? Para averiguarlo, el equipo ejecutó MemAlign en un Genie Space en vivo y lo alimentó con logs históricos de conversaciones de usuarios, sin respuestas de referencia. Un juez LLM filtró esos logs por utilidad, y solo los de alta calidad fueron memorizados.

La curva de escalado siguió un patrón similar, con un inicio aún más pronunciado:

  • Precisión: El agente mostró una ganancia inicial abrupta. Tras el primer fragmento de logs, extrajo información clave sobre tablas relevantes y preferencias implícitas de los usuarios. El rendimiento subió de 2,5% a más de 50%, superando la línea base curada por especialistas (33,0%) después de apenas 62 registros de log.
  • Eficiencia: Los pasos de razonamiento bajaron de aproximadamente 19 a cerca de 4,3 tras el primer fragmento y se mantuvieron estables. El agente internalizó el esquema del espacio tempranamente y evitó exploración redundante en las consultas siguientes.

La conclusión es clara: interacciones de usuarios sin curación, filtradas solo por un juez automatizado sin referencia, pueden sustituir instrucciones de dominio creadas manualmente, que son costosas y lentas de producir. Esto apunta hacia agentes que mejoran continuamente a partir del uso normal y pueden escalar más allá de las limitaciones de la anotación humana. 🔄

Organizational Knowledge Store: conocimiento que ya existía antes del primer usuario

Los experimentos anteriores muestran cómo el Memory Scaling ocurre con interacciones de usuarios. Pero las empresas también poseen conocimiento que precede cualquier interacción: esquemas de tablas, queries de dashboards, glosarios de negocio y documentación interna. Databricks probó si precomputar ese conocimiento organizacional en un almacenamiento de memoria estructurado podría mejorar el rendimiento del agente.

El pipeline procesa metadatos brutos de bases de datos en conocimiento recuperable en tres etapas: extracción de información sobre activos, enriquecimiento de activos mediante transformaciones adicionales e indexación del contenido enriquecido. En el momento de la consulta, el agente puede buscar contexto empresarial mediante búsqueda por palabras clave o navegación jerárquica. Esto tiende un puente entre cómo los usuarios de negocio formulan preguntas, por ejemplo consumo de IA, y cómo los datos están realmente almacenados en nombres de columnas específicos en tablas específicas.

Añadir el knowledge store mejoró la precisión en aproximadamente 10% en los dos benchmarks evaluados. Las ganancias se concentraron en preguntas que requerían puente de vocabulario, joins de tablas y conocimiento a nivel de columna, es decir, información que el agente no podría haber descubierto solo mediante la exploración de esquemas.

Desde el punto de vista competitivo, esto cambia bastante la ecuación. Las empresas que invierten temprano en este tipo de infraestructura de memoria no están simplemente comprando un agente más inteligente hoy. Están construyendo una ventaja acumulativa que crece con el tiempo. Cuanto más se usa el agente, más aprende. Cuanto más aprende, más útil se vuelve. Y cuanto más útil se vuelve, más personas lo utilizan, creando un ciclo virtuoso difícil de replicar.

La infraestructura necesaria para que todo funcione en producción

Memory Scaling en despliegues corporativos requiere una infraestructura robusta que va mucho más allá de un simple vector store. Databricks identificó tres desafíos centrales que esta infraestructura necesita abordar.

Almacenamiento escalable

El almacenamiento de memoria más simple es el sistema de archivos: archivos markdown en carpetas jerárquicas, navegados y buscados con herramientas estándar de terminal. Esto funciona bien a pequeña escala y para usuarios individuales, pero carece de indexación, consultas estructuradas y búsqueda eficiente por similitud. Conforme la memoria crece a miles de entradas en múltiples usuarios, la recuperación se degrada y la gobernanza se vuelve difícil de aplicar.

Las bases de datos dedicadas son el paso natural siguiente. Las bases vectoriales standalone manejan bien la búsqueda semántica, pero carecen de capacidades relacionales como joins y filtrado. Los sistemas modernos basados en PostgreSQL ofrecen una alternativa más unificada, soportando de forma nativa consultas estructuradas, búsqueda full-text y búsqueda por similitud vectorial en un único motor.

Databricks ha estado utilizando Lakebase, construido sobre el motor PostgreSQL serverless de Neon, gracias a su costo scale-to-zero y soporte tanto para búsqueda vectorial como exacta. El branching nativo de base de datos también simplifica el ciclo de desarrollo, permitiendo que los ingenieros hagan fork del estado de memoria del agente para pruebas sin afectar producción.

Gestión de memoria

El almacenamiento escalable por sí solo no es suficiente. Un sistema de memoria también necesita gestionar sus contenidos de forma activa:

  • Bootstrapping: Los agentes nuevos sufren problemas de cold-start. Ingerir activos empresariales existentes como wikis, documentación y guías internas mediante parsing y extracción proporciona una base de memoria inicial que alivia estos problemas.
  • Destilación: Las memorias episódicas brutas son útiles para recuperación directa, pero se vuelven costosas de almacenar y buscar a escala. Destilarlas periódicamente en memorias semánticas, que son reglas y patrones comprimidos, mantiene el almacenamiento manejable y proporciona insights generalizables al agente.
  • Consolidación: Conforme la memoria crece, es fundamental mantener el sistema consistente, compacto y actualizado. Esto requiere pipelines que eliminen duplicados, poden información obsoleta y resuelvan conflictos entre entradas antiguas y nuevas.

Seguridad y gobernanza

La memoria introduce requisitos de gobernanza que simplemente no existen para agentes stateless. Conforme los agentes acumulan conocimiento profundamente contextual, incluyendo preferencias de usuarios, workflows propietarios y patrones de datos internos, los mismos principios de gobernanza que se aplican a datos corporativos necesitan extenderse a la memoria del agente.

Los controles de acceso deben ser identity-aware: las memorias individuales deben permanecer privadas, mientras que el conocimiento organizacional puede compartirse dentro de límites controlados por acceso. Más allá del control de acceso, el data lineage y la auditabilidad importan. Cuando el comportamiento de un agente está moldeado por su memoria, los equipos necesitan rastrear qué memorias influyeron en una respuesta específica y cuándo esas memorias fueron creadas o actualizadas. Los requisitos de compliance y regulatorios, particularmente en industrias reguladas, exigen que los almacenamientos de memoria soporten las mismas garantías de observabilidad que los datos subyacentes.

Los obstáculos que aún necesitan superarse

Todo eje de escalado eventualmente encuentra su propio cuello de botella. El parametric scaling está limitado por la oferta de datos de entrenamiento de alta calidad. El inference-time scaling puede degenerar en overthinking, donde cadenas más largas de razonamiento añaden costo sin añadir señal. El Memory Scaling tiene límites análogos, centrados en calidad, alcance y acceso.

Herramientas que usamos a diario

La calidad de la memoria es difícil de mantener. Algunas memorias están equivocadas desde el principio; otras se vuelven erróneas con el tiempo. Un agente stateless comete errores aislados, pero un agente con memoria puede transformar un error en un error recurrente al almacenarlo y recuperarlo después como evidencia. Databricks reportó casos de agentes que citaron notebooks de ejecuciones anteriores que ya estaban equivocados, y reutilizaron esos resultados con aún más confianza. La obsolescencia es más sutil: un agente que aprendió el esquema del trimestre pasado puede seguir consultando tablas que ya fueron renombradas o eliminadas.

La gobernanza necesita extenderse a la destilación. Escalar memoria dentro de una organización requiere destilar interacciones repetidas en memorias semánticas reutilizables. Pero la abstracción no elimina la sensibilidad. Una memoria como para la empresa Y, haz join de las tablas CRM, inteligencia de mercado y alianzas puede parecer inofensiva mientras sigue revelando interés confidencial en adquisición. Los controles de acceso y las etiquetas de sensibilidad necesitan sobrevivir a la destilación, no solo a la ingestión.

Las memorias útiles pueden permanecer inaccesibles. Aunque la memoria sea precisa y actual, el agente todavía necesita descubrir que existe. La recuperación es inherentemente metacognitiva: el agente necesita decidir qué preguntarle a su almacenamiento de memoria antes de saber qué tiene ahí. Cuando no anticipa que una memoria relevante podría ayudar, nunca formula la consulta correcta y recae en la exploración lenta y redundante. En la práctica, la brecha entre conocimiento almacenado y conocimiento accesible puede ser el principal limitante del Memory Scaling.

El agente como memoria: la visión de futuro de Databricks

Los experimentos y la infraestructura descritos anteriormente apuntan hacia un patrón de diseño natural: un agente cuya identidad vive en su memoria, no en los pesos de su modelo.

En este diseño, el contexto del agente se construye a partir de un almacenamiento persistente alojado en una base de datos serverless como Lakebase. El almacenamiento contiene tres componentes: prompts de sistema y capacidades del agente (habilidades), activos empresariales estructurados y no estructurados (conocimiento), y memorias episódicas y semánticas con alcance a nivel de organización y de usuario. Juntos, estos componentes forman el estado del agente: instrucciones, documentos recuperados, memorias relevantes, resultados de ejecución de queries SQL, llamadas a APIs y otras herramientas, además del historial de conversación. Este estado se alimenta al LLM en cada paso y se actualiza tras cada interacción.

El LLM en sí es un motor de razonamiento reemplazable: actualizar a un modelo más nuevo es directo, ya que el nuevo modelo lee del mismo almacenamiento persistente y se beneficia inmediatamente de todo el contexto acumulado.

Conforme los modelos de fundación convergen en capacidad, el diferenciador para agentes corporativos será cada vez más qué memoria han acumulado y no qué modelo invocan. Hipotéticamente, un modelo más pequeño con un almacenamiento de memoria rico puede superar a un modelo más grande con menos memoria. Si esto se confirma, invertir en infraestructura de memoria puede generar mayores retornos que escalar parámetros de modelo. El conocimiento de dominio, las preferencias de usuarios y los patrones operativos específicos de tu organización no están en ningún modelo de fundación. Solo pueden construirse a través del uso, y a diferencia de las capacidades del modelo, son únicos para cada despliegue.

Qué cambia en la práctica para quienes usan IA en el día a día

Para quienes ya trabajan con herramientas basadas en AI Agents en su día a día, los experimentos de Databricks apuntan hacia un cambio de perspectiva importante: el agente no debe tratarse como una herramienta estática que entrega siempre el mismo resultado independientemente del contexto, sino como un sistema que evoluciona y necesita ser alimentado para mejorar. Esto cambia la forma en que los equipos interactúan con él, la forma en que se recoge el feedback y la forma en que las organizaciones piensan la gobernanza de estas herramientas.

Del lado del rendimiento, las mejoras documentadas son alentadoras, pero dependen de una implementación cuidadosa. Simplemente activar un mecanismo de memoria no es suficiente. La calidad de la memoria, la forma en que se recupera y cuánto el modelo consigue integrarla de forma coherente en las respuestas son factores que determinan si el Memory Scaling va, de hecho, a entregar los resultados prometidos.

Al final del día, lo que Databricks está señalando con estos experimentos es que el próximo gran salto en calidad para los AI Agents puede no venir de modelos más grandes ni de más potencia computacional durante la inferencia, sino de sistemas que acumulan contexto de forma inteligente y aprenden de su propio uso a lo largo del tiempo. Es un enfoque más parecido a cómo los humanos desarrollan experiencia que al modelo tradicional de IA que la mayoría de las personas tiene en mente, y eso, por sí solo, ya es un cambio de paradigma que vale la pena seguir de cerca. 🚀

Imagen de Rafael

Rafael

Operaciones

Transformo los procesos internos en máquinas de entrega, garantizando que cada cliente de Viral Method reciba un servicio de primera calidad y resultados reales.

Rellena el formulario y nuestro equipo se pondrá en contacto contigo en un plazo de 24 horas.

Publicaciones relacionadas

Robot detecta actividad inusual en el navegador con JavaScript y cookies

Descubre por qué algunos sitios exigen JavaScript y cookies ante actividad inusual y cómo resolver bloqueos con pasos simples y

Productividad con Inteligencia Artificial Agentic en ejecución y flujos de trabajo.

Agentic AI: cómo usar agentes de IA para mejorar flujos, métricas y gobernanza, convirtiendo pilotos en ganancias reales de productividad.

IA y automatización en el centro de contacto: productividad y experiencia del cliente

Productividad: cómo la IA y automatización transforman centros de contacto, reduciendo costos y elevando eficiencia y experiencia del cliente.

Receba o melhor conteúdo de inovação em seu e-mail

Todas as notícias, dicas, tendências e recursos que você procura entregues na sua caixa de entrada.

Ao assinar a newsletter, você concorda em receber comunicações da Método Viral. A gente se compromete a sempre proteger e respeitar sua privacidade.

Rafael

Online

Atendimento

Calculadora de Precio de Sitios

Descubre cuánto cuesta el sitio ideal para tu negocio

Páginas del Sitio

¿Cuántas páginas necesitas?

Arrastra para seleccionar de 1 a 20 páginas

En solo 2 minutos, descubre automáticamente cuánto cuesta un sitio a medida para tu negocio

Más de 0+ empresas ya calcularon su presupuesto

Fale com um consultor

Preencha o formulário e nossa equipe entrará em contato.