Agentes de IA están redefiniendo lo que significa usar inteligencia artificial en el día a día.
Hace apenas dos años, la mayoría de las personas interactuaba con modelos de IA básicamente como lo haría con un campo de búsqueda más inteligente: hacía una pregunta, recibía una respuesta.
Así de simple.
Pero ese panorama cambió — y rápido.
Hoy, herramientas como Claude Code y Claude Cowork, de Anthropic, permiten que la IA escriba y ejecute código, gestione archivos, navegue por sistemas corporativos y complete tareas que atraviesan múltiples aplicaciones, casi sin necesitar que alguien esté guiándola todo el tiempo.
Es un cambio de paradigma real. 🔑
Y con él llegan ganancias de productividad impresionantes — pero también un conjunto nuevo de responsabilidades y riesgos que no existían cuando la IA solo respondía preguntas.
Cuando un agente actúa de forma autónoma, con menos supervisión humana, el margen para errores de interpretación crece. Surgen vulnerabilidades nuevas, como los ataques de prompt injection, donde instrucciones maliciosas se esconden dentro de contenidos que el agente procesa.
Y a medida que estos sistemas se vuelven más poderosos y las empresas confían en ellos para acciones cada vez más importantes, la tendencia es que ambos riesgos se intensifiquen.
¿Cómo garantizar que los agentes de IA sean realmente confiables?
Es exactamente eso lo que Anthropic intenta responder con su framework para la construcción de agentes confiables, publicado originalmente en agosto del año pasado y ahora detallado en términos prácticos. Este framework se apoya en cinco principios centrales: mantener a los humanos en control, alinear el comportamiento con los valores humanos, proteger las interacciones de los agentes, mantener transparencia y preservar la privacidad.
Desde la estructura técnica que hace funcionar a un agente hasta los principios prácticos de seguridad, control humano y transparencia, pasando por lo que va más allá de una sola empresa e abarca toda la industria — vamos a explorar cada una de esas capas aquí.
Vamos a entender lo que está en juego. 👇
Qué hace que un agente de IA sea diferente de un chatbot común
La diferencia entre un chatbot tradicional y un agente de inteligencia artificial va mucho más allá del nombre. Un chatbot responde. Un agente actúa. Y esa distinción cambia completamente la forma en que necesitamos pensar sobre estos sistemas.
Anthropic define un agente como un modelo de IA que dirige sus propios procesos y el uso de herramientas al cumplir una tarea — es decir, decide por cuenta propia cómo alcanzar lo que el usuario quiere, en lugar de seguir un guion fijo. En la práctica, esto significa que el agente opera en un ciclo autodirigido: planifica, ejecuta una acción, observa el resultado, ajusta el plan y repite ese proceso hasta que la tarea esté completada o hasta que necesite consultar al humano.
Para hacerlo más tangible, piensa en un ejemplo real. Si le pidieras a Claude en Claude Cowork que presentara los recibos de un viaje de negocios, él planificaría los pasos uno por uno — transcribir cada foto de recibo, extraer el monto y el proveedor, categorizar el gasto y enviarlo a través del sistema de tu empresa. Si un cobro de hotel fuera rechazado por superar el límite de tarifa diaria, Claude no solo se daría cuenta de que la presentación falló, sino que identificaría que no conoce cuál es el tope permitido ni qué otras reglas podrían aplicarse. En ese punto, haría una pausa para preguntar si debe consultar la política de gastos en el drive compartido de la empresa antes de intentarlo nuevamente. Con tu aprobación, incorporaría lo aprendido al plan y seguiría adelante.
Ese nivel de integración con el mundo real — donde las acciones tienen consecuencias fuera de la ventana del chat — es lo que define a un agente moderno y es también lo que exige un enfoque completamente nuevo en términos de seguridad y gobernanza.
La anatomía de un agente: cuatro componentes esenciales
Para entender de dónde provienen tanto las capacidades como los riesgos de un agente, hay que mirar sus cuatro componentes fundamentales. Cada uno de ellos es al mismo tiempo una fuente de poder y un potencial punto de vulnerabilidad:
- El modelo: es la inteligencia que hace todo posible. Esa inteligencia es producto del proceso de entrenamiento, que moldea tanto lo que el modelo sabe como la forma en que razona y se comporta.
- El harness (arnés de instrucciones): son las instrucciones y las barreras de protección bajo las cuales opera el modelo. En el ejemplo de los recibos, el harness podría instruir a Claude para que señale cualquier monto superior a cien dólares o para que nunca presente gastos sin confirmación del usuario.
- Las herramientas: son los servicios y aplicaciones que el modelo puede usar — tu correo electrónico, calendario, software de gastos y demás. Sin herramientas, Claude puede leer el recibo, pero no puede archivarlo.
- El entorno: es donde el agente se ejecuta — si está configurado en Claude Code, en Claude Cowork o en otro producto — y a qué archivos, sitios o sistemas puede acceder. El mismo agente en una laptop corporativa dentro de una red empresarial tendrá accesos y riesgos completamente diferentes a los que tendría en un celular personal.
La mayor parte de la conversación sobre políticas de IA hoy gira en torno al modelo, lo cual es comprensible — es de ahí de donde provienen las capacidades centrales. Pero el comportamiento de un agente depende de las cuatro capas funcionando en conjunto. Un modelo bien entrenado aún puede ser explotado mediante un harness mal configurado, una herramienta con permisos excesivos o un entorno expuesto. Por eso las protecciones necesitan cubrir todos estos niveles.
La autonomía real trae riesgos reales
Cuanta más autonomía posee un agente, mayor es la superficie de ataque disponible para que algo salga mal — ya sea por un error genuino de interpretación o por una explotación maliciosa intencional.
Uno de los riesgos más discutidos actualmente en el campo de la inteligencia artificial es el llamado prompt injection, que funciona de manera bastante insidiosa: instrucciones maliciosas se incrustan dentro de contenidos que el agente va a procesar durante la ejecución de una tarea. Imagina un agente que lee correos electrónicos para gestionar tu agenda — un correo cuidadosamente elaborado podría contener instrucciones ocultas ordenando al agente que reenvíe información confidencial a una dirección externa. El agente, sin darse cuenta, ejecutaría la instrucción como si fuera legítima.
Anthropic reconoce que, a medida que los modelos se vuelven más capaces, la comprensión sobre prompt injection también ha evolucionado considerablemente — tanto en relación con cómo funcionan los ataques como con la razón por la cual ninguna línea de defensa aislada es suficiente para garantizar protección total. Cuanto más abierto es el entorno de un agente, más puntos de entrada existen. Cuantas más herramientas puede usar, más puede hacer un atacante cuando obtiene acceso.
Es por eso que la empresa construye defensas en múltiples capas: entrena al modelo para reconocer patrones de inyección, monitorea el tráfico en producción para bloquear ataques en el mundo real y cuenta con red-teamers externos para probar y estresar sus sistemas.
Aun así, incluso combinadas, estas protecciones no son una garantía absoluta. Por eso la recomendación de Anthropic es que los propios clientes piensen cuidadosamente sobre qué herramientas y datos ponen a disposición de un agente, qué permisos otorgan y en qué entornos permiten que opere. Acciones irreversibles — como eliminar datos permanentemente o enviar mensajes en nombre del usuario — deben tener un punto de confirmación humana antes de ser ejecutadas.
Ese equilibrio entre eficiencia y control es uno de los grandes desafíos de diseño que toda la industria de inteligencia artificial enfrenta ahora.
Principios en la práctica: cómo Anthropic toma decisiones de producto
Construir agentes que sean al mismo tiempo útiles y confiables exige decisiones de producto muy cuidadosas. El framework de Anthropic establece cinco principios para guiar estas elecciones. Vamos a ver tres de ellos con ejemplos concretos: control humano, alineamiento con las expectativas del usuario y seguridad. Los otros dos — transparencia y privacidad — permean todos los demás.
Diseño pensado para mantener al humano en control
La tensión central de los agentes es clara: para ser útiles, necesitan funcionar con autonomía, pero para ser seguros, los humanos necesitan mantener un control significativo sobre cómo trabajan.
La forma más directa en que el usuario mantiene control sobre Claude es decidiendo qué puede y qué no puede hacer. En Claude.ai y en Claude Desktop, los usuarios eligen qué herramientas activar y configuran permisos — como permitir siempre, necesita aprobación o bloquear — para cada acción que Claude ejecuta. Esto permite, por ejemplo, definir que siempre es seguro que Claude lea tu calendario, pero exigir aprobación antes de enviar una invitación a alguien.
Este enfoque funciona bien para tareas simples. Pero cuando una tarea involucra decenas de acciones, los pedidos repetidos de aprobación se convierten en una fuente de fricción, y los usuarios terminan ignorando esos prompts por fatiga. Para resolver esta brecha, Anthropic introdujo en Claude Code una función llamada Plan Mode. En lugar de pedir aprobación acción por acción, Claude presenta al usuario su plan completo de acción por adelantado. El usuario puede revisar, editar y aprobar todo antes de que cualquier cosa suceda — y aún puede intervenir en cualquier momento durante la ejecución. Esto desplaza el nivel de supervisión del paso individual a la estrategia general, que suele ser el punto donde los usuarios más quieren ejercer su criterio.
También están surgiendo patrones de uso más complejos. Cada vez más, agentes en productos como Claude Code delegan parte del trabajo a subagentes — otros Claudes trabajando en paralelo en diferentes partes de una tarea. Los subagentes plantean cuestiones nuevas sobre cómo los usuarios pueden comprender y dirigir flujos de trabajo que ya no son visibles como una secuencia lineal de acciones. Anthropic está explorando diferentes patrones de coordinación para abordar esto, y el aprendizaje obtenido alimentará el diseño de supervisión para esta próxima generación de agentes.
Ayudando a los agentes a entender realmente sus objetivos
Garantizar que los agentes persigan los objetivos correctos, de la forma que los usuarios más desean, es uno de los problemas no resueltos más difíciles en el desarrollo de agentes. Un agente solo puede actuar de acuerdo con lo que el usuario realmente quiere si sabe cuándo detenerse y pedir aclaraciones — ya sea cuando tiene incertidumbre o cuando está a punto de cometer un error.
Trabajando en una tarea, un agente frecuentemente encuentra situaciones que su plan inicial no cubría. Puede resolver muchas de esas lagunas por sí solo — investigando información que necesita, por ejemplo. Pero otras serán cuestiones de preferencia o intención que solo el usuario puede resolver. El desafío para Anthropic es ayudar a sus modelos a reconocer cuál es cuál, encontrando el equilibrio correcto entre pausar demasiado y no pausar lo suficiente. Un agente que se detiene ante cada posible duda renuncia a la mayor parte de la autonomía que lo hace útil. Uno que siempre sigue adelante arriesga interpretar mal lo que el usuario realmente quería.
Anthropic ataca este problema desde múltiples ángulos durante el entrenamiento de Claude. Primero, construye escenarios de entrenamiento que colocan al modelo en situaciones ambiguas y refuerza la elección de pausar en lugar de asumir. Segundo, la Constitución de Claude — que influye directamente en cómo se entrenan los modelos — refuerza un instinto similar, favoreciendo plantear preocupaciones, buscar aclaraciones o negarse a continuar en lugar de actuar basándose en suposiciones.
Las investigaciones de Anthropic sobre el uso de agentes ilustran bien el impacto de este entrenamiento. En tareas complejas, los usuarios interrumpen a Claude solo un poco más frecuentemente que en tareas simples, pero la tasa del propio Claude de hacer verificaciones prácticamente se duplica. Esto muestra la importancia de calibrar a los agentes en la decisión sobre cuándo actuar y cuándo devolver la decisión al humano.
Seguridad y transparencia como pilares innegociables
Dentro de la arquitectura de agentes de IA modernos, seguridad y transparencia no son funcionalidades opcionales que se agregan después — son fundamentos que necesitan estar presentes desde el inicio del diseño del sistema.
La transparencia entra en este contexto de una forma bastante práctica: si un agente no puede explicar qué está haciendo o por qué está tomando determinada decisión, es imposible para un humano supervisar su comportamiento de manera eficaz. Por eso, los sistemas bien diseñados incluyen mecanismos de logging detallado, pistas de auditoría y, en casos más críticos, la capacidad del propio agente de señalar cuando encuentra una situación ambigua o potencialmente riesgosa y solicitar orientación humana antes de continuar.
Ese comportamiento — detenerse y preguntar en lugar de adivinar — es una señal de madurez en el diseño de un agente y reduce significativamente el riesgo de consecuencias indeseadas.
También hay una dimensión más amplia aquí que va más allá de cualquier empresa específica. La construcción de estándares de seguridad y transparencia para agentes autónomos es un desafío que toda la industria de inteligencia artificial necesita enfrentar de forma colaborativa. La transparencia necesita ser no solo una característica técnica, sino un compromiso cultural de quienes desarrollan estas herramientas.
Qué puede hacer el ecosistema más amplio
Las medidas descritas hasta aquí representan lo que Anthropic puede hacer dentro de sus propios productos. Pero la seguridad y la confiabilidad de los agentes no pueden ser alcanzadas por ninguna empresa de forma aislada. La cuestión para todo el ecosistema es cómo crear las condiciones para que las empresas puedan experimentar con agentes y los desarrolladores puedan seguir construyendo con seguridad.
Existen algunos frentes donde la industria, organismos de estandarización y gobiernos pueden contribuir de forma significativa:
Benchmarks estandarizados
Actualmente no existe una forma rigurosa y estandarizada de comparar sistemas de agentes en términos de resistencia a prompt injection o de qué tan confiablemente señalan incertidumbres. Cada empresa prueba sus propios sistemas usando sus propios métodos, y ningún resultado es verificado de forma independiente. Organismos de estándares como el NIST, trabajando junto a grupos de la industria, están bien posicionados para mantener benchmarks compartidos e fomentar un ecosistema más amplio de evaluación por terceros.
Compartir evidencias
Anthropic ya ha publicado extensamente sobre cómo se usa Claude como agente y dónde presenta dificultades, y espera que esta práctica se vuelva habitual en el campo. Cuantos más desarrolladores compartan este tipo de evidencia, más completa será la visión que los formuladores de políticas tendrán sobre cómo los agentes están siendo realmente utilizados.
Estándares abiertos
Anthropic creó el Model Context Protocol (MCP) como un estándar abierto para la forma en que los modelos se comunican con fuentes de datos y herramientas externas — y posteriormente donó el protocolo a la Agentic AI Foundation de la Linux Foundation, para que pertenezca a la comunidad más amplia. La lógica detrás de esto es que los protocolos abiertos permiten que las propiedades de seguridad se diseñen en la infraestructura una sola vez, en lugar de ser parcheadas individualmente en cada implementación. Los estándares abiertos también mantienen la competencia enfocada en la calidad y seguridad del agente, y no en quién controla las integraciones.
Ninguna de estas medidas sustituye el trabajo que los desarrolladores de modelos necesitan hacer para construir agentes seguros, pero esta es el tipo de infraestructura que ninguna empresa sola puede levantar.
El futuro cercano de los agentes y el papel del control humano
El debate sobre cuánta autonomía conceder a un agente de IA no tiene una respuesta única — y probablemente nunca la tendrá. El nivel adecuado de independencia depende del contexto, de la criticidad de la tarea, de la madurez del sistema y de cuánto el operador humano comprende lo que está sucediendo tras bambalinas. Un agente que gestiona recordatorios de agenda puede operar con mucha más libertad que uno que tiene acceso a sistemas financieros o de infraestructura crítica. Esa calibración entre eficiencia y control va a ser un ejercicio continuo a medida que la tecnología avanza y los casos de uso se multiplican.
Lo que queda cada vez más claro es que el futuro de los agentes de inteligencia artificial no se trata de sustituir humanos, sino de construir sistemas donde humanos y agentes trabajen juntos de forma fluida — con el humano en el rol de supervisor estratégico y el agente en el rol de ejecutor táctico altamente capaz. Para que esta alianza funcione bien, la transparencia sobre lo que el agente está haciendo necesita ser constante, y los mecanismos de intervención humana necesitan ser simples, rápidos y eficaces.
Los agentes van a remodelar la forma en que las personas trabajan. Si esto sucederá sobre una base segura y abierta depende de cómo la industria, la sociedad civil y los gobiernos construyan esos cimientos juntos.
La evolución de los agentes de IA ya está ocurriendo, con o sin consenso sobre las mejores prácticas. Lo que cambia es la velocidad con la que la industria logra establecer bases sólidas de seguridad, transparencia y responsabilidad antes de que los sistemas se vuelvan demasiado complejos para ser fácilmente auditados. Ese es el verdadero desafío del momento — y la forma en que se resuelva va a definir no solo el futuro de la inteligencia artificial, sino la relación que la sociedad tendrá con esta tecnología en las próximas décadas. 🤖
