Trazabilidad de acciones de agentes: qué auditar y cómo
La trazabilidad de acciones de agentes permite auditar y reconstruir eventos con registros íntegros que facilitan cumplimiento y resolución.

La trazabilidad de acciones de agentes registra quién hizo qué, cuándo y por qué, y sin ella no existe forma seria de auditar un sistema de IA agéntica. Un registro completo captura identidad del agente, sesión y llamadas a herramientas, entradas y salidas de cada paso, cualquier intervención humana y una prueba de integridad (normalmente un hash) sobre cada evento. Esto es lo que convierte una acción automatizada en algo reproducible, atribuible y defendible ante un auditor.
En resumen:
- La trazabilidad de acciones en sistemas de IA es obligatoria por regulaciones y fundamental para auditar correctamente, especialmente en casos de fallo o mal uso.
- Es imprescindible registrar la identidad del agente y del humano, estructura jerárquica de eventos, metadatos técnicos precisos y supervisión humana para una trazabilidad eficaz.
- La instrumentación recomendable se apoya en convenciones estándar como OpenTelemetry ATSC, que permiten capturar de manera estructurada y automática todos los eventos relevantes.
- La gobernanza de permisos y la protección contra manipulaciones deben acompañar la trazabilidad para garantizar su integridad y cumplimiento normativo.
- La solución open source agent-swarm.dev facilita mantener la trazabilidad en la propia infraestructura sin depender de proveedores externos, con opciones de autohospedaje gratuito y planes económicos en la nube.
Tabla de contenidos
- Por qué la trazabilidad es imprescindible para la auditoría empresarial
- Elementos mínimos que debe registrar cualquier agente
- Cómo instrumentar la trazabilidad: convenciones y almacenamiento
- Gobernanza operativa: permisos, identidad y supervisión humana
- Paquetes de evidencia para auditoría: qué incluir y cómo verificarlos
- Desafíos prácticos: escala, privacidad, coste y reproducibilidad
- Cómo lo aplicamos en la práctica en agent-swarm.dev
- Prioridades prácticas para los primeros 180 días
- Cómo agent-swarm.dev facilita la trazabilidad sin ceder el control de tus datos
- Fuentes
- Preguntas frecuentes
Por qué la trazabilidad es imprescindible para la auditoría empresarial
Un agente que ejecuta tareas sin dejar rastro verificable es un pasivo, no una ventaja. Cuando algo falla (una transacción incorrecta, una respuesta que filtra datos, una decisión que afecta a un cliente) la empresa necesita reconstruir la secuencia exacta de eventos, no una aproximación.
El Reglamento Europeo de Inteligencia Artificial exige capacidades de registro automático y retención de logs proporcional al propósito del sistema para los casos de mayor riesgo, lo que convierte la trazabilidad en un requisito de cumplimiento, no en un extra técnico. Un sistema bien instrumentado debe poder responder, sin ambigüedad, a estas preguntas:
- ¿Qué agente y qué versión de modelo ejecutó esta acción?
- ¿Qué herramientas invocó y con qué parámetros exactos?
- ¿Hubo una persona que aprobó, rechazó o modificó el resultado?
- ¿Se puede demostrar que el registro no fue alterado después de generarse?
Sin respuestas verificables a estas cuatro preguntas, cualquier informe de auditoría se apoya en promesas, no en evidencia.
Elementos mínimos que debe registrar cualquier agente
Una taxonomía de eventos bien diseñada distingue entre lo que identifica al actor y lo que describe la acción. Estos son los componentes que no pueden faltar en ningún sistema de gestión de agentes que aspire a ser auditable:
- Identidad del agente y del actor humano: identificador único del agente, versión del modelo, credenciales usadas y, cuando aplica, el usuario humano que inició o supervisó la tarea.
- Estructura jerárquica de trazas: sesión, ejecución (run), invocación del agente (agent.invoke), turno de razonamiento (agent.turn) y llamada a herramienta (tool.call), anidados de forma que cualquier evento se pueda ubicar dentro de su contexto completo.
- Metadatos técnicos por evento: modelo y versión exactos, marcas temporales con precisión de milisegundos, conteo de tokens de entrada y salida, y un identificador de política (policy id) que indique bajo qué reglas de permisos se ejecutó la acción.
- Registro de intervención humana: quién revisó, qué vio exactamente en el momento de revisar y el resultado de esa aprobación o rechazo.
Esta estructura por capas es la que permite responder «qué pasó» sin reconstruir nada a mano, y es la base de cualquier estrategia de seguimiento de acciones seria.
Cómo instrumentar la trazabilidad: convenciones y almacenamiento
La forma más eficiente de instrumentar agentes no es inventar un formato propio, sino apoyarse en convenciones ya validadas por la comunidad técnica. Las convenciones semánticas GenAI de OpenTelemetry permiten capturar atributos como el modelo solicitado, los tokens consumidos y un identificador de conversación que agrupa turnos múltiples bajo una misma sesión.
Sobre esa base, las Agent Telemetry Semantic Conventions (ATSC) añaden una capa específica para operaciones de agentes: agent.invoke, agent.turn, tool.call, memory.read/write y human.input, entre otras. Esto resuelve un problema real: OpenTelemetry describe llamadas a modelos, pero no el ciclo de razonamiento ni los traspasos entre agentes, y ATSC llena ese vacío sin obligar a construir un esquema desde cero.
En la práctica, la instrumentación sigue un patrón repetible:
- Crear spans dedicados para cada invocación de agente y cada ejecución de herramienta, en lugar de mezclar todo en un span genérico.
- Usar un procesador de spans que estampe un identificador de conversación en cada evento, de forma automática y consistente en toda la sesión.
- Capturar prompts y conteos de tokens de forma opcional (opt-in), nunca por defecto, para no arrastrar datos sensibles a los registros.
- Exportar todo en formato OTLP o JSON hacia un almacén de solo escritura (append-only), donde ningún evento pueda editarse ni borrarse tras su creación.
Consejo profesional: no esperes a tener miles de agentes en producción para instrumentar bien. El coste de añadir ATSC sobre una base OTel ya existente es mucho menor que el de reconstruir trazas retroactivamente cuando llega la primera auditoría.
El periodo de retención de estos registros debe alinearse con el propósito del sistema y con las obligaciones normativas aplicables, no fijarse de forma arbitraria a treinta o noventa días.
Gobernanza operativa: permisos, identidad y supervisión humana
Un registro detallado no sirve de mucho si cualquier agente puede hacer cualquier cosa. La gobernanza empieza por tratar la identidad del agente con el mismo rigor que la identidad de un empleado.
NIST plantea, a través de su centro de excelencia en ciberseguridad (NCCoE), que los agentes necesitan identificadores propios, credenciales rotativas y ámbitos de permiso (scopes) claramente delimitados, en lugar de heredar de forma indiscriminada las credenciales del sistema que los invoca. Esto reduce el riesgo de que una sola credencial comprometida abra acceso a todo el entorno.
Los controles que sostienen esta gobernanza incluyen:
- Permisos mínimos por tarea, otorgados justo antes de la ejecución y revocados al terminar, no concedidos de forma permanente.
- Flujos de aprobación explícitos para las acciones de mayor impacto, con un registro que capture quién aprobó y bajo qué condiciones.
- Un registro indiscutible de la supervisión humana (human-in-the-loop) que muestre exactamente qué vio la persona antes de decidir, no solo que existió una revisión.
Microsoft Learn insiste en que la trazabilidad exige mecanismos de transparencia y supervisión continua, no una verificación puntual al desplegar el sistema. Una guía práctica sobre supervisión humana en IA detalla cómo estructurar estos registros de aprobación paso a paso.
Paquetes de evidencia para auditoría: qué incluir y cómo verificarlos
Un paquete de evidencia bien construido se organiza en cuatro capas, cada una respondiendo a una pregunta distinta que hará un auditor:
- Capa de decisión: qué eligió hacer el agente y con qué justificación o razonamiento asociado.
- Capa de contexto: qué entradas, documentos o resultados de herramientas alimentaron esa decisión.
- Capa de gobernanza: qué permisos se aplicaron y qué aprobación humana intervino, si la hubo.
- Capa de verificación: un hash criptográfico de cada evento y un manifiesto con marcas temporales que documente la cadena de custodia completa.
Los equipos que ya trabajan con estos paquetes de evidencia auditables coinciden en que la captura debe ser síncrona (en el momento en que ocurre la acción) y almacenarse en un sistema de solo adición, porque cualquier posibilidad de edición posterior invalida el valor probatorio del registro.
Dato clave: los verificadores automáticos que investiga NIST (evaluation probes) se integran directamente en el flujo del agente para validar la calidad de una salida antes de que el evento se consolide en el registro de auditoría, y guardan su veredicto como parte del propio paquete de evidencia.
El formato exportable, sea OTLP o JSON estructurado, es lo que permite que un auditor externo revise los datos sin depender de acceso directo a la infraestructura del agente.
Desafíos prácticos: escala, privacidad, coste y reproducibilidad
Instrumentar todo genera un volumen de datos que puede resultar caro de almacenar e ingerir a escala. Un muestreo inteligente (conservar el cien por cien de las trazas en operaciones críticas y muestrear las rutinarias) suele ser la vía más razonable para controlar el coste sin perder capacidad de auditoría donde importa.
La privacidad plantea otro conflicto: capturar prompts completos puede exponer datos personales o confidenciales dentro de los propios registros. Los puntos que exigen atención constante son:
- Redactar o enmascarar campos sensibles antes de persistir cualquier traza, no después.
- Versionar el linaje de los datos en pipelines con memoria compartida o recuperación aumentada (RAG), para poder reconstruir qué fuente alimentó cada respuesta.
- Proteger los propios logs contra manipulación, incluyendo mitigaciones frente a intentos de inyección de instrucciones que buscan alterar el comportamiento del agente.
Cómo lo aplicamos en la práctica en agent-swarm.dev
En agent-swarm.dev, un agente líder descompone objetivos complejos y asigna subtareas a trabajadores especializados que se ejecutan en contenedores aislados, cada uno con su propia identidad operativa. Esa separación facilita capturar eventos por trabajador sin mezclar contextos entre tareas distintas.
Las integraciones con Slack, Linear, GitHub y OpenAI generan puntos naturales de captura: cada mensaje, ticket o commit que dispara una acción queda vinculado a la sesión que lo originó. Un flujo habitual consiste en exportar las trazas de una sesión completa y construir a partir de ellas un paquete de evidencia listo para revisión, similar al que puede consultarse en los ejemplos de sesiones reales publicados por el proyecto.
Entre las prácticas que sostienen este enfoque:
- Memoria compartida entre trabajadores que acumula contexto de tareas anteriores, en lugar de reiniciar el conocimiento en cada ejecución.
- Revisiones de código realizadas por agentes con controles de auditoría integrados en el propio flujo de trabajo.
- Un marco de evaluación para agentes que documenta criterios de calidad antes de aceptar una salida como definitiva.
Prioridades prácticas para los primeros 180 días
Si tu equipo empieza desde cero, el orden importa más que la exhaustividad. En los primeros 30 días, instrumenta con OpenTelemetry GenAI y ATSC antes de escribir una sola línea de lógica de negocio nueva: es mucho más barato nacer trazable que volverse trazable después.
Entre los 30 y los 90 días, monta el almacenamiento append-only con hashing y define quién aprueba qué, con qué evidencia visible en ese momento. A partir del día 90, dedica tiempo a simular una auditoría real contra tus propios registros antes de que te la pida alguien externo. La gobernanza que no se prueba a sí misma tiende a fallar justo cuando más se necesita.

Cómo agent-swarm.dev facilita la trazabilidad sin ceder el control de tus datos
agent-swarm es la alternativa a las plataformas cerradas cuando lo que buscas es trazabilidad completa sin depender de un proveedor externo para guardar tus registros de auditoría. Al ser código abierto bajo licencia MIT, la memoria, el historial de contexto y los paquetes de evidencia se quedan en tu propia infraestructura, algo que las soluciones SaaS cerradas no ofrecen porque restringen dónde y cómo se almacenan tus datos.

Esto acelera tareas concretas: integrar trazas OTLP desde tus agentes existentes, montar paneles de control sobre esos eventos y exportar paquetes de evidencia sin depender de un formato propietario. El proyecto se puede autohospedar gratis para siempre, o adoptar en su versión Cloud desde 30 hasta 100 € al mes según el número de trabajadores activos, con una modalidad Enterprise para despliegues on-premise con soporte dedicado. Revisa los planes disponibles y compara tu caso con los ejemplos de sesiones reales antes de decidir qué modalidad se ajusta a tu equipo.
Fuentes
Para equipos de ingeniería, empezar por ATSC y las convenciones GenAI de OpenTelemetry resuelve la instrumentación. Para responsables de cumplimiento, el concept paper de NIST sobre identidad de agentes y la guía de Microsoft Learn sobre confianza y transparencia fijan el marco de gobernanza.
- Accelerating the Adoption of Software and Artificial Intelligence Agent Identity and Authorization | CSRC
- Building Evaluation Probes into Agentic AI | NIST
- Determinar la confianza, la trazabilidad y la transparencia | Microsoft Learn
Preguntas frecuentes
¿Cuáles son los tres tipos principales de trazabilidad?
En sistemas de agentes conviene distinguir trazabilidad de identidad (quién actuó), trazabilidad de ejecución (qué pasos y herramientas se usaron) y trazabilidad de decisión (qué evidencia y aprobación humana respaldó el resultado). Las tres capas juntas son las que permiten reconstruir una acción de forma completa.
¿Qué elementos no pueden faltar en un registro de trazabilidad?
Un registro completo necesita identidad del agente y del actor humano, estructura de sesión y llamadas a herramientas, entradas y salidas de cada paso, marcas temporales precisas, registro de aprobaciones humanas y una prueba de integridad como un hash. Faltar cualquiera de estos rompe la cadena de evidencia.
¿Qué dice la norma ISO 9001 sobre trazabilidad?
Un estándar reconocido exige identificar y controlar las salidas de un proceso a lo largo de toda su producción, un principio que en sistemas de IA se traduce en registrar cada paso de una acción de forma que pueda vincularse a su origen y a quien la autorizó. El estándar no es específico de IA, pero su lógica de control encaja con lo que exige el Reglamento Europeo de Inteligencia Artificial para sistemas de alto riesgo.
¿Puedes dar un ejemplo concreto de trazabilidad de agentes?
Un agente que aprueba un reembolso debe dejar constancia de qué modelo lo procesó, qué herramienta de pagos invocó, qué datos de entrada usó y si una persona revisó la decisión antes de ejecutarla. En agent-swarm.dev, ese flujo queda capturado en la sesión completa y puede exportarse como paquete de evidencia verificable.
¿Cuánto cuesta implementar trazabilidad con agent-swarm.dev?
La versión autohospedada de agent-swarm es gratuita de forma indefinida bajo licencia MIT. La versión Cloud tiene un precio variable; consulta la página oficial de precios para detalles actuales, y la modalidad Enterprise se cotiza a medida según las condiciones publicadas.
Recomendaciones
Related field notes
Orquestación de agentes: guía práctica para equipos de ingeniería
Descubre cómo la orquestación de agentes mejora la eficiencia en flujos de trabajo complejos, integrando múltiples herramientas y aprobaciones. ¡Optimiza...
Un orquestador de agentes no es un lujo: es el límite entre un prototipo y un sistema en producción
Descubre cómo un orquestador de agentes transforma prototipos en sistemas eficientes, gestionando tareas complejas con IA de manera efectiva.
We Rebuilt Linear's “Loops updates” Clip as a Swarm Video in Eight Rounds
Three video models read Linear's motion-design teaser; the two Gemini models called the 3D scene 2D until 7.5s. A frame-by-frame check caught it. The replica is 858 frames of Remotion and three.js, reviewed eight times.