Agentes de IA para negocios: oportunidades, límites y casos de uso
Un agente de IA no es un chatbot más inteligente: decide pasos y actúa sobre sistemas reales. Definiciones, casos de uso por función, cinco riesgos concretos, un caso judicial documentado y un modelo de gobierno por niveles de autonomía.
Tabla de contenidos
- Chatbot, flujo o agente: tres cosas distintas con un mismo nombre comercial
- Cuatro preguntas para saber si necesitas un agente
- Casos de uso por función
- Cinco riesgos concretos (no genéricos)
- Quién responde cuando el agente se equivoca: el caso Air Canada
- Gobierno mínimo viable: niveles de autonomía y controles
- Del piloto a producción: cuatro criterios de paso
- Errores comunes
- El siguiente paso
Un agente de IA no es un chatbot más inteligente. Es un sistema que, ante un objetivo, decide qué pasos dar y usa herramientas (consultar un CRM, redactar y enviar un mensaje, actualizar un registro, procesar un reembolso) para alcanzarlo. Esa capacidad de actuar es lo que lo hace valioso y lo que lo hace peligroso. Un chatbot que se equivoca da una respuesta equivocada; un agente que se equivoca puede ejecutar una acción equivocada.
Nuestra posición: la mayoría de las necesidades de una empresa mediana se resuelven mejor con reglas y flujos fijos, algunos de ellos con pasos de IA. Un agente se justifica cuando el camino no puede fijarse de antemano, el resultado puede verificarse y el coste de un error está acotado. Y siempre que se despliegue, la responsabilidad sigue siendo de la empresa. Este artículo cubre la empresa completa: atención, ventas, operaciones, finanzas y servicios internos. Para el caso específico de marketing, el análisis está en Agentes de IA para marketing: cuándo implementar y cuándo todavía no.
Chatbot, flujo o agente: tres cosas distintas con un mismo nombre comercial
El mercado llama “agente” a casi cualquier producto con IA. Antes de evaluar un proveedor, conviene separar tres conceptos.
| Concepto | Qué hace | Quién decide los pasos | Qué puede salir mal |
|---|---|---|---|
| Chatbot / asistente conversacional | Responde preguntas en una conversación, a menudo con una base de conocimiento. | La persona que conversa; el modelo solo responde. | Una respuesta incorrecta o inventada que el cliente toma por cierta. |
| Flujo automatizado (con o sin IA) | Ejecuta una secuencia fija de pasos; en ciertos pasos puede usar un modelo para clasificar, extraer o resumir. | La persona que diseñó el flujo. | Un paso del modelo falla, pero el recorrido es predecible y auditable. |
| Agente de IA | Persigue un objetivo, elige qué herramientas usar y en qué orden, y actúa sobre sistemas externos. | El modelo, dentro de los límites que se le hayan dado. | Una acción errónea sobre un sistema real, errores encadenados, uso indebido de permisos. |
Definiciones basadas en OpenAI, A practical guide to building agents (2025), y Anthropic, Building effective agents (2024). La columna de riesgos es criterio editorial de Maccam Network.
Las definiciones de los dos principales laboratorios coinciden en lo esencial. OpenAI describe los agentes como sistemas que realizan tareas de forma independiente en nombre del usuario, con un modelo que gestiona la ejecución del flujo y toma decisiones, y con acceso a herramientas para interactuar con sistemas externos, siempre dentro de límites claramente definidos. Añade una precisión útil: las aplicaciones que integran modelos sin usarlos para controlar la ejecución del flujo (chatbots simples, modelos de un solo turno, clasificadores de sentimiento) no son agentes. Anthropic distingue entre workflows, orquestados mediante rutas de código predefinidas, y agentes, donde el modelo dirige dinámicamente su proceso y el uso de herramientas.
La consecuencia práctica es que “tenemos un agente” no dice nada sobre el nivel de riesgo. Lo dice la lista de acciones que puede ejecutar y los permisos con que cuenta. Si quieres ver cómo se aplica este criterio en un flujo concreto de ventas, lo desarrollamos en automatización de marketing con IA: de consultas a oportunidades.
Cuatro preguntas para saber si necesitas un agente
OpenAI propone priorizar flujos que históricamente se han resistido a la automatización tradicional, con tres señales: decisiones complejas que requieren juicio y excepciones (su ejemplo: aprobar reembolsos en atención al cliente), reglas difíciles de mantener por su complejidad (revisiones de seguridad de proveedores) y fuerte dependencia de datos no estructurados (tramitar la reclamación de un seguro). Su recomendación explícita es validar que el caso cumple estos criterios con claridad y, de no ser así, una solución determinista puede bastar.
A esas señales añadimos una condición propia de gestión. Un agente se justifica si respondes que sí a las cuatro preguntas siguientes:
- ¿La ruta no se puede fijar de antemano? Si sí se puede, un flujo es más barato, más rápido y más fácil de auditar.
- ¿Se puede verificar si el resultado es correcto? Anthropic señala que los agentes de código funcionan bien en parte porque las soluciones se verifican con pruebas automáticas. Sin un criterio de verificación, no sabrás si el agente se degrada.
- ¿Tiene el error un coste acotado y, si es posible, reversible? Si no, la acción debe pasar por aprobación humana.
- ¿El volumen y el valor justifican configurarlo, evaluarlo y supervisarlo? Un agente no es un producto que se instala; es un proceso que se opera.
Casos de uso por función
La tabla recoge ejemplos plausibles y, para cada uno, el nivel de autonomía que recomendamos al empezar. Es una guía de criterio, no una garantía de resultados: el valor depende de la calidad de los datos, del diseño del proceso y de la supervisión.
| Función | Caso de uso | Por qué encaja | Autonomía inicial recomendada |
|---|---|---|---|
| Atención al cliente | Resolver consultas con acceso a la base de conocimiento y al historial del cliente; gestionar cambios sencillos. | Conversación más acceso a herramientas; Anthropic cita el soporte como caso natural, con éxito medido por resoluciones. | Responde con información verificada; las acciones con impacto económico requieren aprobación y existe escalado a una persona. |
| Ventas y gestión de consultas | Calificar consultas, preparar resúmenes de cuenta, proponer reuniones. | Texto libre más criterios de encaje, con resultado medible en avance a oportunidad. | Propone y prepara; el vendedor decide. Más detalle en el flujo de consultas a oportunidades. |
| Marketing | Monitorización de menciones y competidores, análisis de campañas, preparación de informes. | Tareas de investigación con salida revisable. | Solo lectura y propuesta. Ver agentes de IA para marketing. |
| Operaciones y back-office | Revisión de documentos, conciliación de datos, tramitación de solicitudes con reglas y excepciones. | Datos no estructurados y reglas complejas; el ejemplo de OpenAI es la tramitación de reclamaciones de seguros. | Prepara el expediente; ejecuta solo acciones reversibles; el resto con aprobación. |
| Finanzas y control | Detección de anomalías, análisis de transacciones sospechosas, apoyo a cierres. | OpenAI ilustra con el análisis de fraude: un motor de reglas funciona como una lista de comprobación, mientras que un agente evalúa el contexto. | Señala y explica; no bloquea ni paga sin aprobación. |
| Tecnología y desarrollo | Asistencia en código con pruebas automáticas, revisión de incidencias. | Los resultados se verifican con pruebas, lo que permite iterar. | Trabaja en entornos aislados; los cambios pasan por revisión antes de producción. |
| Personas y selección | Organizar agendas, responder dudas internas con la política vigente. | Tareas de bajo riesgo y alto volumen. | Cautela con cualquier decisión sobre personas: la Comisión Europea incluye el empleo entre las áreas sensibles de la Ley de IA. Requiere análisis jurídico específico. |
Fuentes de los ejemplos: OpenAI (2025), Anthropic (2024), Comisión Europea (2026). Los niveles de autonomía son una recomendación de Maccam Network.
Observa lo que tienen en común los casos de la tabla: información no estructurada, decisiones con excepciones y una salida verificable. Y lo que tienen en común los casos que no funcionan: una promesa de “autonomía total” sin un criterio claro para saber si el agente acierta.
Cinco riesgos concretos (no genéricos)
1. Errores encadenados. Un agente que comete un error pequeño en un paso intermedio puede construir sobre él los pasos siguientes. Anthropic advierte de los costes superiores y de la posibilidad de errores compuestos en los agentes, y recomienda pruebas extensas en entornos aislados con las salvaguardas adecuadas. Contramedida: límites de pasos, validaciones intermedias y puntos de control.
2. Permisos excesivos y manipulación. El proyecto OWASP incluye la “agencia excesiva” (LLM06:2025) entre los riesgos de las aplicaciones con modelos de lenguaje. Aparece cuando un modelo puede invocar funciones o conectarse a sistemas y se le conceden demasiada funcionalidad, demasiados permisos o demasiada autonomía; puede dar lugar a acciones dañinas a partir de salidas inesperadas, ambiguas o manipuladas, ya sea por un fallo del modelo o por un ataque de inyección de instrucciones. Entre las medidas que recomienda: minimizar las herramientas disponibles, evitar herramientas abiertas (como comandos de consola), limitar los permisos a lo esencial y exigir aprobación humana para las acciones de alto impacto. Para riesgos propios de sistemas con agentes, el proyecto OWASP GenAI publicó el 9 de diciembre de 2025 el Top 10 for Agentic Applications 2026, una lista elaborada con la colaboración de más de cien especialistas; es una referencia técnica para tu equipo de seguridad o tu proveedor.
3. Responsabilidad. La empresa responde por lo que dice y hace su agente. Lo vemos en el caso siguiente.
4. Transparencia hacia el cliente. Si el agente interactúa con personas, hay obligaciones y expectativas de transparencia. En la Unión Europea, el artículo 50(1) de la Ley de IA exige informar a las personas de que interactúan con una IA salvo que sea evidente por el contexto. Incluso donde no exista esa obligación, ocultarlo erosiona la confianza; lo tratamos en cómo usar IA para conseguir clientes sin perder autenticidad.
5. Deriva y coste. Los agentes dependen de modelos, herramientas y datos que cambian. Sin un conjunto de casos de prueba y una revisión periódica, la calidad puede degradarse sin que nadie lo note, y el consumo de recursos puede crecer. No es un riesgo espectacular, pero es el más frecuente.
Quién responde cuando el agente se equivoca: el caso Air Canada
Entre las decisiones documentadas sobre responsabilidad por un asistente conversacional, una de las más comentadas es Moffatt v. Air Canada, 2024 BCCRT 149, resuelta el 14 de febrero de 2024 por el Civil Resolution Tribunal de Columbia Británica (Canadá).
Los hechos, según la propia resolución: un cliente consultó el chatbot de la aerolínea tras el fallecimiento de un familiar, y el chatbot le indicó que podía solicitar con carácter retroactivo una tarifa por duelo. La política real de la aerolínea no lo permitía. El cliente compró el billete confiando en esa información y, después, la aerolínea se negó al reembolso. Air Canada sostuvo, entre otros argumentos, que el chatbot era una entidad legal separada. El tribunal lo rechazó, al razonar que un chatbot forma parte del sitio web de la empresa y que Air Canada responde por toda la información que contiene, provenga de una página estática o de un chatbot. Concluyó que había incurrido en tergiversación negligente y le ordenó pagar 812,02 dólares canadienses en total: 650,88 en daños, 36,14 de intereses previos a la sentencia y 125 de tasas del tribunal (párr. 44 de la resolución).
Tres cautelas de lectura. Es una decisión de un tribunal de reclamaciones de menor cuantía, no un precedente vinculante, y su alcance depende de la jurisdicción. El chatbot de ese caso se limitaba a responder; no era un agente que ejecutaba acciones. Y la cuantía es modesta. Lo que importa es el razonamiento: ni la complejidad técnica ni la autonomía del sistema desplazan la responsabilidad de quien lo pone frente al cliente. Si eso aplica a un chatbot que solo habla, la exigencia razonable para un agente que actúa es mayor, no menor. Nada de esto es asesoría legal: consulta a un abogado.
Gobierno mínimo viable: niveles de autonomía y controles
No hace falta un departamento para gobernar un agente. Hace falta una decisión explícita sobre cuánta autonomía tiene y qué controles lo acompañan. Proponemos cuatro niveles.
| Nivel | Qué hace el agente | Controles mínimos |
|---|---|---|
| 0. Asistente | Sugiere; una persona ejecuta. | Revisión de la calidad de las sugerencias en muestras. |
| 1. Prepara y espera | Prepara la acción (borrador, expediente, orden) y espera aprobación. | Aprobación humana previa; registro de lo aprobado y rechazado. |
| 2. Ejecuta lo reversible | Realiza acciones de bajo riesgo y reversibles con límites claros. | Permisos mínimos, registro completo de acciones, muestreo periódico, mecanismo de reversión y de parada. |
| 3. Ejecuta lo crítico | Acciones sensibles, irreversibles o de alto impacto. | No recomendado en una primera fase. Si llega a considerarse: aprobación humana, límites cuantitativos y análisis jurídico. |
Marco de trabajo de Maccam Network. La guía de OpenAI recomienda supervisión humana para acciones de alto riesgo (por ejemplo, cancelar pedidos, autorizar reembolsos grandes o realizar pagos) y escalar a una persona cuando se superan umbrales de fallo.
Para ordenar estas decisiones en el tiempo, un marco de referencia muy conocido es el AI Risk Management Framework (AI RMF 1.0) del NIST, publicado el 26 de enero de 2023, de uso voluntario y estructurado en cuatro funciones: Gobernar (quién decide y quién responde), Mapear (para qué se usa y en qué contexto), Medir (cómo se evalúa el rendimiento y los riesgos) y Gestionar (qué se hace con los riesgos identificados). El NIST publicó el 26 de julio de 2024 un perfil específico para IA generativa (NIST-AI-600-1), y su página indica que el AI RMF 1.0 está en proceso de revisión en el marco del plan de acción de IA de la Casa Blanca, por lo que conviene consultar la versión vigente (página consultada a 9 de octubre de 2026).
Aplicado a un agente de empresa mediana, ese marco se traduce en cinco decisiones sencillas:
- Gobernar: un responsable con nombre para cada agente, y una lista de lo que puede y no puede hacer.
- Mapear: el proceso, los datos que toca, las personas afectadas y qué pasa si falla.
- Medir: un conjunto de casos de prueba con respuesta conocida y una revisión periódica de muestras reales.
- Gestionar: umbrales de fallo tras los cuales escala a una persona, un interruptor de parada y un registro de incidentes.
- Documentar: qué modelo, qué versión, qué herramientas y qué permisos tiene en cada momento.
Del piloto a producción: cuatro criterios de paso
Un piloto bien diseñado limita el alcance (un proceso, un canal), define de antemano qué cuenta como éxito y mantiene al nivel 0 o 1 mientras se mide. Para pasar a más autonomía, recomendamos exigir:
- Resultados medidos contra un conjunto de casos de prueba y contra la decisión de personas, con los errores analizados uno por uno.
- Acciones y permisos revisados: nada que el agente no necesite.
- Un procedimiento de escalado y de parada probado, no solo escrito.
- Un responsable que responda de los resultados, y una revisión jurídica donde haya clientes, empleados o datos personales.
Errores comunes
- Comprar “un agente” sin definir el proceso. Sin proceso documentado, el agente automatiza la ambigüedad. Es la misma lección de las tres condiciones previas a automatizar.
- Empezar por el caso de mayor impacto. Empieza donde el error es barato y reversible.
- Conceder permisos amplios “para que funcione”. Es el origen típico de la agencia excesiva.
- Medir solo el ahorro de tiempo. Mide también errores, escalados y satisfacción del usuario afectado.
- Olvidar al cliente. Si el cliente no sabe que habla con una IA, o no puede llegar a una persona, el ahorro se paga en confianza.
- Tratar la adopción como un proyecto tecnológico. Es un cambio de proceso y de responsabilidades; lo tratamos en cómo implementar IA en una empresa mediana sin quemar presupuesto.
El siguiente paso
Si estás evaluando agentes de IA en tu empresa, empezamos por lo que importa antes de la tecnología: qué procesos tienen las características adecuadas, qué nivel de autonomía es razonable y qué gobierno necesitan. Conoce nuestro servicio de Agentes de IA o escríbenos.
Fuentes
- OpenAI (2025). A practical guide to building agents. cdn.openai.com
- Anthropic (2024). Building effective agents (19 de diciembre de 2024). anthropic.com
- OWASP GenAI Security Project (2025). LLM06:2025 Excessive Agency, en OWASP Top 10 for LLM Applications 2025. genai.owasp.org
- NIST (2023). AI Risk Management Framework (AI RMF 1.0) y NIST (2024) Generative AI Profile (NIST-AI-600-1). nist.gov
- Civil Resolution Tribunal de Columbia Británica (2024). Moffatt v. Air Canada, 2024 BCCRT 149 (14 de febrero de 2024). decisions.civilresolutionbc.ca (texto original de la resolución; el servidor del tribunal puede bloquear descargas automatizadas).
- OWASP GenAI Security Project (2025). OWASP Top 10 for Agentic Applications for 2026 (9 de diciembre de 2025). genai.owasp.org
- Unión Europea. Reglamento de IA, artículo 50: obligaciones de transparencia (texto consolidado, AI Act Service Desk). ai-act-service-desk.ec.europa.eu
- Comisión Europea (2026). AI Act: marco regulatorio de la IA (actualizado el 3 de agosto de 2026). digital-strategy.ec.europa.eu
Nota editorial: este artículo ofrece criterios generales de gestión y no constituye asesoría legal. Fuentes verificadas a 9 de octubre de 2026.
Preguntas frecuentes
Un chatbot responde en una conversación; un agente, además, decide qué pasos dar y usa herramientas para actuar sobre sistemas externos hasta cumplir un objetivo. OpenAI lo define como un sistema que realiza tareas de forma independiente en nombre del usuario, y señala que las aplicaciones que integran un modelo sin usarlo para controlar la ejecución del flujo (chatbots simples, modelos de un solo turno, clasificadores) no son agentes. Anthropic lo describe como un sistema en el que el modelo dirige dinámicamente su proceso y el uso de herramientas, frente a los workflows, que siguen rutas de código predefinidas.
Las que combinan información no estructurada, decisiones con excepciones y pasos que no se pueden fijar de antemano, siempre que el resultado se pueda verificar y el error tenga un coste acotado: atención al cliente con acceso a herramientas, revisión de documentos, conciliaciones, preparación de informes, apoyo a desarrollo de software con pruebas automáticas. Las acciones sensibles, irreversibles o de alto impacto (pagos, grandes reembolsos, cancelaciones) deben requerir aprobación humana, tal como recomienda la guía de OpenAI.
En la práctica, la empresa que lo despliega. En el caso Moffatt contra Air Canada (2024 BCCRT 149), el Civil Resolution Tribunal de Columbia Británica rechazó que un chatbot pudiera tratarse como entidad separada y concluyó que Air Canada era responsable de la información de su sitio web, incluida la del chatbot. Es una decisión de un tribunal de reclamaciones de menor cuantía, no un precedente vinculante, pero ilustra un criterio probable. Esto no es asesoría legal; consulta a un abogado de tu jurisdicción.
El más conocido es el AI Risk Management Framework (AI RMF 1.0) del NIST de Estados Unidos, publicado el 26 de enero de 2023, de uso voluntario y organizado en cuatro funciones: Gobernar, Mapear, Medir y Gestionar. El NIST publicó además un perfil para IA generativa (NIST-AI-600-1) el 26 de julio de 2024. En la Unión Europea rige la Ley de IA, con obligaciones de transparencia para sistemas que interactúan con personas y reglas más estrictas para ciertos usos de alto riesgo. Ninguno sustituye el criterio de negocio ni el asesoramiento jurídico.
Depende del impacto de sus acciones. Como criterio de trabajo, un agente que solo propone requiere revisión posterior; uno que prepara acciones requiere aprobación antes de ejecutar; uno que ejecuta acciones reversibles y de bajo riesgo requiere registro, límites y muestreo; y las acciones irreversibles o de alto impacto deben mantener aprobación humana. Además, conviene fijar umbrales de fallo tras los cuales el agente escale el caso a una persona.
Cuando una regla simple o un flujo fijo resuelven el caso, cuando no puedes verificar si el resultado es correcto, cuando el error es costoso o irreversible y no hay supervisión posible, o cuando el volumen no justifica el esfuerzo de configurarlo, evaluarlo y supervisarlo. Anthropic recomienda empezar por la solución más sencilla y añadir complejidad solo cuando mejora de forma demostrable los resultados.
Nuevas ideas, análisis e investigaciones directamente en tu correo.
Suscríbete para recibir las nuevas publicaciones de Insights y otros contenidos seleccionados de Maccam Network. Sin spam. Te puedes dar de baja en cualquier momento.
¿Hablamos de tu empresa?
Hablemos de lo que necesita tu negocio.
Una conversación de 30 minutos es suficiente para entender el contexto, identificar el problema y ver si somos el equipo adecuado para ayudarte.