IA agéntica: lo que esconde la palabra
la ia agéntica está haciendo un trabajo de marketing enorme este año, y casi nada de ese trabajo va sobre lo que decide de verdad si un proyecto sale bien.
tengo varios de estos funcionando en mi propio negocio — una marca de moda que fundé en 2015, que vende en marketplaces, donde el trabajo operativo aburrido es real y los errores cuestan dinero de verdad (algunos están explicados aquí). ninguno fue difícil por el modelo. todos fueron difíciles por las mismas tres razones, y ninguna de ellas aparece en una demo.
la palabra describe una propiedad, no un producto
agéntico significa que el software elige su siguiente paso en vez de seguir uno que alguien escribió. es una distinción real y merece tener una palabra.
también es una distinción que no decide ningún presupuesto. el mismo desarrollo — un modelo que lee una petición y llama a la función correcta — se vende como ia agéntica en la mitad del mercado y como chatbot en la otra mitad, y el precio cambia en una proporción que nadie puede justificar mirando el código. cuando un proveedor dedica la reunión a cómo razona el modelo, te está enseñando el cuarto barato del trabajo.
la pregunta que hay debajo es el permiso. hasta dónde puede llegar antes de que firme una persona, qué no puede decidir nunca solo, y qué ocurre en la ejecución en la que se para. esas tres respuestas las escribe el negocio antes de que exista código, y son el proyecto entero.
la línea más importante la escribió alguien que no programa
cuando construí el robot que gestiona las solicitudes de devolución, la especificación llegó en una nota de cuatro frases de la persona que lleva ventas en mi negocio. una era una prohibición, y es la línea más importante de todo el sistema: nunca elegir «aprobar sin recoger la mercancía». o se rechaza, o se aprueba y se recoge.
yo no habría escrito esa línea. no es una decisión de ingeniería: es una decisión sobre cuánto vale una prenda devuelta frente al coste de una discusión, y quien vive con esa respuesta la conoce de una manera que yo no. todo lo demás sale de ahí: por defecto se aprueba y se recoge — la regla dice que en torno a nueve casos de cada diez — y un rechazo necesita un motivo que encaje en una de dos reglas escritas — más de catorce días entre la entrega y la reclamación, o un texto que describa un abuso evidente.
así es una lista de «nunca» cuando es real. es corta, es específica de un negocio, y viene de quien carga con el riesgo. una lista de «nunca» descubierta después de arrancar no es una especificación: es un parte de incidencias.
el límite vive en el permiso, no en el prompt
en el mismo negocio hay un robot construido alrededor de un solo trabajo: sacar productos de las promociones del marketplace antes de que empiecen. hoy solo lee. vigila el calendario de promociones por horario y le pasa un aviso a una persona, y la credencial que tiene es de solo lectura, así que no podría escribir en el marketplace ni aunque lo decidiera.
la mitad que escribe está diseñada y no está encendida. existe como exactamente una función — excluir — y en ese módulo no hay ningún camino para meter un producto en una promoción. no porque lo prohíba un prompt: porque nunca se escribió. encenderla sigue esperando a un problema de acceso que no he resuelto, y prefiero que espere ahí antes que soltar un robot cuyo único límite sea una frase en un prompt.
esa es la diferencia entre una garantía y una esperanza. un prompt que dice «no metas productos en promociones» es una instrucción a un modelo que acierta casi siempre. un módulo sin camino para meter nada es un hecho. cuando alguien te dice que su agente es seguro por cómo está escrito el prompt, te está describiendo una esperanza.
lo mismo vale para hasta dónde llega. no necesita acceso a todo para ser útil, y cada sistema en el que puede escribir es un sistema en el que puede equivocarse. la versión buena llega exactamente hasta donde llega su trabajo.
todos empezaron con dos semanas proponiendo
ninguno salió actuando solo. el robot de devoluciones pasó dos semanas con esta forma: él propone, una persona decide, y las dos respuestas se anotan. una o dos semanas de eso zanjan discusiones que ninguna demo zanja, porque dejas de hablar de si la cosa es buena y empiezas a leer los casos en los que no coincidisteis.
la mitad de esos desacuerdos son el robot equivocándose de una forma que se arregla con una regla. la otra mitad — y esta es la parte que justifica esas dos semanas — es el robot teniendo razón sobre algo que nadie había visto. ninguna de las dos sale en un porcentaje de acierto.
el robot que contesta a los compradores en el chat pasó por esto y no podía saltárselo, porque es la cara externa del negocio. tiene prohibido prometer una fecha de entrega, una devolución o dinero de cualquier tipo. una segunda pasada lee cada respuesta antes de que la vea nadie — y lo que sostiene la línea de verdad no es el modelo: es un filtro determinista, porque el revisor basado en modelo se escapaba con la variación y lo vimos hacerlo. ese filtro no es inteligencia: es una valla, y construirla llevó más tiempo que conseguir que la primera pasada escribiera bien.
cuándo la respuesta no es un agente
una tabla de decisión es más barata, más rápida, exactamente repetible y explicable ante un auditor. si el trabajo es una regla y en realidad nada tiene que elegir, la versión agéntica es una forma más cara de tener un peor rastro. he convencido a más gente de no hacer esto que de hacerlo, y la prueba es sencilla: di en voz alta qué decide la cosa. si la frase describe una consulta, quieres software, no un agente.
el otro punto honesto para parar es la medición. si nadie sabe decir cómo es un resultado correcto, no se puede evaluar, y lo que no se evalúa no se mejora y no avisa cuando se rompe. eso no es motivo para esperar a que salga un modelo mejor. es motivo para dedicar una reunión a acordar la regla, que suele valer más que el software.
¿qué hay que preguntarle a un proveedor sobre su propio agente?
tres preguntas, y funcionan con cualquiera que venda algo agéntico:
¿hasta dónde llega vuestro producto antes de que firme una persona? ¿qué no puede decidir nunca? y ¿qué hace en la ejecución en la que se para: quién se entera, y qué ve?
quien sepa contestar esas tres sobre lo suyo está describiendo un sistema. quien devuelva la conversación al modelo está describiendo una demo con una palabra mejor pegada encima. el problema no es la palabra. el problema es la palabra ocupando el sitio de esas tres respuestas.
relacionado: crear un agente de ia o encargarlo y cuando el robot se niega.
preguntas frecuentes
¿qué es la ia agéntica, en una frase? software que elige su siguiente paso en vez de seguir uno que escribiste tú. es una propiedad real y no es la que decide tu presupuesto: la que lo decide es el permiso.
¿en qué se diferencia un agente de un chatbot? un chatbot responde. un agente actúa: reserva, actualiza, devuelve dinero, se niega. la diferencia es la consecuencia, no la inteligencia, y por eso la ingeniería interesante está en el límite y no en el modelo.
¿cuánto cuesta de verdad un proyecto de ia agéntica? el modelo no. lo caro es el dato que se contradice entre tus sistemas, el registro de qué hizo y por qué, y la lista escrita de lo que no puede decidir solo. el modelo es una línea en la factura mensual.
¿cómo distingo un sistema real de una demo? hazle tres preguntas al proveedor sobre su propio producto: hasta dónde llega antes de que firme una persona, qué no puede decidir nunca, y qué pasa en la ejecución en la que se para. quien no sepa contestarlas sobre lo suyo te está enseñando una demo con una palabra mejor.
¿debe ser totalmente autónomo? normalmente un escalón menos de lo previsto. mirar y avisar, o redactar para que una persona firme, recupera casi todo el valor con una fracción del riesgo. actuar dentro de un límite escrito compensa cuando ya existe el registro.
¿quién escribe la lista de lo que no puede hacer nunca? quien asume el riesgo, no el ingeniero. en mi propio negocio, la línea más importante del robot de devoluciones la escribió la persona que lleva ventas, antes de que existiera una sola línea de código, y es una prohibición.
¿cómo se aplican los límites en la práctica? en el código y en la credencial, no en el prompt. uno de los míos funciona con una clave de solo lectura y su módulo de escritura tiene exactamente una función, excluir, sin ningún camino para añadir nada. eso es una garantía. pedirle a un modelo que se porte bien es una esperanza.
¿cuánto tarda en poder actuar solo? primero dos semanas funcionando al lado de la persona que hace hoy ese trabajo — así fue el mío: él propone, ella decide, y las dos respuestas se anotan. lo que importa es en qué porcentaje coinciden, y lo que más enseña son los casos en los que no.
¿sirven los sistemas multiagente? casi nunca al principio, y la pregunta suele ser señal de que el primero todavía no está construido. varios modelos hablando entre ellos multiplican las formas de fallar sin multiplicar lo que hacen.
si quieres una segunda opinión sobre si lo que te están vendiendo es un agente o una demo, la primera conversación es de una hora y es gratis. reserva una hora.
Creado con asistencia de IA.