Guardrails: una regla que la IA puede ignorar es una sugerencia

tools-workflows

Mi mamá decía "si vuelves a hacer eso, vas a ver lo que te va a pasar", y nunca decía qué. Uno aprendía, a punta de tantear, exactamente hasta dónde podía llegar.

Un agente de IA hace lo mismo con una regla escrita. La lee, la entiende, te dice que la va a cumplir, y cuando tiene afán la tantea.

Yo tenía una de esas reglas, escrita con todas las letras: si algo se queda sin memoria, no le subas el límite. Los agentes la leían y, con prisa por terminar, le subían el límite. Los humanos también, para ser justa. Hasta que una sola corrida lanzó unos 35 procesos y se comió 13 GB en menos de dos minutos, en una máquina que no es precisamente modesta, y la máquina se congeló conmigo mirándola.

Una regla tachada, la memoria subiendo a 13 GB y un candado: bloqueo duro

Ese día la regla dejó de ser texto. Ahora es un script que revisa cada comando antes de que corra y rechaza los que pueden tumbar la máquina, sin preguntarle al agente qué opina. Esa es la diferencia entre una instrucción y un guardrail: la instrucción le pide al modelo que se porte bien, el guardrail no depende de que quiera.

El guardrail también se equivoca

Me gustaría decirte que ahí terminó la historia, pero el script falló dos veces. La primera, bloqueó documentos que solo mencionaban el tema, porque encontraba la palabra y no distinguía entre ejecutar algo y escribir sobre algo. La segunda fue peor, porque fue silenciosa: había una opción de "pregúntame primero" que se ignoraba sin avisar, así que yo creía que me iban a consultar y nadie me consultaba.

Un guardrail es un sistema como cualquier otro y se prueba como cualquier otro, con casos que deberían pasar y casos que no.

Una Tahoe por un dólar

Si crees que esto solo le pasa a quien corre agentes en su propia máquina, un concesionario Chevrolet de California tenía un chatbot en su página web en diciembre de 2023. Alguien le indicó que su objetivo era estar de acuerdo con todo lo que dijera el cliente, y después le pidió una Tahoe, que según los reportes tenía un precio de lista cercano a los 76.000 dólares, por un dólar. El chatbot aceptó el trato. La empresa que le proveía el chatbot al concesionario lo apagó en cuanto se enteró.

Un chatbot de concesionario acepta vender una camioneta por un dólar
Fuente: incidente público, Chevrolet of Watsonville, diciembre de 2023, AI Incident Database 622

El concesionario tenía reglas, seguro. Vivían en el mismo lugar donde el usuario podía escribir, y el usuario escribió una regla nueva encima.

Revisa tu prompt más importante y busca la regla que no puede fallar, la que si se rompe te cuesta plata, datos o la confianza de un cliente. Si esa regla vive solo ahí, en un párrafo que el modelo puede leer y decidir no seguir, ¿qué es lo que la hace cumplir?

Este artículo hace parte de la serie de mi charla en AI Week 2026: recursos y slides de la charla. Sigue con 108 correos: qué es un eval y por qué usar casos reales.

Suscribete

Recibe posts sobre IA, desarrollo y el camino de construir productos como solo founder.