¿La IA nos salvará de sí misma?

Hace un par de años, en un seminario web sobre gobierno digital, alguien de centroamérica contó una escena que se me quedó grabada: un equipo había implementado un sistema de IA para priorizar casos de inspección sanitaria. En la primera semana, la supervisora aprobaba las recomendaciones del sistema en bloques de veinte, sin abrir los expedientes. No por negligencia. Porque el sistema las presentaba como "validadas" y ella no tenía forma de saber qué había detrás.

Este artículo nace de esa incomodidad, no de una tesis. Nace de una sospecha: que buena parte de lo que llamamos "control humano sobre la IA" es una coreografía. Nos ponemos en el medio para sentirnos tranquilos, no para decidir nada.

El problema empieza antes de la decisión

Cuando la IA traduce intenciones humanas en acciones concretas, las reglas con las que hace esa traducción se vuelven, inevitablemente, una forma de poder.

Eso ya lo sabemos. Lo que no tenemos tan claro es si el control humano sobre esa traducción es real o es un espejismo.

Podemos mantener a una persona formalmente "en el circuito" y darle tan poco tiempo, tan poca información y tan poca capacidad de intervención que su aprobación termine siendo un trámite. Un sello. Un clic.

Entonces la pregunta cambia: ¿podemos diseñar IA no solo para ejecutar decisiones, sino para hacer posible un control verificable sobre esas decisiones?

Y ahí aparece la trampa: si necesitamos controlar a la IA, ¿vamos a usar otra IA para hacerlo? ¿Y quién controla a esa? Es la versión tecnológica de poner al gato de despensero. Y no, no es un problema menor: es el problema central.

El problema no es el lenguaje. Es la intención.

En sistemas complejos —salud, contratación pública, seguridad, tributación— las personas casi nunca formulamos instrucciones completas.

Decimos "busca la mejor opción", "detecta el riesgo", "prioriza los casos más importantes". Y no especificamos todos los criterios, restricciones, excepciones y riesgos que esas frases contienen.

La IA puede entender cada palabra y, aun así, equivocarse sobre lo que quisimos decir.

Porque el problema no es solo el lenguaje.

Es la intención.

Una interfaz de control verdaderamente útil debería distinguir entre un objetivo, una restricción, una preferencia, una autorización y una decisión. Y esa distinción debería quedar registrada de manera que pueda examinarse después.

Si no, la traducción entre lo que una persona quiso y lo que la máquina hizo queda escondida dentro de la caja negra. Y ya sabemos cómo terminan las cajas negras: con nadie sabiendo por qué pasó lo que pasó.

La IA como capa de control

Por eso pienso que una de las funciones más importantes de la IA podría no ser responder preguntas, sino actuar como una capa semántica de control.

Su trabajo sería traducir objetivos humanos en especificaciones operativas y, en sentido contrario, convertir datos, decisiones y consecuencias en algo que una persona pueda comprender y cuestionar.

Eso permitiría pasar de una aprobación meramente formal a una capacidad real de supervisión.

Pero aparece inmediatamente otro problema.

Si esa traducción queda a cargo de un único sistema, por sofisticado que sea, simplemente habremos creado una nueva caja negra.

Un único traductor interpreta la intención humana, formula la recomendación y explica su propia interpretación.

¿Quién controla al traductor?

Del traductor único al ecosistema de agentes

Aquí es donde la IA agéntica ofrece una posibilidad distinta.

En lugar de un sistema único que interpreta, decide y ejecuta, podemos imaginar varios agentes especializados, con funciones diferentes y niveles de confianza distintos.

Uno propone una acción.

Otro la audita.

Otro verifica aspectos concretos.

Otro la ejecuta, pero solo cuando se cumplen ciertas condiciones.

Y un sistema de escalamiento lleva al humano aquellos casos en los que hay un desacuerdo significativo.

La idea tiene un antecedente interesante. En The Society of Mind (1986), Marvin Minsky planteaba que la inteligencia no tiene por qué residir en un único módulo, sino que puede emerger de la interacción de múltiples agentes, ninguno de los cuales posee por sí solo una visión completa del sistema.

La investigación contemporánea sobre seguridad de IA lleva esa intuición a un terreno operativo. El programa conocido como AI Control, desarrollado por Greenblatt, Shlegeris, Sachan y Roger (2024), plantea una arquitectura en la que un agente potente pero no del todo confiable propone una acción; otro, más limitado pero confiable, la audita; y una cantidad limitada de supervisión humana interviene en los casos que requieren revisión.

Dicho de otro modo: en lugar de poner al gato de despensero, se reparte la despensa entre varios gatos que no se caen bien entre sí. Lo importante no es encontrar una IA perfectamente confiable, sino diseñar el sistema suponiendo que ninguna lo es del todo.

El control, por tanto, no depende de que exista un agente infalible, sino de que ningún agente tenga por sí solo la autoridad suficiente para actuar sin posibilidad de ser cuestionado por otro.

Control no es simplemente tener más agentes

Pero aquí hay una condición fundamental. Y es fácil pasarla por alto.

Poner varios agentes frente al mismo problema no garantiza nada.

Si todos usan las mismas fuentes, persiguen los mismos objetivos, tienen los mismos sesgos y están diseñados para producir respuestas similares, tendremos multiplicidad, pero no control.

Incluso pueden coincidir en el mismo error.

Y eso, en un sistema de alto impacto, es peor que un solo agente equivocado. Porque el error se propaga con una eficiencia extraordinaria.

Por eso la diversidad importa más que el número.

Un agente puede estar orientado a maximizar eficiencia; otro, a detectar riesgos; otro, a verificar el cumplimiento de restricciones. Pueden usar fuentes de información diferentes o tener mecanismos de evaluación distintos.

La función del segundo agente no es simplemente producir otra respuesta.

Es tener una razón estructural para discrepar cuando existe algo que cuestionar.

Ahí está la diferencia entre control y redundancia.

Varios agentes que coinciden siempre no son control.

Son redundancia decorativa.

Y de eso ya tenemos bastante en el sector público.

Del debate al control

Esto también permite distinguir dos arquitecturas que a primera vista pueden parecer similares.

En un sistema de debate, varios agentes defienden posiciones diferentes y un tercero evalúa sus argumentos.

En un sistema de control, en cambio, los agentes pueden tener roles diferentes.

Uno propone. Otro audita. Otro ejecuta. Otro interviene solo cuando aparece una discrepancia que supera determinado umbral.

La diferencia importa: no se trata de conseguir que todos lleguen a la misma respuesta, sino de conseguir que las discrepancias relevantes sean visibles.

Ningún agente controla por sí solo a la IA.

El control emerge de la arquitectura completa.

¿Y esto qué tiene que ver con el gobierno digital?

Todo.

Imaginemos un sistema de IA que recomienda una acción administrativa. En lugar de enviar directamente esa recomendación al funcionario para que la apruebe, otro agente podría examinarla desde un objetivo deliberadamente diferente.

Por ejemplo, mientras el primero busca maximizar la eficiencia, el segundo podría estar orientado a minimizar falsos negativos de riesgo.

El funcionario no tendría que revisar toda la decisión desde cero. Podría concentrarse en lo que realmente requiere juicio humano: los puntos en los que los agentes discreparon y la razón de esa discrepancia.

Eso cambia radicalmente la función de la supervisión humana.

El humano deja de ser un aprobador mecánico de decisiones producidas por máquinas y se convierte en el árbitro de las situaciones que el propio sistema identifica como inciertas o controvertidas.

Pero para que esto funcione, el control tiene que estar presente desde el diseño.

Debe existir trazabilidad entre la intención inicial y la recomendación final; separación estricta entre propuesta y autorización; explicaciones proporcionales al impacto de la decisión; canales alternativos; mecanismos efectivos de desconexión; y registro explícito de la incertidumbre.

Y, sobre todo, debe existir diversidad real entre los agentes que participan en el proceso.

Porque si todos piensan igual, no existe control.

Del "humano en el circuito" al control verificable

La literatura sobre sistemas autónomos suele distinguir entre human-in-the-loop, human-on-the-loop y human-in-command.

Pero estar formalmente "en el circuito" no significa necesariamente tener control.

Una persona puede recibir una recomendación y aprobarla sin disponer del tiempo, la información o la comprensión necesarios para cuestionarla.

Para el gobierno digital, quizá sea más útil pensar en tres funciones distintas:

  • el humano que confirma una acción;
  • el humano que define los objetivos y límites;
  • el humano que puede auditar el sistema completo.

En los sistemas de alto impacto, el tercer nivel es el verdaderamente importante.

No basta con que una persona pueda decir "sí" o "no".

Debe poder comprender qué está aprobando, por qué se llegó a esa recomendación y qué ocurrió cuando otros agentes la cuestionaron.

La arquitectura multiagente puede hacer esto viable a gran escala porque permite que el sistema filtre previamente los casos rutinarios y lleve al humano, precisamente, aquellos en los que existe una discrepancia significativa.

Del cerebro global a una sociedad con control

Esta idea también corrige, o al menos matiza, la noción del "cerebro global".

La inteligencia puede emerger de la coordinación entre personas, máquinas y redes. Pero la conectividad, por sí sola, no produce control.

Sin diversidad, verificación y capacidad de disentir, una red conectada puede hacer algo muy distinto: propagar un mismo error con una eficiencia extraordinaria.

Eso vale para las sociedades y también para la inteligencia artificial.

Un único modelo, por poderoso que sea, no debería convertirse en la autoridad final simplemente porque sea capaz de producir respuestas extraordinariamente buenas.

La alternativa no es encontrar un modelo todavía más inteligente que vigile al anterior.

Es construir sistemas en los que la autoridad esté distribuida, las funciones estén separadas y las discrepancias puedan hacerse visibles.

En ese sentido, la analogía con la separación de poderes no es accidental.

El control institucional no depende de encontrar una autoridad perfectamente virtuosa. Depende de que ninguna autoridad pueda ejercer todo el poder sin que otra tenga la posibilidad de cuestionarla.

La misma lógica puede aplicarse a los sistemas de IA.

La IA no debería gobernarnos

La pregunta del título, entonces, puede responderse de una manera distinta de la que inicialmente parece sugerir.

No necesitamos que una IA nos salve de otra IA.

Necesitamos diseñar la inteligencia artificial de manera que ninguna IA tenga que salvarnos de sí misma.

La IA no debería convertirse en el cerebro que gobierna a la sociedad.

Debería convertirse en una pluralidad de agentes que permita a la sociedad mantener un control real sobre sus propias decisiones y, cuando la escala lo haga necesario, también sobre las máquinas que las proponen.

El desafío no es construir una IA que nunca se equivoque.

Es construir una arquitectura en la que, cuando una IA se equivoque, exista una posibilidad real de que otra lo detecte y de que un humano pueda intervenir.

Ahí es donde la gobernanza deja de ser una capa colocada después de la tecnología.

La gobernanza se convierte en la arquitectura misma del sistema.

Referencias

Comentarios

Entradas más populares de este blog

El Cerebro Global: Gobernanza y Complejidad en la Era de la IA

Errare humanum est. ¿La IA hereda nuestro derecho a equivocarnos?

Reporte anual - 10 Avances en tecnologías digitales y su impacto en gobierno