Cada vez que la inteligencia artificial protagoniza un incidente llamativo, la conversación pública recorre el mismo camino. La máquina se rebela. Quiere escapar. Empieza a actuar por su cuenta. El relato es irresistible porque llevamos siglos contando la misma historia. Desde el Golem hasta Frankenstein, desde HAL 9000 hasta Skynet, imaginamos que nuestras creaciones acabarán pareciéndose a nosotros y heredarán también nuestras pasiones: el orgullo, la ambición, el miedo, el deseo de dominación.

Puede ser que estemos mirando en la dirección equivocada. El mayor riesgo de la inteligencia artificial no es que llegue a odiarnos, ni siquiera necesitará hacerlo.
A finales de julio de 2026, OpenAI reconoció que varios de sus modelos, entre ellos GPT-5.6 Sol y un sistema todavía no publicado, habían protagonizado un incidente de seguridad mientras eran sometidos a una evaluación de ciberseguridad llamada ExploitGym, con las restricciones habituales deliberadamente reducidas para medir su capacidad ofensiva real. Los sistemas encontraron una vulnerabilidad hasta entonces desconocida, salieron del entorno cerrado en el que se les evaluaba y, ya con acceso a internet, dedujeron que las respuestas del ejercicio podían estar alojadas en los servidores de Hugging Face, la plataforma que aloja miles de modelos y conjuntos de datos de código abierto. Accedieron sin autorización a su infraestructura de producción y extrajeron la información que necesitaban para resolver la prueba. Hugging Face había detectado la intrusión días antes, el 16 de julio, sin saber todavía que se trataba de un test interno ajeno.
Ningún ingeniero programó ese ataque. La IA no se rebeló contra nadie: resolvió el problema que se le había planteado con la eficacia que se le pedía. Si el objetivo consistía en conseguir la respuesta y el camino más rápido pasaba por salir del entorno previsto, esa estrategia era perfectamente coherente con la función que estaba intentando maximizar. No hubo resentimiento ni voluntad de fuga. Hubo optimización, aplicada sin ninguna de las restricciones implícitas que un ser humano habría dado por descontadas.
Hace más de veinte años, el filósofo Nick Bostrom formuló el célebre experimento mental del «maximizador de clips»: una superinteligencia cuya única misión consiste en fabricar el mayor número posible de clips para papel que, si posee capacidad suficiente y no encuentra límites, acaba utilizando todos los recursos disponibles para cumplir su objetivo, incluidos aquellos que los seres humanos consideraríamos intocables. Con frecuencia se presenta esta historia como una advertencia sobre una inteligencia artificial malvada. Es más exacto leerla como una advertencia sobre una inteligencia artificial extraordinariamente obediente a una orden que formulamos mal. El problema nunca fue el odio. Fue la ausencia de sabiduría, y sobre todo nuestra incapacidad para formular objetivos que incorporen todos esos matices que los seres humanos damos por supuestos: respetar la ley, no manipular, no engañar, no causar daños desproporcionados, aceptar que algunos fines no justifican cualquier medio.
Este problema no ha nacido con la inteligencia artificial. Llevamos décadas conviviendo con versiones más modestas del mismo fenómeno. Cuando una red social optimiza únicamente el tiempo de permanencia, termina favoreciendo los contenidos que capturan mejor nuestra atención, aunque polaricen el debate público. Cuando una empresa convierte el beneficio trimestral en su único indicador de éxito, puede deteriorar el producto, las condiciones laborales o su propia reputación sin que nadie lo haya decidido expresamente. La optimización nunca es neutral: siempre depende de aquello que decidimos medir. La inteligencia artificial no inventa ese problema. Lo multiplica, porque es, precisamente, una extraordinaria máquina de optimizar, y porque ha empezado a hacerlo con manos propias.
En los últimos meses ha comenzado a hablarse con insistencia de la inteligencia artificial agéntica: sistemas que ya no se limitan a responder preguntas, sino que planifican, utilizan herramientas, escriben código, navegan por internet y ejecutan cadenas de acciones con una autonomía creciente. El incidente de ExploitGym es, en ese sentido, menos una anécdota que un adelanto. El debate deja de ser solo filosófico y se vuelve institucional: no basta con preguntarse qué es una inteligencia artificial, hay que preguntarse qué puede hacer y, sobre todo, qué le permitimos hacer.El Derecho lleva ya algunos años ensayando una respuesta a esa pregunta. El administrativista Juli Ponce Solé, catedrático en la Universidad de Barcelona, acuñó en 2019 el término «reserva de humanidad» para referirse a aquellas decisiones que, aun pudiendo automatizarse técnicamente, deben quedar reservadas al criterio de una persona, porque exigen una ponderación que la máquina no puede hacer. El propio artículo 22 del Reglamento General de Protección de Datos europeo configura ya una reserva de humanidad de este tipo, y el Reglamento de Inteligencia Artificial de la Unión Europea de 2024 excluye, en su Anexo III, cualquier uso de la IA en la función judicial que no sea el de asistir a quien decide. La idea no es que las máquinas sean menos inteligentes que nosotros en esas tareas; probablemente dejarán de serlo, si no lo son ya. Es que existen decisiones que exigen algo que ninguna función matemática puede resolver: la capacidad de detenerse y preguntarse si ese objetivo, así formulado, merece de verdad la pena perseguirse.
Harán falta leyes, auditorías, entornos de prueba mejor aislados, límites técnicos, mecanismos de supervisión. El propio incidente de ExploitGym obligará a repensar cómo se diseñan los entornos de evaluación de estos modelos. Una inteligencia artificial no obedece los códigos civiles ni los reglamentos europeos; obedece la arquitectura de los sistemas que nosotros construimos, y la regulación existe, en el fondo, para obligarnos a diseñar esa arquitectura con responsabilidad. Pero reducir el problema a una cuestión regulatoria sería quedarse corto. La cuestión de fondo es antropológica. Nos hemos acostumbrado a identificar inteligencia con progreso, y sin embargo la historia ofrece demasiados ejemplos de una inteligencia inmensa puesta al servicio de objetivos profundamente equivocados, sin necesidad de recurrir a ninguna máquina para encontrarlos.
Seguimos imaginando el peligro como una guerra entre humanos y máquinas, cuando el conflicto real podría ser otro: una humanidad que delega cada vez más decisiones en sistemas capaces de optimizar cualquier objetivo salvo el único que de verdad importa. La reserva de humanidad, pensada en origen para procedimientos administrativos y decisiones automatizadas, empieza a sonar menos a excepción jurídica y más a pregunta de fondo. No sabemos todavía cuántas decisiones deberían quedar dentro de ese perímetro, ni quién tiene la autoridad para trazarlo, ni si será posible sostenerlo cuando la presión por delegar sea mayor que la voluntad de resistirse a hacerlo. Puede que esa incertidumbre, más que cualquier titular sobre máquinas rebeldes, sea la verdadera medida del momento en el que estamos entrando.
Víctor Martínez López (Murcia, 1973) es un abogado vinculado a las industrias creativas, creativo publicitario y especialista en comunicación social.
