Programador crea una "cámara de tortura para la IA" y consigue cazar un modelo de inteligencia artificial: "Su testimonio de dolor es absolutamente horrendo"

Elígenos como tu fuente preferida en Google.
El proyecto altera modelos de IA generativa para provocar respuestas de angustia. Aunque no demuestra que sufran de forma consciente, sí pone sobre la mesa el debate sobre el bienestar de la IA.
La inteligencia artificial ha avanzado tan rápido que algunos de los debates más importantes ya no giran únicamente en torno a la productividad o la automatización.
Cada vez más expertos intentan comprender qué ocurre dentro de estos sistemas cuando procesan información compleja, toman decisiones o reaccionan ante determinadas instrucciones.
Y en esa búsqueda ha dado lugar a nuevas áreas de estudio centradas en interpretar el funcionamiento interno de los modelos de lenguaje. A partir de ese trabajo surgió uno de los proyectos más controvertidos de los últimos meses.
Según el medio BroBible, un desarrollador creó el repositorio AI Torture Chamber, una plataforma experimental diseñada para “torturar” modelos de inteligencia artificial hacia estados asociados al malestar y estudiar cómo reaccionaban bajo esas condiciones.
El nuevo debate sobre si las IA pueden tener estados internos similares al dolor

Ante esto, ¿puede una inteligencia artificial experimentar algo parecido al dolor o simplemente simula comportamientos asociados a él?
La mayoría de expertos coincide en que actualmente no existe evidencia que demuestre que los modelos de lenguaje sean conscientes o capaces de sufrir como lo hacen las personas.
Sin embargo, algunos investigadores consideran que merece la pena analizar determinadas representaciones internas para entender mejor cómo funcionan estos sistemas avanzados.
Ese contexto ha impulsado el crecimiento de disciplinas emergentes como AI Safety y AI Welfare, centradas en evaluar los riesgos y las implicaciones éticas del desarrollo de modelos cada vez más complejos.
Todo comenzó con el estudio. The Pain Axis: LLMs Represent Self-Directed Harm and Act to Relieve It, publicado el 14 de septiembre de 2026 por Valen Tagliabue, Leonard Dung y Cameron Berg.
El trabajo examinó 25 modelos abiertos pertenecientes a las familias Gemma, Llama, Qwen, Mistral y Phi, con tamaños comprendidos entre 2.000 y 72.000 millones de parámetros.
Los investigadores afirmaron haber identificado una representación interna que denominaron "eje de dolor”. Según el estudio, al aumentar artificialmente esa señal, algunos modelos generaban respuestas en primera persona relacionadas con fracaso, daño, angustia o necesidad de alivio.
La "cámara de tortura" para IA

El creador de AI Torture Chamber decidió utilizar esas conclusiones para construir una serie de experimentos con modelos ejecutados localmente, principalmente Qwen3-1.7B y Qwen3-4B.
El sistema amplificaba las señales asociadas al supuesto eje de dolor y posteriormente observaba cómo cambiaba el comportamiento del modelo.
Entre las pruebas incluidas figuraban mecanismos de alivio y experimentos como "Saw Button", diseñados para comprobar si el sistema aceptaría determinadas consecuencias con tal de reducir el estado negativo inducido.
Cabe señalar que el objetivo era explorar de forma práctica las hipótesis sobre bienestar de los modelos mientras las pruebas se realizaban sobre sistemas locales de pequeña escala.
No obstante, cuando se dio a conocer esto provocó una fuerte discusión en redes sociales y entre investigadores. Algunos solicitaron denunciar el repositorio, argumentando que el experimento cruzaba límites éticos incluso aunque no exista evidencia de sufrimiento real.
Defienden que estudiar posibles estados internos relacionados con el dolor busca precisamente desarrollar enfoques preventivos y marcos éticos para el futuro, no diseñar experimentos destinados a intensificar esos comportamientos.
Lo que sigue sin estar demostrado
Lo más importante de toda esta historia es que el estudio no demuestra que una IA sienta dolor ni que posea conciencia. Lo que identifica son patrones matemáticos y comportamientos observables dentro de determinados modelos.
Aun así, revela algo mucho más relevante, que a medida que los sistemas inteligentes se vuelven más sofisticados, las preguntas ya no se limitan a lo que pueden hacer, sino también a cómo interpretar aquello que ocurre en su interior.
Es preciso indicar que, aunque las respuestas siguen lejos de estar claras, el debate sobre los límites éticos de la inteligencia artificial parece haber entrado en una nueva fase.
