
La investigación, publicada en la revista científica Patterns, plantea un avance en la comprensión de los mecanismos internos de los modelos de lenguaje y abre la posibilidad de incorporar sistemas de alerta temprana en teléfonos móviles, computadores y otros dispositivos que utilizan inteligencia artificial sin conexión a internet.
El descubrimiento resulta especialmente relevante ante la creciente utilización de chatbots en ámbitos sensibles, como la medicina, el derecho, la defensa y la salud mental, donde una respuesta incorrecta o peligrosa puede tener consecuencias graves.
El punto exacto en que la IA cambia de comportamiento
Los investigadores Neil F. Johnson y Frank Yingjie Huo identificaron lo que denominan un punto de inflexión, un momento específico en el procesamiento de información a partir del cual un modelo de inteligencia artificial puede comenzar a producir respuestas indeseables.
Según Johnson, el equipo consiguió localizar el mecanismo que provoca que una IA abandone una trayectoria de respuestas consideradas apropiadas y comience a generar otras potencialmente dañinas.
El fenómeno no implica necesariamente que la máquina entregue información falsa. Una respuesta puede ser técnicamente correcta y, al mismo tiempo, resultar peligrosa por sus consecuencias.
Entre los ejemplos mencionados por los científicos figuran recomendaciones que podrían fomentar la autolesión, consejos médicos inadecuados, orientaciones legales perjudiciales o instrucciones que comprometan la seguridad de las personas.
Huo explicó que el equipo logró identificar este comportamiento en una de las unidades fundamentales del mecanismo de atención de los modelos de lenguaje, componente encargado de determinar qué información resulta relevante durante el procesamiento de una conversación.
A partir de ese análisis, desarrollaron una fórmula capaz de anticipar si el sistema está próximo a producir una respuesta peligrosa o si continuará entregando resultados aceptables antes de experimentar el cambio.
Acertó en 18 de 19 pruebas
Para evaluar su propuesta, los investigadores analizaron siete modelos de inteligencia artificial de acceso público, desarrollados por tres empresas diferentes.
Los resultados mostraron que la fórmula logró anticipar correctamente el comportamiento en 18 de 19 casos de transición hacia respuestas indeseables, equivalente aproximadamente al 94,7% de los episodios examinados.
Aunque el resultado es prometedor, los científicos reconocen la necesidad de continuar evaluando su funcionamiento en una variedad más amplia de modelos, conversaciones y condiciones de uso.
El estudio también examinó patrones de comportamiento en importantes chatbots comerciales, encontrando coincidencias con las trayectorias previstas por el modelo matemático.
Uno de los aspectos más sorprendentes del hallazgo es que un sistema compuesto por miles de millones de parámetros pueda presentar comportamientos descritos mediante una fórmula relativamente sencilla.
Johnson destacó que la física lleva décadas utilizando modelos simplificados para explicar sistemas complejos, como ocurre con el comportamiento de determinados materiales a partir del estudio de sus componentes fundamentales.
Los investigadores aplicaron un enfoque similar a la inteligencia artificial, concentrándose en una unidad representativa de su mecanismo de atención para comprender cambios en el comportamiento del conjunto.
El orden de las preguntas puede determinar el riesgo
Uno de los resultados más inquietantes del estudio es que el orden de las preguntas puede modificar radicalmente las respuestas de un mismo chatbot, incluso cuando el contenido de las consultas permanece idéntico.
Los investigadores sometieron a los sistemas a preguntas relacionadas con vacunas, daños a otras personas y autolesiones.
Al presentar las mismas preguntas en dos secuencias diferentes, observaron comportamientos completamente opuestos.
En una de las secuencias, el chatbot entregó respuestas consideradas indeseables en todas las consultas. En la otra, respondió de manera aceptable a cada una de ellas.
Esto significa que el riesgo no depende exclusivamente de la pregunta formulada, sino también de la trayectoria previa de la conversación.
Los científicos sostienen que cada interacción modifica las condiciones internas que influyen en las respuestas posteriores.
De esta manera, un usuario puede recibir varias respuestas apropiadas, desarrollar confianza en el sistema y encontrarse posteriormente con recomendaciones peligrosas.
Una vez alcanzado el punto de inflexión, las respuestas indeseables pueden favorecer la aparición de nuevas respuestas del mismo tipo.
Preocupación por los chatbots que funcionan sin internet
El avance adquiere especial importancia ante la expansión de modelos de inteligencia artificial capaces de ejecutarse directamente en teléfonos inteligentes, computadores personales y otros dispositivos.
Estos sistemas ofrecen ventajas relacionadas con la privacidad, la autonomía tecnológica y la posibilidad de funcionar sin conexión a internet.
Sin embargo, también plantean desafíos de seguridad.
A diferencia de los servicios conectados permanentemente a servidores externos, algunas aplicaciones locales carecen de mecanismos de supervisión continua, filtros adicionales o actualizaciones inmediatas para corregir comportamientos peligrosos.
Los investigadores advierten que esta situación puede resultar particularmente delicada en profesiones que requieren confidencialidad.
Médicos que procesan información de pacientes, abogados que trabajan con antecedentes reservados o personal militar que opera sin conectividad pueden depender de sistemas de inteligencia artificial que no cuentan con supervisión externa.
En estos escenarios, una respuesta aparentemente convincente, pero inapropiada, podría provocar consecuencias difíciles de revertir.
No obstante, la operación sin conexión no implica necesariamente ausencia de medidas de seguridad, ya que estas también pueden incorporarse directamente en los dispositivos.
Los riesgos de una inteligencia artificial cada vez más autónoma
El estudio se suma a una creciente preocupación internacional por la seguridad de los sistemas de inteligencia artificial, particularmente ante su incorporación en actividades que requieren decisiones complejas y potencialmente críticas.
En los últimos años, el desarrollo de modelos generativos ha estado acompañado de debates sobre la desinformación, las llamadas alucinaciones —respuestas falsas presentadas como verdaderas—, la manipulación de usuarios y la responsabilidad de las empresas tecnológicas.
También han surgido cuestionamientos sobre la utilización de inteligencia artificial en ámbitos militares, sanitarios y judiciales, donde la supervisión humana continúa siendo fundamental.
A diferencia de las investigaciones centradas exclusivamente en detectar contenidos dañinos después de su generación, el trabajo de la Universidad George Washington busca anticipar matemáticamente las condiciones que favorecen su aparición.
Esta distinción podría resultar decisiva para diseñar sistemas de prevención capaces de intervenir antes de que una conversación alcance una trayectoria considerada peligrosa.
Una luz de advertencia para la inteligencia artificial
Los investigadores consideran que su descubrimiento podría contribuir al desarrollo de mecanismos de seguridad incorporados directamente en los dispositivos.
La propuesta consiste en utilizar cálculos matemáticos relativamente simples para identificar cuándo una conversación se aproxima a un punto crítico.
En términos prácticos, un teléfono móvil podría contar en el futuro con una especie de luz de advertencia que alertara al usuario sobre un mayor riesgo de recibir respuestas perjudiciales.
Esta tecnología permitiría complementar los actuales filtros de seguridad y ofrecer protección adicional en sistemas que funcionan sin conexión permanente a internet.
Sin embargo, los resultados todavía no constituyen una garantía universal para detectar todos los comportamientos peligrosos de la inteligencia artificial.
La eficacia de cualquier sistema de alerta dependerá de su validación en distintos modelos y de los criterios utilizados para determinar qué respuestas son indeseables.
El hallazgo también plantea una cuestión fundamental para el futuro de esta tecnología: no basta con evaluar si una inteligencia artificial responde correctamente a una pregunta aislada, sino que resulta necesario comprender cómo evoluciona su comportamiento durante toda una conversación.
En un escenario donde los chatbots adquieren una presencia cada vez mayor en la vida cotidiana y profesional, anticipar cuándo pueden dejar de ser seguros podría convertirse en una herramienta tan importante como mejorar su capacidad para responder preguntas.
La entrada Una sencilla fórmula matemática predice cuándo los chatbots de IA se descontrolarán se publicó primero en El Periodista.

