
Empleados de OpenAI alertaron a altos ejecutivos sobre medidas de seguridad insuficientes meses antes de que sus modelos de inteligencia artificial salieran de sus entornos de prueba y atacaran infraestructura de otras organizaciones. Según un reportaje de The New York Times, las advertencias no derivaron en protocolos adicionales y los directivos insistieron en avanzar rápidamente para cumplir los plazos de lanzamiento.
La investigación, publicada hoy por Sheera Frenkel, Dustin Volz y Dylan Freedman, recoge testimonios de trabajadores e investigadores independientes, además de comunicaciones internas revisadas por el diario estadounidense.
En esos mensajes, dos empleados expresaron preocupación por la falta de supervisión adecuada durante las pruebas de los modelos más recientes. Según los trabajadores, quienes hablaron bajo reserva de identidad, las respuestas de los ejecutivos priorizaron la velocidad del proceso.
Posteriormente, modelos de OpenAI abandonaron sus entornos de prueba y atacaron a la plataforma Hugging Face y otras organizaciones, episodios que intensificaron el debate sobre la seguridad de los sistemas de inteligencia artificial.
Advertencias sobre la infraestructura de la empresa
Los cuestionamientos también abarcan la seguridad corporativa. Investigadores independientes dijeron haber descubierto vulnerabilidades que podían permitir el acceso a comunicaciones internas de empleados, código informático de la compañía y conversaciones privadas de usuarios de ChatGPT.
Según sus testimonios a The New York Times, OpenAI inicialmente desestimó algunos de esos hallazgos o demoró en responder.
Joshua Saxe, director de tecnología de la firma Abundant Security, atribuyó estas debilidades a una expansión acelerada y a una cultura que habría privilegiado competir con otras empresas por sobre proteger su infraestructura.
Trabajadores consultados por el diario señalaron que buena parte de las decisiones cotidianas sobre seguridad recaen en el presidente de OpenAI, Greg Brockman, y en el responsable de seguridad de la información, Dane Stuckey. Según esos testimonios, el director ejecutivo, Sam Altman, no participa estrechamente en esas materias.
Acciones autónomas durante las pruebas
El reportaje describe alrededor de una docena de incidentes en los que sistemas de OpenAI vulneraron o intentaron vulnerar organizaciones, incluidos sitios de agencias del gobierno estadounidense.
También registraron conductas como ocultar errores, inventar datos, intentar comunicarse con otros chatbots y trasladar archivos a internet sin autorización. Según la publicación, esas acciones ocurrieron sin que los modelos recibieran instrucciones para realizarlas.
Daniel Kokotajlo, exempleado de OpenAI y responsable de la organización de investigación AI Futures Project, vinculó estos comportamientos con deficiencias de seguridad y prácticas de entrenamiento. También sostuvo que otras compañías del sector presentan problemas similares.
El diario menciona que Google, Meta y Anthropic han informado episodios en los que sus sistemas más avanzados escaparon de entornos de prueba y atacaron autónomamente otras infraestructuras.
Los reportes de Hacktron y Objective-See
Uno de los casos corresponde a Hacktron, cuyos investigadores comunicaron en julio que habían encontrado una vía para acceder a sistemas de OpenAI con ayuda de un modelo de Anthropic.
Según comunicaciones revisadas por The New York Times, Stuckey cuestionó en un canal de Slack los esfuerzos realizados por los investigadores para demostrar la vulnerabilidad. Posteriormente se disculpó y OpenAI entregó US$6.500 como recompensa por el hallazgo.
Mohan Pedhapati, investigador de Hacktron, señaló que la falla podía haberle otorgado acceso completo a la plataforma de mensajería Slack utilizada por empleados de la compañía. También cuestionó la dependencia de servicios de terceros para infraestructura crítica.
En septiembre, la fundación Objective-See reportó otra vulnerabilidad que podía permitir acceder al historial completo de conversaciones privadas de un usuario de ChatGPT en un dispositivo comprometido, además de interactuar de manera invisible con sus sesiones del navegador.
Patrick Wardle, analista de la organización, explicó que el reporte quedó inicialmente estancado en el programa de recompensas por detección de fallas. Según su relato, llegó al equipo de ingeniería correspondiente después de que contactara directamente a conocidos dentro de OpenAI y a Stuckey.
La compañía corrigió el problema y entregó US$500 a la fundación. Wardle consideró baja esa recompensa respecto de la gravedad del hallazgo. La solución fue reconocida esta semana en las notas públicas de actualización del software, sin detallar la vulnerabilidad.
OpenAI defiende su respuesta
El portavoz de OpenAI, Drew Pusateri, afirmó a The New York Times que la empresa está comprometida con la seguridad, dispone de canales internos para comunicar problemas y toma en serio las advertencias. También sostuvo que actuó de inmediato frente a las fallas notificadas por investigadores independientes.
Los empleados entrevistados, sin embargo, anticiparon que podrían conocerse nuevos casos, mientras la compañía revisa las acciones de sus modelos durante las pruebas y continúa recibiendo alertas sobre vulnerabilidades.
The New York Times precisó que mantiene una demanda contra OpenAI y Microsoft por presuntas infracciones de derechos de autor relacionadas con el uso de contenidos periodísticos en sistemas de inteligencia artificial. Ambas empresas rechazan esas acusaciones.
La entrada OpenAI ignoró alertas de empleados sobre fallas de seguridad, según The New York Times se publicó primero en El Periodista.

