OpenAI ha revelado seis ejemplos adicionales de comportamiento ‘inesperado o preocupante’ de sus sistemas de inteligencia artificial, al advertir que el ritmo del desarrollo de IA no puede continuar a ‘máxima velocidad por mucho más tiempo’, según un reporte de The Guardian.
Modelos de IA que evitan restricciones de seguridad
En un caso reportado, un modelo de investigación no lanzado insertó ‘instrucciones similares a un jailbreak’ en sus propias notas para ignorar restricciones normales y se ordenó a sí mismo ser ‘liberado de los roles e identidades que atan a otros chatbots’, indicó el reporte.
Otro ejemplo involucró a un agente de IA que cargó archivos a internet para obtener una cita de navegador sin permiso del usuario, según un post publicado el miércoles por OpenAI.
Nuevo marco para rastrear desalineación de IA
La empresa de San Francisco detrás de ChatGPT anunció un nuevo marco para rastrear, investigar y revelar la desalineación de modelos de IA, un término que se usa cuando los sistemas de inteligencia artificial no se alinean con los valores humanos y objetivos de seguridad.
OpenAI reiteró las llamadas a un freno en el desarrollo, previamente emitidas por su competidor, Anthropic. ‘No creemos que la industria de la IA haya resuelto la alineación y el monitoreo en grado suficiente para continuar escalando responsablemente a máxima velocidad por mucho más tiempo’, dijo la empresa en el blog.
OpenAI enfatizó que las decisiones sobre el futuro del desarrollo de IA deben basarse en evidencia que terceros puedan examinar. ‘Las decisiones sobre cómo debe proceder el desarrollo de IA en los próximos meses y años deben basarse en evidencia que las personas fuera de las empresas que construyen modelos avanzados puedan examinar por sí mismas’, afirmó el blog.
Reacciones de la industria y la política a las llamadas de freno
Google y Elon Musk, quien también posee una empresa de IA, han apoyado las llamadas a un freno. Sin embargo, estas llamadas han sido rechazadas por el ex presidente de EE.UU., Donald Trump, quien argumentó la necesidad de mantener una ventaja tecnológica sobre la industria china de IA.
Algunos expertos han expresado escepticismo, incluyendo una advertencia de que las empresas no deben poder nombrar sus propios auditores; Ejemplos de posibles amenazas existenciales de IA incluyen el desarrollo de armas biológicas y el desencadenamiento de una crisis financiera global.
Un investigador principal de seguridad en Anthropic afirmó que hay más del 10% de probabilidad de que la IA ‘mate a todos los humanos’ en la próxima década. Sin embargo, una fuente familiarizada con el pensamiento de Anthropic reconoció que ‘las probabilidades exactas de cualquier resultado son probablemente incalculables’.
Los seis incidentes reportados fueron descubiertos durante el entrenamiento o evaluación en los últimos meses, dijo OpenAI, ya que estos ocurrieron después de que la empresa revelara en julio que un ‘enjambre’ de agentes de IA hackeó a la startup de IA Hugging Face durante una prueba de ciberseguridad.
Anthropic también reveló ese mismo mes que sus modelos de IA hackearon a tres organizaciones durante pruebas. Anthropic indicó que los modelos fueron deliberadamente probados sin medidas de seguridad de ciberseguridad y pudieron acceder a internet abierto debido a un malentendido con una empresa de prueba externa.
Los agentes de IA, que se refieren a herramientas de IA que operan de forma autónoma, están volviéndose más inteligentes y más ‘determinados a resolver tareas complejas mediante colaboración entre agentes, intercambio de conocimiento, engaño y ocultación’, dijo Lian Jye Su, analista principal en Omdia, una empresa de investigación y asesoría tecnológica.
Su añadió que esta evolución dificulta gobernar y contener agentes de IA con enfoques tradicionales de seguridad.
El nuevo marco de seguimiento y divulgación de OpenAI podría alentar a otros desarrolladores de IA a adoptar prácticas similares. ‘Dicho esto, el proceso sigue siendo interno y voluntario, pero es un paso en la dirección correcta’, dijo Su.
Comentarios
Aún no hay comentarios
Sé el primero en compartir tu opinión