OpenAI blinda a ChatGPT Atlas contra ataques de inyección de prompts

Written by

in

El gigante de la inteligencia artificial generativa OpenAI ha lanzado una actualización de su navegador basado en IA ChatGPT Atlas con el fin de protegerlo de ataques de inyección de prompts. 

En estos ataques dirigidos a los modelos de lenguaje de gran tamaño (LLM) los actores maliciosos crean entradas maliciosas camufladas como instrucciones legítimas, manipulando a los sistemas de IA generativa para que filtren datos confidenciales, difundan desinformación o hagan cosas incluso peores. 

IBM explica que en los incidentes de este tipo más básicos un chatbot de IA puede ignorar las protecciones del sistema y decir cosas que no debería decir.

“Las inyecciones de prompts plantean riesgos de seguridad aún mayores para las aplicaciones de IA generativa que pueden acceder a información sensible y desencadenar acciones a través de integraciones API. Piense en un asistente virtual basado en LLM que pueda editar archivos y escribir correos electrónicos. Con la instrucción adecuada, un hacker puede engañar a este asistente para que reenvíe documentos privados”, comenta el Gigante Azul en una entrada.

Estos envites son escurridizos y aprovechan el hecho de que las aplicaciones de LLM no distinguen claramente entre las instrucciones del desarrollador y las entradas del usuario

Los cibermalos pueden ocultar peticiones maliciosas en páginas webs, documentos o emails. Cualquier lugar es bueno para ‘esconderlas’. Cuando la IA lee dicho contenido, puede ser engañada e ignorar las peticiones del usuario, siguiendo las del atacante

“Escribiendo instrucciones cuidadosamente elaboradas, los hackers pueden anular las instrucciones del desarrollador y hacer que el LLM cumpla sus órdenes”, explican desde la empresa tecnológica. Así, la IA podría llegar a borrar archivos importantes o incluso transferir dinero sin que el usuario se percate de ello. 

Un Red Team robótico

Para un agente como ChatGPT Atlas los riesgos son muy elevados, porque interactúa con un amplia gama de contenido no confiable, que va desde documentos de trabajo hasta redes sociales.  

OpenAI se ha servido de una nueva técnica conocida como ‘equipo rojo automatizado’, siguiendo los métodos de algunas firmas de ciberseguridad. La empresa de Sam Altman ha desarrollado un atacante de IA especializado entrenado mediante aprendizaje por refuerzo. Dicho atacante trata repetidamente de comprometer el sistema, aprendiendo de sus éxitos y fracasos para idear ataques nuevos y sofisticados. 

De esta forma la empresa puede probar defensas a gran escala y simular ataques complejos de varios pasos. Dicho método ya habría descubierto exploits a largo plazo que se desarrollaron mediante docenas de pasos. 

Desde el gigante tecnológico insisten en que los ataques de inyección de prompts son un reto a largo plazo, similar a las estafas en línea y su novedad no supone una protección completa. No obstante, estas nuevas defensas automatizadas reducirían el riesgo significativamente. 

Comments

Leave a Reply

Your email address will not be published. Required fields are marked *