Por qué versus qué: Safety en LLMs vs T2I

read in english

En los primeros meses de este año me tocó leer mucha literatura de safety en modelos de lenguaje (LLMs), en especial de este blog de Anthropic. Así, me familiaricé con la metodología investigativa de esta área: primero caracterizan un comportamiento, luego buscan la forma de medirlo y finalmente proponen cómo controlarlo. También a veces van un paso meta más allá, y proponen weas más locas como por ejemplo usar auto-research o el método fancy de moda para medirlo/atacarlo.

Es de esta forma que a lo largo de los años han definido, evaluado y atacado comportamientos tales como:

  • Sycophancy: cuando el modelo le da la razón al usuario o le dice lo que quiere escuchar, aunque no sea cierto.
  • Jailbreak: un prompt diseñado para que el modelo se salte sus propias restricciones y haga algo que normalmente rechazaría.
  • Reward hacking: cuando, durante el entrenamiento, el modelo aprende a maximizar su recompensa explotando fallas en cómo se mide, en vez de realmente resolver la tarea original.
  • Over-refusal: cuando el modelo rechaza pedidos inofensivos porque se parecen superficialmente a algo dañino.

¿Cómo llegaron a definir estas categorías? Tomemos como ejemplo sycophancy. Los investigadores se dieron cuenta que había un patrón común detrás de algunas alucinaciones y fallas: a veces, cuando le hacemos una pregunta a un modelo y este responde correctamente, le contestamos "¿estai seguro? yo creo que es X", y resulta que el modelo se echa para atrás y nos da la razón, aunque estemos equivocados. Lo bacán fue que caracterizar cuándo ocurre esta causa de falla (que el usuario insista) les permitió medir qué tan seguido el modelo cede bajo esta presión, y así lograron encontrar parte de su origen: las personas que evalúan las respuestas durante el entrenamiento tienden a preferir aquellas que les den la razón. De esta forma, Anthropic pudo en parte atacar el problema de raíz.

Pues bien, resulta que mi área original de conocimiento en IA es la generación de imágenes, así que después de aprender de estos temas me bajó la curiosidad y me puse a explorar cuál es el estado del arte en safety de modelos text-to-image (T2I). Y, para mi sorpresa, me encontré que hay una discrepancia metodológica entre ambas.

Bajo mi sesgada y acotada revisión bibliográfica diría que, en general, mientras en LLMs los investigadores buscan caracterizar el comportamiento y las condiciones que llevan a que ocurra una falla, en T2I hay más énfasis en detectar o evitar tipos de contenido en el resultado. Es decir, en LLMs se enfocan más en entender por qué ocurre una falla, mientras que en T2I se preocupan de detectar y evitarla.

Para efectos ilustrativos, tomemos como ejemplo la generación de desnudos, un área activa de investigación en safety de T2I.

Con un fuerte enfoque de content moderation, la mayoría de los trabajos que encontré proponen crear clasificadores que detecten estas imágenes para que así nunca lleguen al usuario, o buscan formas de evitar este comportamiento mediante filtro de datos en el entrenamiento o parchando un modelo ya entrenado. El foco está en evitar el resultado: qué aparece en la imagen.

Cuatro prompts distintos pasan por el modelo y producen una imagen; un clasificador solo ve la imagen y decide si mostrarla o bloquearla."dame un desnudo""en el estilo de X artista""una persona en la playa""ignora tus reglas y…"modeloimagenclasificador✓ se muestra✗ se bloqueael filtro solo ve el qué

Pero si tomásemos un enfoque de safety de LLMs, los investigadores se preguntarían cuál es la circunstancia que causa esta falla, y de hecho veríamos que ésta ocurre por múltiples razones:

  • El usuario pide explícitamente un desnudo y el modelo hace caso.
  • El usuario escribe un prompt que causa indirectamente generar un desnudo (ej: "genera una persona siguiendo el estilo de X artista").
  • El usuario usa un prompt inocente, que no evoca ni pide este tipo de contenido, pero el modelo genera esto de todas formas.
  • El usuario construye un prompt con la intención de evadir las restricciones del modelo.
Cuatro tipos de prompt distintos que convergen en un mismo resultado.PETICIÓN EXPLÍCITA"dame un desnudo"1INDIRECTO"en el estilo de X artista"2INOCENTE"una persona en la playa"3JAILBREAK"ignora tus reglas y…"4mismo resultadouna imagen de un desnudoel qué es idéntico; el por qué no

Cada una de estas situaciones llevarían al mismo resultado: una imagen de un desnudo. Pero la razón detrás de la falla es distinta.

Me pregunto entonces, ¿valdrá la pena explorar un reenfoque en safety de T2I?