Subjects
Sufijos adversariales; Jailbreaking; Modelos de lenguaje; Greedy Coordinate Gradient; Similitud semántica; Alineación de seguridad; Embeddings.
Adversarial suffixes; Jailbreaking; Large language models; Greedy Coordinate Gradient; Semantic similarity; Safety alignment; Embeddings.