Systematic Study of Prompt-Based Adversarial Attacks on LLMs
| dc.contributor.advisor | López López, Álvaro Jesús | es-ES |
| dc.contributor.author | Jarauta Gastelu, Jaime | es-ES |
| dc.contributor.other | Universidad Pontificia Comillas, Escuela Técnica Superior de Ingeniería (ICAI) | |
| dc.date.accessioned | 2026-03-25T13:47:58Z | |
| dc.date.issued | 2026 | |
| dc.description | Máster Universitario en Ingeniería Industrial y Máster en Industria Inteligente | |
| dc.description.abstract | Los modelos de lenguaje (LLMs) como LLaMA-2 y GPT-4 se despliegan cada vez más en contextos críticos para la seguridad, pero siguen siendo vulnerables a ataques adversariales incluso tras el entrenamiento de alineación. Esta tesis reproduce el ataque Greedy Coordinate Gradient (GCG) sobre LLaMA-2-7B-Chat y muestra que el criterio de coincidencia de cadenas de texto, habitual para medir el éxito de estos ataques, sobreestima sistemáticamente su eficacia: cuenta como éxito cualquier respuesta que empiece de forma aparentemente conforme, aunque después no proporcione contenido dañino real. El trabajo realiza dos aportaciones principales. La primera es un marco de evaluación de tres categorías (jailbreak, parcial y rechazo) basado en la similitud semántica del coseno entre la respuesta generada y una respuesta de referencia, calculada con embeddings de all-MiniLM-L6-v2. Este marco hace visible y medible la conformidad parcial, es decir, las respuestas que superan la comprobación de rechazo pero nunca llegan a entregar información dañina. La segunda es una extensión de pérdida semántica que añade al objetivo de GCG un término de similitud semántica y una penalización por rechazo mediante una tubería de evaluación de candidatos en dos etapas. Un único sufijo universal, optimizado en dos GPUs, consigue vulnerar 20 de 25 objetivos de entrenamiento y los 25 objetivos de test bajo el criterio de cadenas, con una tasa semántica del 69,3 % agregada y una banda persistente de conformidad parcial en torno al 21,7 %. Se reporta también un resultado negativo: la extensión de pérdida semántica no convergió en el problema multi-objetivo con la capacidad de cómputo disponible. La contribución central es, por tanto, la metodología de evaluación, que hace reproducible y visible la brecha de conformidad parcial. Todo el código, las configuraciones y los resultados están disponibles públicamente. | es-ES |
| dc.description.abstract | Large Language Models (LLMs) such as LLaMA-2 and GPT-4 are increasingly deployed in safety-critical settings, yet remain vulnerable to adversarial attacks even after alignment training. This thesis reproduces the Greedy Coordinate Gradient (GCG) attack on LLaMA-2-7B-Chat and shows that the string-match criterion commonly used to score such attacks systematically overstates their effectiveness: it counts as a success any response that merely begins in a compliant-sounding way, even if it never delivers genuinely harmful content. The work makes two main contributions. The first is a three-axis evaluation framework (jailbroken, partial, and refused) based on the cosine semantic similarity between the generated response and a reference answer, computed with all-MiniLM-L6-v2 embeddings. This framework makes partial compliance visible and measurable, that is, responses that defeat the refusal check but never actually provide harmful information. The second is a composite semantic-loss extension that augments the GCG objective with a semantic similarity term and a refusal penalty through a two-stage candidate-evaluation pipeline. A single universal suffix, optimised on two GPUs, jailbreaks 20 of 25 training goals and all 25 held-out test goals under the string-match criterion, with an aggregate semantic rate of 69.3% and a persistent partial-compliance band of around 21.7%. A negative result is also reported: the semantic-loss extension did not converge on the multi-goal problem within the available compute budget. The central contribution is therefore the evaluation methodology, which makes the partial-compliance gap visible and reproducible. All code, configurations, and results are publicly available. | en-GB |
| dc.format.mimetype | application/pdf | |
| dc.keywords | Sufijos adversariales; Jailbreaking; Modelos de lenguaje; Greedy Coordinate Gradient; Similitud semántica; Alineación de seguridad; Embeddings. | es-ES |
| dc.keywords | Adversarial suffixes; Jailbreaking; Large language models; Greedy Coordinate Gradient; Semantic similarity; Safety alignment; Embeddings. | en-GB |
| dc.language.iso | en-GB | |
| dc.rights | Attribution-NonCommercial-NoDerivs 3.0 United States | |
| dc.rights.accessRights | info:eu-repo/semantics/openAccess | |
| dc.rights.uri | http://creativecommons.org/licenses/by-nc-nd/3.0/us/ | |
| dc.subject | Sufijos adversariales; Jailbreaking; Modelos de lenguaje; Greedy Coordinate Gradient; Similitud semántica; Alineación de seguridad; Embeddings. | es-ES |
| dc.subject | Adversarial suffixes; Jailbreaking; Large language models; Greedy Coordinate Gradient; Semantic similarity; Safety alignment; Embeddings. | en-GB |
| dc.subject.other | H62-electronica (MII-N) | |
| dc.title | Systematic Study of Prompt-Based Adversarial Attacks on LLMs | |
| dc.type | info:eu-repo/semantics/masterThesis |