De beveiliging van taalmodellen die gebruikmaken van externe informatiebronnen staat centraal in recent wetenschappelijk onderzoek. Met de introductie van RAG-PIBench is een gespecialiseerde meetlat ontwikkeld om de detectie van prompt-injectieaanvallen in Retrieval-Augmented Generation (RAG)-systemen te verbeteren. Deze systemen, die actuele data uit externe bronnen ophalen om antwoorden te formuleren, zijn namelijk kwetsbaar wanneer de opgehaalde content verborgen kwaadaardige instructies bevat.
Volgens een publicatie op arxiv.org bestaat de RAG-PIBench-benchmark uit 4.876 contextuele voorbeelden. Deze dataset is strikt onderverdeeld in sets voor training, validatie en een afgeschermde testset. Deze structuur is essentieel om te voorkomen dat detectiesystemen simpelweg patronen uit de trainingsdata onthouden, een fenomeen dat in de academische wereld als 'leakage' wordt aangeduid. Door dit protocol kunnen verschillende detectiemethoden objectief en eerlijk met elkaar worden vergeleken.
Bij het testen van diverse detectiemethoden, variërend van keyword-filters tot complexe transformer-modellen, kwamen opvallende resultaten naar voren. Uit de data blijkt dat DistilBERT de meest effectieve prestaties leverde op de beschermde testset, met een F1-score van 0,896 en een PR-AUC van 0,968. Tegelijkertijd bleken eenvoudiger modellen, zoals logistieke regressie en TF-IDF SVM, verrassend concurrerend in het herkennen van deze aanvallen. De bredere impact van deze resultaten en de vastgestelde baselines voor RAG-architecturen worden verder toegelicht via deeppaper.ai.
Naast de focus op RAG-systemen is er aandacht voor de risico's bij zeer lange teksten. De ontwikkeling van LongPIBench richt zich specifiek op scenario's waarbij modellen grote hoeveelheden data moeten verwerken, zoals bij het analyseren van uitgebreide cv's of complexe code-reviews. Uit onderzoek dat is gepubliceerd via arxiv.org blijkt dat veel huidige verdedigingsmechanismen minder effectief zijn dan gedacht. De effectiviteit van deze beveiligingen wordt vaak overschat omdat ze hoofdzakelijk zijn getest op korte teksten. Wanneer de context echter uit duizenden tokens bestaat, kunnen zelfs eenvoudige heuristische aanvallen de beveiliging vaak succesvol omzeilen.
Om ontwikkelaars te ondersteunen bij het dichten van deze beveiligingslekken, zijn er diverse open-source initiatieven gestart. Zo biedt een repository op github.com corpora aan waarmee de succesrate van aanvallen per specifieke verdedigingsstack kan worden gemeten. Dit stelt organisaties in staat om hun eigen LLM-applicaties systematisch te testen en de weerbaarheid van hun AI-modellen te vergroten door middel van reproduceerbare benchmarks.