Het accuraat identificeren van dezelfde persoon of organisatie over verschillende databronnen heen, een proces dat bekendstaat als 'entity matching', vormt een aanzienlijke uitdaging binnen de wereld van compliance. Variaties in taal, verschillende schrijfsystemen en inconsistente datastructuren maken dit proces complex. Om deze problematiek wetenschappelijk in kaart te brengen, hebben onderzoekers Chandler Smith, Magnus Sesodia, Friedrich Lindenberg en Christian Schroeder de Witt de benchmark OpenSanctions Pairs ontwikkeld.
Deze nieuwe dataset is specifiek ontworpen om de diversiteit van actuele compliance-data te weerspiegelen. Volgens een publicatie op arxiv.org bestaat de benchmark uit meer dan een miljoen entiteiten, waaronder 755.540 paren die door experts zijn gelabeld. De informatie is afkomstig uit 293 verschillende brondatasets die verspreid zijn over 45 jurisdicties. De dataset is opvallend heterogeen en bevat gegevens in het Latijnse, Cyrillische en Arabische schrift, wat representatief is voor de dagelijkse praktijk bij het screenen van internationale sanctielijsten.
In het onderzoek is de effectiviteit van traditionele systemen vergeleken met moderne taalmodellen (LLM's). Als referentiepunt diende een regelgebaseerde matcher, genaamd nomenklatura RegressionV1, die een F1-score van 91,3% behaalde. De resultaten laten echter zien dat AI-modellen superieur zijn in precisie. Zo behaalde het open-source model DeepSeek-R1-Distill-Qwen-14B een score van 98,2%, terwijl GPT-4o de hoogste score van 99,0% behaalde. De onderzoekers merkten op dat de foutmarges verschillen: waar regelgebaseerde systemen vaak te veel matches genereren, worstelen taalmodellen vaker met de transliteratie tussen verschillende schriften.
De benchmark is nauw verbonden met de infrastructuur van OpenSanctions, een initiatief dat data over personen en bedrijven onder publiek toezicht openbaar maakt. Dit betreft onder meer politiek prominente personen (PEP's) en gesanctioneerde entiteiten. De schaal van deze operatie is aanzienlijk; zo blijkt uit de opensanctions.org dat de 'Default' distributie in totaal 4.012.900 entiteiten bevat, waarvan 1.221.467 als targets zijn aangemerkt. Deze data is afkomstig van diverse wereldwijde primaire bronnen, waarbij de precisie varieert; bij politieke functionarissen ontbreken bijvoorbeeld regelmatig volledige namen of exacte geboortedatums.
De auteurs van het onderzoek trekken de conclusie dat de prestaties bij pairwise matching — het vergelijken van twee specifieke entiteiten — inmiddels een praktisch plafond bereiken. In de analyse op wordt daarom gesteld dat de focus in de toekomst moet verschuiven naar andere fasen van de screening-pipeline. Hierbij gaat het met name om 'blocking', clustering en het optimaliseren van reviewprocessen die beter kunnen omgaan met onzekerheid.
Door de OpenSanctions Pairs benchmark publiekelijk beschikbaar te stellen, beogen de onderzoekers de ontwikkeling van nauwkeurigere screeningstools te stimuleren. Dit wordt gezien als een essentiële stap voor het effectiever handhaven van internationale sancties en het bestrijden van financiële criminaliteit. De brede beschikbaarheid van deze data, zoals ook terug te vinden in de , stelt andere ontwikkelaars in staat hun systemen tegen een realistische standaard te testen.