← Terug
Nieuwe benchmark CORE-Bench onthult tekortkomingen in code-retrieval voor AI-agenten

Nieuwe benchmark CORE-Bench onthult tekortkomingen in code-retrieval voor AI-agenten

De ontwikkeling van autonome AI-coding agents stuit op een fundamentele uitdaging: het vermogen om accuraat relevante codefragmenten terug te vinden binnen grootschalige softwareprojecten. Een nieuw onderzoek wijst uit dat er een aanzienlijk verschil bestaat tussen het simpelweg matchen van zoektermen en het daadwerkelijk navigeren door een volledige repository om complexe problemen op te lossen.

Om dit fenomeen te analyseren, hebben Fuwei Zhang en een team van onderzoekers CORE-Bench ontwikkeld. Deze benchmark is specifiek ontworpen om te testen hoe effectief AI-modellen code kunnen lokaliseren wanneer zij worden ingezet als agenten. Volgens een publicatie op arxiv.org schieten bestaande evaluatiemethoden tekort omdat zij zich vaak beperken tot het koppelen van een docstring aan een functie of eenvoudige 'snippet-level matching'. Dit negeert de realiteit van moderne softwareontwikkeling, waarbij een agent moet kunnen filteren tussen irrelevante elementen en contextuele informatie moet verzamelen om een gebruikersvraag correct te beantwoorden.

CORE-Bench evalueert de prestaties van AI-modellen op drie specifieke niveaus. Ten eerste wordt gekeken naar het algemene codebegrip en de logica. Ten tweede wordt de 'issue-to-edit lokalisatie' getoetst, waarbij de agent precies moet aanwijzen waar een wijziging in de code noodzakelijk is om een specifiek probleem op te lossen. Ten slotte meet de benchmark het vermogen tot breder context-retrieval, wat essentieel is om een compleet beeld van de softwarearchitectuur te krijgen.

De omvang van het onderzoek is aanzienlijk. De dataset is gebaseerd op instanties uit de SWE-bench-serie en bevat meer dan 180.000 queries en 106.000 labels voor relevantie. De resultaten van de experimenten met diverse embedding-modellen tonen een problematische trend: er is een sterke daling in prestaties zichtbaar zodra de overstap wordt gemaakt van eenvoudige zoekopdrachten naar de complexere scenario's van agentic coding. Dit bewijst dat modellen die uitblinken in simpele zoekvragen, niet automatisch effectief kunnen opereren als autonome agenten in een echte productieomgeving.

Ondanks deze resultaten biedt het onderzoek ook mogelijkheden voor verbetering. In de wetenschappelijke tekst via stellen de auteurs dat de prestaties van bestaande embedding-modellen aanzienlijk kunnen worden verhoogd door middel van eenvoudige 'supervised fine-tuning'. Dit suggereert dat de huidige beperkingen technisch overbrugbaar zijn. Het onderzoek is inmiddels geaccepteerd voor presentatie op de EMNLP 2026 conferentie.

Vanwege de gebruikte terminologie is er een mogelijke verwarring met andere systemen die dezelfde afkorting gebruiken. De term CORE wordt namelijk ook gehanteerd door de overheid van de staat Illinois. Zo beschrijft het illinois.gov het 'Comprehensive Online Regulatory Environment' (CORE) systeem. Dit platform is bedoeld voor de modernisering van professionele licentieaanvragen en heeft geen enkele relatie met kunstmatige intelligentie of code-retrieval.

Volgens de informatie van de is de derde fase van dit administratieve systeem inmiddels gelanceerd. Hierdoor kunnen mensen uit 131 verschillende beroepsgroepen hun aanvragen en vernieuwingen volledig digitaal afhandelen. Hoewel beide systemen de naam CORE dragen, bevindt de ene zich in de wereld van academische AI-benchmarks en de andere in de Amerikaanse publieke administratie.

Geraadpleegde bronnen
Lees origineel artikel — Nieuws
Waardering
0
Stem mee op dit artikel
Discussie
Nog geen reacties. Wees de eerste!