Wetenschappers hebben een nieuwe methode ontwikkeld om hallucinaties in zogenaamde 'Deep Research Agents' (DRA's) op te sporen. Volgens het onderzoek schieten huidige evaluatiemethoden tekort omdat ze enkel naar het eindresultaat kijken, terwijl fouten zich vaak onzichtbaar opstapelen tijdens het proces.
Het diagnosticeren van foutpatronen in geavanceerde AI-agenten die autonoom onderzoek doen, blijft een grote uitdaging voor de sector. In een recent gepubliceerd wetenschappelijk artikel, getiteld "Why Your Deep Research Agent Fails?", stellen onderzoekers Yuhao Zhan en collega's dat de huidige benchmarks te veel leunen op end-to-end evaluaties. Dit betekent dat alleen het uiteindelijke antwoord wordt beoordeeld, waardoor tussenliggende hallucinaties die tijdens het onderzoekstraject ontstaan, over het hoofd worden gezien.
Volgens de publicatie op arxiv.org is er een noodzakelijke verschuiving nodig van een resultaatgerichte benadering naar een procesbewuste evaluatie. De onderzoekers pleiten ervoor om hallucinaties te auditeren gedurende het volledige traject van planning, zoeken en samenvatten.
De PING-taxonomie: vier soorten fouten
Om deze fouten beter in kaart te brengen, hebben de auteurs de zogenaamde PING-taxonomie geïntroduceerd. Deze methode categoriseert hallucinaties in Deep Research Agents in vier complementaire typen:
- Propagation (Voortplanting): Fouten die in een vroeg stadium ontstaan en doorwerken in latere stappen.
- Intent (Intentie): Problemen met de bedoeling of richting van het onderzoek.
- Noise-induced (Ruis-geïnduceerd): Fouten veroorzaakt door irrelevante of storende informatie.
- Grounding (Fundering): Het onvermogen om claims correct te koppelen aan feitelijke bronnen.
Dit kader is omgezet in een gedetailleerd evaluatiesysteem dat trajecten opdeelt in 'atomaire acties', claims en sub-vragen. Door deze versnippering kunnen onderzoekers elke stap van het proces rigoureus verifiëren. De betrouwbaarheid van dit systeem is inmiddels gevalideerd aan de hand van standaard benchmarks voor feitencontrole en trajecten die door mensen zijn beoordeeld, zoals beschreven in de .
Stress-tests tonen betrouwbaarheidskloof aan
Om de theorie in de praktijk te testen, hebben de onderzoekers 'DeepHalluBench' gecreëerd. Dit is een verzameling van 100 taken die specifiek zijn ontworpen om hallucinaties uit te lokken, waaronder scenario's met bewuste tegenstrijdigheden (adversarial scenarios).
Bij het testen van zes representatieve Deep Research Agents bleek dat alle geëvalueerde systemen nog steeds aanzienlijke betrouwbaarheidskloven vertonen. De diagnostische analyse wijst uit dat deze mislukkingen vaak terug te voeren zijn op systemische tekortkomingen. Vooral de voortplanting van hallucinaties en cognitieve biases spelen hierbij een grote rol.
De resultaten, die op in de derde versie van het document zijn bijgewerkt, bieden volgens de auteurs concrete inzichten voor de optimalisatie van de architectuur van toekomstige AI-agenten. Door inzichtelijk te maken waar in het proces het precies misgaat, kunnen ontwikkelaars gerichtere verbeteringen aanbrengen in hoe AI-systemen informatie verwerken en verifiëren.
De volledige dataset en de gebruikte code voor dit onderzoek zijn publiekelijk beschikbaar gesteld via de om verdere wetenschappelijke validatie en ontwikkeling te stimuleren.