Wetenschappers hebben een innovatieve benadering ontwikkeld om de betrouwbaarheid van grote taalmodellen te vergroten. De methode, die bekendstaat als 'Reinforced Hesitation', is bedoeld om het fenomeen van hallucinaties tegen te gaan, waarbij AI-systemen met grote zekerheid onjuiste informatie verstrekken. Volgens een publicatie op arxiv.org ontbreekt het huidige modellen aan het cruciale vermogen om te bepalen wanneer een vraag simpelweg niet beantwoord kan worden.
Uit de analyse blijkt dat zelfs de meest geavanceerde modellen vaak negeren dat foutieve antwoorden ernstige gevolgen kunnen hebben, ondanks expliciete waarschuwingen in de instructies. De onderzoekers, waaronder Mohamad Amin Mohamadi, stellen in hun dat het enkel aanpassen van prompts niet effectief is. Dit komt doordat de huidige trainingsstructuren AI-modellen belonen voor het geven van een antwoord, terwijl het weigeren van een vraag vaak wordt geïnterpreteerd als een tekortkoming. Hierdoor neigen modellen naar gokken in plaats van het aangeven van een gebrek aan kennis.
Om dit gedrag te corrigeren, introduceert de methode 'Reinforced Hesitation' (RH), een variant van Reinforcement Learning from Verifiable Rewards. In tegenstelling tot traditionele systemen die enkel onderscheid maken tussen goed en fout, hanteert RH een ternair beloningsmodel. Een correct antwoord levert een positieve score op, terwijl een foutief antwoord wordt bestraft met een negatieve waarde. Het aangeven dat een antwoord onbekend is, resulteert in een neutrale score. Door de zwaarte van de straf aan te passen, kunnen ontwikkelaars sturen op hoe conservatief een model moet reageren. In tests met medische vragen en logische puzzels bleek dat een strengere straf leidde tot een model dat vaker weigerde te antwoorden, wat essentieel is voor toepassingen met een laag risicoprofiel.
Daarnaast beschrijft het onderzoek twee strategieën voor de inzet van deze modellen. De eerste, 'cascading', stuurt vragen door een reeks modellen met verschillende tolerantieniveaus. De tweede, 'self-cascading', laat hetzelfde model een vraag opnieuw benaderen na een initiële weigering. Volgens de zijn beide methoden efficiënter en effectiever dan de veelgebruikte techniek van 'majority voting'.
Het uiteindelijke doel is om onthouding te transformeren van een teken van zwakte naar een betrouwbaar signaal. Door systemen te trainen op een vorm van gekalibreerde oprechtheid, worden ze transparanter over hun eigen beperkingen. Deze benadering sluit aan bij het concept van cambridge.org, wat in deze context staat voor de oprechtheid van het systeem over zijn eigen kennisniveau.
De bevindingen, waarvan de laatste revisie dateert van 6 oktober 2026, onderstrepen dat het aanleren van twijfel een noodzakelijke stap is voor de integratie van AI in kritieke sectoren waar accuraatheid van levensbelang is.