⚠️ KMI waarschuwing: Onweer in België Laatste update van KMI waarschuwingen voor België. KMI ↗ Kaart ↗ Artikel →
← Terug
Nieuwe benchmark onthult tekortkomingen van AI bij het genereren van datagrafieken

Nieuwe benchmark onthult tekortkomingen van AI bij het genereren van datagrafieken

Wetenschappers hebben een nieuwe evaluatiemethode genaamd DEEPCHART ontwikkeld om de betrouwbaarheid van Large Language Models (LLM's) te toetsen bij het produceren van wetenschappelijke visualisaties. Uit de resultaten blijkt dat AI-modellen vaak grafieken genereren die er professioneel en overtuigend uitzien, maar die in de kern gebaseerd zijn op onjuiste gegevens.

Het proces om complexe informatie om te zetten naar een visuele weergave is een essentieel onderdeel van moderne data-science. Volgens een publicatie op arxiv.org bestaat een correcte grafiekgeneratie uit drie cruciale fasen: het vinden van bewijsmateriaal in diverse bronnen, het berekenen van de juiste waarden en het accuraat renderen van de uiteindelijke visualisatie. Hoewel huidige modellen in staat zijn om instructies van gebruikers nauwgezet op te volgen en visueel aantrekkelijke resultaten te leveren, blijft de feitelijke juistheid van de gebruikte data een hardnekkig probleem.

Het gevaar van visuele hallucinaties

Een centraal punt in het onderzoek is het fenomeen van 'data-level hallucinations'. Hierbij creëert het model een grafiek die er correct uitziet, maar waarbij de getoonde cijfers niet overeenstemmen met de oorspronkelijke brongegevens. De auteurs van het onderzoek op stellen dat deze fouten bijzonder lastig te detecteren zijn, zeker wanneer de context waarin het model werkt lang is, veel ruis bevat of uit verschillende mediavormen bestaat.

Om deze tekortkomingen meetbaar te maken, is DEEPCHART ontwikkeld. Deze benchmark bevat 1.482 door experts gecontroleerde instanties van grafiekgeneratie. De dataset is opgebouwd uit praktijksituaties, waaronder financiële rapportages, wetenschappelijke artikelen en verslagen over ecosystemen.

Analyse van de foutenketen

Binnen het DEEPCHART-raamwerk wordt het proces opgesplitst in een specifieke pijplijn: extractie van brongegevens, het redeneren over de benodigde berekeningen en de uiteindelijke visualisatie. Door deze stappen apart te analyseren, konden de onderzoekers precies vaststellen waar het misgaat. De experimenten tonen aan dat fouten in de extractie- en redeneerfase zeer frequent voorkomen in realistische scenario's.

Een belangrijke conclusie uit de studie op is dat het simpelweg vergroten van het 'context window' — de hoeveelheid informatie die een model tegelijkertijd kan verwerken — niet voldoende is om de foutmarge te verlagen. Voor een werkelijk betrouwbare output is een fundamentele verbetering in het kwantitatief redeneren en het extraheren van bewijslast noodzakelijk.

Bredere context van taalmodellen

Deze problematiek past in het grotere plaatje van de ontwikkeling van LLM's. Zoals beschreven door google.com, zijn dit statistische modellen die getraind zijn op enorme hoeveelheden data om tekst te genereren, te vertalen en complexe taken uit te voeren. Moderne versies, zoals de Gemini-modellen, zijn multimodaal, wat betekent dat ze tekst, code en afbeeldingen kunnen combineren.

Hoewel deze geavanceerde systemen worden gepromoot vanwege hun vermogen tot redeneren en het ontsluiten van informatie uit beelden, laat het DEEPCHART-onderzoek zien dat er voor specifieke data-science toepassingen nog aanzienlijke onbetrouwbaarheid bestaat. De kloof tussen een visueel plausibele weergave en een feitelijk correcte weergave vormt een kritiek obstakel voor de volledige implementatie van AI in sectoren zoals de wetenschap en financiële wereld.

Geraadpleegde bronnen
Lees origineel artikel — Nieuws
Waardering
0
Stem mee op dit artikel
Discussie
Nog geen reacties. Wees de eerste!