⚠️ KMI waarschuwing: Onweer in België Laatste update van KMI waarschuwingen voor België. KMI ↗ Kaart ↗ Artikel →
← Terug
AI-gegenereerde beelden scheiden zich spontaan van menselijke kunst in CLIP-ruimte

AI-gegenereerde beelden scheiden zich spontaan van menselijke kunst in CLIP-ruimte

Onderzoekers hebben een opmerkelijk fenomeen vastgesteld binnen de representaties van CLIP, een model dat beelden en tekst met elkaar verbindt. Het blijkt dat kunstwerken vervaardigd door mensen en afbeeldingen gegenereerd door kunstmatige intelligentie zich in de zogenaamde 'embedding space' automatisch van elkaar scheiden. Deze splitsing vindt plaats zonder dat het systeem expliciet is getraind om dit onderscheid te maken, wat betekent dat er geen sprake is van een gestuurd leerproces voor deze specifieke taak.

Volgens een wetenschappelijke publicatie op arxiv.org vindt deze spontane scheiding plaats langs de dominante hoofdrichtingen van de gezamenlijke distributie. Hoewel dit mechanisme in theorie gebruikt zou kunnen worden om AI-kunst op te sporen, richt de auteur van het onderzoek, Andrea Asperti, zich primair op de interpretatie van dit proces. De centrale vraag is welke specifieke visuele kenmerken verantwoordelijk zijn voor deze scheiding en hoe deze abstracte data vertaald kunnen worden naar concrete visuele elementen in een afbeelding.

Om dit te onderzoeken is gebruikgemaakt van een combinatie van interpreteerbare beeldrepresentaties en gradiëntgebaseerde inversie. Deze techniek fungeert als een instrument om de relaties binnen de kenmerkruimte van het model te analyseren. Het model CLIP zelf is ontworpen om visuele concepten te leren door training op grote hoeveelheden afbeelding-tekstparen, zoals beschreven in de officiële documentatie van openai.com.

In de zoektocht naar de oorzaak van de scheiding zijn diverse hypothesen getoetst. Door middel van statistische beschrijvers en robuustheidstesten is gebleken dat eenvoudige lokale statistieken of globale eigenschappen van een beeld niet de doorslaggevende factor zijn. De resultaten wijzen eerder op een 'gedistribueerde multiscale beeldstructuur'. Hoewel 'multiscale scattering' een van de meest informatieve representaties bleek te zijn, biedt dit nog geen volledige verklaring voor het waargenomen fenomeen.

Een cruciale bevinding uit het onderzoek op is dat de scheiding tussen mens en machine vaak gebaseerd is op details die voor het menselijk oog onzichtbaar zijn. Door directe inversie van de data werd duidelijk dat minimale aanpassingen in een afbeelding — perturbaties die voor mensen nauwelijks waarneembaar zijn — een enorme impact hebben op de positie van het beeld in de CLIP-ruimte. Dit betekent dat het model reageert op visuele variaties die voor menselijke waarnemers geen enkele relevantie hebben.

Deze ontdekking legt een fundamenteel verschil bloot tussen hoe een mens naar kunst kijkt en hoe een neuraal netwerk visuele informatie verwerkt. De manier waarop CLIP heeft ontwikkeld om visuele representaties te koppelen aan taal, resulteert hier in een vorm van 'zienswijze' die patronen herkent die buiten het menselijke waarnemingsvermogen liggen. Het onderzoek, dat is ingediend onder de categorieën Computer Vision en Pattern Recognition, onderstreept hiermee de complexiteit van de interne logica van moderne AI-modellen en de kloof tussen algoritmische interpretatie en menselijke esthetiek.

Geraadpleegde bronnen
Lees origineel artikel — Nieuws
Waardering
0
Stem mee op dit artikel
Discussie
Nog geen reacties. Wees de eerste!