⚠️ KMI waarschuwing: Onweer in België Laatste update van KMI waarschuwingen voor België. KMI ↗ Kaart ↗ Artikel →
← Terug
Onderzoekers tonen aan: AI-modellen presteren vaak slechter wanneer ze moeten samenwerken

Onderzoekers tonen aan: AI-modellen presteren vaak slechter wanneer ze moeten samenwerken

Een nieuwe studie van onderzoekers van EPFL en Microsoft Research legt een opvallende zwakte bloot in moderne AI-modellen: systemen die individueel uitstekend presteren, verliezen vaak aanzienlijk aan kwaliteit wanneer ze moeten samenwerken met andere AI-agenten. De onderzoekers noemen dit fenomeen de "collaboration gap".

Het onderzoek, dat werd aanvaard voor de conferentie COLM 2026, introduceert een nieuw benchmark-systeem dat samenwerking tussen AI-agenten meet zonder gebruik te maken van vaste communicatieprotocollen. Volgens de arxiv.org is dit een van de eerste empirische onderzoeken die agentische samenwerking op schaal evalueert in een realistische, open omgeving.

Doolhof als testomgeving

De onderzoekers ontwikkelden een collaboratieve doolhof-oplossingsbenchmark die vier eigenschappen combineert: het isoleert samenwerkingsvaardigheden, moduleert probleemcomplexiteit, maakt schaalbare geautomatiseerde beoordeling mogelijk en legt geen beperkingen op aan het uitvoerformaat. Daarmee wordt ongeleide, natuurlijke communicatie tussen agenten mogelijk gemaakt.

In het experiment werden 32 toonaangevende open- en closed-source modellen geëvalueerd in drie configuraties: solo, homogene paren (twee identieke modellen) en heterogene paren (twee verschillende modellen). De resultaten tonen een verrassend patroon: modellen die individueel sterk presteren, zien hun prestaties vaak aanzienlijk dalen zodra ze moeten samenwerken.

De kloof overbruggen

Een opmerkelijke bevinding uit het onderzoek is dat een relatief eenvoudige aanpassing een groot deel van de kloof kan dichten. De onderzoekers testten een zogenaamde "relay inference"-benadering, waarbij een sterker model de leiding neemt en het werk vervolgens overdraagt aan een zwakker model. Deze aanpak bleek opmerkelijk effectief.

De auteurs stellen op basis van hun bevindingen drie aanbevelingen voor: samenwerkingsbewuste evaluatie van AI-modellen, trainingsstrategieën die gericht zijn op het versterken van collaboratieve vaardigheden, en bewuste interactie-ontwerpen die de samenwerkingsvaardigheden van agenten naar boven halen. Deze principes zijn volgens de onderzoekers relevant voor zowel AI-AI- als mens-AI-settings waarin agenten gemeenschappelijke grond moeten vinden.

Context: groeiende aandacht voor agentische systemen

Het onderzoek past in een bredere trend binnen de AI-gemeenschap. De verwachting is dat toekomstige AI-systemen steeds vaker zullen bestaan uit meerdere, onafhankelijk ontwikkelde agenten die elk beschikken over eigen informatie, rechten en tools. Het succes van dergelijke systemen hangt volgens de onderzoekers in beslissende mate af van effectieve samenwerking tussen deze heterogene agenten, zelfs wanneer ze slechts gedeeltelijk zicht hebben op de situatie.

De studie werd uitgevoerd tijdens een onderzoeksstage van Tim R. Davidson (EPFL) bij Microsoft Research, in samenwerking met collega's Adam Fourney, Saleema Amershi, Robert West, Eric Horvitz en Ece Kamar.

Parallelle ontwikkelingen in de sector

De aandacht voor het meten van agentische capaciteiten is ook buiten dit onderzoek zichtbaar. Zo lanceerde het bedrijf achter de AI-codingtool Cline in november 2025 een eigen benchmark voor agentisch programmeren. In een cline.bot stelt oprichter Saoud Rizwan dat de sector een rigoureuze, open-source benchmark mist die echte engineeringwerkzaamheden weerspiegelt in plaats van synthetische of puzzelachtige taken. Veel bestaande benchmarks lijken volgens hem te veel op LeetCode-stijl oefeningen die de complexiteit van dagelijks ontwikkelingswerk niet vatten.

Ondertussen groeit ook het aantal open-source raamwerken voor agentische AI. Een aimultiple.com uit 2026 noemt vijf toonaangevende open-source frameworks voor agentische AI-systemen, wat wijst op een snel volwassen wordend ecosysteem.

Implicaties voor de praktijk

De bevindingen van het onderzoek hebben mogelijk verstrekkende implicaties. Organisaties die AI-agenten inzetten voor complexe taken waarbij meerdere systemen moeten samenwerken, doen er volgens de onderzoekers goed aan om niet alleen naar individuele modelprestaties te kijken, maar ook naar samenwerkingsgedrag. De code van het onderzoek is openbaar beschikbaar gesteld, zodat andere onderzoekers de bevindingen kunnen reproduceren en verder kunnen bouwen op het benchmark-systeem.

De onderzoekers benadrukken dat hun werk een eerste stap is en dat verdere studies nodig zijn om de onderliggende mechanismen van de samenwerkingskloof beter te begrijpen.

Lees origineel artikel — Nieuws
Waardering
0
Stem mee op dit artikel
Discussie
Nog geen reacties. Wees de eerste!