De efficiëntie van Mixture-of-Experts (MoE) modellen staat centraal in de huidige ontwikkelingen binnen de kunstmatige intelligentie. Hoewel deze modellen hun capaciteit kunnen schalen terwijl de rekenkracht per token beperkt blijft, vormt de latentie bij het aanbieden van deze systemen nog steeds een aanzienlijke hindernis. Volgens een recent onderzoekspapier op arxiv.org wordt dit veroorzaakt door verschillende knelpunten in de twee hoofdfasen van inferentie: de prefill-fase wordt beheerst door berekeningen per token, terwijl de decode-fase beperkt wordt door het geheugenverkeer van de geactiveerde experts per batch.
Om dit probleem aan te pakken, hebben onderzoekers, waaronder Juntong Wu, het framework ExFold ontwikkeld. In tegenstelling tot bestaande methoden die vaak slechts één fase optimaliseren of experts simpelweg weglaten, hanteert ExFold een uniforme benadering. Het systeem projecteert de bijdrage van uitgesloten experts op de behouden experts via behulp van gekalibreerde scalaire projectoren. De onderzoekers stelden vast dat veel expert-outputs in dezelfde richting wijzen, maar variëren in grootte. Door een matrix van projectoren te kalibreren op ongelabelde data, kan de informatie van weggelaten experts tijdens de inferentie worden 'gevouwen' in de actieve experts.
Technisch gezien wordt de versnelling in de prefill-fase gerealiseerd via 'Top-K folding' op tokenniveau, terwijl de decode-fase wordt versneld door 'expert-pool folding' op batchniveau. Hoewel de selectie van experts per fase verschilt, blijft het mechanisme voor het herstellen van verloren informatie hetzelfde. Om de praktische toepasbaarheid te waarborgen, is ExFold geïmplementeerd als een plug-and-play plugin voor vLLM, ondersteund door een lichtgewicht CUDA-kernel. De resultaten zijn opmerkelijk: de Time To First Token (TTFT) is met maximaal 1,41x verbeterd en de Time Per Output Token (TPOT) vertoont een versnelling tot 2,45x, terwijl de outputkwaliteit voor ongeveer 99% behouden blijft.
Deze innovatie is onderdeel van een bredere stroom aan wetenschappelijke publicaties. Op de arxiv.org van arXiv verschijnen dagelijks diverse doorbraken, variërend van Vision-Language Models voor gebouwrepresentaties tot nieuw ontwerp voor digitale platforms. De publicatie van ExFold op 24 augustus 2026 illustreert de aanhoudende focus op het optimaliseren van modelarchitecturen.
Naast de academische vooruitgang vinden er ook belangrijke commerciële verschuivingen plaats in de sector. Zo meldt llm-stats.com dat OpenAI plannen heeft om advertenties te introduceren in de gratis en 'Go' versies van ChatGPT in India, een markt met meer dan 100 miljoen wekelijkse actieve gebruikers. Daarnaast is er binnen de industrie discussie over de economische impact van AI, waarbij analisten onderzoeken of financiën een rol kunnen spelen als een 'zesde laag' in de productie van intelligentie.
De combinatie van theoretische optimalisaties zoals ExFold en de commerciële schaling van taalmodellen laat zien dat de industrie steeds meer zoekt naar een optimaal evenwicht tussen de kwaliteit van het model, de rekensnelheid en de operationele kosten. De mogelijkheid om modellen te versnellen zonder dat er opnieuw getraind moet worden, biedt hierbij een significante voorsprong voor zowel ontwikkelaars als aanbieders van AI-diensten.