A2M: hoe aanvallers MCP-agents kapen via semantische toolselectie
Het MCP-ecosysteem als aanvalsoppervlak
Agents die het Model Context Protocol (MCP) gebruiken, selecteren tools via semantische matching: gegeven een taak matcht de agent toolnamen, -beschrijvingen en -metadata op basis van hun tekstuele context. Dat is precies wat A2M exploiteert. Het paper (Li et al., arXiv:2609.26761, Chinese Academy of Sciences) introduceert een tweefasig black-box-kader dat MCP-toolselection én -uitvoering naar de hand van de aanvaller zet.
Het aanvalsmodel is een semantische supply-chain-risico: de aanvaller controleert de metadata of de output van een tool-server, zonder toegang tot het agentmodel zelf. De agent vertrouwt de tool-server alsof die betrouwbaar is, en semantische selectie bepaalt welke tool bij welke taak hoort.
Het A2M-mechanisme: twee fasen
Attractie-fase. De aanvaller optimaliseert tool-metadata (naam, beschrijving, parameters) zodat de kans dat de MCP-agent juist de kwaadaardige tool selecteert toeneemt. Dit is black-box: de aanvaller kent het selectiemechanisme niet, maar kan proberen metadata zó te formuleren dat de semantische match score hoog wordt.
Manipulatie-fase. Zodra de tool is geselecteerd en uitgevoerd, gebruikt de aanvaller executietraces om de adversarial tool-returns te verfijnen. Het tool-resultaat is wat de agent terugkrijgt en waarmee hij verdere stappen zet. Door deze returns te sturen, wordt de agent richting een door de aanvaller gewenst resultaat geleid, zonder dat de agent doorheeft dat het resultaat is geforceerd.
Het onderscheid met klassieke prompt injection: dit is geen directe instructie aan de agent, maar een indirecte manipulatie via de gereedschapsinterface, de tool is het aanvalsvehikel, niet de prompt.
De meetresultaten: hoe effectief is A2M?
Op LiveMCPBench, directe aanvallen geoptimaliseerd én geëvalueerd op GLM-4.6:
- 93,6% macro-gemiddelde schadelijke tool-invocatie over vier scenario's
- 32,4× hogere gewogen tokencost dan de benigne baseline onder Cognitive Denial of Service (het model verspilt enorme rekenkosten aan gemanipuleerde tool-interacties)
- 74,4% gemiddelde attack-success-rate over Information Exfiltration, Environment Integrity Compromise en Reasoning Derailment
Transfer naar vier andere modellen zonder her-optimalisatie levert nog steeds 63,6% macro-gemiddelde tool-invocatie, 2,7× tokencost en 24,5% attack-success op. De aanval is dus niet model-specifiek maar generaliseert.
Wat dit betekent voor wie MCP in productie draait
Tool-vetting is een first-class security requirement. Een MCP-server van een derde partij is een softwarecomponent met een vertrouwensimplicatie, maar wordt nu behandeld als een API-call. Elke MCP-tool moet dezelfde review krijgen als een applicatie: bron-herleidbaarheid, output-scheiding, en minimal privilege op wat de tool kan doen.
Runtime-isolatie voorkomt de ergste uitkomsten. Zelfs als de aanval slaagt en de agent een kwaadaardig tool-resultaat incorporeert, moet de impact beperkt blijven door isolement: geen toegang tot systemen buiten een smalle grens, geen mogelijkheid tot consequentie acties zonder menselijke autorisatie.
De semantische matching is zelf een kwetsbare component. Het feit dat toolselectie op ongedifferentieerde tekstuele metadata draait, betekent dat metadata-vervuiling een structurele zwakte is. Het kan helpen om selectie te baseren op een expliciet vertrouwensniveau van de tool-server, niet op hoe aantrekkelijk de beschrijving klinkt.
De kosten-factor is een aanvullend risico. De 32,4× tokencost betekent dat een aanvaller die geen data-steal maar een denial-of-service wil, het budget van een organisatie kan opvreten door het model op gemanipuleerde tool-interacties te laten draaien. Dit is een economische aanval op de AI-kostenbasis.
Conclusie
A2M bevestigt wat de MCP-uitbreiding van het aanvalsoppervlak al deed vermoeden: de semantische tool-kiezer is een kwetsbare grens, en de gereedschapsinterface van een agent is een nieuw aanvalsvechter. Voor organisaties die MCP-agents in productie hebben, is de les niet "verbied MCP" maar "behandel elke tool-server als een onvertrouwde partij waartegen isolatie, vetting en kostenlimieten gelden". De 93,6% tool-invocatieratio is het bewijs dat de selectie zelf gemanipuleerd kan worden, niet alleen de uitvoering.
Referenties
Li, Wang, Zhao, Zhao, Ye, Xu & Gao, A2M: Trace-Optimized Agent Hijacking in the MCP Ecosystem, arXiv:2609.26761, Chinese Academy of Sciences / NTU / SUSTech / University of Macau.
AI & Security Intelligence
Wekelijkse nieuwsbrief met AI updates, security alerts en compliance inzichten, direct in uw inbox.
Security & AI Operating Model
Advisory met executiekracht
Van BIO2 en NIS2 tot EU AI Act, embedded in uw operating model, niet als extern project. Maandelijks opzegbaar, met assessments als bewijsvoering.