Hoe beveilig je AI agents en MCP/tooling?
Antwoordpagina over trust boundaries, prompt injection, tool poisoning, approvals, logging en incidentrespons voor AI agents.
Kort antwoord
AI agents en MCP/tooling beveilig je door duidelijke trust boundaries, minimale toolrechten, expliciete approvals, inputvalidatie, logging, sandboxing, secret-afscherming en incidentrespons. Behandel elk modelantwoord, elke toolcall en elke externe bron als onbetrouwbaar totdat het gecontroleerd is.
Belangrijkste risico's
- Prompt injection: externe content stuurt het model om beleid, instructies of data te lekken.
- Tool poisoning: een tool, connector of MCP-server geeft misleidende output of voert ongewenste acties uit.
- Over-permissioning: agents krijgen te brede rechten op bestanden, systemen, cloud of productie.
- Data-exfiltratie: secrets, persoonsgegevens of interne documenten lekken via prompts, logs of toolcalls.
- Onvoldoende traceerbaarheid: achteraf is niet duidelijk waarom een agent iets deed of wie akkoord gaf.
Praktische beveiligingsmaatregelen
- Toolrechten minimaliseren: geef per taak alleen de benodigde bestanden, commands en netwerktoegang.
- Approvals afdwingen: vereis menselijke goedkeuring voor writes, productie, secrets, externe publicatie en destructieve acties.
- Bronnen labelen: onderscheid systeeminstructies, gebruikersinput, repositorybestanden, webcontent en tooloutput.
- Logging en traces bewaren: registreer toolcalls, beslissingen, diffs, approvals en deploymentbewijs.
- Secrets scheiden: tokens niet in prompts, logs, screenshots of generated docs opnemen.
- Incidentpad definiëren: leg vast hoe je toolmisbruik, prompt injection of datalekken onderzoekt en herstelt.
MCP-specifieke aandachtspunten
MCP-servers vergroten de actieruimte van AI-systemen. Beoordeel daarom per server:
- welke data gelezen of geschreven kan worden;
- of output als ontrusted wordt behandeld;
- of tools productie of externe systemen kunnen raken;
- of permissies smaller kunnen;
- hoe fouten, auditlogs en rate limits werken;
- hoe een server snel kan worden uitgeschakeld.
Djimit-aanpak
Djimit beoordeelt AI agents en tooling via threat modeling, control design, red-team scenario's en auditability checks. De uitkomst is geen abstract beleid, maar een concrete set grenzen: toegestane tools, approvalregels, loggingvereisten, secret-handling, testscenario's en incidentrunbooks.
Zie ook AI Security Assessment, AI Governance en Advisory.
Proof En Verdieping
FAQ
Is sandboxing genoeg?
Nee. Sandboxing helpt, maar is geen vervanging voor minimale rechten, approvals, logging, inputvalidatie en secretbescherming.
Moet elke toolcall handmatig worden goedgekeurd?
Niet altijd. Leesacties binnen een afgebakende scope kunnen automatisch, maar writes, productie, externe publicatie, secrets en destructieve acties horen expliciete goedkeuring te vragen.
Hoe test je AI agent security?
Met scenario's voor prompt injection, misleidende tooloutput, path traversal, data-exfiltratie, privilege escalation, incidentrespons en audit-trace reconstructie.
Agent Observability En Auditability
Voor AI agents is observability geen nice-to-have maar een governance-control. Een organisatie moet achteraf kunnen reconstrueren wat de agent zag, besloot, aanriep en veranderde. Minimale auditvelden zijn:
- taakdoel, gebruiker en goedkeuringscontext;
- model/provider, toolnaam, scope en permissieniveau;
- samenvatting van input, output en relevante toolresultaten;
- gemaakte wijzigingen, externe publicatie of productieactie;
- fout, rollback, incidentclassificatie en opvolgactie.
Djimit gebruikt deze auditlaag om AI-agentrisico's te vertalen naar beleid, technische guardrails en bewijs voor security- of compliance-overleggen.