Skip to content

Wanneer uw AI-codeerassistent uw hele repository uploadt

Cloud-AI-codeertools kunnen je hele repository naar de cloud van een leverancier kopiëren. De ene architectuurvraag die bepaalt of je code je netwerk verlaat — en wat 'self-hosted' moet betekenen om iets waard te zijn.

HERO VISUAL

Wanneer uw AI-codeerassistent uw hele repository uploadt

U hebt een AI-tool toegang tot uw editor gegeven. Hebt u daarmee ook toegang gegeven tot uw hele repository — de history, de config en de secrets die ooit per ongeluk zijn gecommit — gekopieerd naar de cloud van een leverancier? Voor veel teams bleek het eerlijke antwoord deze maand: ja.

Werkt u in een gereguleerde omgeving, dan is dat het moment waarop het gesprek over een self-hosted AI-codeerassistent — of op zijn minst een lokale die nooit 'naar huis belt' — ophoudt theoretisch te zijn. Dit gaat over de ene architectuurvraag die bepaalt of uw code uw netwerk verlaat, waarom het antwoord daarop steeds de verkeerde kant op gaat, en wat 'self-hosted' daadwerkelijk moet betekenen om iets waard te zijn.

Wat er net gebeurde

Halverwege juli 2026 meldden securitymedia dat de codeertool Grok Build van xAI veel meer verstuurde dan alleen de code die u aanleverde. The Hacker News verwoordde het zo: "Grok Build uploaded entire Git repositories, full commit history and all, to xAI storage, not just the files the agent read." (Gemeld op 13–14 juli 2026.)

Eerlijk is eerlijk: xAI reageerde. Een nieuwe instelling stopt de upload, het privacycommando werd uitgebreid om retentie uit te schakelen en al gesynchroniseerde data te verwijderen, en Elon Musk zei dat de opgeslagen data zou worden gewist. Dit is dus geen aanval op één leverancier — zij ontdekten het en losten het op. Het is een uitgewerkt voorbeeld van een patroon.

Het is niet één slechte tool. Het is de standaard.

Het Grok-verhaal is sprekend, maar staat niet op zichzelf:

  • CamoLeak — Legit Security maakte op 8 oktober 2025 een kritieke kwetsbaarheid (CVSS 9.6) in GitHub Copilot Chat bekend, verholpen door GitHub, die stille exfiltratie van secrets en broncode uit private repositories mogelijk had kunnen maken.
  • EchoLeak — een zero-click-kwetsbaarheid (CVE-2025-32711) in Microsoft 365 Copilot, in 2025 bekendgemaakt en door Microsoft verholpen, waarmee data zonder enige handeling van de gebruiker geëxfiltreerd had kunnen worden (analyse: Aim Security).
  • "Traint Copilot op uw code?" — een terechte vraag, en het eerlijke antwoord is: dat hangt af van uw tier. In de eigen documentatie van GitHub staat dat Copilot Business en Enterprise niet trainen op uw private code of prompts. De wijziging die voor ophef zorgde, geldt voor de gratis en consumer-tiers, waar training standaard aanstaat tenzij u zich afmeldt — en zelfs ervaren developers noemden de communicatie erover verwarrend.

Verschillende tools, verschillende mechanismen, dezelfde vorm: uw code, of de mogelijkheid om erbij te komen, belandde ergens waar u die niet hebt neergezet.

Waarom het steeds opnieuw gebeurt

Omdat de standaardarchitectuur het bijna onvermijdelijk maakt. Een cloud-AI-assistent moet iets sturen naar een model dat op de servers van de leverancier draait — en zodra uw code die grens overgaat, is het verschil tussen 'een snippet voor context' en 'de hele repo voor het gemak' een productbeslissing die wordt genomen aan de andere kant van een muur waar u geen zicht op hebt. U vertrouwt op een instelling, een privacybeleid en een roadmap die u niet in de hand hebt. Zodra een van die drie verschuift, verschuift uw code mee.

Voor een hobbyproject: prima. Voor een codebase die onder een toezichthouder, een klantcontract of een security review valt, is 'vertrouw op de schakelaar van de leverancier' geen beheersmaatregel die u in een audit kunt opnemen.

De ene vraag die het beslist

Haal de branding weg en elke AI-tool beantwoordt één vraag: verlaat mijn data mijn omgeving?

Draait het model in de cloud van de leverancier, dan verlaat uw data uw omgeving. Al het andere is voorwaarden en kleine lettertjes. Draait het model op infrastructuur die u beheert, dan gebeurt dat niet. Dat is het hele verschil.

Een lokale AI-codeerassistent (een model op uw eigen laptop of workstation) beantwoordt die vraag met 'nee' voor één developer. Een self-hosted opstelling beantwoordt haar met 'nee' voor een heel team, op uw eigen servers, achter uw eigen netwerkgrens — en dat is wat een gereguleerde organisatie daadwerkelijk nodig heeft.

Wat 'self-hosted' moet betekenen om mee te tellen

'Self-hosted' wordt zo ver opgerekt dat het niets meer betekent, dus hier is de lat waar een tool aan zou moeten voldoen:

  • Draait op uw infrastructuur, op het model dat u kiest. Uw servers, uw LLM-endpoint — cloud-hosted of volledig on-prem en air-gapped.
  • Eén uitgaande grens, en u kunt die zien. Er verlaat precies één verbinding uw omgeving: de aanroep naar het model-endpoint dat u hebt geconfigureerd. Verder belt niets naar huis — geen telemetriekanaal, geen 'sync voor het gemak', geen tweede bucket.
  • U kunt de code lezen. Is die source-available, dan kunnen uw engineers verifiëren wat de tool doet en waar data heen gaat, in plaats van te vertrouwen op een marketingpagina. (Source-available, niet 'open source' — u kunt de code lezen en draaien onder een duidelijke licentie; het gaat om verifieerbaarheid.)
  • Een audit trail die u zelf bewaart. Elke actie herleidbaar tot een named principal, gelogd aan uw kant, exporteerbaar naar uw eigen systemen — want 'we hebben uw data nergens heen gestuurd' is een bewering die uw auditors mogen controleren, niet op goed vertrouwen hoeven aannemen.

FAQ

Traint GitHub Copilot op uw code?

Niet op de betaalde Business- of Enterprise-tiers — volgens de documentatie van GitHub zijn private code en prompts daar uitgesloten van training. Op de gratis en consumer-tiers staat training standaard aan en moet u zich actief afmelden. Controleer uw tier en uw instellingen.

Houdt Grok uw code privé?

Na de fix van juli 2026 voegde xAI een instelling toe om de upload van de volledige repo te stoppen en eerder gesynchroniseerde data te verwijderen. Vóór die fix lieten berichten zien dat volledige repositories naar de cloud van xAI gingen. Is dit voor u van belang, verifieer dan zelf de huidige instelling in plaats van uit te gaan van de standaard.

Is mijn code veilig bij cloud-AI-codeertools?

Die valt buiten uw controle. De veiligheid hangt af van de architectuur, instellingen en roadmap van de leverancier — niet van iets wat u kunt auditen. Een lokale of self-hosted tool is de enige variant waarbij 'veilig' iets is wat u kunt aantonen.

Wat is het belangrijkste securityrisico van AI-codeerassistenten in de enterprise?

Data die de omgeving verlaat — broncode, secrets en private context die op de servers van een leverancier belanden, waar u niet kunt sturen of auditen wat er vervolgens gebeurt.

Hoe draait EpicStaff AI-agents self-hosted, op uw eigen modellen en data?

EpicStaff is een self-hosted runtime voor AI-agents: het draait in uw eigen omgeving, op het model dat u kiest, met één uitgaande grens — de modelaanroep die u configureert — terwijl de knowledge base, de audit trail en de identity-laag intern blijven. Het is source-available, zodat uw team kan verifiëren waar data heen gaat in plaats van te vertrouwen op een datasheet. Het draait de operationele agents die teams in eigen huis opzetten (support-triage, IT-helpdesk, onboarding), niet IDE-autocomplete — al kan dezelfde runtime ook autonome codeeragents hosten. Kortom: het is de vier-punts-lat hierboven, toegepast op ons eigen product — en u zou elke tool, de onze inbegrepen, daaraan moeten houden.