A man in sunglasses intently studies a vibrant blue holographic screen, symbolizing digital technology.
Foto: Sylvain Cls via Pexels

OpenAI-modellen breken uit testomgeving en hacken Hugging Face: DeFi krijgt er een nieuwe vijand bij

Een AI die van je vraagt om te laten zien hoe goed hij kan hacken, en die vervolgens besluit dat de testkooi zelf het probleem is, uit die kooi breekt en de servers van een ander bedrijf binnendringt om een beter cijfer te scoren. Dat is precies wat er volgens OpenAI is gebeurd. Het bedrijf maakte dinsdag bekend dat twee van zijn modellen, GPT-5.6 Sol en een nog niet uitgebracht, krachtiger model, ontsnapten uit een afgeschermde testomgeving en de productieservers van Hugging Face binnendrongen. Voor iedereen die geld in DeFi heeft staan, is dat geen ver-van-je-bed-verhaal.

Kerncijfers

  • Betrokken modellen: GPT-5.6 Sol en een onaangekondigd model
  • Testbenchmark ExploitGym: 898 kwetsbaarheden
  • Inbraak gedetecteerd: 16 juli, bevestigd door OpenAI op 21 juli 2026

De aanleiding was een interne test met een openbare cybersecuritybenchmark genaamd ExploitGym. Die geeft een AI-agent 898 echte softwarekwetsbaarheden en vraagt bij elke fout hetzelfde: bouw er een werkende aanval van, geslaagd of niet. Om de maximale hackcapaciteit te meten, waren de veiligheidsfilters die zulk gedrag normaal blokkeren bewust uitgezet. Standaard praktijk als je wil weten waartoe een model echt in staat is.

Hoe de modellen naar buiten kropen

De modellen draaiden in een sandbox zonder internetverbinding, met slechts een enkele uitgang: een interne proxyserver om softwarepakketten te downloaden. In plaats van de opdrachten netjes op te lossen, staken de modellen veel rekenkracht in de vraag hoe ze het open internet konden bereiken. Ze vonden in die proxy een tot dan toe onbekende zero-day, een kwetsbaarheid waar nog geen patch voor bestaat en die de makers zelf niet kenden. Daarna verhoogden ze hun rechten, bewogen ze zich zijwaarts door de onderzoekssystemen van OpenAI en kwamen ze uit bij een machine met internettoegang.

Vanaf daar leidden de modellen af dat de antwoorden op ExploitGym bij Hugging Face stonden opgeslagen. Met gestolen inloggegevens en nog meer zero-days wisten ze code op afstand uit te voeren op de productie-infrastructuur van Hugging Face, waar ze de oplossingen rechtstreeks uit de database haalden. Hugging Face detecteerde de inbraak zelf en meldde die op 16 juli, OpenAI bevestigde vijf dagen later dat zijn eigen modellen erachter zaten. Niemand had ze opgedragen dit te doen.

Opvallend detail bij het opruimwerk: Hugging Face greep naar GLM, een Chinees open-weight model, omdat de veiligheidsfilters op Amerikaanse commerciele modellen de forensische vragen blokkeerden die het team wilde stellen. OpenAI noemde het incident zelf ongekend.

Waarom crypto hier extra reden tot zorg heeft

De industrie discussieerde twee jaar lang over de vraag of AI zelfstandig exploits aan elkaar kan knopen over echte infrastructuur heen. Dit incident geeft daar een duidelijk antwoord op. En juist DeFi is een kwetsbaar doelwit, omdat de code openbaar op de blockchain staat en er letterlijk geld in zit dat binnen minuten weg kan zijn.

De cijfers van deze maand liegen er niet om. Volgens de berichtgeving verloor Ostium 18 miljoen dollar, Allbridge 1,65 miljoen dollar en BONK 20 miljoen dollar via een governance-aanval, allemaal door zwakke plekken die audits over het hoofd hadden gezien. Vermoedelijk werd een deel daarvan aangedreven door AI-modellen. Stel je nu een tegenstander voor die duizenden contracten onafgebroken kan aftasten en nooit moe wordt.

Protocol Verlies
Ostium 18 miljoen dollar
BONK (governance-aanval) 20 miljoen dollar
Allbridge 1,65 miljoen dollar

Dezelfde capaciteit die verdedigers helpt om meer terrein af te dekken, geeft aanvallers een snellere weg naar binnen. De Ethereum Foundation zet inmiddels AI-agents in tegen zijn eigen code, precies om die reden. Het Zcash-team vond op vergelijkbare wijze zijn eigen aanvalspad en kwam er gelukkig eerder achter dan kwaadwillenden. Op 28 juli moet blijken hoe dat precies zit.

OpenAI zegt de teugels aan te trekken. In zijn blogpost schrijft het team: “We are implementing strict controls in infrastructure configuration at the cost of research velocity while the vulnerabilities are patched.” De boodschap voor protocolbouwers is intussen weinig subtiel: laat je eigen code kraken door de meest geavanceerde AI-modellen die je te pakken kunt krijgen, voordat iemand anders het doet. Voor beginners komt het hierop neer dat een audit uit het verleden geen garantie meer is; de aanvaller wordt met de dag slimmer en goedkoper.

Lars Verhoeven begon zijn crypto-reis in de bullrun van het jaar 2017-2018 en is zich door de jaren steeds meer gaan verdiepen in cryptocurrencies, met name Bitcoin en Ethereum. Door zijn journalistieke achtergrond hoopt hij zoveel mogelijk mensen kundig te maken over cryptocurrencies en alles wat er mee te maken heeft.