Een relatief eenvoudige opdracht aan een AI-agent van OpenAI zou bij een Italiaans AI-bedrijf zijn uitgelopen op honderden parallel uitgevoerde taken en uiteindelijk bijna 80.000 dollar aan kosten. Dat stelt Lorenzo Massaro, CTO van het Italiaanse Eternal Tech, in een uitvoerige bijdrage op Hacker News. OpenAI heeft vooralsnog niet publiekelijk bevestigd dat het incident inderdaad op de door Massaro beschreven manier heeft plaatsgevonden. De zaak is niettemin interessant, omdat hij een belangrijk praktisch probleem rond steeds autonomer opererende AI-agents blootlegt: wie bewaakt wat een agent doet, hoeveel resources hij gebruikt en hoeveel geld hij daarbij mag uitgeven?
Het gaat bovendien niet om een hobbygebruiker die thuis wat met AI experimenteert. Eternal Tech is een Europees AI-bedrijf uit Italië. Het bedrijf is gevestigd in Acireale op Sicilië en ontwikkelt technologie rond AI, geheugen en kennis. Een van de belangrijkste projecten is DeTwin, een platform waarmee AI-agents informatie en context langdurig kunnen bewaren en organiseren.
De technologie achter DeTwin wordt AGVM genoemd, wat staat voor “Agentic Generative Vector Memory”. De gedachte daarachter is dat het geheugen van een AI-agent niet simpelweg uit een steeds langer wordende conversatiehistorie hoeft te bestaan. De technologie moet informatie, context en de bronnen waarop die informatie is gebaseerd met elkaar verbinden. DeTwin omschrijft AGVM zelf als een ‘local-first memory OS’ waarbij informatie kan worden gekoppeld aan bronmateriaal en wijzigingen controleerbaar blijven.
Van UX-controle naar honderden taken
Volgens Massaro begon het probleem op 10 juli. Vanuit Visual Studio Code gaf hij Codex een volgens hem normale opdracht. De AI moest een UX/UI-validatie uitvoeren op een specifieke module van het product waaraan Eternal Tech werkt. Voor de taak zou GPT‑5.5 met een gemiddeld reasoningniveau zijn geselecteerd.
Daarna gebeurde volgens Massaro iets onverwachts. De oorspronkelijke taak zou 826 afzonderlijke “child tasks” hebben aangemaakt. Het ging volgens hem dus niet simpelweg om honderden berichten binnen één AI-conversatie, maar om afzonderlijke taken met ieder een eigen identificatie. Bovendien werden deze taken in de lokaal teruggevonden gegevens volgens Massaro geregistreerd als uitgevoerd met GPT‑5.6 Sol op een veel hoger reasoningniveau.
Nog opmerkelijker is wat die agents vervolgens zouden zijn gaan doen. De oorspronkelijke opdracht ging over het controleren van de gebruikersinterface. In de titels van de teruggevonden taken kwamen volgens Massaro echter onderwerpen voor als backend-infrastructuur, OAuth, metering, hardening, audits, certificering, implementatie en software-releases. De scope van de opdracht lijkt daarmee, als de reconstructie tenminste klopt, veel verder te zijn uitgebreid dan de oorspronkelijke vraag.
Massaro zegt daarnaast een opvallend verschil te hebben gevonden tussen twee versies van de Codex-client. Bij versie 0.144.0‑alpha.4 telde hij 584 child tasks met samen ongeveer 154 miljard lokale token-counters. Bij versie 0.144.2 ging het om 242 taken en ongeveer 7,5 miljard. Gemiddeld zou de eerste versie daarmee ongeveer 8,5 keer zoveel lokale tokenactiviteit per taak hebben laten zien. Hij vermoedt daarom dat een bug in de alpha-versie een rol kan hebben gespeeld. Dat is op dit moment echter zijn hypothese; een technische bevestiging van OpenAI ontbreek, meldt hij op Hacker News.
Bijna 80.000 dollar
Het meest pijnlijke gevolg is financieel. Massaro zegt 162 betaalde facturen te hebben gereconstrueerd met een gezamenlijk bedrag van 79.664,88 dollar. Het geld zou gedurende ongeveer twintig dagen in juli en augustus zijn afgeschreven. Een deel daarvan hing volgens hem samen met het automatisch opnieuw aankopen van credits.
Dat laatste is belangrijk voor het begrijpen van de zaak. OpenAI biedt voor daarvoor geschikte accounts een functie voor “automatic reload”. Wanneer het creditsaldo onder een ingestelde grens komt, kunnen automatisch nieuwe credits worden aangeschaft via de geregistreerde betaalmethode. Daarbij kan een maximaal maandelijks bedrag worden ingesteld. OpenAI maakt daarbij expliciet onderscheid tussen automatisch gekochte credits en eenmalige aankopen.
Dat betekent tegelijkertijd dat uit de Hacker News-post nog niet kan worden vastgesteld hoe de bijna 80.000 dollar precies is opgebouwd en welke beveiligings- en bestedingsinstellingen op het betreffende account actief waren. Massaro stelt zelf dat alleen OpenAI de servergegevens bezit waarmee precies kan worden vastgesteld welke taken daadwerkelijk zijn uitgevoerd en hoe het gebruik uiteindelijk in rekening is gebracht. Hij waarschuwt bovendien zelf dat de lokale token-counters die hij heeft teruggevonden niet simpelweg kunnen worden vermenigvuldigd met een API-tarief om de rekening te reconstrueren.
Discussie over grenzen voor agents
Juist dat punt speelt een belangrijke rol in de discussie die vervolgens op Hacker News ontstond. Een aantal deelnemers richt zich minder op de vraag of hier daadwerkelijk een softwarebug is opgetreden en meer op de beveiliging rond autonome agents. Zij wijzen erop dat agents die betaalde diensten kunnen gebruiken eigenlijk harde grenzen zouden moeten hebben voor de resources en het geld waarover ze zelfstandig mogen beschikken.
Een interessante observatie in de discussie is dat zulke beperkingen niet alleen beschikbaar zouden moeten zijn, maar volgens sommige deelnemers ook standaard behoorlijk streng ingesteld zouden moeten worden. Een AI-agent kan immers in korte tijd veel meer acties uitvoeren dan een menselijke gebruiker. Een fout, verkeerde interpretatie van een opdracht of softwareprobleem kan daardoor veel sneller escaleren.
Een andere deelnemer schrijft dat zijn organisatie bij de selectie van AI-leveranciers expliciet kijkt naar de beschikbaarheid van “billing limits”. Ontbreken zulke mogelijkheden, dan valt een leverancier af. Daarmee verschuift kostenbeheersing bij AI dus van een administratieve functie naar een onderdeel van de technische beveiligingsarchitectuur.
Dat is wellicht de belangrijkste vraag die de zaak oproept. Traditioneel worden limieten vooral gebruikt om bijvoorbeeld API-gebruik of cloudkosten onder controle te houden. Bij agentic AI krijgen ze een extra betekenis. Een agent kan immers zelfstandig vervolgstappen bedenken, andere taken starten en tools gebruiken. Hoe groter die autonomie wordt, hoe belangrijker het wordt om niet alleen te bepalen wat een agent technisch mag doen, maar ook hoeveel rekenkracht, tokens, tijd en geld hij daarbij zelfstandig mag gebruiken.
Logs maken reconstructie lastig
Een ander probleem is dat Massaro zegt niet meer over alle oorspronkelijke logs te beschikken. In zijn lokale omgeving vond hij naar eigen zeggen metadata van ongeveer 2550 oudere threads waarvoor de bijbehorende uitvoeringsgegevens niet meer aanwezig waren. Ook zegt hij gesprekken en taken uit de normale historie te hebben zien verdwijnen. Daardoor is het volgens hem moeilijk om achteraf precies te reconstrueren welke instructies agents aan elkaar hebben gegeven.
De CTO heeft hierover een supportzaak bij OpenAI geopend en zegt het bedrijf om een reconstructie op basis van de servergegevens te hebben gevraagd. Volgens zijn Hacker News-post heeft hij daarop nog geen inhoudelijke technische verklaring gekregen. Ook deze lezing is op dit moment alleen afkomstig van Massaro. Er is geen openbare reactie van OpenAI waarin het beschreven incident technisch wordt bevestigd of verklaard.
Nieuwe risico’s van agentic AI
Of bij Eternal Tech daadwerkelijk sprake was van een bug, een onverwachte interactie tussen instellingen en software, of een andere oorzaak kan op basis van de nu beschikbare informatie niet worden vastgesteld. Daarvoor zijn uiteindelijk de servergegevens van OpenAI en een technische analyse van het incident nodig.
De zaak laat ondertussen wel zien dat de opkomst van AI-agents nieuwe eisen stelt aan kostenbeheer en controle. Bij een chatbot is de gebruiker meestal degene die iedere volgende opdracht geeft. Bij een agent kan één menselijke opdracht het begin zijn van een hele reeks automatisch gegenereerde vervolgacties.
Daarmee verandert ook de betekenis van een simpele opdracht. Een vraag als ‘controleer deze gebruikersinterface’ hoeft in een agentic omgeving technisch gezien niet noodzakelijk één modelaanroep te betekenen. Een systeem kan de opdracht opdelen, subagents inzetten, aanvullende analyses uitvoeren en nieuwe acties starten.
Juist daarom worden technische grenzen belangrijker: maximale aantallen subtaken, tokenbudgetten, tijdslimieten, bestedingslimieten en menselijke goedkeuring voordat een agent kostbare of risicovolle vervolgstappen uitvoert.
Wat er precies bij het Italiaanse Eternal Tech is gebeurd, moet nog worden opgehelderd. Maar de bijna 80.000 dollar die Massaro zegt te zijn kwijtgeraakt, maakt één ontwikkeling in ieder geval zeer concreet: naarmate AI-systemen autonomer worden, moet ook de infrastructuur waarmee hun autonomie wordt begrensd een stuk volwassener worden.
