Eenvoudige opdracht aan AI-agent loopt volgens Italiaans bedrijf uit op rekening van bijna 80.000 dollar

28 september 2026

Een relatief eenvou­dige opdracht aan een AI-agent van OpenAI zou bij een Italiaans AI-bedrijf zijn uitge­lopen op honderden parallel uitge­voerde taken en uitein­de­lijk bijna 80.000 dollar aan kosten. Dat stelt Lorenzo Massaro, CTO van het Itali­aanse Eternal Tech, in een uitvoe­rige bijdrage op Hacker News. OpenAI heeft voor­alsnog niet publie­ke­lijk bevestigd dat het incident inderdaad op de door Massaro beschreven manier heeft plaats­ge­vonden. De zaak is niettemin inte­res­sant, omdat hij een belang­rijk praktisch probleem rond steeds autonomer opere­rende AI-agents blootlegt: wie bewaakt wat een agent doet, hoeveel resources hij gebruikt en hoeveel geld hij daarbij mag uitgeven?

Het gaat bovendien niet om een hobby­ge­bruiker die thuis wat met AI expe­ri­men­teert. Eternal Tech is een Europees AI-bedrijf uit Italië. Het bedrijf is gevestigd in Acireale op Sicilië en ontwik­kelt tech­no­logie rond AI, geheugen en kennis. Een van de belang­rijkste projecten is DeTwin, een platform waarmee AI-agents infor­matie en context langdurig kunnen bewaren en organiseren.

De tech­no­logie achter DeTwin wordt AGVM genoemd, wat staat voor “Agentic Gene­ra­tive Vector Memory”. De gedachte daar­achter is dat het geheugen van een AI-agent niet simpelweg uit een steeds langer wordende conver­sa­tie­his­torie hoeft te bestaan. De tech­no­logie moet infor­matie, context en de bronnen waarop die infor­matie is gebaseerd met elkaar verbinden. DeTwin omschrijft AGVM zelf als een ‘local-first memory OS’ waarbij infor­matie kan worden gekoppeld aan bron­ma­te­riaal en wijzi­gingen contro­leer­baar blijven.

Van UX-controle naar honderden taken

Volgens Massaro begon het probleem op 10 juli. Vanuit Visual Studio Code gaf hij Codex een volgens hem normale opdracht. De AI moest een UX/UI-validatie uitvoeren op een speci­fieke module van het product waaraan Eternal Tech werkt. Voor de taak zou GPT‑5.5 met een gemiddeld reaso­ning­ni­veau zijn geselecteerd.

Daarna gebeurde volgens Massaro iets onver­wachts. De oorspron­ke­lijke taak zou 826 afzon­der­lijke “child tasks” hebben aange­maakt. Het ging volgens hem dus niet simpelweg om honderden berichten binnen één AI-conver­satie, maar om afzon­der­lijke taken met ieder een eigen iden­ti­fi­catie. Bovendien werden deze taken in de lokaal terug­ge­vonden gegevens volgens Massaro gere­gi­streerd als uitge­voerd met GPT‑5.6 Sol op een veel hoger reasoningniveau.

Nog opmer­ke­lijker is wat die agents vervol­gens zouden zijn gaan doen. De oorspron­ke­lijke opdracht ging over het contro­leren van de gebrui­kers­in­ter­face. In de titels van de terug­ge­vonden taken kwamen volgens Massaro echter onder­werpen voor als backend-infra­struc­tuur, OAuth, metering, hardening, audits, certi­fi­ce­ring, imple­men­tatie en software-releases. De scope van de opdracht lijkt daarmee, als de recon­structie tenminste klopt, veel verder te zijn uitge­breid dan de oorspron­ke­lijke vraag.

Massaro zegt daarnaast een opvallend verschil te hebben gevonden tussen twee versies van de Codex-client. Bij versie 0.144.0‑alpha.4 telde hij 584 child tasks met samen ongeveer 154 miljard lokale token-counters. Bij versie 0.144.2 ging het om 242 taken en ongeveer 7,5 miljard. Gemiddeld zou de eerste versie daarmee ongeveer 8,5 keer zoveel lokale token­ac­ti­vi­teit per taak hebben laten zien. Hij vermoedt daarom dat een bug in de alpha-versie een rol kan hebben gespeeld. Dat is op dit moment echter zijn hypothese; een tech­ni­sche beves­ti­ging van OpenAI ontbreek, meldt hij op Hacker News.

Bijna 80.000 dollar

Het meest pijnlijke gevolg is finan­cieel. Massaro zegt 162 betaalde facturen te hebben gere­con­stru­eerd met een geza­men­lijk bedrag van 79.664,88 dollar. Het geld zou gedurende ongeveer twintig dagen in juli en augustus zijn afge­schreven. Een deel daarvan hing volgens hem samen met het auto­ma­tisch opnieuw aankopen van credits.

Dat laatste is belang­rijk voor het begrijpen van de zaak. OpenAI biedt voor daarvoor geschikte accounts een functie voor “automatic reload”. Wanneer het credit­saldo onder een inge­stelde grens komt, kunnen auto­ma­tisch nieuwe credits worden aange­schaft via de gere­gi­streerde betaal­me­thode. Daarbij kan een maximaal maan­de­lijks bedrag worden ingesteld. OpenAI maakt daarbij expliciet onder­scheid tussen auto­ma­tisch gekochte credits en eenmalige aankopen.

Dat betekent tege­lij­ker­tijd dat uit de Hacker News-post nog niet kan worden vast­ge­steld hoe de bijna 80.000 dollar precies is opgebouwd en welke bevei­li­gings- en beste­dings­in­stel­lingen op het betref­fende account actief waren. Massaro stelt zelf dat alleen OpenAI de server­ge­ge­vens bezit waarmee precies kan worden vast­ge­steld welke taken daad­wer­ke­lijk zijn uitge­voerd en hoe het gebruik uitein­de­lijk in rekening is gebracht. Hij waar­schuwt bovendien zelf dat de lokale token-counters die hij heeft terug­ge­vonden niet simpelweg kunnen worden verme­nig­vul­digd met een API-tarief om de rekening te reconstrueren.

Discussie over grenzen voor agents

Juist dat punt speelt een belang­rijke rol in de discussie die vervol­gens op Hacker News ontstond. Een aantal deel­ne­mers richt zich minder op de vraag of hier daad­wer­ke­lijk een soft­wa­rebug is opge­treden en meer op de bevei­li­ging rond autonome agents. Zij wijzen erop dat agents die betaalde diensten kunnen gebruiken eigenlijk harde grenzen zouden moeten hebben voor de resources en het geld waarover ze zelf­standig mogen beschikken.

Een inte­res­sante obser­vatie in de discussie is dat zulke beper­kingen niet alleen beschik­baar zouden moeten zijn, maar volgens sommige deel­ne­mers ook standaard behoor­lijk streng ingesteld zouden moeten worden. Een AI-agent kan immers in korte tijd veel meer acties uitvoeren dan een mense­lijke gebruiker. Een fout, verkeerde inter­pre­tatie van een opdracht of soft­wa­re­pro­bleem kan daardoor veel sneller escaleren.

Een andere deelnemer schrijft dat zijn orga­ni­satie bij de selectie van AI-leve­ran­ciers expliciet kijkt naar de beschik­baar­heid van “billing limits”. Ontbreken zulke moge­lijk­heden, dan valt een leve­ran­cier af. Daarmee verschuift kosten­be­heer­sing bij AI dus van een admi­ni­stra­tieve functie naar een onderdeel van de tech­ni­sche beveiligingsarchitectuur.

Dat is wellicht de belang­rijkste vraag die de zaak oproept. Tradi­ti­o­neel worden limieten vooral gebruikt om bijvoor­beeld API-gebruik of cloud­kosten onder controle te houden. Bij agentic AI krijgen ze een extra betekenis. Een agent kan immers zelf­standig vervolgstappen bedenken, andere taken starten en tools gebruiken. Hoe groter die autonomie wordt, hoe belang­rijker het wordt om niet alleen te bepalen wat een agent technisch mag doen, maar ook hoeveel reken­kracht, tokens, tijd en geld hij daarbij zelf­standig mag gebruiken.

Logs maken reconstructie lastig

Een ander probleem is dat Massaro zegt niet meer over alle oorspron­ke­lijke logs te beschikken. In zijn lokale omgeving vond hij naar eigen zeggen metadata van ongeveer 2550 oudere threads waarvoor de bijbe­ho­rende uitvoe­rings­ge­ge­vens niet meer aanwezig waren. Ook zegt hij gesprekken en taken uit de normale historie te hebben zien verdwijnen. Daardoor is het volgens hem moeilijk om achteraf precies te recon­stru­eren welke instruc­ties agents aan elkaar hebben gegeven.

De CTO heeft hierover een support­zaak bij OpenAI geopend en zegt het bedrijf om een recon­structie op basis van de server­ge­ge­vens te hebben gevraagd. Volgens zijn Hacker News-post heeft hij daarop nog geen inhou­de­lijke tech­ni­sche verkla­ring gekregen. Ook deze lezing is op dit moment alleen afkomstig van Massaro. Er is geen openbare reactie van OpenAI waarin het beschreven incident technisch wordt bevestigd of verklaard.

Nieuwe risico’s van agentic AI

Of bij Eternal Tech daad­wer­ke­lijk sprake was van een bug, een onver­wachte inter­actie tussen instel­lingen en software, of een andere oorzaak kan op basis van de nu beschik­bare infor­matie niet worden vast­ge­steld. Daarvoor zijn uitein­de­lijk de server­ge­ge­vens van OpenAI en een tech­ni­sche analyse van het incident nodig.

De zaak laat onder­tussen wel zien dat de opkomst van AI-agents nieuwe eisen stelt aan kosten­be­heer en controle. Bij een chatbot is de gebruiker meestal degene die iedere volgende opdracht geeft. Bij een agent kan één mense­lijke opdracht het begin zijn van een hele reeks auto­ma­tisch gege­ne­reerde vervolgacties.

Daarmee verandert ook de betekenis van een simpele opdracht. Een vraag als ‘contro­leer deze gebrui­kers­in­ter­face’ hoeft in een agentic omgeving technisch gezien niet nood­za­ke­lijk één modelaan­roep te betekenen. Een systeem kan de opdracht opdelen, subagents inzetten, aanvul­lende analyses uitvoeren en nieuwe acties starten.

Juist daarom worden tech­ni­sche grenzen belang­rijker: maximale aantallen subtaken, token­bud­getten, tijds­li­mieten, beste­dings­li­mieten en mense­lijke goed­keu­ring voordat een agent kostbare of risi­co­volle vervolgstappen uitvoert.

Wat er precies bij het Itali­aanse Eternal Tech is gebeurd, moet nog worden opge­hel­derd. Maar de bijna 80.000 dollar die Massaro zegt te zijn kwijt­ge­raakt, maakt één ontwik­ke­ling in ieder geval zeer concreet: naarmate AI-systemen autonomer worden, moet ook de infra­struc­tuur waarmee hun autonomie wordt begrensd een stuk volwas­sener worden.

Pin It on Pinterest

Share This