AI Nieuws
· dinsdag 28 juli 2026
Scientific computing in the age of agentic AI — AI agents nemen het bouwwerk over
OpenAI publiceert vandaag Scientific computing in the age of agentic AI, een veldrapport van 55 pagina’s over acht projecten waarin AI agents bestaande software onderhielden, versnelden en herbouwden. De resultaten zijn fors: één werkwijze ging van vijftien uur naar een kwartier. Maar in zeven van de acht projecten verschoof het knelpunt naar dezelfde plek — het beoordelen of het klopt. Dat is precies het deel dat niet automatiseert.
Door Maria Cappon · So-MC B.V. · Rubriek: AI Nieuws · Gepubliceerd 28 juli 2026
Wat is scientific computing?
Scientific computing — wetenschappelijk rekenwerk — is het gebruik van software en rekenkracht om onderzoeksvragen te beantwoorden. Denk aan klimaatmodellen, simulaties van materiaalgedrag of het analyseren van meetreeksen. Niet de computer als tekstverwerker, maar als instrument waarmee het onderzoek zelf wordt uitgevoerd.
In de life sciences is dat de dominante werkvorm geworden. Eén sequencer produceert per run miljoenen DNA-fragmenten die alleen betekenis krijgen na een keten van bewerkingen: uitlijnen, filteren, corrigeren, samenstellen, controleren. Die keten heet een pipeline, en bestaat uit losse programma’s die elkaars uitvoer doorgeven.
Daar zit de scheefgroei. De kosten van sequencen zijn de afgelopen vijftien jaar veel sneller gedaald dan de kosten van de analyse erna. Rekenkracht, opslag en vooral de arbeid om die pipelines draaiend te houden vormen inmiddels een groeiend deel van de projectbegroting.
Dezelfde scheefgroei doet zich buiten het laboratorium voor. Verzamelen is goedkoop geworden, verwerken niet: CRM-data, formulierinzendingen, campagneresultaten. Het knelpunt zit daar zelden in de invoer en meestal in de bewerking.
Wat voor onderzoek is dit — en wie deden er mee?
Het is nadrukkelijk een veldrapport en geen vergelijkende test: acht groepen beschrijven achteraf hun eigen project, in hun eigen woorden. OpenAI standaardiseerde de vorm, maar heeft de gerapporteerde cijfers niet zelf nagerekend.
De medeauteurs komen uit een serieus gezelschap: de University of North Carolina, Harvard Medical School, het Allen Institute for AI, het Australische Garvan Institute, de University of Maryland, Helmholtz Munich, NVIDIA en de bedrijven Seqera, Altos Labs en MinosAI. Vijf teams werkten met Codex, drie combineerden Codex met Claude Code.
Het werkterrein is de life sciences, met name genomica — software die DNA-data verwerkt. Dat lijkt misschien een specialistische hoek, maar de onderliggende situatie komt in meer sectoren voor: verouderde systemen waar het werk op draait, en waarvoor budget noch tijd wordt vrijgemaakt.
Eén begrip vooraf. Een AI agent is geen chatbot met een ander jasje. Het is software die zelfstandig een opdracht uitvoert binnen kaders die jij stelt, en een afgerond resultaat oplevert in plaats van een antwoord.
Waarom dit probleem bestaat
Wetenschappelijke software ontstaat meestal als bijproduct van een publicatie. Kleine teams, korte doorlooptijd, financiering die resultaten beloont en onderhoud niet. Wat begon als prototype wordt vervolgens tien jaar lang gedeelde infrastructuur voor een heel vakgebied.
Het rapport onderbouwt dat met harde cijfers uit eerder onderzoek. Van ruim 9.000 gepubliceerde onderzoeksscripts draaide 74 procent niet bij de eerste poging in een schone omgeving — een computer waarop de hulpprogramma’s, versies en instellingen ontbreken die de maker zelf al had staan. Dat is de startsituatie van iedere nieuwe gebruiker. Van 98 onderzoekstools mislukte de installatie in 57,1 procent van de gevallen bij het volgen van de eigen documentatie, met gemiddeld zeventig minuten aan uitzoekwerk per storing.
Herbouwen was tot voor kort geen serieuze optie. Het aligneerprogramma STAR, dat in een van de projecten werd vervangen, telt ruim 20.000 regels code; de betrokken onderzoeker noemt een handmatige herschrijving expliciet onhaalbaar. Bij de kwaliteitscontrole in RustQC, een ander onderzoek, speelde iets anders: de inefficiëntie was al jaren bekend, maar er is nauwelijks financiering of erkenning voor het opnieuw bouwen van bestaande software. Volgens de betrokken ontwikkelaar zijn de kosten van zo’n herimplementatie met coding agents teruggelopen tot enkele dagen. Dat is de kern van dit rapport: niet dat AI betere code schrijft, maar dat werk dat structureel bleef liggen ineens binnen bereik komt.
Welke acht projecten met AI agents zijn onderzocht?
Het gaat om acht bestaande programma’s die dagelijks in onderzoek worden gebruikt, geen proefopstellingen. Elk team liet de agent los op zijn eigen software: de mensen die het programma door en door kennen, bepaalden de opdracht en beoordeelden het resultaat. Zes projecten draaien om DNA-analyse, één om immunologisch onderzoek en één om statistiek voor keuze- en marketingmodellen.
De ingrepen lopen uiteen van het opknappen van een installatieprocedure tot een volledige herbouw op de grafische kaart. Onderstaand overzicht laat per project zien wat het programma doet en wat de ingreep opleverde.
| Programma | Waar het voor dient | Wat de AI agent deed — en wat het opleverde |
| cyvcf2 | Python-bibliotheek voor het lezen van genetische varianten, ruim tien jaar oud | Verouderd bouw- en distributieproces vervangen. Installeren, testen en uitbrengen verlopen weer voorspelbaar |
| HI.SIM | Simulator die kunstmatige DNA-leesbestanden genereert | Reeks kleine optimalisaties: circa 31 procent sneller, met een resultaat dat tot op de byte gelijk bleef |
| hifiasm | Assembler die genomen samenstelt uit lange DNA-fragmenten | 25,1 procent sneller op de synthetische testset, 14,7 procent op echte humane data |
| MHCflurry | Model dat voorspelt welke eiwitfragmenten zichtbaar worden voor het immuunsysteem | Rekenmotor gemigreerd naar PyTorch: bijna 10.000 regels in circa 130 bestanden, met ongewijzigde voorspellingen |
| bayesm | Statistiekpakket voor keuze- en marketingmodellen, sinds 2005 in gebruik | Herbouwd in Rust: 2 tot 20 keer sneller. Beide latere uitbreidingen bevatten bij eerste oplevering fouten |
| rustar-aligner | Vervanger voor STAR, een veelgebruikt maar niet langer onderhouden RNA-programma | Ruim 20.000 regels vanaf nul herbouwd. 99,8 procent gelijke uitkomsten; beheer overgedragen aan een gemeenschap |
| RustQC | Kwaliteitscontrole in de meest gebruikte RNA-werkwijze ter wereld | Vijftien losse tools samengevoegd tot één doorloop: 15 uur 34 naar 14 minuten 54, schijfgebruik van 2,5 TB naar 0,1 TB |
| HelixForge | Generator van testbestanden met vooraf bekende DNA-mutaties | Herbouwd voor de grafische kaart: circa 60 keer sneller van begin tot eind, bijna 99 keer op de zwaarste stap |
Twee regels verdienen aandacht. RustQC toont wat er te halen valt bij herontwerp in plaats van optimalisatie: vijftien programma’s die ieder afzonderlijk hetzelfde bestand doorliepen, werden één doorloop. De winst zat niet in slimmere code, maar in het schrappen van dertienmaal dubbel werk.
hifiasm laat de keerzijde zien. Op de testset 25 procent tijdwinst, op echte data 14,7 procent — bijna een halvering van de belofte. Elke businesscase die op een proefopstelling is gebouwd, verdient een korting voordat je hem tekent.
Waar AI agents de mist in gaan: drie patronen
De onderzoekers identificeren drie patronen die in vrijwel elk project terugkomen. Ze zijn belangrijker dan de snelheidscijfers, want ze bepalen of je resultaat bruikbaar is.
Het oordeel blijft menselijk. In zeven van de acht projecten was de opdrachtgever de eindbeoordelaar. De agents voerden scherp afgebakende opdrachten uit, maar konden niet vaststellen of het resultaat inhoudelijk deugde. Eén bijdrager formuleert het onbarmhartig: agents zijn welbespraakt, overtuigend, en met dezelfde overtuiging fout — op een manier die je makkelijk mist.
De laatste tien procent kost het meeste. Bij rustar-aligner — de herbouw van het verlaten programma STAR — strandde het proces rond 90 procent overeenkomst met het origineel. Er lagen meerdere fouten over elkaar heen, waardoor elke correctie elders iets anders brak en de agent zijn eigen werk terugdraaide. De doorbraak kwam pas toen een mens afzonderlijke DNA-fragmenten stap voor stap door beide programma’s volgde en zo kon aanwijzen waar ze uiteenliepen. Eerste versies ontstaan snel; het zijn de uitzonderingen en de kleine rekenverschillen die het leeuwendeel van de tijd kosten.
De zelfbeoordeling van een agent is geen bewijs. Bij kuva, een programma dat wetenschappelijke grafieken tekent, verklaarde de agent zijn grafieken correct terwijl labels over elkaar vielen en assen gekanteld stonden. Zulke fouten zie je alleen door te kijken, dus worden er nu ruim 900 grafieken met het oog gecontroleerd voor elke nieuwe versie. Bij bayesm, het statistiekpakket voor keuze- en marketingmodellen, kwamen de totaaluitkomsten voor 99,1 procent overeen met het origineel — en tóch zaten er structurele fouten in. Overeenkomst op totaalcijfers zegt dus niets over de juistheid van de onderdelen.
Wat wél werkte, is opvallend consistent: een ijkpunt dat losstaat van de agent en dat vóór aanvang vastligt. In de projecten was dat een uitkomst die exact gelijk moest zijn aan de bestaande, een resultaat dat minstens zo goed moest zijn als het gereedschap dat er al was, of een lijst eisen waaraan het werk vooraf moest voldoen. Zonder zo’n ijkpunt kost beoordelen meer tijd dan het werk zelf.
Wat dit AI-onderzoek betekent voor professionals
De bijdragers beschrijven allemaal dezelfde rolverschuiving: van uitvoeren naar specificeren, verifiëren en accorderen. Ze bepalen wat er moet komen, hoe correctheid wordt gemeten, en wanneer iets af is. Eén van hen typeert de nieuwe rol als die van productmanager in plaats van bouwer.
Voor adviseurs, accountants, juristen, ontwerpers en projectleiders geldt dezelfde beweging. De uren waarin je produceert dalen in waarde. De uren waarin je vaststelt wat kwaliteit is, stijgen. Je vakinhoud verdwijnt niet, maar verplaatst zich naar de kop en de staart van het proces: de opdracht scherp krijgen, en het resultaat streng toetsen.
Eén bijdrager vat de balans kernachtig samen: snel gaan is inmiddels eenvoudig, ver komen vraagt nog altijd expertise, oordeelsvermogen en zorgvuldigheid.
Wat dit AI-onderzoek betekent voor ondernemers
Voor jou verschuift vooral wat haalbaar is. De vaste kosten van ontwikkeling dalen, waardoor projecten in beeld komen die eerder afvielen op capaciteit. Voor veel bedrijven is dat de feitelijke rem: niet een tekort aan ideeën, maar aan handen.
Het rapport rekent de andere kant ook door. Voor één breed gebruikt softwarepakket ging het om circa 650 onderhoudsuren per jaar, wat neerkomt op 49.000 tot 98.000 dollar aan arbeidskosten. Ook bij een handvol systemen loopt dat bedrag zichtbaar op.
De valkuil staat er direct naast. Goedkoop bouwen leidt tot meerdere varianten van hetzelfde, waardoor gebruikers uiteenvallen en de schaarse aandacht versnippert. Het rapport is daar stellig over: zonder duidelijke eigenaar en een geloofwaardig onderhoudsplan wordt de moderne herbouw van vandaag de verweesde code van morgen. Bouw er één, en wijs de beheerder aan voordat je begint.
Wat doe je deze week met AI agents?
1. Leg vooraf vast waaraan je toetst. Eén A4 per taak: wat moet erin, wat mag er nooit in, en waartegen toets je het resultaat. In elk succesvol project uit het rapport lag dit ijkpunt vooraf vast.
2. Toets op productiemateriaal. Randgevallen komen pas boven bij realistische volumes en echte data. Reken de opbrengst van een pilot dus niet één op één door naar de praktijk.
3. Wijs eigenaarschap toe voordat je oplevert. Wie beheert de agent, wie actualiseert de kennisbasis, wie toetst periodiek of het nog klopt? De vuistregel uit het rapport is bruikbaar buiten de wetenschap: begin er niet aan als je niet van plan bent het te onderhouden. Zo werken de AI agents van So-MC ook — jij houdt de regie, de agent doet het werk eronder.
Wil je AI agents die binnen jouw norm werken?
AI Agents MAX automatiseert je marketing en sales met agents die je zelf aanstuurt en toetst — jij houdt de regie, de agent doet het werk eronder. Bekijk hoe het werkt.
Ontdek AI Agents MAX →
Veelgestelde vragen over AI agents
Wat is een AI agent?
Een AI agent is software die zelfstandig een opdracht uitvoert en een afgerond resultaat oplevert, binnen doelen en kaders die jij vooraf stelt. Het onderscheid met een chatbot is het verschil tussen antwoorden en handelen.
Wat is scientific computing?
Scientific computing is het gebruik van software en rekenkracht om onderzoeksvragen te beantwoorden: simulaties, modellen en de analyse van grote meetreeksen. In de life sciences is het de dominante werkvorm, waarbij ketens van programma’s DNA-data verwerken. Het veldrapport van OpenAI onderzoekt wat AI agents in dat vakgebied veranderen.
Welk onderzoek naar AI agents is dit precies?
Een veldrapport van 55 pagina’s dat OpenAI op 28 juli 2026 publiceerde met medeauteurs van onder meer de University of North Carolina, Harvard Medical School, het Allen Institute for AI en het Garvan Institute. Acht groepen beschrijven elk hun eigen project met AI agents in wetenschappelijke software.
Hoeveel sneller werd het werk met AI agents?
Dat loopt sterk uiteen: van circa 15 procent tijdwinst tot ruim 60 keer sneller. De grootste sprongen kwamen uit herontwerp, niet uit optimalisatie. Op echte data viel de winst structureel lager uit dan op testsets.
Kun je een AI agent zelfstandig laten werken?
Alleen tegen een vooraf vastgelegd ijkpunt. In zeven van de acht projecten bleef een mens eindverantwoordelijk voor de beoordeling. Agents rapporteerden regelmatig succes terwijl hun werk aantoonbare fouten bevatte.
Gelden deze lessen over AI agents ook buiten software?
Ja. Het patroon gaat over uitvoering delegeren en beoordeling behouden. Dat is identiek bij content, offertes, rapportages, dossieranalyse en leadopvolging.
Wordt mijn vak overbodig door AI agents?
Nee, het verschuift. Uitvoering wordt goedkoper, oordeelsvermogen duurder. De deelnemers bewogen van uitvoerder naar opdrachtgever: specificeren, verifiëren, accorderen. Wie weet wat goed is, wordt waardevoller.
Wat is de grootste fout die organisaties maken met AI agents?
Meer laten bouwen zonder eigenaarschap te beleggen. Lagere bouwkosten leiden tot parallelle varianten, versnipperde aandacht en uiteindelijk tot systemen die niemand meer valideert. Zonder beheerder en onderhoudsplan is snelheid een schijnwinst.
Dit artikel verscheen in AI Nieuws, de rubriek van So-MC waarin we AI-ontwikkelingen wegen op wat ze betekenen voor Nederlandse ondernemers, professionals en marketeers. Elke week nieuw.
Betrouwbaarheidsnotitie: dit artikel is gebaseerd op het veldrapport Scientific computing in the age of agentic AI van OpenAI (openai.com) en het volledige onderzoeksverslag van 55 pagina’s met alle acht casussen. Het rapport is retrospectief en verkennend: de projecten zijn niet vooraf voor deze studie opgezet, de deelnemende teams schreven hun eigen casus, en OpenAI geeft aan de gerapporteerde prestatiecijfers niet onafhankelijk te hebben gereproduceerd. Interpreteer ze als casus-specifieke uitkomsten, niet als algemene meting van wat AI agents presteren. De vertaling naar ondernemerschap en marketing is van So-MC en maakt geen deel uit van het rapport. Laatst bijgewerkt op 28 juli 2026.