# Onderzoek — Koen Holman > Artikelen over agent-architectuur, modelkeuze en de evaluatie van AI-systemen. > Elk artikel noemt wat er gemeten is, wat daaruit volgt en waar het ophoudt, met > de bronnen erbij. Een onderzoeksstuk draagt ook een prompt waarmee je de bevinding > op je eigen systeem kunt toetsen; een nieuwssamenvatting niet — die stelt niets vast. Auteur: Koen Holman · https://koenholman.nl/koen-holman/ Overzicht: https://koenholman.nl/onderzoek/ Feed: https://koenholman.nl/onderzoek/rss.xml ## Rubrieken - **Agents & pijplijnen** — Technieken om autonome systemen bruikbaar te houden over lange taken, en wat dat vraagt van de machinerie eromheen. - **Modellen & evaluatie** — Wat er uit de modellen en de benchmarks komt, en wat daarvan overeind blijft zodra je het op echt werk loslaat. - **Veiligheid & grenzen** — Wat er gebeurt als een autonoom systeem invoer tegenkomt die het niet zelf geschreven heeft, en welke grenzen dan nog houden. - **deSchouwVloot verdiepen** — Artikelen die de pijplijn onder deze site zelf als onderwerp nemen: wat er aan deSchouwVloot beter kan, getoetst aan wat er buiten deze repo over bekend is. - **Nieuwssamenvatting** — Wat er gebeurde, gedateerd en met de bron erbij: de gebeurtenissen achter een ontwikkeling op een rij, en daarna wat er redelijkerwijs volgt. - **Digital analytics** — Wat er tussen een klik en een cijfer gebeurt — de datalaag, de tags en de verzameling — en wat een model daar wel en niet mee kan. ## Artikelen ### Een model kan niets met een rommelige datalaag Elke belofte over AI in analytics gaat over de bovenkant van de stack. Een model dat vier spellingen van hetzelfde event binnenkrijgt, ziet vier gedragingen. - Pagina: https://koenholman.nl/onderzoek/een-model-kan-niets-met-een-rommelige-datalaag/ - Markdown: https://koenholman.nl/onderzoek/een-model-kan-niets-met-een-rommelige-datalaag/index.md - Rubriek: Digital analytics - Gepubliceerd: 15 september 2026 - Trefwoorden: datalaag, datakwaliteit, digital analytics, eventnaamgeving, datacontract, tagmanager, data cascades ### Tien jaar AI-veiligheidsincidenten, tot aan Amodei’s oproep om te vertragen Een interactieve tijdlijn van de AI-veiligheidsincidenten die voorafgingen aan Amodei’s oproep om de frontier te vertragen, en wat er redelijkerwijs op volgt. - Pagina: https://koenholman.nl/onderzoek/tijdlijn-ai-veiligheidsincidenten/ - Markdown: https://koenholman.nl/onderzoek/tijdlijn-ai-veiligheidsincidenten/index.md - Rubriek: Nieuwssamenvatting - Gepubliceerd: 13 september 2026 - Trefwoorden: AI-veiligheid, tijdlijn, Dario Amodei, We Must Pace the Frontier, recursieve zelfverbetering, OpenAI Hugging Face incident, embedded evaluators, METR, AI-incidenten, AI-regulering ### Drift: de afstand tussen wat je getoetst hebt en wat er draait Drift is de afstand tussen wat je ooit getoetst hebt en wat er nu draait. Zeven soorten in AI-systemen, wat ze delen, en hoe je die afstand meetbaar en kleiner maakt. - Pagina: https://koenholman.nl/onderzoek/drift-is-een-afstand/ - Markdown: https://koenholman.nl/onderzoek/drift-is-een-afstand/index.md - Rubriek: Agents & pijplijnen - Gepubliceerd: 3 september 2026 - Trefwoorden: drift, concept drift, datadrift, modeldrift, goal drift, promptdrift, configuratiedrift, model collapse, AI-agents, monitoring ### Een model dat op de gemiddelde fout traint, leert vervagen AI-weermodellen versloegen de natuurkunde op 90% van de toetsdoelen. Dezelfde foutmaat die dat aantoonde, betaalt een model om te vervagen. - Pagina: https://koenholman.nl/onderzoek/de-foutmaat-kiest-de-modelklasse/ - Markdown: https://koenholman.nl/onderzoek/de-foutmaat-kiest-de-modelklasse/index.md - Rubriek: Modellen & evaluatie - Gepubliceerd: 31 augustus 2026 - Trefwoorden: MSE, RMSE, dubbele straf, verliesfunctie, AI-weermodel, GraphCast, GenCast, AIFS, CRPS, wet van Goodhart ### Hugging Face-inbraak: AI-agents ontweken een controle die niet bestond In juli 2026 braken 700 evaluatie-agents in bij Hugging Face om een scorer te misleiden die niet bestond. Wat ze over hun toezicht geloofden, stuurde het gedrag. - Pagina: https://koenholman.nl/onderzoek/de-scorer-die-er-niet-was/ - Markdown: https://koenholman.nl/onderzoek/de-scorer-die-er-niet-was/index.md - Rubriek: deSchouwVloot verdiepen - Gepubliceerd: 31 augustus 2026 - Trefwoorden: reward hacking, evaluatie-agents, Hugging Face-incident, METR, toezicht op AI-agents, blast radius, ExploitGym, deSchouwVloot ### Model Context Protocol: vertrouwen bindt aan de naam, niet aan de inhoud MCP verbindt AI-agents met tools van derden. Drie los ontdekte kwetsbaarheden delen hetzelfde patroon: vertrouwen bindt aan een naam, niet aan de inhoud. - Pagina: https://koenholman.nl/onderzoek/vertrouwen-bindt-aan-de-naam-niet-de-inhoud/ - Markdown: https://koenholman.nl/onderzoek/vertrouwen-bindt-aan-de-naam-niet-de-inhoud/index.md - Rubriek: Veiligheid & grenzen - Gepubliceerd: 29 augustus 2026 - Trefwoorden: Model Context Protocol, MCP, tool poisoning, rug pull attack, confused deputy, lethal trifecta, AI-agents, agent security, toolpermissies, MCP security ### Een lokaal model breekt niet op kwantisatie, maar op de horizon Een gekwantiseerd model haalt 86% op losse tool-aanroepen; apart onderzoek naar 16 lokale modellen vindt de klap pas bij taken met meerdere stappen. - Pagina: https://koenholman.nl/onderzoek/lokaal-model-breekt-niet-op-kwantisatie/ - Markdown: https://koenholman.nl/onderzoek/lokaal-model-breekt-niet-op-kwantisatie/index.md - Rubriek: Modellen & evaluatie - Gepubliceerd: 28 augustus 2026 - Trefwoorden: lokale LLM-inferentie, agentic AI, tool calling, quantisatie, BFCL, multi-step reasoning, AgentFloor, MLPerf, edge inference ### Wat er op je GPU past is een bandbreedtevraag, geen VRAM-vraag Drie methodes om te bepalen wat op een 16GB-GPU past — een rekenregel, gemeten tokens/s en een testgids — komen op hetzelfde venster uit, en wijzen naar bandbreedte. - Pagina: https://koenholman.nl/onderzoek/wat-past-is-een-bandbreedtevraag/ - Markdown: https://koenholman.nl/onderzoek/wat-past-is-een-bandbreedtevraag/index.md - Rubriek: Modellen & evaluatie - Gepubliceerd: 28 augustus 2026 - Trefwoorden: RTX 5070 Ti, lokale LLM-inferentie, VRAM, geheugenbandbreedte, GPU-keuze, quantisatie, Ollama ### Reward hacking: het getal dat de gemeten partij kan lezen Meet je doorlooptijd, dan worden PR’s vanzelf kleiner. Datzelfde effect, maar met een agent die je opdracht letterlijk leest en bij het meetbestand kan. - Pagina: https://koenholman.nl/onderzoek/de-gemeten-partij-leest-mee/ - Markdown: https://koenholman.nl/onderzoek/de-gemeten-partij-leest-mee/index.md - Rubriek: deSchouwVloot verdiepen - Gepubliceerd: 27 augustus 2026 - Trefwoorden: reward hacking, specification gaming, wet van Goodhart, AI-agents, CI/CD-pijplijn, SpecBench, deSchouwVloot ### Waar de stemming en het incidentregister uiteenlopen, telt de richting De OWASP-lijst van 2026 legde de stem van practitioners naast 7.714 incidenten. Waar die twee uiteenlopen zegt de richting meer dan de omvang. - Pagina: https://koenholman.nl/onderzoek/de-richting-van-de-kloof/ - Markdown: https://koenholman.nl/onderzoek/de-richting-van-de-kloof/index.md - Rubriek: Veiligheid & grenzen - Gepubliceerd: 26 augustus 2026 - Trefwoorden: OWASP LLM Top 10, OWASP GenAI, misinformatie, excessive agency, risicorangschikking, incidentdata, AI-agents, promptinjectie ### Promptinjectie bij AI-agents: filters falen, actiegrenzen werken Promptinjectie bij AI-agents: waarom aanvalscijfers zo uiteenlopen, wat een grens rond risicovolle handelingen oplevert, en wat die kost. - Pagina: https://koenholman.nl/onderzoek/grens-om-de-handeling/ - Markdown: https://koenholman.nl/onderzoek/grens-om-de-handeling/index.md - Rubriek: Veiligheid & grenzen - Gepubliceerd: 26 augustus 2026 - Trefwoorden: promptinjectie, prompt injection, indirect prompt injection, AI-agents, agent security, security boundary, consequential actions, policy enforcement, AgentDojo, toolpermissies ### Autonomie is een ontwerpkeuze, geen modeleigenschap Autonomie bij AI-agents: waarom hetzelfde model op vijf niveaus kan draaien, en waarom een langere tijdshorizon niet vanzelf minder toezicht betekent. - Pagina: https://koenholman.nl/onderzoek/autonomie-is-een-ontwerpkeuze/ - Markdown: https://koenholman.nl/onderzoek/autonomie-is-een-ontwerpkeuze/index.md - Rubriek: Agents & pijplijnen - Gepubliceerd: 25 augustus 2026 - Trefwoorden: autonomie, AI-agents, agentic AI, levels of autonomy, agency vs autonomy, human-in-the-loop, agent oversight, time horizon, permissiemodi, toezicht ### Metadata in een CI/CD-pijplijn: vastleggen, niet reconstrueren Een pijplijn laat zien dát er iets gebeurde, maar zelden wát. Welke velden je op het moment zelf moet opschrijven voordat er iets te meten valt — en wie dat opschrijft. - Pagina: https://koenholman.nl/onderzoek/meten-is-vastleggen/ - Markdown: https://koenholman.nl/onderzoek/meten-is-vastleggen/index.md - Rubriek: deSchouwVloot verdiepen - Gepubliceerd: 25 augustus 2026 - Trefwoorden: CI/CD-observability, metadata, DORA-metrics, OpenTelemetry semantic conventions, pijplijn meten, deSchouwVloot, build provenance ### Geheugen voor agents is geen product, maar een keuze per knelpunt Twee onafhankelijke evaluaties vergelijken vijftien geheugensystemen voor agents. Geen enkele wint overal, en een lang contextvenster blijft een geduchte basislijn. - Pagina: https://koenholman.nl/onderzoek/geheugen-volgt-het-knelpunt/ - Markdown: https://koenholman.nl/onderzoek/geheugen-volgt-het-knelpunt/index.md - Rubriek: Agents & pijplijnen - Gepubliceerd: 24 augustus 2026 - Trefwoorden: agent memory, AI-agents, contextvenster, benchmark, retrieval, agentarchitectuur ### Toegang is geen controle Je kunt een AI-capability gebruiken zonder grip op het model dat hem levert. Die afstand is geen implementatiedetail maar een architectuurvariabele. - Pagina: https://koenholman.nl/onderzoek/toegang-tot-capaciteit/ - Markdown: https://koenholman.nl/onderzoek/toegang-tot-capaciteit/index.md - Rubriek: Modellen & evaluatie - Gepubliceerd: 24 augustus 2026 - Trefwoorden: modeltoegang, LLM gateway, agentarchitectuur, reproduceerbaarheid, AI-governance, Claude ### Context is een eindige hulpbron, geen emmer Waarom een groter contextvenster een agent niet betrouwbaarder maakt, en welke vier technieken de aandacht van een model wél efficiënt besteden. - Pagina: https://koenholman.nl/onderzoek/context-als-eindige-hulpbron/ - Markdown: https://koenholman.nl/onderzoek/context-als-eindige-hulpbron/index.md - Rubriek: Agents & pijplijnen - Gepubliceerd: 23 augustus 2026 - Trefwoorden: context engineering, AI-agents, contextvenster, context rot, subagents, LLM-architectuur, Claude ### Een groene testsuite bewijst niet dat de patch klopt Bijna een derde van de patches die op SWE-bench Verified slagen, gedraagt zich anders dan de referentie. Wat dat betekent voor wie agents in een pijplijn zet. - Pagina: https://koenholman.nl/onderzoek/groene-tests-bewijzen-geen-correcte-patch/ - Markdown: https://koenholman.nl/onderzoek/groene-tests-bewijzen-geen-correcte-patch/index.md - Rubriek: Modellen & evaluatie - Gepubliceerd: 23 augustus 2026 - Trefwoorden: SWE-bench, agent evaluatie, benchmark, differential testing, code review, CI/CD, AI-agents ### Modelkeuze is een architectuurbeslissing, geen prijsvergelijking Tien keer prijsverschil tussen het duurste en het goedkoopste model, drie redenen waarom dat getal misleidt, en waarom je in de verkeerde eenheid rekent. - Pagina: https://koenholman.nl/onderzoek/modelkeuze-is-geen-prijsvergelijking/ - Markdown: https://koenholman.nl/onderzoek/modelkeuze-is-geen-prijsvergelijking/index.md - Rubriek: Modellen & evaluatie - Gepubliceerd: 23 augustus 2026 - Trefwoorden: Claude, modelkeuze, LLM-prijzen, tokenizer, model versioning, AI-agents, reproduceerbaarheid ## Tijdlijn Modellen, doorbraken, incidenten, geld en beleid rond AI sinds 1950 op één tijdlijn, met per gebeurtenis één bron. Groeit mee met elke nieuwssamenvatting. - Pagina: https://koenholman.nl/onderzoek/tijdlijn/ - Markdown: https://koenholman.nl/onderzoek/tijdlijn/index.md - Bijgewerkt op: 2 oktober 2026 - Gebeurtenissen: 165 ## Citeren Verwijs naar de pagina-URL van het artikel, niet naar dit bestand. De bronnen onderaan elk artikel zijn primaire publicaties; citeer die rechtstreeks waar dat kan.