Onderzoek
Uitzoeken wat er werkelijk staat
Een onderwerp uitpluizen tot de bewering en het bewijs uit elkaar te houden zijn. Elk artikel hier zegt wat er gemeten is, wat daaruit volgt, en waar het ophoudt — met de bronnen erbij, zodat je het kunt natrekken zonder mij te geloven. En met een prompt eronder, zodat je kunt zien of je eigen systeem er iets mee kan.
19 van de 19 artikelen
- Modellen & evaluatie
Test-time training: een lager verlies is nog geen herinnering
Test-time training laat een model tijdens gebruik doorleren. Een preprint uit 2026 toont dat een dalend verlies nog niet wil zeggen dat het model iets kan navertellen.Lees het artikel → - Digital analytics
Een model kan niets met een rommelige datalaag
Elke belofte over AI in analytics gaat over de bovenkant van de stack. Een model dat vier spellingen van hetzelfde event binnenkrijgt, ziet vier gedragingen.Lees het artikel → - Nieuwssamenvatting
Tien jaar AI-veiligheidsincidenten, tot aan Amodei’s oproep om te vertragen
Een interactieve tijdlijn van de AI-veiligheidsincidenten die voorafgingen aan Amodei’s oproep om de frontier te vertragen, en wat er redelijkerwijs op volgt.Lees het artikel → - Agents & pijplijnen
Drift: de afstand tussen wat je getoetst hebt en wat er draait
Drift is de afstand tussen wat je ooit getoetst hebt en wat er nu draait. Zeven soorten in AI-systemen, wat ze delen, en hoe je die afstand meetbaar en kleiner maakt.Lees het artikel → - Modellen & evaluatie
Een model dat op de gemiddelde fout traint, leert vervagen
AI-weermodellen versloegen de natuurkunde op 90% van de toetsdoelen. Dezelfde foutmaat die dat aantoonde, betaalt een model om te vervagen.Lees het artikel → - deSchouwVloot verdiepen
Hugging Face-inbraak: AI-agents ontweken een controle die niet bestond
In juli 2026 braken 700 evaluatie-agents in bij Hugging Face om een scorer te misleiden die niet bestond. Wat ze over hun toezicht geloofden, stuurde het gedrag.Lees het artikel → - Veiligheid & grenzen
Model Context Protocol: vertrouwen bindt aan de naam, niet aan de inhoud
MCP verbindt AI-agents met tools van derden. Drie los ontdekte kwetsbaarheden delen hetzelfde patroon: vertrouwen bindt aan een naam, niet aan de inhoud.Lees het artikel → - Modellen & evaluatie
Een lokaal model breekt niet op kwantisatie, maar op de horizon
Een gekwantiseerd model haalt 86% op losse tool-aanroepen; apart onderzoek naar 16 lokale modellen vindt de klap pas bij taken met meerdere stappen.Lees het artikel → - Modellen & evaluatie
Wat er op je GPU past is een bandbreedtevraag, geen VRAM-vraag
Drie methodes om te bepalen wat op een 16GB-GPU past — een rekenregel, gemeten tokens/s en een testgids — komen op hetzelfde venster uit, en wijzen naar bandbreedte.Lees het artikel → - deSchouwVloot verdiepen
Reward hacking: het getal dat de gemeten partij kan lezen
Meet je doorlooptijd, dan worden PR’s vanzelf kleiner. Datzelfde effect, maar met een agent die je opdracht letterlijk leest en bij het meetbestand kan.Lees het artikel → - Veiligheid & grenzen
Waar de stemming en het incidentregister uiteenlopen, telt de richting
De OWASP-lijst van 2026 legde de stem van practitioners naast 7.714 incidenten. Waar die twee uiteenlopen zegt de richting meer dan de omvang.Lees het artikel → - Veiligheid & grenzen
Promptinjectie bij AI-agents: filters falen, actiegrenzen werken
Promptinjectie bij AI-agents: waarom aanvalscijfers zo uiteenlopen, wat een grens rond risicovolle handelingen oplevert, en wat die kost.Lees het artikel → - Agents & pijplijnen
Autonomie is een ontwerpkeuze, geen modeleigenschap
Autonomie bij AI-agents: waarom hetzelfde model op vijf niveaus kan draaien, en waarom een langere tijdshorizon niet vanzelf minder toezicht betekent.Lees het artikel → - deSchouwVloot verdiepen
Metadata in een CI/CD-pijplijn: vastleggen, niet reconstrueren
Een pijplijn laat zien dát er iets gebeurde, maar zelden wát. Welke velden je op het moment zelf moet opschrijven voordat er iets te meten valt — en wie dat opschrijft.Lees het artikel → - Agents & pijplijnen
Geheugen voor agents is geen product, maar een keuze per knelpunt
Twee onafhankelijke evaluaties vergelijken vijftien geheugensystemen voor agents. Geen enkele wint overal, en een lang contextvenster blijft een geduchte basislijn.Lees het artikel → - Modellen & evaluatie
Toegang is geen controle
Je kunt een AI-capability gebruiken zonder grip op het model dat hem levert. Die afstand is geen implementatiedetail maar een architectuurvariabele.Lees het artikel → - Agents & pijplijnen
Context is een eindige hulpbron, geen emmer
Waarom een groter contextvenster een agent niet betrouwbaarder maakt, en welke vier technieken de aandacht van een model wél efficiënt besteden.Lees het artikel → - Modellen & evaluatie
Een groene testsuite bewijst niet dat de patch klopt
Bijna een derde van de patches die op SWE-bench Verified slagen, gedraagt zich anders dan de referentie. Wat dat betekent voor wie agents in een pijplijn zet.Lees het artikel → - Modellen & evaluatie
Modelkeuze is een architectuurbeslissing, geen prijsvergelijking
Tien keer prijsverschil tussen het duurste en het goedkoopste model, drie redenen waarom dat getal misleidt, en waarom je in de verkeerde eenheid rekent.Lees het artikel →
Waar dit over gaat
- Agents & pijplijnenTechnieken om autonome systemen bruikbaar te houden over lange taken, en wat dat vraagt van de machinerie eromheen.
- Modellen & evaluatieWat er uit de modellen en de benchmarks komt, en wat daarvan overeind blijft zodra je het op echt werk loslaat.
- Veiligheid & grenzenWat er gebeurt als een autonoom systeem invoer tegenkomt die het niet zelf geschreven heeft, en welke grenzen dan nog houden.
- deSchouwVloot verdiepenArtikelen die de pijplijn onder deze site zelf als onderwerp nemen: wat er aan deSchouwVloot beter kan, getoetst aan wat er buiten deze repo over bekend is.
- NieuwssamenvattingWat er gebeurde, gedateerd en met de bron erbij: de gebeurtenissen achter een ontwikkeling op een rij, en daarna wat er redelijkerwijs volgt.
- Digital analyticsWat er tussen een klik en een cijfer gebeurt — de datalaag, de tags en de verzameling — en wat een model daar wel en niet mee kan.
Nieuwe artikelen verschijnen ook in de RSS-feed.