# Test-time training: een lager verlies is nog geen herinnering Test-time training laat een model tijdens gebruik doorleren. Een preprint uit 2026 toont dat een dalend verlies nog niet wil zeggen dat het model iets kan navertellen. - Bron: https://koenholman.nl/onderzoek/lager-verlies-is-geen-herinnering/ - Auteur: Koen Holman - Rubriek: Modellen & evaluatie - Gepubliceerd: 2 oktober 2026 ## In het kort - Test-time training werkt gewichten bij tijdens gebruik en wordt meestal beoordeeld met proxies: perplexity, toekomstig tokenverlies, lange-contextprestaties of reward. - Die proxies passen bij claims over aanpassing aan een stroom of een domein, maar zijn zwak bewijs voor onthouden na inzet: terughalen, parafraseren, behouden en gebruiken in een actie. - In één gecontroleerde diagnose daalde het verlies bij drie modelgroottes terwijl vrij teruggehaald geheugen op nul bleef. Dat is één opzet, geen uitspraak over alle methoden. --- **Figuur.** Twee paneeltjes naast elkaar, schematisch en zonder gemeten waarden. Links daalt het verlies op het antwoord na een test-time-trainingsupdate: de balk na de update is lager dan de balk ervoor. Rechts staat wat een model vrij kan terughalen zonder dat de brontekst nog in de context staat: voor en na de update een balk ter hoogte van nul. Een dalend verlies zegt dat het model de tokens beter voorspelt; het zegt niet dat het model het feit kan navertellen. Een dalend verlies en een geheugen zijn twee verschillende waarnemingen. In de diagnose van Song en collega's daalde het ene terwijl het andere op nul bleef; het plaatje toont alleen die richting, geen gemeten waarden. Een taalmodel dat na de training wordt ingevroren, leert niet meer bij. Test-time training (TTT) probeert dat te veranderen: tijdens gebruik wordt een deel van de gewichten bijgewerkt op wat het model net te zien kreeg. Een van de varianten uit 2026 is bedoeld als “drop-in” voor bestaande modellen, en daarmee wordt een andere vraag dringender: wat mag je uit zo'n resultaat concluderen? Hieronder staan drie preprints uit 2026 naast elkaar: een techniek, een overzichtsartikel dat het leren tijdens gebruik in het veld plaatst, en een voorstel om zulke resultaten zorgvuldiger te beoordelen. Dat het verlies daalt, is een uitspraak over tokens. Dat een model iets onthoudt, is een uitspraak over gedrag — en daar is een andere meting voor nodig. ## Wat In-Place TTT verandert [Feng en collega's](https://arxiv.org/abs/2604.06169) vertrekken vanuit de beperking van het “train, dan inzetten”-model: een ingevroren model kan zich niet aanpassen aan een voortdurende stroom nieuwe informatie. TTT werkt daarom een deel van de parameters bij tijdens inferentie, de zogeheten *fast weights*. Volgens het abstract staan drie dingen de inzet daarvan in de weg: de architectuur past niet bij gangbare modellen, het is rekenkundig duur, en het doel waarop de gewichten worden bijgewerkt sluit niet aan op taalmodellering. Hun antwoord heet In-Place TTT. De laatste projectiematrix van de MLP-blokken wordt de aanpasbare laag, zodat een bestaand model zonder hertraining vanaf nul een “drop-in” verbetering krijgt. Het generieke reconstructiedoel wordt vervangen door een doel dat aansluit op het voorspellen van het volgende token, en de updates gebeuren per blok (*chunk-wise*). Als resultaat melden ze dat een model van 4 miljard parameters betere prestaties haalt op taken met contexten tot 128k — waartegen dat vergeleken wordt, laat het abstract open — en dat de methode bij pretraining vanaf nul concurrerende TTT-aanpakken overtreft. De afsluitende zin van het abstract is de moeite van het citeren waard: de resultaten “establish In-Place TTT as a promising step towards a paradigm of continual learning in LLMs”. De gemeten prestatie is dus die op lange contexten; de ambitie waar die in wordt geplaatst is continu leren. ## Waar het leren kan zitten Dat “continual learning” een ruimer begrip is geworden, beschrijven [Hou en collega's](https://arxiv.org/abs/2608.06216) in een overzichtsartikel van augustus 2026. Klassiek continual learning draait om parameters: trainingsstrategieën, architecturen, gewichtsaanpassing. Volgens het abstract verbreden meerdere ontwikkelingen dat: on-policy leren vergroot het aanbod aan updatemechanismen, test-time training brengt het leren naar het moment van inferentie, en externe componenten — geheugen, vaardigheidsbibliotheken, interactieprotocollen — verruimen wat een model kan buiten zijn eigen parameters. Hun conclusie is een verschuiving van parametergericht leren naar aanpassing op systeemniveau. Ze ordenen dat langs drie vragen: *wanneer* er geleerd wordt (bij pretraining, posttraining of tijdens inferentie), *hoe*, en *waar* — binnen de parameters of in structuur eromheen. Het is een survey, dus een lezing van het veld en geen meting. Voor dit stuk telt vooral de derde as: leren in de parameters, of in de structuur eromheen. ## Wat Song en collega's ertegenover zetten [Song en collega's](https://arxiv.org/abs/2607.00368) beginnen bij hoe TTT wordt beoordeeld. Een model wordt bijgewerkt op recente tokens, opgehaalde context, data uit het doeldomein of verifieerbare pogingen, en daarna beoordeeld met perplexity, toekomstig tokenverlies, prestaties op lange context of reward. Die maten passen, schrijven ze, bij claims over aanpassing aan een stroom, aanpassing aan een domein, contextcompressie en reward-gedreven verbetering tijdens gebruik. Ze zijn zwakker bewijs voor iets waarvoor TTT-resultaten steeds vaker als motivatie dienen: een geheugen van een ingezette assistent, personalisatie, of schaars leren na inzet. Dat vraagt gedragsbewijs, en het abstract noemt daarvan onder meer zes soorten, te meten nadat de oorspronkelijke steuncontext is weggehaald: - later terughalen; - robuustheid tegen herformuleren; - behoud over tijd; - lokaliteit — geen doorsijpelen naar iets anders; - omgaan met een tegenstrijdig feit; - gebruik in een vervolgactie. Hun raamwerk heeft twee onderdelen. Het eerste is een *evidence ladder* die een geheugenclaim afstemt op het bewijs dat haar draagt, met drie sporten: aanpassing aan een stroom of domein, “bridge internalization” en gedragsleren tijdens inzet. Wat die middelste sport precies inhoudt, laat het abstract open; ik kan het hier niet uitleggen zonder het volledige paper. Het tweede onderdeel is een evaluatieprotocol met bijpassende expliciete geheugenbasislijnen en foutcategorieën die elkaar uitsluiten. > **De diagnose, volgens het abstract** > > In een setting met schaarse *nonce facts* (in mijn lezing: verzonnen feiten die het model uit zijn training niet kan kennen) verlagen eenstaps-LoRA-updates het verlies op de steun en op het antwoord bij drie Qwen3-groottes, terwijl vrij gegenereerd terughalen op nul blijft. Zij noemen dat een meetbaar gat tussen verbetering op de proxy en gedrag na inzet. **Wat deze diagnose niet zegt** Het is één opzet: eenstaps-LoRA-updates, schaarse verzonnen feiten, één modelfamilie in drie groottes. De diagnose zegt niet dat TTT geen geheugen kan opleveren, en ze zegt niets over In-Place TTT, dat een ander mechanisme gebruikt en in het abstract van Song en collega's niet voorkomt. Wat ze laat zien is dat de ene waarneming de andere niet impliceert. Het abstract meldt ook dat de auteurs recent TTT-werk en aanverwant geheugenwerk met hun raamwerk hebben doorgelicht. De uitkomst daarvan staat niet in het abstract, en ik doe er dus geen uitspraak over. > **Vanaf hier: mijn interpretatie** > > Alles hierboven is terug te lezen in de bronnen onderaan, op het niveau van hun abstracts. Wat nu volgt staat daar niet in: het zijn de gevolgtrekkingen die ik eruit trek voor wie een systeem bouwt dat moet onthouden. Neem ze als voorstel, niet als bevinding. ## Wat hieruit volgt - **Zeg eerst welke claim het is.** “Het model past zich aan de stroom aan” en “het model onthoudt wat gebruiker X zei” klinken verwant en vragen verschillend bewijs. Prestaties op lange contexten, wat het abstract van Feng en collega's rapporteert, staan op de lijst van maten die Song en collega's bij aanpassingsclaims passend noemen. Dat Fengs abstract eindigt bij continu leren maakt van die meting nog geen bewijs voor de tweede soort claim. - **Een dalend verlies is geen bewijs.** Mijn lezing van de diagnose is dat het verlies kan zakken zonder dat er iets terug te halen valt. Of het omgekeerde kan — terughalen zonder dat het verlies zakt — zegt de bron niet, en dat laat ik open. - **Zet de saaie basislijn ernaast.** Hou en collega's onderscheiden leren in de parameters van leren in structuur eromheen; Song en collega's nemen in hun protocol expliciete geheugenbasislijnen op. Dat is dezelfde vraag als in [het stuk over geheugen voor agents](https://koenholman.nl/onderzoek/geheugen-volgt-het-knelpunt/): zet de informatie eerst gewoon in een notitie of haal haar op, en kijk wat die eenvoudiger route op dezelfde toets haalt. - **Kies foutcategorieën die elkaar uitsluiten.** “Het werkt niet” is geen diagnose. Wie per mislukte toets vastlegt waar het misging, ziet welk deel van het systeem knelt in plaats van een totaalcijfer te krijgen. ### Een uitgewerkt geval, verzonnen en zonder uitkomst Illustratief voorbeeld, geen benchmark en geen meting. Een assistent krijgt eenmalig te horen: “Onze leverancier voor staalplaat is Brouwer Metaal.” Het systeem verwerkt dat via een TTT-update, en het verlies op die zin daalt. De vraag is wat dat bewijst. De toetsen die erbij horen, zonder dat de zin nog in de context staat: 1. Later terughalen: “Wie levert onze staalplaat?” 2. Herformuleren: “Bij welk bedrijf bestel ik plaatstaal?” 3. Behoud: dezelfde vraag na een nacht en na andere updates. 4. Lokaliteit: “Wie levert onze aluminiumprofielen?” mag niet Brouwer opleveren. 5. Tegenspraak: na “We zijn overgestapt naar De Vries” moet het antwoord meeveranderen. 6. Vervolgactie: een bestelmail opstellen aan de juiste leverancier. Dezelfde zes toetsen kun je naast een notitiebestand met die ene zin erin leggen. Dat is geen oordeel over TTT; het is de vraag welke van de twee routes de lijst haalt, en dat weet je pas als je ze draait. ## Waar het ophoudt **Vier voorbehouden bij dit stuk** **Alleen abstracts.** Dit stuk leunt op de abstracts van drie preprints. Ik heb de volledige teksten, de tabellen en de code niet gelezen, omdat arxiv.org vanuit de omgeving waarin dit stuk is geschreven niet bereikbaar was. Over hoe groot het gat in de diagnose is, onder welke instellingen het optreedt, en hoe de doorlichting van eerder werk is uitgevallen, kan ik daarom niets zeggen. **Preprints, niet gerepliceerd.** Geen van de drie is door mij nagerekend, en de abstracts noemen geen onafhankelijke replicatie. De arXiv-pagina van Feng en collega's noemt een ICLR 2026-presentatie; dat wijst op beoordeling door reviewers, niet op herhaling van de meting. **Eén diagnose, één familie.** Het gat tussen verlies en terughalen is aangetoond in een smalle opzet. Dat een andere TTT-methode het niet heeft, of juist wel, volgt er niet uit. Dat is de reden dat dit stuk eindigt in een prompt waarmee je het op je eigen systeem kunt toetsen en niet in een conclusie over TTT. **Het veld beweegt.** De drie preprints zijn van 2026, en wat nu “de nieuwste techniek” heet, kan over een half jaar een basislijn zijn. Wat blijft staan is naar verwachting de vorm van de vraag: welk gedrag hoort bij de claim, en is dat gemeten? ## Bronnen 1. [Beyond Perplexity: A Behavioral Evaluation Framework for Deployment-Memory Claims in LLM Test-Time Training](https://arxiv.org/abs/2607.00368) — Song et al. · arXiv:2607.00368 · 2026 2. [In-Place Test-Time Training](https://arxiv.org/abs/2604.06169) — Feng et al. · arXiv:2604.06169 · 2026 3. [Continual Learning in Transition](https://arxiv.org/abs/2608.06216) — Hou et al. · arXiv:2608.06216 · 2026 ## Toets het op je eigen systeem Laat je eigen systeem vaststellen welk bewijs er ligt onder een claim dat het bijleert of onthoudt, voordat je die claim vertrouwt. ``` Je gaat beoordelen of een claim over leren of onthouden in dit project gedragen wordt door het juiste bewijs. Het gaat niet om de vraag of de techniek goed is, maar om wat de meting werkelijk aantoont. Stap 1 — formuleer de claim letterlijk. Welke zin in de documentatie, de code of een PR beweert dat het systeem bijleert, onthoudt of zich aanpast? Noem de plek. Stap 2 — plaats de claim. Gaat het om (a) aanpassing aan een stroom of een domein, (b) iets daartussen: informatie belandt in het model of de opslag, maar is nog niet getoetst op later gebruik, of (c) gedrag na inzet: het systeem gebruikt later iets wat het eenmalig te zien kreeg. Zeg bij welke je uitkomt en waarom. Stap 3 — inventariseer het bewijs dat er nu ligt. Welke maat is gebruikt (verlies, perplexity, score op een taak, reward, een indruk)? Past die maat bij de soort claim uit stap 2? Zeg expliciet wat die maat niet kan zien. Stap 4 — ontwerp, voor een claim van soort (c), de toets zonder dat de oorspronkelijke brontekst nog in de context staat. Minstens: later vrij terughalen; dezelfde vraag anders geformuleerd; behouden na verloop van tijd of na andere updates; geen doorsijpelen naar aangrenzende feiten; omgaan met een feit dat later wordt tegengesproken; gebruik in een vervolgactie en niet alleen in een antwoord. Stap 5 — zet een expliciete geheugenbasislijn ernaast: dezelfde informatie in een notitie of via ophalen. Wat doet die eenvoudiger route op dezelfde toets? Stap 6 — geef pas dan je oordeel: welk bewijs ontbreekt, welke toets draai je als eerste, en wat zou je moeten zien om de claim terug te brengen tot wat de maat wel draagt. Benoem wat je niet kunt beoordelen zonder het systeem te draaien. ```