De virale claim: ruwe, letterlijke opslag verslaat alles voor AI-geheugen. Wij reproduceerden de benchmark en vonden een ander antwoord. Het knelpunt is truncatie van de embedding, niet verlies bij extractie. Hier zijn de data.
Waarom we deze benchmark hebben gedraaid
MemPalace (github.com/milla-jovovich/mempalace) lanceerde op 5 april 2026 en bereikte 14.500 GitHub-sterren in 48 uur. De kernstelling: sla elk gesprek letterlijk op in ChromaDB, sla LLM-extractie volledig over, en je krijgt 96,6% recall op de standaardbenchmark voor AI-geheugen (LongMemEval).
De implicatie voor het vakgebied: elk systeem dat een LLM gebruikt om herinneringen te extraheren of samen te vatten, maakt het probleem onnodig complex. Ruwe tekst met goede embeddings wint.
Wij bouwen kennismanagementsystemen op basis van het SECI-model (Nonaka & Takeuchi, 1995), waarin gestructureerde extractie een kernbewerking is. Als ruwe opslag extractie werkelijk verslaat, klopt onze architectuur niet. Dus we hebben het getest.
Wat we hebben getest
Benchmark: LongMemEval_S (Wu et al., ICLR 2025). 500 vragen die vijf langetermijngeheugenvaardigheden testen: informatie-extractie, redeneren over meerdere sessies, kennisupdates, temporeel redeneren en onthouding. Elke vraag bevat ongeveer 48 "hooiberg"-gespreksessies, waarvan er 1 tot 3 het antwoord bevatten.
Vier ophaalmethoden, hetzelfde embeddingmodel (all-MiniLM-L6-v2), dezelfde data:
| # | Methode | Beschrijving |
|---|---|---|
| 1 | Ruw, alle beurten | Sla de volledige sessietekst op (gebruiker + assistent), embed as-is |
| 2 | Ruw, alleen gebruiker | De methode van MemPalace: sla alleen gebruikersbeurten op, embed as-is |
| 3 | SECI-extractie | Verdicht elke sessie tot ongeveer 500 tekens gestructureerde feiten |
| 4 | SECI hybride + trefwoord | Combineer ruwe en geëxtraheerde scores via reciprocal rank fusion, met een trefwoordoverlap-boost |
Alle methoden gebruiken ChromaDB met zoeken op cosinusgelijkenis. Geen LLM betrokken bij het ophalen. Het enige verschil is wat er wordt geïndexeerd.
Resultaten
LongMemEval_S: ophalen op sessieniveau (500 vragen, alle 6 types)
| Methode | R@5 | R@10 | NDCG@5 | NDCG@10 |
|---|---|---|---|---|
| Ruw, alle beurten | 85,9% | 92,8% | 80,3% | 83,0% |
| Ruw, alleen gebruiker (MemPalace-methode) | 92,1% | 96,3% | 86,8% | 88,5% |
| SECI-extractie | 93,7% | 96,7% | 89,1% | 90,3% |
| SECI hybride + trefwoord | 93,9% | 96,6% | 89,7% | 90,8% |

SECI hybride versloeg ruwe opslag in MemPalace-stijl met 1,8 procentpunt op R@5.
Uitsplitsing per vraagtype
| Methode | Kennisupdate (n=72) | Meerdere sessies (n=121) | SS-gebruiker (n=64) | Temporeel (n=127) |
|---|---|---|---|---|
| Ruw, alleen gebruiker (MemPalace) | 98,6% | 90,6% | 92,2% | 86,9% |
| SECI-extractie | 95,8% | 93,2% | 96,9% | 88,8% |
| SECI hybride+tw | 96,5% | 93,7% | 96,9% | 88,4% |
SECI-extractie loopt voorop bij 4 van de 6 vraagtypes. De MemPalace-methode wint bij kennisupdate (+2,1pp), waar de oorspronkelijke bewoording van gewijzigde feiten ertoe doet. Het SECI-voordeel is het grootst bij vragen over één sessie met de gebruiker (+4,7pp), waar het antwoord diep in een lang gesprek verstopt zit.
Waarom extractie wint: het truncatieprobleem bij 256 tokens
Het resultaat verraste ons. De stelling van MemPalace is intuïtief: extractie verliest informatie, ruwe opslag bewaart alles. In theorie zou ruw moeten winnen.
De marge is krapper dan onze eerste steekproef van 100 vragen suggereerde (+4,9pp versmalde tot +1,8pp op de volledige schaal van 500 vragen). Vragen over temporeel redeneren en kennisupdate brachten het gat dichterbij. Precies daarom draai je de volledige benchmark.
De realiteit: het embeddingmodel kan het volledige document niet lezen.
all-MiniLM-L6-v2 (de standaard van ChromaDB, gebruikt door zowel MemPalace als onze benchmark) heeft een maximale sequentielengte van 256 tokens. Dat is ongeveer 1.000 tekens.
LongMemEval-sessies zijn gemiddeld 10.000 tekens lang. Sommige overschrijden 30.000.
Wanneer je een ruwe sessie opslaat en embed, leest het model de eerste ongeveer 1.000 tekens en negeert het de rest. 90% van de inhoud is onzichtbaar voor het ophalen.
Onze SECI-extractie verdicht de hele sessie tot ongeveer 500 tekens gestructureerde kernfeiten. Elk geëxtraheerd feit past binnen het venster van 256 tokens. Er wordt niets afgekapt.
De stelling "ruw wint altijd" gaat alleen op wanneer je embeddingmodel het volledige document daadwerkelijk kan lezen. Bij 256 tokens kan het dat niet.
Ruwe sessie (10.000 tekens):
[████████░░░░░░░░░░░░░░░░░░░░░░░░░░░░░░░░░░░░░░░░░░░░]
↑ ge-embed (1.000 tekens) ↑ afgekapt (9.000 tekens) ← onzichtbaar voor zoeken
SECI-extractie (500 tekens):
[████████████████████]
↑ volledige inhoud ge-embed ← niets verloren
Zou een embeddingmodel met langere context het resultaat veranderen?
Waarschijnlijk wel. Modellen als bge-large-en-v1.5 (512 tokens) of nomic-embed-text-v1.5 (8192 tokens) zouden ruwe opslag meer van elke sessie laten embedden. De gepubliceerde 96,6% van MemPalace gebruikt mogelijk optimalisaties die verder gaan dan het standaardmodel. We testen als volgende stap embeddings met langere context.
Het punt blijft staan: je ophaalkwaliteit wordt begrensd door je embeddingvenster, en de meeste ontwikkelaars controleren dit niet.
Wat MemPalace goed deed
Eer wie eer toekomt:
-
Indexeren op alleen gebruiker. Het verwijderen van assistentbeurten verbeterde het ruwe ophalen van 85,9% naar 92,1%, een sprong van 6,2 punten. Assistentantwoorden voegen ruis toe (generiek, breedsprakig) die de embedding verwatert. Slimme ontwerpkeuze.
-
Prestaties bij kennisupdate. Ruw, alleen gebruiker scoort 98,6% op kennisupdatevragen tegenover onze 96,5%. Wanneer feiten in de loop van de tijd veranderen, helpt het om de oorspronkelijke bewoording te hebben. Extractie kan het updatesignaal gladstrijken.
-
Benchmarkcultuur. Het publiceren van reproduceerbare LongMemEval-resultaten met scripts, transparant zijn over welke modus (ruw versus AAAK versus rooms) welke score oplevert, en eerlijke correcties uitbrengen binnen 48 uur na de lancering. Zo hoort open source te werken.
-
Het kerninzicht klopt gedeeltelijk. Op schaal met het juiste embeddingmodel is ruwe opslag een sterke basislijn. Het vakgebied heeft extractie te complex gemaakt met dure LLM-aanroepen, terwijl eenvoudigere methoden werken. De nuance: "eenvoudiger" moet rekening houden met het embeddingvenster.
Het SECI-model voor AI-geheugen
Onze extractiemethode is gebaseerd op het SECI-kennismanagementmodel (Nonaka & Takeuchi, 1995), aangepast voor het geheugen van AI-agenten:
| Fase | Kennisstroom | Implementatie |
|---|---|---|
| Socialisatie | Impliciet → Impliciet | Sessie vindt plaats, context wordt ervaren |
| Externalisatie | Impliciet → Expliciet | /distill extraheert gestructureerde feiten naar markdown |
| Combinatie | Expliciet → Expliciet | /consolidate voegt samen, ontdubbelt, detecteert veroudering |
| Internalisatie | Expliciet → Impliciet | /remember laadt relevante context in de volgende sessie |
Het systeem slaat geëxtraheerde kennis op als platte markdown-bestanden in 10 namespaces (brain, patterns, solutions, research, content, voice, clients, projects, docs, quick-reference). Elk bestand is leesbaar voor mensen en onder versiebeheer.
Voor deze benchmark hebben we ChromaDB onder de markdown-bestanden toegevoegd: dubbele indexering van zowel ruwe tekst als geëxtraheerde samenvattingen, met reciprocal rank fusion op het moment van de query.
Methodologie
Dataset: LongMemEval_S (Wu et al., "LongMemEval: Benchmarking Chat Assistants on Long-Term Interactive Memory," ICLR 2025). 500 vragen, ongeveer 48 hooibergsessies per vraag, gemiddelde sessielengte 10.042 tekens.
Embeddingmodel: all-MiniLM-L6-v2 (384-dim, maximale sequentielengte van 256 tokens). Standaard van ChromaDB.
Ophalen: Granulariteit op sessieniveau. Top-10-ophalen. Metrieken: Recall@5, Recall@10, NDCG@5, NDCG@10.
Extractiemethode: Op regels gebaseerde verdichting (geen LLM). Extraheert het onderwerp uit het eerste gebruikersbericht, de vervolgvraag uit het laatste gebruikersbericht, de resolutie uit het laatste assistentbericht. Ongeveer 500 tekens per sessie. Dit simuleert de uitvoerstructuur van ons /distill-commando.
Hybride fusie: Reciprocal Rank Fusion (k=60) van ruwe en geëxtraheerde ophaalscores, plus een trefwoordoverlap-boost (tot 30% voor exacte termovereenkomsten).
Steekproef: 500 vragen (470 geëvalueerd, 30 onthoudingen overgeslagen). Alle 6 vraagtypes: één sessie met gebruiker, één sessie met assistent, één sessie met voorkeur, meerdere sessies, temporeel redeneren, kennisupdate.
Code: seci_vs_mempalace.py
Kanttekeningen
- Top-10-ophalen. MemPalace benchmarkt met top-50-ophalen (n_results=50) en evalueert R@5 uit die pool. Onze top-10 is beperkter. Een eerlijke vergelijking met gelijke parameters volgt.
- Op regels gebaseerde extractie. Onze extractie gebruikt verdichting op basis van regex/heuristiek, geen LLM-samenvatting. Op LLM gebaseerde extractie zou de kwaliteit waarschijnlijk verbeteren, maar kosten en latentie toevoegen.
- Eén embeddingmodel. De resultaten gelden specifiek voor all-MiniLM-L6-v2 (256 tokens). Modellen met langere context zouden het gat tussen ruwe en geëxtraheerde methoden verkleinen.
- Kennisupdate is een zwak punt. De MemPalace-methode scoort 98,6% tegenover onze 96,5% op vragen waar feiten in de loop van de tijd veranderen. Extractie kan het updatesignaal gladstrijken.
Wat dit betekent voor bouwers
Als je een AI-geheugensysteem bouwt:
-
Controleer je embeddingvenster. Als je embeddingmodel afkapt bij 256 of 512 tokens en je documenten langer zijn, verlies je informatie in de embeddinglaag, ongeacht je opslagstrategie.
-
Extractie is niet altijd verliesgevend. Wanneer extractie een lang document verdicht tot een weergave die in het embeddingvenster past, bewaart het meer opvraagbare informatie dan ruwe opslag die wordt afgekapt.
-
Indexeren op alleen gebruiker helpt. Het verwijderen van assistentbeurten uit het gespreksgeheugen vermindert ruis. Een verbetering van 6,2 punten voor niets.
-
Hybride ophalen voegt rangschikkingskwaliteit toe. Het combineren van ruwe en geëxtraheerde scores via RRF verbetert de recall niet ten opzichte van extractie alleen, maar het verbetert de NDCG (rangschikkingskwaliteit). De juiste documenten komen hoger te staan wanneer je beide signalen combineert.
-
Benchmark je systeem. LongMemEval is gratis, goed ontworpen en reproduceerbaar. Het draaien ervan kost een paar uur. De resultaten kunnen je verrassen.
Deze resultaten reproduceren
# Installeer afhankelijkheden
pip install chromadb sentence-transformers
# Download LongMemEval-data
mkdir -p data && cd data
curl -L -o longmemeval_s_cleaned.json \
https://huggingface.co/datasets/xiaowu0162/longmemeval-cleaned/resolve/main/longmemeval_s_cleaned.json
cd ..
# Draai de benchmark
python seci_vs_mempalace.py --dataset s --mode retrieval
Volledige code: github.com/rankfor/ai-memory-benchmark
Wat we hierna testen
- Embeddingmodellen met langere context (bge-large, nomic-embed-text) om te zien of ruwe opslag bijtrekt wanneer truncatie wordt weggenomen.
- Op LLM gebaseerde extractie (Gemini Flash voor sessiesamenvatting) versus onze op regels gebaseerde extractie.
- Temporele boosting voor datumbewust ophalen bij de vraagcategorie temporeel redeneren.
- Top-50-ophalen om exact overeen te komen met de opzet van MemPalace voor een eerlijke vergelijking.
De code is open. Reproducties zijn welkom.
Dmitrij Żatuchin, Rankfor.AI. April 2026.
Dit onderzoek is onafhankelijk. We hebben geen band met MemPalace, LongMemEval of ChromaDB. De benchmarkcode en de resultaten zijn open voor reproductie.
