Det virala påståendet: rå ordagrann lagring slår allt annat för AI-minne. Vi reproducerade benchmarken och fick ett annat svar. Flaskhalsen ligger i embedding-trunkeringen. Extraktionsförlust är inte orsaken. Här är datan.
Varför vi körde den här benchmarken
MemPalace (github.com/milla-jovovich/mempalace) lanserades den 5 april 2026 och nådde 14,500 GitHub-stjärnor på 48 timmar. Grundtesen: lagra varje konversation ordagrant i ChromaDB, hoppa över LLM-extraktion helt, och du får 96.6% recall på standardbenchmarken för AI-minne (LongMemEval).
Innebörden för fältet: varje system som använder en LLM för att extrahera eller sammanfatta minnen överarbetar problemet. Rå text med bra embeddingar vinner.
Vi bygger system för kunskapshantering utifrån SECI-modellen (Nonaka & Takeuchi, 1995), där strukturerad extraktion är en central operation. Om rå lagring verkligen slår extraktion är vår arkitektur fel. Så vi testade det.
Vad vi testade
Benchmark: LongMemEval_S (Wu et al., ICLR 2025). 500 frågor som testar fem förmågor för långtidsminne: informationsextraktion, resonemang över flera sessioner, kunskapsuppdateringar, temporalt resonemang och avstående. Varje fråga innehåller cirka 48 "höstack"-konversationssessioner, varav 1-3 innehåller svaret.
Fyra hämtningsmetoder, samma embedding-modell (all-MiniLM-L6-v2), samma data:
| # | Metod | Beskrivning |
|---|---|---|
| 1 | Rå, alla turer | Lagra hela sessionstexten (användare + assistent), bädda in som den är |
| 2 | Rå, endast användare | MemPalace-metoden: lagra endast användarturer, bädda in som de är |
| 3 | SECI-extraktion | Kondensera varje session till cirka 500 tecken strukturerade fakta |
| 4 | SECI-hybrid + nyckelord | Slå samman råa och extraherade poäng via reciprocal rank fusion, lägg till boost för nyckelordsöverlapp |
Alla metoder använder ChromaDB med cosinuslikhetssökning. Ingen LLM är inblandad i hämtningen. Den enda skillnaden är vad som indexeras.
Resultat
LongMemEval_S: hämtning på sessionsnivå (500 frågor, alla 6 typer)
| Metod | R@5 | R@10 | NDCG@5 | NDCG@10 |
|---|---|---|---|---|
| Rå, alla turer | 85.9% | 92.8% | 80.3% | 83.0% |
| Rå, endast användare (MemPalace-metoden) | 92.1% | 96.3% | 86.8% | 88.5% |
| SECI-extraktion | 93.7% | 96.7% | 89.1% | 90.3% |
| SECI-hybrid + nyckelord | 93.9% | 96.6% | 89.7% | 90.8% |

SECI-hybrid slog MemPalace-stilens råa lagring med 1.8 procentenheter på R@5.
Uppdelning per frågetyp
| Metod | Kunskapsuppd. (n=72) | Flera sessioner (n=121) | SS-User (n=64) | Temporal (n=127) |
|---|---|---|---|---|
| Rå, endast användare (MemPalace) | 98.6% | 90.6% | 92.2% | 86.9% |
| SECI-extraktion | 95.8% | 93.2% | 96.9% | 88.8% |
| SECI-hybrid+nyckelord | 96.5% | 93.7% | 96.9% | 88.4% |
SECI-extraktion leder på 4 av 6 frågetyper. MemPalace-metoden vinner på kunskapsuppdatering (+2.1pp), där den ursprungliga formuleringen av ändrade fakta spelar roll. SECI-fördelen är störst på frågor av typen single-session-user (+4.7pp), där svaret ligger djupt begravt i en lång konversation.
Varför extraktion vinner: 256-token-trunkeringsproblemet
Resultatet överraskade oss. MemPalaces tes är intuitiv: extraktion tappar information, rå lagring bevarar allt. I teorin borde rå lagring vinna.
Marginalen är mindre än vad vårt inledande urval på 100 frågor antydde (+4.9pp krympte till +1.8pp vid full skala med 500 frågor). Frågor om temporalt resonemang och kunskapsuppdatering minskade gapet. Det är precis därför man kör hela benchmarken.
Verkligheten: embedding-modellen kan inte läsa hela dokumentet.
all-MiniLM-L6-v2 (ChromaDB:s standard, som används både av MemPalace och i vår benchmark) har en maximal sekvenslängd på 256 tokens. Det motsvarar ungefär 1,000 tecken.
LongMemEval-sessioner är i genomsnitt 10,000 tecken. Vissa överstiger 30,000.
När du lagrar en rå session och bäddar in den läser modellen de första cirka 1,000 tecknen och ignorerar resten. 90% av innehållet är osynligt för hämtningen.
Vår SECI-extraktion kondenserar hela sessionen till cirka 500 tecken strukturerade nyckelfakta. Varje extraherat faktum får plats inom 256-token-fönstret. Ingenting trunkeras.
Tesen att "rå lagring alltid vinner" håller bara när din embedding-modell faktiskt kan läsa hela dokumentet. Vid 256 tokens kan den inte det.
Rå session (10,000 tecken):
[████████░░░░░░░░░░░░░░░░░░░░░░░░░░░░░░░░░░░░░░░░░░░░]
↑ inbäddat (1,000 tecken) ↑ trunkerat (9,000 tecken) ← osynligt för sökning
SECI-extraktion (500 tecken):
[████████████████████]
↑ hela innehållet inbäddat ← inget förlorat
Skulle en embedding-modell med längre kontext ändra resultatet?
Sannolikt ja. Modeller som bge-large-en-v1.5 (512 tokens) eller nomic-embed-text-v1.5 (8192 tokens) skulle låta rå lagring bädda in mer av varje session. MemPalaces publicerade 96.6% använder kanske optimeringar utöver standardmodellen. Härnäst testar vi embeddingar med längre kontext.
Poängen kvarstår: din hämtningskvalitet begränsas av ditt embedding-fönster, och de flesta utvecklare kontrollerar inte detta.
Vad MemPalace gjorde rätt
Erkännande där det förtjänas:
-
Indexering av enbart användarturer. Att ta bort assistentturer förbättrade rå hämtning från 85.9% till 92.1%, ett hopp på 6.2 punkter. Assistentsvar tillför brus (generiskt, mångordigt) som späder ut embeddingen. Ett smart designval.
-
Prestanda på kunskapsuppdatering. Rå, endast användare får 98.6% på frågor om kunskapsuppdatering mot våra 96.5%. När fakta ändras över tid hjälper det att ha den ursprungliga formuleringen. Extraktion kan jämna ut uppdateringssignalen.
-
Benchmarkkultur. Att publicera reproducerbara LongMemEval-resultat med skript, vara transparent om vilket läge (rå vs AAAK vs rooms) som ger vilken poäng, och komma med ärliga rättelser inom 48 timmar efter lanseringen. Så bör öppen källkod fungera.
-
Kärninsikten stämmer delvis. I stor skala och med rätt embedding-modell är rå lagring en stark baslinje. Fältet har överarbetat extraktion med dyra LLM-anrop när enklare metoder fungerar. Nyansen: "enklare" måste ta hänsyn till embedding-fönstret.
SECI-modellen för AI-minne
Vår extraktionsmetod bygger på SECI-modellen för kunskapshantering (Nonaka & Takeuchi, 1995), anpassad för AI-agenters minne:
| Fas | Kunskapsflöde | Implementering |
|---|---|---|
| Socialisering | Tyst → Tyst | Sessionen sker, kontexten upplevs |
| Externalisering | Tyst → Explicit | /distill extraherar strukturerade fakta till markdown |
| Kombinering | Explicit → Explicit | /consolidate slår samman, avdubblerar, upptäcker förfall |
| Internalisering | Explicit → Tyst | /remember laddar relevant kontext till nästa session |
Systemet lagrar extraherad kunskap som platta markdown-filer i 10 namnrymder (brain, patterns, solutions, research, content, voice, clients, projects, docs, quick-reference). Varje fil är läsbar för människor och versionshanterad.
För den här benchmarken lade vi ChromaDB under markdown-filerna: dubbel indexering av både rå text och extraherade sammanfattningar, med reciprocal rank fusion vid frågetillfället.
Metodik
Datamängd: LongMemEval_S (Wu et al., "LongMemEval: Benchmarking Chat Assistants on Long-Term Interactive Memory," ICLR 2025). 500 frågor, cirka 48 höstack-sessioner per fråga, genomsnittlig sessionslängd 10,042 tecken.
Embedding-modell: all-MiniLM-L6-v2 (384 dimensioner, 256 tokens maximal sekvenslängd). ChromaDB:s standard.
Hämtning: Granularitet på sessionsnivå. Top-10-hämtning. Mått: Recall@5, Recall@10, NDCG@5, NDCG@10.
Extraktionsmetod: Regelbaserad kondensering (ingen LLM). Extraherar ämne från första användarmeddelandet, uppföljning från sista användarmeddelandet, lösning från sista assistentmeddelandet. Cirka 500 tecken per session. Detta simulerar utdatastrukturen från vårt /distill-kommando.
Hybridfusion: Reciprocal Rank Fusion (k=60) av råa och extraherade hämtningspoäng, plus boost för nyckelordsöverlapp (upp till 30% vid exakta termmatchningar).
Urval: 500 frågor (470 utvärderade, 30 avstående hoppades över). Alla 6 frågetyper: single-session-user, single-session-assistant, single-session-preference, multi-session, temporal-reasoning, knowledge-update.
Kod: seci_vs_mempalace.py
Förbehåll
- Top-10-hämtning. MemPalace benchmarkar med top-50-hämtning (n_results=50) och utvärderar R@5 ur den poolen. Vår top-10 är mer begränsad. En rättvis jämförelse med matchade parametrar kommer.
- Regelbaserad extraktion. Vår extraktion använder regex/heuristisk kondensering (ingen LLM-sammanfattning). LLM-baserad extraktion skulle sannolikt förbättra kvaliteten men öka kostnad och latens.
- En enda embedding-modell. Resultaten är specifika för all-MiniLM-L6-v2 (256 tokens). Modeller med längre kontext skulle minska gapet mellan råa och extraherade metoder.
- Kunskapsuppdatering är en svag punkt. MemPalace-metoden får 98.6% mot våra 96.5% på frågor där fakta ändras över tid. Extraktion kan jämna ut uppdateringssignalen.
Vad detta betyder för dig som bygger
Om du bygger ett AI-minnessystem:
-
Kontrollera ditt embedding-fönster. Om din embedding-modell trunkerar vid 256 eller 512 tokens och dina dokument är längre, tappar du information i embedding-lagret oavsett din lagringsstrategi.
-
Extraktion medför inte alltid förlust. När extraktion kondenserar ett långt dokument till en representation som får plats i embedding-fönstret bevarar den mer hämtbar information än rå lagring som blir trunkerad.
-
Indexering av enbart användarturer hjälper. Att ta bort assistentturer från konversationsminnet minskar bruset. En förbättring på 6.2 punkter gratis.
-
Hybridhämtning ger bättre rangordningskvalitet. Att slå samman råa och extraherade poäng via RRF förbättrar inte recall jämfört med enbart extraktion, men det förbättrar NDCG (rangordningskvalitet). Rätt dokument rankas högre när du kombinerar båda signalerna.
-
Benchmarka ditt system. LongMemEval är gratis, väldesignat och reproducerbart. Att köra det tar några timmar. Resultaten kan överraska dig.
Reproducera dessa resultat
# Installera beroenden
pip install chromadb sentence-transformers
# Ladda ner LongMemEval-data
mkdir -p data && cd data
curl -L -o longmemeval_s_cleaned.json \
https://huggingface.co/datasets/xiaowu0162/longmemeval-cleaned/resolve/main/longmemeval_s_cleaned.json
cd ..
# Kör benchmark
python seci_vs_mempalace.py --dataset s --mode retrieval
Fullständig kod: github.com/rankfor/ai-memory-benchmark
Vad vi testar härnäst
- Embedding-modeller med längre kontext (bge-large, nomic-embed-text) för att se om rå lagring kommer ikapp när trunkeringen tas bort.
- LLM-baserad extraktion (Gemini Flash för sessionssammanfattning) jämfört med vår regelbaserade extraktion.
- Temporal boosting för datumsmedveten hämtning på frågekategorin temporal-reasoning.
- Top-50-hämtning för att matcha MemPalaces exakta uppsättning för en rättvis jämförelse.
Koden är öppen. Vi välkomnar reproduktioner.
Dmitrij Żatuchin, Rankfor.AI. April 2026.
Denna forskning är oberoende. Vi har ingen koppling till MemPalace, LongMemEval eller ChromaDB. Benchmarkkoden och resultaten är öppna för reproduktion.
