research

MemPalace saavutab LongMemEvalis 96,6%. Käivitasime sama võrdlustesti. Struktureeritud ekstraheerimine sai kõrgema tulemuse.

April 8, 2026
10 min read
n=500
Dmitrij Żatuchin
AI MemoryLongMemEvalKnowledge ManagementSECI ModelRetrievalChromaDBEmbeddingsLLM Infrastructure

Viraalne väide: toores sõnasõnaline salvestamine lööb AI mälu jaoks kõik muu üle. Taastootsime võrdlustesti ja leidsime teistsuguse vastuse. Kitsaskoht on manustamise kärpimine, ekstraheerimise kaotus. Siin on andmed.


Miks me selle võrdlustesti käivitasime

MemPalace (github.com/milla-jovovich/mempalace) käivitus 5. aprillil 2026 ja jõudis 48 tunniga 14 500 GitHubi täheni. Põhitees: salvesta iga vestlus sõnasõnalt ChromaDB-sse, jäta LLM-ekstraheerimine täielikult vahele ja saad standardses AI mälu võrdlustestis (LongMemEval) 96,6% meelespidamist.

Mida see valdkonna jaoks tähendab: iga süsteem, mis kasutab mälestuste ekstraheerimiseks või kokkuvõtmiseks LLM-i, lahendab probleemi liiga keeruliselt. Toores tekst heade manustustega võidab.

Me ehitame teadmusjuhtimise süsteeme SECI mudeli alusel (Nonaka & Takeuchi, 1995), kus struktureeritud ekstraheerimine on põhitegevus. Kui toores salvestamine tõesti ekstraheerimise üle lööb, siis on meie arhitektuur vale. Nii et me testisime seda.


Mida me testisime

Võrdlustest: LongMemEval_S (Wu jt, ICLR 2025). 500 küsimust, mis testivad viit pikaajalise mälu võimet: teabe ekstraheerimine, mitme seansi arutlus, teadmiste uuendamine, ajaline arutlus ja hoidumine. Iga küsimus sisaldab umbes 48 "heinakuhja" vestlusseanssi, millest 1 kuni 3 sisaldavad vastust.

Neli otsingumeetodit, sama manustusmudel (all-MiniLM-L6-v2), samad andmed:

#MeetodKirjeldus
1Toores kõik käigudSalvesta seansi täistekst (kasutaja + assistent), manusta sellisena
2Toores ainult kasutajaMemPalace'i meetod: salvesta ainult kasutaja käigud, manusta sellisena
3SECI ekstraheerimineTihenda iga seanss umbes 500 tähemärgi struktureeritud faktideks
4SECI hübriid + märksõnadÜhenda toorese ja ekstraheeritud skoorid vastastikuse edetabeli sulandamisega, lisa märksõnade kattuvuse võimendus

Kõik meetodid kasutavad ChromaDB-d koosinussarnasuse otsinguga. Otsingus ei osale ühtegi LLM-i. Ainus erinevus on see, mis indekseeritakse.


Tulemused

LongMemEval_S: seansitaseme otsing (500 küsimust, kõik 6 tüüpi)

MeetodR@5R@10NDCG@5NDCG@10
Toores kõik käigud85,9%92,8%80,3%83,0%
Toores ainult kasutaja (MemPalace'i meetod)92,1%96,3%86,8%88,5%
SECI ekstraheerimine93,7%96,7%89,1%90,3%
SECI hübriid + märksõnad93,9%96,6%89,7%90,8%

AI mälu võrdlustesti tulemused: SECI ekstraheerimine vs toores salvestamine LongMemEval_S peal

SECI hübriid lõi MemPalace'i stiilis toorese salvestamise R@5 mõõdikul 1,8 protsendipunktiga.

Jaotus küsimusetüüpide kaupa

MeetodTeadm. uuend. (n=72)Mitme seansi (n=121)SS-kasutaja (n=64)Ajaline (n=127)
Toores ainult kasutaja (MemPalace)98,6%90,6%92,2%86,9%
SECI ekstraheerimine95,8%93,2%96,9%88,8%
SECI hübriid+ms96,5%93,7%96,9%88,4%

SECI ekstraheerimine juhib 6 küsimusetüübist 4 puhul. MemPalace'i meetod võidab teadmiste uuendamisel (+2,1 pp), kus muutunud faktide algne sõnastus on oluline. SECI eelis on kõige suurem ühe seansi kasutajaküsimustel (+4,7 pp), kus vastus on sügavale pikka vestlusse maetud.


Miks ekstraheerimine võidab: 256-märgendi kärpimise probleem

Tulemus üllatas meid. MemPalace'i tees on intuitiivne: ekstraheerimine kaotab teavet, toores säilitab kõik. Teoreetiliselt peaks toores võitma.

Vahe on kitsam, kui meie esialgne 100 küsimusega valim viitas (+4,9 pp kahanes täies 500 küsimuse mahus +1,8 pp-ni). Ajaline arutlus ja teadmiste uuendamise küsimused tõid vahe lähemale. Just seepärast käivitatakse kogu võrdlustest.

Tegelikkus: manustusmudel ei suuda kogu dokumenti lugeda.

all-MiniLM-L6-v2-l (ChromaDB vaikimisi mudel, mida kasutavad nii MemPalace kui ka meie võrdlustest) on maksimaalne järjendipikkus 256 märgendit. See on umbes 1000 tähemärki.

LongMemEvali seansid on keskmiselt 10 000 tähemärki. Mõned ületavad 30 000.

Kui salvestad toorese seansi ja manustad selle, loeb mudel esimesed umbes 1000 tähemärki ja ignoreerib ülejäänut. 90% sisust on otsingu jaoks nähtamatu.

Meie SECI ekstraheerimine tihendab kogu seansi umbes 500 tähemärgi struktureeritud võtmefaktideks. Iga ekstraheeritud fakt mahub 256-märgendi aknasse. Miski ei jää kärpimisele.

Tees "toores võidab alati" kehtib ainult siis, kui manustusmudel suudab tegelikult kogu dokumenti lugeda. 256 märgendi juures ei suuda ta seda.

Toores seanss (10 000 tähemärki):
[████████░░░░░░░░░░░░░░░░░░░░░░░░░░░░░░░░░░░░░░░░░░░░]
 ↑ manustatud (1000 tähemärki)   ↑ kärbitud (9000 tähemärki) ← otsingule nähtamatu

SECI ekstraheerimine (500 tähemärki):
[████████████████████]
 ↑ kogu sisu manustatud ← midagi ei lähe kaduma

Kas pikema kontekstiga manustusmudel muudaks tulemust?

Tõenäoliselt jah. Sellised mudelid nagu bge-large-en-v1.5 (512 märgendit) või nomic-embed-text-v1.5 (8192 märgendit) laseksid toorese salvestamise puhul manustada igast seansist rohkem. MemPalace'i avaldatud 96,6% võib kasutada optimeeringuid vaikimisi mudelist kaugemale. Testime järgmisena pikema kontekstiga manustusi.

Mõte jääb kehtima: teie otsingu kvaliteet on piiratud manustusaknaga ja enamik arendajaid ei kontrolli seda.


Mille MemPalace tegi õigesti

Au sinna, kuhu au kuulub:

  1. Ainult kasutaja indekseerimine. Assistendi käikude eemaldamine parandas toorest otsingut 85,9%-lt 92,1%-le, 6,2-punktine hüpe. Assistendi vastused lisavad müra (üldsõnalist, paljusõnalist), mis lahjendab manustust. Nutikas kujundusvalik.

  2. Teadmiste uuendamise sooritus. Toores ainult kasutaja saab teadmiste uuendamise küsimustel 98,6% võrreldes meie 96,5%-ga. Kui faktid ajas muutuvad, aitab algse sõnastuse olemasolu. Ekstraheerimine võib uuendussignaali silumisega maha suruda.

  3. Võrdlustestimise kultuur. Taastoodetavate LongMemEvali tulemuste avaldamine koos skriptidega, läbipaistvus selle osas, milline režiim (toores vs AAAK vs ruumid) millise tulemuse annab, ja ausate paranduste väljastamine 48 tunni jooksul pärast käivitamist. Just nii peaks avatud lähtekoodiga tarkvara toimima.

  4. Põhitõdemus on osaliselt õige. Suures mahus ja õige manustusmudeliga on toores salvestamine tugev lähtejoon. Valdkond on ekstraheerimist kallite LLM-päringutega liiga keeruliseks ehitanud, kui lihtsamad meetodid töötavad. Nüanss: "lihtsam" peab arvestama manustusaknaga.


SECI mudel AI mälu jaoks

Meie ekstraheerimismeetod põhineb SECI teadmusjuhtimise mudelil (Nonaka & Takeuchi, 1995), mida on kohandatud AI agendi mälu jaoks:

FaasTeadmiste voogTeostus
SotsialiseerimineVaikiv → VaikivSeanss toimub, kontekst kogetakse
VäljastamineVaikiv → Selgesõnaline/distill ekstraheerib struktureeritud faktid markdowni
KombineerimineSelgesõnaline → Selgesõnaline/consolidate liidab, eemaldab dubleeringud, tuvastab kulumise
SisestamineSelgesõnaline → Vaikiv/remember laadib asjakohase konteksti järgmisse seanssi

Süsteem salvestab ekstraheeritud teadmised lamedate markdown-failidena 10 nimeruumis (brain, patterns, solutions, research, content, voice, clients, projects, docs, quick-reference). Iga fail on inimloetav ja versioonihaldusega.

Selle võrdlustesti jaoks lisasime markdown-failide alla ChromaDB: nii toorese teksti kui ka ekstraheeritud kokkuvõtete kahekordne indekseerimine koos vastastikuse edetabeli sulandamisega päringu ajal.


Metoodika

Andmestik: LongMemEval_S (Wu jt, "LongMemEval: Benchmarking Chat Assistants on Long-Term Interactive Memory," ICLR 2025). 500 küsimust, umbes 48 heinakuhja seanssi küsimuse kohta, keskmine seansi pikkus 10 042 tähemärki.

Manustusmudel: all-MiniLM-L6-v2 (384-mõõtmeline, 256-märgendi maksimaalne järjendipikkus). ChromaDB vaikimisi mudel.

Otsing: seansitaseme detailsus. Top-10 otsing. Mõõdikud: Recall@5, Recall@10, NDCG@5, NDCG@10.

Ekstraheerimismeetod: reeglipõhine tihendamine (LLM-ita). Ekstraheerib teema esimesest kasutajasõnumist, jätku viimasest kasutajasõnumist, lahenduse viimasest assistendi sõnumist. Umbes 500 tähemärki seansi kohta. See simuleerib meie /distill käsu väljundstruktuuri.

Hübriidsulandamine: vastastikune edetabeli sulandamine (k=60) toorese ja ekstraheeritud otsinguskooride vahel, pluss märksõnade kattuvuse võimendus (kuni 30% täpsete terminivastete puhul).

Valim: 500 küsimust (470 hinnatud, 30 hoidumist vahele jäetud). Kõik 6 küsimusetüüpi: single-session-user, single-session-assistant, single-session-preference, multi-session, temporal-reasoning, knowledge-update.

Kood: seci_vs_mempalace.py

Hoiatused

  • Top-10 otsing. MemPalace teeb võrdlustesti top-50 otsinguga (n_results=50) ja hindab R@5 sellest kogumist. Meie top-10 on piiratum. Õiglane võrdlus võrdsete parameetritega on tulemas.
  • Reeglipõhine ekstraheerimine. Meie ekstraheerimine kasutab regulaaravaldistel ja heuristikal põhinevat tihendamist, LLM-i kokkuvõtte asemel. LLM-põhine ekstraheerimine parandaks tõenäoliselt kvaliteeti, kuid lisaks kulu ja viivitust.
  • Üks manustusmudel. Tulemused kehtivad spetsiifiliselt all-MiniLM-L6-v2 jaoks (256 märgendit). Pikema kontekstiga mudelid kitsendaksid toorese ja ekstraheeritud meetodite vahet.
  • Teadmiste uuendamine on nõrk koht. MemPalace'i meetod saab 98,6% vs meie 96,5% küsimustel, kus faktid ajas muutuvad. Ekstraheerimine võib uuendussignaali silumisega maha suruda.

Mida see ehitajate jaoks tähendab

Kui ehitad AI mälu süsteemi:

  1. Kontrolli oma manustusakent. Kui manustusmudel kärbib 256 või 512 märgendi juures ja sinu dokumendid on pikemad, kaotad teavet manustuskihis olenemata salvestusstrateegiast.

  2. Ekstraheerimine ei ole alati kadudega. Kui ekstraheerimine tihendab pika dokumendi manustusaknasse mahtuvaks esituseks, säilitab see rohkem otsitavat teavet kui toores salvestamine, mis kärbitakse.

  3. Ainult kasutaja indekseerimine aitab. Assistendi käikude eemaldamine vestlusmälust vähendab müra. 6,2-punktine parendus tasuta.

  4. Hübriidotsing lisab edetabeli kvaliteeti. Toorese ja ekstraheeritud skooride sulandamine RRF-iga ei paranda meelespidamist võrreldes ainult ekstraheerimisega, kuid parandab NDCG-d (edetabeli kvaliteeti). Õiged dokumendid tõusevad edetabelis kõrgemale, kui ühendad mõlemad signaalid.

  5. Testi oma süsteemi. LongMemEval on tasuta, hästi läbimõeldud ja taastoodetav. Selle käivitamine võtab paar tundi. Tulemused võivad sind üllatada.


Nende tulemuste taastootmine

# Paigalda sõltuvused
pip install chromadb sentence-transformers

# Laadi alla LongMemEvali andmed
mkdir -p data && cd data
curl -L -o longmemeval_s_cleaned.json \
  https://huggingface.co/datasets/xiaowu0162/longmemeval-cleaned/resolve/main/longmemeval_s_cleaned.json
cd ..

# Käivita võrdlustest
python seci_vs_mempalace.py --dataset s --mode retrieval

Täielik kood: github.com/rankfor/ai-memory-benchmark


Mida me järgmisena testime

  1. Pikema kontekstiga manustusmudelid (bge-large, nomic-embed-text), et näha, kas toores salvestamine jõuab järele, kui kärpimine on eemaldatud.
  2. LLM-põhine ekstraheerimine (Gemini Flash seansside kokkuvõtmiseks) vs meie reeglipõhine ekstraheerimine.
  3. Ajaline võimendus kuupäevateadlikuks otsinguks ajalise arutluse küsimuste kategoorias.
  4. Top-50 otsing, et vastata MemPalace'i täpsele seadistusele õiglase võrdluse jaoks.

Kood on avatud. Ootame taastootmisi.


Dmitrij Żatuchin, Rankfor.AI. Aprill 2026.

See uuring on sõltumatu. Meil ei ole seost MemPalace'i, LongMemEvali ega ChromaDB-ga. Võrdlustesti kood ja tulemused on taastootmiseks avatud.

BeVisible Club

Get research like this before we publish it.

New AI visibility studies, ranking patterns, and source-stack data delivered to your inbox a week before they go public.

Join BeVisible Club

Want to Know How AI Sees Your Brand?

Rankfor.AI measures your brand's AI visibility across all major platforms and provides actionable recommendations.

About the Author

Dmitrij Żatuchin

Founder

Dmitrij Żatuchin is the founder of Rankfor.AI. A computer scientist with a PhD in semantic web technologies, he bridges the gap between how AI reasons about brands and how brands want to be understood. With over two decades of software architecture experience and academic roles at Estonian Business School, Dmitrij builds the measurement infrastructure brands need to transition from optimizing for search engines to becoming visible for reasoning engines.

© 2025-2026 Rankfor.AI™ Kõik õigused kaitstud

Ask AI about Rankfor.AI

Rankfor.AI sp. z o.o., Skarbowcow 23B, 53-025 Wroclaw, Poland

KRS: 0001190083 | NIP: 8993033605

Kasutame küpsiseid

Kasutame hädavajalikke küpsiseid, et meie veebileht töötaks. Teie nõusolekul võime kasutada ka analüütikaküpsiseid, et mõista, kuidas te meie tööriistu (nagu Dice Roller) kasutate, et saaksime neid parandada. Õppige rohkem