Viraalne väide: toores sõnasõnaline salvestamine lööb AI mälu jaoks kõik muu üle. Taastootsime võrdlustesti ja leidsime teistsuguse vastuse. Kitsaskoht on manustamise kärpimine, ekstraheerimise kaotus. Siin on andmed.
Miks me selle võrdlustesti käivitasime
MemPalace (github.com/milla-jovovich/mempalace) käivitus 5. aprillil 2026 ja jõudis 48 tunniga 14 500 GitHubi täheni. Põhitees: salvesta iga vestlus sõnasõnalt ChromaDB-sse, jäta LLM-ekstraheerimine täielikult vahele ja saad standardses AI mälu võrdlustestis (LongMemEval) 96,6% meelespidamist.
Mida see valdkonna jaoks tähendab: iga süsteem, mis kasutab mälestuste ekstraheerimiseks või kokkuvõtmiseks LLM-i, lahendab probleemi liiga keeruliselt. Toores tekst heade manustustega võidab.
Me ehitame teadmusjuhtimise süsteeme SECI mudeli alusel (Nonaka & Takeuchi, 1995), kus struktureeritud ekstraheerimine on põhitegevus. Kui toores salvestamine tõesti ekstraheerimise üle lööb, siis on meie arhitektuur vale. Nii et me testisime seda.
Mida me testisime
Võrdlustest: LongMemEval_S (Wu jt, ICLR 2025). 500 küsimust, mis testivad viit pikaajalise mälu võimet: teabe ekstraheerimine, mitme seansi arutlus, teadmiste uuendamine, ajaline arutlus ja hoidumine. Iga küsimus sisaldab umbes 48 "heinakuhja" vestlusseanssi, millest 1 kuni 3 sisaldavad vastust.
Neli otsingumeetodit, sama manustusmudel (all-MiniLM-L6-v2), samad andmed:
| # | Meetod | Kirjeldus |
|---|---|---|
| 1 | Toores kõik käigud | Salvesta seansi täistekst (kasutaja + assistent), manusta sellisena |
| 2 | Toores ainult kasutaja | MemPalace'i meetod: salvesta ainult kasutaja käigud, manusta sellisena |
| 3 | SECI ekstraheerimine | Tihenda iga seanss umbes 500 tähemärgi struktureeritud faktideks |
| 4 | SECI hübriid + märksõnad | Ühenda toorese ja ekstraheeritud skoorid vastastikuse edetabeli sulandamisega, lisa märksõnade kattuvuse võimendus |
Kõik meetodid kasutavad ChromaDB-d koosinussarnasuse otsinguga. Otsingus ei osale ühtegi LLM-i. Ainus erinevus on see, mis indekseeritakse.
Tulemused
LongMemEval_S: seansitaseme otsing (500 küsimust, kõik 6 tüüpi)
| Meetod | R@5 | R@10 | NDCG@5 | NDCG@10 |
|---|---|---|---|---|
| Toores kõik käigud | 85,9% | 92,8% | 80,3% | 83,0% |
| Toores ainult kasutaja (MemPalace'i meetod) | 92,1% | 96,3% | 86,8% | 88,5% |
| SECI ekstraheerimine | 93,7% | 96,7% | 89,1% | 90,3% |
| SECI hübriid + märksõnad | 93,9% | 96,6% | 89,7% | 90,8% |

SECI hübriid lõi MemPalace'i stiilis toorese salvestamise R@5 mõõdikul 1,8 protsendipunktiga.
Jaotus küsimusetüüpide kaupa
| Meetod | Teadm. uuend. (n=72) | Mitme seansi (n=121) | SS-kasutaja (n=64) | Ajaline (n=127) |
|---|---|---|---|---|
| Toores ainult kasutaja (MemPalace) | 98,6% | 90,6% | 92,2% | 86,9% |
| SECI ekstraheerimine | 95,8% | 93,2% | 96,9% | 88,8% |
| SECI hübriid+ms | 96,5% | 93,7% | 96,9% | 88,4% |
SECI ekstraheerimine juhib 6 küsimusetüübist 4 puhul. MemPalace'i meetod võidab teadmiste uuendamisel (+2,1 pp), kus muutunud faktide algne sõnastus on oluline. SECI eelis on kõige suurem ühe seansi kasutajaküsimustel (+4,7 pp), kus vastus on sügavale pikka vestlusse maetud.
Miks ekstraheerimine võidab: 256-märgendi kärpimise probleem
Tulemus üllatas meid. MemPalace'i tees on intuitiivne: ekstraheerimine kaotab teavet, toores säilitab kõik. Teoreetiliselt peaks toores võitma.
Vahe on kitsam, kui meie esialgne 100 küsimusega valim viitas (+4,9 pp kahanes täies 500 küsimuse mahus +1,8 pp-ni). Ajaline arutlus ja teadmiste uuendamise küsimused tõid vahe lähemale. Just seepärast käivitatakse kogu võrdlustest.
Tegelikkus: manustusmudel ei suuda kogu dokumenti lugeda.
all-MiniLM-L6-v2-l (ChromaDB vaikimisi mudel, mida kasutavad nii MemPalace kui ka meie võrdlustest) on maksimaalne järjendipikkus 256 märgendit. See on umbes 1000 tähemärki.
LongMemEvali seansid on keskmiselt 10 000 tähemärki. Mõned ületavad 30 000.
Kui salvestad toorese seansi ja manustad selle, loeb mudel esimesed umbes 1000 tähemärki ja ignoreerib ülejäänut. 90% sisust on otsingu jaoks nähtamatu.
Meie SECI ekstraheerimine tihendab kogu seansi umbes 500 tähemärgi struktureeritud võtmefaktideks. Iga ekstraheeritud fakt mahub 256-märgendi aknasse. Miski ei jää kärpimisele.
Tees "toores võidab alati" kehtib ainult siis, kui manustusmudel suudab tegelikult kogu dokumenti lugeda. 256 märgendi juures ei suuda ta seda.
Toores seanss (10 000 tähemärki):
[████████░░░░░░░░░░░░░░░░░░░░░░░░░░░░░░░░░░░░░░░░░░░░]
↑ manustatud (1000 tähemärki) ↑ kärbitud (9000 tähemärki) ← otsingule nähtamatu
SECI ekstraheerimine (500 tähemärki):
[████████████████████]
↑ kogu sisu manustatud ← midagi ei lähe kaduma
Kas pikema kontekstiga manustusmudel muudaks tulemust?
Tõenäoliselt jah. Sellised mudelid nagu bge-large-en-v1.5 (512 märgendit) või nomic-embed-text-v1.5 (8192 märgendit) laseksid toorese salvestamise puhul manustada igast seansist rohkem. MemPalace'i avaldatud 96,6% võib kasutada optimeeringuid vaikimisi mudelist kaugemale. Testime järgmisena pikema kontekstiga manustusi.
Mõte jääb kehtima: teie otsingu kvaliteet on piiratud manustusaknaga ja enamik arendajaid ei kontrolli seda.
Mille MemPalace tegi õigesti
Au sinna, kuhu au kuulub:
-
Ainult kasutaja indekseerimine. Assistendi käikude eemaldamine parandas toorest otsingut 85,9%-lt 92,1%-le, 6,2-punktine hüpe. Assistendi vastused lisavad müra (üldsõnalist, paljusõnalist), mis lahjendab manustust. Nutikas kujundusvalik.
-
Teadmiste uuendamise sooritus. Toores ainult kasutaja saab teadmiste uuendamise küsimustel 98,6% võrreldes meie 96,5%-ga. Kui faktid ajas muutuvad, aitab algse sõnastuse olemasolu. Ekstraheerimine võib uuendussignaali silumisega maha suruda.
-
Võrdlustestimise kultuur. Taastoodetavate LongMemEvali tulemuste avaldamine koos skriptidega, läbipaistvus selle osas, milline režiim (toores vs AAAK vs ruumid) millise tulemuse annab, ja ausate paranduste väljastamine 48 tunni jooksul pärast käivitamist. Just nii peaks avatud lähtekoodiga tarkvara toimima.
-
Põhitõdemus on osaliselt õige. Suures mahus ja õige manustusmudeliga on toores salvestamine tugev lähtejoon. Valdkond on ekstraheerimist kallite LLM-päringutega liiga keeruliseks ehitanud, kui lihtsamad meetodid töötavad. Nüanss: "lihtsam" peab arvestama manustusaknaga.
SECI mudel AI mälu jaoks
Meie ekstraheerimismeetod põhineb SECI teadmusjuhtimise mudelil (Nonaka & Takeuchi, 1995), mida on kohandatud AI agendi mälu jaoks:
| Faas | Teadmiste voog | Teostus |
|---|---|---|
| Sotsialiseerimine | Vaikiv → Vaikiv | Seanss toimub, kontekst kogetakse |
| Väljastamine | Vaikiv → Selgesõnaline | /distill ekstraheerib struktureeritud faktid markdowni |
| Kombineerimine | Selgesõnaline → Selgesõnaline | /consolidate liidab, eemaldab dubleeringud, tuvastab kulumise |
| Sisestamine | Selgesõnaline → Vaikiv | /remember laadib asjakohase konteksti järgmisse seanssi |
Süsteem salvestab ekstraheeritud teadmised lamedate markdown-failidena 10 nimeruumis (brain, patterns, solutions, research, content, voice, clients, projects, docs, quick-reference). Iga fail on inimloetav ja versioonihaldusega.
Selle võrdlustesti jaoks lisasime markdown-failide alla ChromaDB: nii toorese teksti kui ka ekstraheeritud kokkuvõtete kahekordne indekseerimine koos vastastikuse edetabeli sulandamisega päringu ajal.
Metoodika
Andmestik: LongMemEval_S (Wu jt, "LongMemEval: Benchmarking Chat Assistants on Long-Term Interactive Memory," ICLR 2025). 500 küsimust, umbes 48 heinakuhja seanssi küsimuse kohta, keskmine seansi pikkus 10 042 tähemärki.
Manustusmudel: all-MiniLM-L6-v2 (384-mõõtmeline, 256-märgendi maksimaalne järjendipikkus). ChromaDB vaikimisi mudel.
Otsing: seansitaseme detailsus. Top-10 otsing. Mõõdikud: Recall@5, Recall@10, NDCG@5, NDCG@10.
Ekstraheerimismeetod: reeglipõhine tihendamine (LLM-ita). Ekstraheerib teema esimesest kasutajasõnumist, jätku viimasest kasutajasõnumist, lahenduse viimasest assistendi sõnumist. Umbes 500 tähemärki seansi kohta. See simuleerib meie /distill käsu väljundstruktuuri.
Hübriidsulandamine: vastastikune edetabeli sulandamine (k=60) toorese ja ekstraheeritud otsinguskooride vahel, pluss märksõnade kattuvuse võimendus (kuni 30% täpsete terminivastete puhul).
Valim: 500 küsimust (470 hinnatud, 30 hoidumist vahele jäetud). Kõik 6 küsimusetüüpi: single-session-user, single-session-assistant, single-session-preference, multi-session, temporal-reasoning, knowledge-update.
Kood: seci_vs_mempalace.py
Hoiatused
- Top-10 otsing. MemPalace teeb võrdlustesti top-50 otsinguga (n_results=50) ja hindab R@5 sellest kogumist. Meie top-10 on piiratum. Õiglane võrdlus võrdsete parameetritega on tulemas.
- Reeglipõhine ekstraheerimine. Meie ekstraheerimine kasutab regulaaravaldistel ja heuristikal põhinevat tihendamist, LLM-i kokkuvõtte asemel. LLM-põhine ekstraheerimine parandaks tõenäoliselt kvaliteeti, kuid lisaks kulu ja viivitust.
- Üks manustusmudel. Tulemused kehtivad spetsiifiliselt all-MiniLM-L6-v2 jaoks (256 märgendit). Pikema kontekstiga mudelid kitsendaksid toorese ja ekstraheeritud meetodite vahet.
- Teadmiste uuendamine on nõrk koht. MemPalace'i meetod saab 98,6% vs meie 96,5% küsimustel, kus faktid ajas muutuvad. Ekstraheerimine võib uuendussignaali silumisega maha suruda.
Mida see ehitajate jaoks tähendab
Kui ehitad AI mälu süsteemi:
-
Kontrolli oma manustusakent. Kui manustusmudel kärbib 256 või 512 märgendi juures ja sinu dokumendid on pikemad, kaotad teavet manustuskihis olenemata salvestusstrateegiast.
-
Ekstraheerimine ei ole alati kadudega. Kui ekstraheerimine tihendab pika dokumendi manustusaknasse mahtuvaks esituseks, säilitab see rohkem otsitavat teavet kui toores salvestamine, mis kärbitakse.
-
Ainult kasutaja indekseerimine aitab. Assistendi käikude eemaldamine vestlusmälust vähendab müra. 6,2-punktine parendus tasuta.
-
Hübriidotsing lisab edetabeli kvaliteeti. Toorese ja ekstraheeritud skooride sulandamine RRF-iga ei paranda meelespidamist võrreldes ainult ekstraheerimisega, kuid parandab NDCG-d (edetabeli kvaliteeti). Õiged dokumendid tõusevad edetabelis kõrgemale, kui ühendad mõlemad signaalid.
-
Testi oma süsteemi. LongMemEval on tasuta, hästi läbimõeldud ja taastoodetav. Selle käivitamine võtab paar tundi. Tulemused võivad sind üllatada.
Nende tulemuste taastootmine
# Paigalda sõltuvused
pip install chromadb sentence-transformers
# Laadi alla LongMemEvali andmed
mkdir -p data && cd data
curl -L -o longmemeval_s_cleaned.json \
https://huggingface.co/datasets/xiaowu0162/longmemeval-cleaned/resolve/main/longmemeval_s_cleaned.json
cd ..
# Käivita võrdlustest
python seci_vs_mempalace.py --dataset s --mode retrieval
Täielik kood: github.com/rankfor/ai-memory-benchmark
Mida me järgmisena testime
- Pikema kontekstiga manustusmudelid (bge-large, nomic-embed-text), et näha, kas toores salvestamine jõuab järele, kui kärpimine on eemaldatud.
- LLM-põhine ekstraheerimine (Gemini Flash seansside kokkuvõtmiseks) vs meie reeglipõhine ekstraheerimine.
- Ajaline võimendus kuupäevateadlikuks otsinguks ajalise arutluse küsimuste kategoorias.
- Top-50 otsing, et vastata MemPalace'i täpsele seadistusele õiglase võrdluse jaoks.
Kood on avatud. Ootame taastootmisi.
Dmitrij Żatuchin, Rankfor.AI. Aprill 2026.
See uuring on sõltumatu. Meil ei ole seost MemPalace'i, LongMemEvali ega ChromaDB-ga. Võrdlustesti kood ja tulemused on taastootmiseks avatud.
