Die virale Behauptung: rohe, wortgetreue Speicherung schlägt beim KI-Gedächtnis alles andere. Wir haben den Benchmark reproduziert und ein anderes Ergebnis gefunden. Der Engpass entsteht durch die Trunkierung beim Embedding, nicht durch Extraktionsverlust. Hier sind die Daten.
Warum wir diesen Benchmark durchgeführt haben
MemPalace (github.com/milla-jovovich/mempalace) startete am 5. April 2026 und erreichte innerhalb von 48 Stunden 14,500 GitHub-Sterne. Die Kernthese: Speichere jede Konversation wortgetreu in ChromaDB, verzichte vollständig auf die LLM-Extraktion, und du erhältst 96.6% Recall beim Standard-Benchmark für KI-Gedächtnis (LongMemEval).
Die Konsequenz für die gesamte Branche: Jedes System, das ein LLM einsetzt, um Erinnerungen zu extrahieren oder zusammenzufassen, betreibt Over-Engineering. Rohtext mit guten Embeddings gewinnt.
Wir entwickeln Wissensmanagement-Systeme auf Basis des SECI-Modells (Nonaka & Takeuchi, 1995), bei dem die strukturierte Extraktion eine Kernoperation ist. Wenn rohe Speicherung die Extraktion tatsächlich schlägt, ist unsere Architektur falsch. Also haben wir es getestet.
Was wir getestet haben
Benchmark: LongMemEval_S (Wu et al., ICLR 2025). 500 Fragen, die fünf Fähigkeiten des Langzeitgedächtnisses prüfen: Informationsextraktion, sitzungsübergreifendes Schlussfolgern, Wissensaktualisierungen, zeitliches Schlussfolgern und Enthaltung. Jede Frage umfasst ~48 „Heuhaufen"-Konversationssitzungen, von denen 1-3 die Antwort enthalten.
Vier Retrieval-Ansätze, dasselbe Embedding-Modell (all-MiniLM-L6-v2), dieselben Daten:
| # | Ansatz | Beschreibung |
|---|---|---|
| 1 | Rohdaten, alle Turns | Vollständigen Sitzungstext speichern (User + Assistant), unverändert einbetten |
| 2 | Rohdaten, nur User | MemPalace-Methode: nur User-Turns speichern, unverändert einbetten |
| 3 | SECI-Extraktion | Jede Sitzung auf ~500 Zeichen strukturierter Fakten verdichten |
| 4 | SECI-Hybrid + Keyword | Roh- und Extraktions-Scores per Reciprocal Rank Fusion verschmelzen, plus Keyword-Overlap-Boost |
Alle Ansätze nutzen ChromaDB mit Suche über Kosinus-Ähnlichkeit. Kein LLM ist am Retrieval beteiligt. Der einzige Unterschied liegt darin, was indexiert wird.
Ergebnisse
LongMemEval_S: Retrieval auf Sitzungsebene (500 Fragen, alle 6 Typen)
| Ansatz | R@5 | R@10 | NDCG@5 | NDCG@10 |
|---|---|---|---|---|
| Rohdaten, alle Turns | 85.9% | 92.8% | 80.3% | 83.0% |
| Rohdaten, nur User (MemPalace-Methode) | 92.1% | 96.3% | 86.8% | 88.5% |
| SECI-Extraktion | 93.7% | 96.7% | 89.1% | 90.3% |
| SECI-Hybrid + Keyword | 93.9% | 96.6% | 89.7% | 90.8% |

SECI-Hybrid schlug die rohe Speicherung im MemPalace-Stil bei R@5 um 1.8 Prozentpunkte.
Aufschlüsselung nach Fragetyp
| Ansatz | Wissensaktual. (n=72) | Multi-Session (n=121) | SS-User (n=64) | Zeitlich (n=127) |
|---|---|---|---|---|
| Rohdaten, nur User (MemPalace) | 98.6% | 90.6% | 92.2% | 86.9% |
| SECI-Extraktion | 95.8% | 93.2% | 96.9% | 88.8% |
| SECI-Hybrid+kw | 96.5% | 93.7% | 96.9% | 88.4% |
Die SECI-Extraktion führt bei 4 von 6 Fragetypen. Die MemPalace-Methode gewinnt bei Wissensaktualisierungen (+2.1pp), wo der ursprüngliche Wortlaut geänderter Fakten zählt. Der SECI-Vorteil ist am größten bei Single-Session-User-Fragen (+4.7pp), bei denen die Antwort tief in einer langen Konversation vergraben ist.
Warum Extraktion gewinnt: das Problem der 256-Token-Trunkierung
Das Ergebnis hat uns überrascht. Die These von MemPalace ist einleuchtend: Extraktion verliert Informationen, Rohdaten bewahren alles. Theoretisch sollten Rohdaten gewinnen.
Der Abstand ist geringer, als unsere erste Stichprobe mit 100 Fragen nahelegte (+4.9pp verengten sich bei voller Skala von 500 Fragen auf +1.8pp). Fragen zum zeitlichen Schlussfolgern und zu Wissensaktualisierungen haben den Abstand verkleinert. Genau deshalb führt man den vollständigen Benchmark durch.
Die Realität: Das Embedding-Modell kann das vollständige Dokument nicht lesen.
all-MiniLM-L6-v2 (die Standardwahl von ChromaDB, verwendet von MemPalace wie auch von unserem Benchmark) hat eine maximale Sequenzlänge von 256 Tokens. Das entspricht etwa 1,000 Zeichen.
LongMemEval-Sitzungen umfassen im Schnitt 10,000 Zeichen. Manche überschreiten 30,000.
Wenn du eine rohe Sitzung speicherst und einbettest, liest das Modell die ersten ~1,000 Zeichen und ignoriert den Rest. 90% des Inhalts sind für das Retrieval unsichtbar.
Unsere SECI-Extraktion verdichtet die gesamte Sitzung auf ~500 Zeichen strukturierter Kernfakten. Jeder extrahierte Fakt passt in das 256-Token-Fenster. Nichts wird abgeschnitten.
Die These „Rohdaten gewinnen immer" gilt nur, wenn dein Embedding-Modell das vollständige Dokument tatsächlich lesen kann. Bei 256 Tokens kann es das nicht.
Rohe Sitzung (10,000 Zeichen):
[████████░░░░░░░░░░░░░░░░░░░░░░░░░░░░░░░░░░░░░░░░░░░░]
↑ eingebettet (1,000 Zeichen) ↑ abgeschnitten (9,000 Zeichen) ← für die Suche unsichtbar
SECI-Extraktion (500 Zeichen):
[████████████████████]
↑ gesamter Inhalt eingebettet ← nichts verloren
Würde ein Embedding-Modell mit längerem Kontext das Ergebnis verändern?
Wahrscheinlich ja. Modelle wie bge-large-en-v1.5 (512 Tokens) oder nomic-embed-text-v1.5 (8192 Tokens) würden es der rohen Speicherung erlauben, mehr von jeder Sitzung einzubetten. Die von MemPalace veröffentlichten 96.6% nutzen möglicherweise Optimierungen jenseits des Standardmodells. Als Nächstes testen wir Embeddings mit längerem Kontext.
Der Punkt bleibt: Deine Retrieval-Qualität ist durch dein Embedding-Fenster begrenzt, und die meisten Entwickler prüfen das nicht.
Was MemPalace richtig gemacht hat
Ehre, wem Ehre gebührt:
-
Indexierung nur der User-Turns. Das Entfernen der Assistant-Turns verbesserte das rohe Retrieval von 85.9% auf 92.1%, ein Sprung um 6.2 Punkte. Assistant-Antworten fügen Rauschen hinzu (generisch, wortreich), welches das Embedding verwässert. Kluge Design-Entscheidung.
-
Leistung bei Wissensaktualisierungen. Rohdaten, nur User erreichen 98.6% bei Wissensaktualisierungs-Fragen gegenüber unseren 96.5%. Wenn sich Fakten im Lauf der Zeit ändern, hilft der ursprüngliche Wortlaut. Die Extraktion kann das Aktualisierungssignal verschleifen.
-
Benchmarking-Kultur. Reproduzierbare LongMemEval-Ergebnisse mit Skripten zu veröffentlichen, transparent zu machen, welcher Modus (raw vs. AAAK vs. rooms) welchen Score erzeugt, und innerhalb von 48 Stunden nach dem Start ehrliche Korrekturen herauszugeben. So sollte Open Source funktionieren.
-
Die Kernerkenntnis stimmt teilweise. Bei entsprechender Skalierung und dem richtigen Embedding-Modell ist rohe Speicherung eine starke Baseline. Die Branche hat die Extraktion mit teuren LLM-Aufrufen überentwickelt, obwohl einfachere Ansätze funktionieren. Die Nuance: „Einfacher" muss das Embedding-Fenster berücksichtigen.
Das SECI-Modell für das KI-Gedächtnis
Unser Extraktionsansatz basiert auf dem SECI-Wissensmanagement-Modell (Nonaka & Takeuchi, 1995), angepasst für das Gedächtnis von KI-Agenten:
| Phase | Wissensfluss | Umsetzung |
|---|---|---|
| Sozialisation | Implizit → Implizit | Sitzung findet statt, Kontext wird erlebt |
| Externalisierung | Implizit → Explizit | /distill extrahiert strukturierte Fakten in Markdown |
| Kombination | Explizit → Explizit | /consolidate führt zusammen, dedupliziert, erkennt Verfall |
| Internalisierung | Explizit → Implizit | /remember lädt relevanten Kontext in die nächste Sitzung |
Das System speichert extrahiertes Wissen als flache Markdown-Dateien in 10 Namespaces (brain, patterns, solutions, research, content, voice, clients, projects, docs, quick-reference). Jede Datei ist menschenlesbar und versionskontrolliert.
Für diesen Benchmark haben wir ChromaDB unter die Markdown-Dateien gelegt: eine doppelte Indexierung von Rohtext und extrahierten Zusammenfassungen, mit Reciprocal Rank Fusion zur Abfragezeit.
Methodik
Datensatz: LongMemEval_S (Wu et al., „LongMemEval: Benchmarking Chat Assistants on Long-Term Interactive Memory", ICLR 2025). 500 Fragen, ~48 Heuhaufen-Sitzungen pro Frage, durchschnittliche Sitzungslänge 10,042 Zeichen.
Embedding-Modell: all-MiniLM-L6-v2 (384 Dimensionen, maximale Sequenzlänge 256 Tokens). ChromaDB-Standard.
Retrieval: Granularität auf Sitzungsebene. Top-10-Retrieval. Metriken: Recall@5, Recall@10, NDCG@5, NDCG@10.
Extraktionsmethode: Regelbasierte Verdichtung (kein LLM). Extrahiert das Thema aus der ersten User-Nachricht, den Folgekontext aus der letzten User-Nachricht und die Auflösung aus der letzten Assistant-Nachricht. ~500 Zeichen pro Sitzung. Das simuliert die Ausgabestruktur unseres /distill-Befehls.
Hybride Fusion: Reciprocal Rank Fusion (k=60) der Roh- und Extraktions-Retrieval-Scores, plus Keyword-Overlap-Boost (bis zu 30% bei exakten Begriffstreffern).
Stichprobe: 500 Fragen (470 ausgewertet, 30 Enthaltungen übersprungen). Alle 6 Fragetypen: single-session-user, single-session-assistant, single-session-preference, multi-session, temporal-reasoning, knowledge-update.
Code: seci_vs_mempalace.py
Einschränkungen
- Top-10-Retrieval. MemPalace benchmarkt mit Top-50-Retrieval (n_results=50) und wertet R@5 aus diesem Pool aus. Unser Top-10 ist stärker eingeschränkt. Ein fairer Vergleich mit abgestimmten Parametern folgt.
- Regelbasierte Extraktion. Unsere Extraktion nutzt Regex- und Heuristik-Verdichtung ohne LLM-Zusammenfassung. LLM-basierte Extraktion würde die Qualität vermutlich verbessern, aber Kosten und Latenz erhöhen.
- Einzelnes Embedding-Modell. Die Ergebnisse gelten spezifisch für all-MiniLM-L6-v2 (256 Tokens). Modelle mit längerem Kontext würden den Abstand zwischen rohen und extrahierten Ansätzen verkleinern.
- Wissensaktualisierung ist eine Schwachstelle. Die MemPalace-Methode erreicht 98.6% gegenüber unseren 96.5% bei Fragen, bei denen sich Fakten im Lauf der Zeit ändern. Die Extraktion kann das Aktualisierungssignal verschleifen.
Was das für Entwickler bedeutet
Wenn du ein KI-Gedächtnissystem entwickelst:
-
Prüfe dein Embedding-Fenster. Wenn dein Embedding-Modell bei 256 oder 512 Tokens abschneidet und deine Dokumente länger sind, verlierst du unabhängig von deiner Speicherstrategie Informationen auf der Embedding-Ebene.
-
Extraktion ist nicht immer verlustbehaftet. Wenn die Extraktion ein langes Dokument in eine Darstellung verdichtet, die in das Embedding-Fenster passt, bewahrt sie mehr abrufbare Information als rohe Speicherung, die abgeschnitten wird.
-
Indexierung nur der User-Turns hilft. Das Entfernen der Assistant-Turns aus dem Konversationsgedächtnis reduziert Rauschen. Eine Verbesserung um 6.2 Punkte, gratis.
-
Hybrides Retrieval steigert die Ranking-Qualität. Das Verschmelzen von Roh- und Extraktions-Scores per RRF verbessert den Recall gegenüber der reinen Extraktion nicht, steigert aber den NDCG (Ranking-Qualität). Die richtigen Dokumente ranken höher, wenn du beide Signale kombinierst.
-
Benchmarke dein System. LongMemEval ist kostenlos, gut konzipiert und reproduzierbar. Die Durchführung dauert einige Stunden. Die Ergebnisse könnten dich überraschen.
So reproduzierst du diese Ergebnisse
# Install dependencies
pip install chromadb sentence-transformers
# Download LongMemEval data
mkdir -p data && cd data
curl -L -o longmemeval_s_cleaned.json \
https://huggingface.co/datasets/xiaowu0162/longmemeval-cleaned/resolve/main/longmemeval_s_cleaned.json
cd ..
# Run benchmark
python seci_vs_mempalace.py --dataset s --mode retrieval
Vollständiger Code: github.com/rankfor/ai-memory-benchmark
Was wir als Nächstes testen
- Embedding-Modelle mit längerem Kontext (bge-large, nomic-embed-text), um zu sehen, ob rohe Speicherung aufholt, wenn die Trunkierung entfällt.
- LLM-basierte Extraktion (Gemini Flash zur Sitzungszusammenfassung) im Vergleich zu unserer regelbasierten Extraktion.
- Temporales Boosting für datumsbewusstes Retrieval in der Fragekategorie temporal-reasoning.
- Top-50-Retrieval, um für einen fairen Vergleich das exakte Setup von MemPalace nachzubilden.
Der Code ist offen. Wir freuen uns über Reproduktionen.
Dmitrij Żatuchin, Rankfor.AI. April 2026.
Diese Untersuchung ist unabhängig. Wir haben keine Verbindung zu MemPalace, LongMemEval oder ChromaDB. Der Benchmark-Code und die Ergebnisse stehen zur Reproduktion offen.
