3 Min. Lesezeit

Ein Simplex senkte den Speichertraffic pro Token um 44%

ассоциативная памятьсимплексыоптимизация памяти

In einer technischen Diskussion berichtete der Autor des Experiments, dass der Wechsel vom 2D-Würfel zum 4D-Simplex die Zellzugriffe von neun auf fünf und den Traffic pro Token von etwa 111 KB auf 61 KB senkte. Die Adressstreckung erhöhte die Kapazität ebenfalls deutlich, benötigte aber mehr Speicher.

Was Adressstreckung und Simplex bewirkten

Entscheidend ist hier nicht die Geometrie an sich, sondern ein konkretes Ergebnis: Im beschriebenen Experiment benötigt ein 4D-Simplex fünf Zellzugriffe statt der neun eines 2D-Würfels. Der Traffic pro Token sinkt von rund 111 KB auf 61 KB, also um 44%.

Die primäre Quelle dieser Zahlen war zum Zeitpunkt der Diskussion eine Nachricht des Experimentautors in einer technischen Telegram-Community. Es handelt sich weder um einen veröffentlichten Benchmark noch um eine abgeschlossene Forschungsarbeit. Die Ergebnisse sollten daher als Bericht über einen aktuellen Prototypen und nicht als universelle Eigenschaft von Simplex-Speicher gelesen werden.

Die erste Optimierung ist noch einfacher: Lese- und Schreibadressen werden mit einem Faktor multipliziert und erweitern damit den verfügbaren Adressraum. Bei 1.024 Paaren lag die ursprüngliche Kennzahl zwischen 0,69 und 0,73; mit Streckung bei γ = 2 stieg sie auf 0,998–0,999. Bei 4.095 Paaren ging sie bei γ = 4 von 0,04–0,05 auf 0,94–0,95 über.

Nach Angaben des Autors erhöht diese Streckung den Rechenaufwand nicht. Der Preis wird beim Speicher bezahlt, weil mehr Zellen erforderlich sind. Es ist also keine kostenlose Optimierung des gesamten Systems, sondern ein Tausch von physischer Kapazität gegen eine günstigere Verteilung der Adressen.

Der Ersatz des Würfels durch einen Simplex zielt auf einen anderen Kostenfaktor. Mit steigender Dimension wächst bei einem kubischen Schema die Zahl der zu lesenden Zellen schnell, während die getestete Simplex-Variante eine kompaktere Zugriffsnachbarschaft bietet. Der Autor berichtet außerdem über deutlich bessere Extrapolation ohne Streckung und eine etwas höhere Obergrenze mit ihr.

Wo der Vorteil endet

Das Ergebnis wirkt aus Engineering-Sicht relevant, sein Geltungsbereich ist aber noch eng: Der Gewinn betrifft ein bestimmtes Speicherdesign und eine konkrete Adressierungsmethode. Die Zahl von 44% lässt sich nicht auf jeden neuronalen Speicher oder jede Vektorsuche übertragen.

Zunächst sollten nicht nur der Traffic, sondern auch das gesamte Speicherbudget, die Zugriffszeit und das Verhalten bei verrauschten Anfragen geprüft werden. Der Autor merkt bereits an, dass das Simplex-Schema Rauschen in Adressen, einschließlich Paraphrasen, schlechter verkraftet und etwas mehr Speicher benötigt. Genau hier kann eine elegante Verringerung der Lesevorgänge auf die reale Verteilung der Anfragen treffen.

Der nächste Test, ein 6D-Simplex, wurde zum Zeitpunkt der Nachricht noch berechnet. Die theoretische Erwartung war optimistisch, aber in den Quelldaten liegt kein Ergebnis vor. Ihm bereits einen zusätzlichen Gewinn zuzuschreiben, wäre daher verfrüht.

Das Interessanteste ist nicht eine Rekordzahl, sondern die Form des Kompromisses: weniger Datenbewegung gegen mehr Speicher und möglicherweise geringere Robustheit gegenüber Rauschen. Über den Erfolg des Ansatzes entscheidet nicht die Geometrie auf dem Papier, sondern ob dieses Gleichgewicht auch bei heterogenen Adressen und paraphrasierten Anfragen erhalten bleibt.

Wir haben zuvor untersucht, wie Konfigurationen von Claude Opus 4.6 die Kontextkosten und die Wahl der Architektur beeinflussen. Das ergänzt die Diskussion über effizientere Wege, den Speicher von LLMs zu organisieren.