Skip to main content
RAGTelegramSupabase

RAG über Telegram-Chats ohne Magie

In der Diskussion tauchte ein realer RAG-Fall zu Telegram-Chats auf: Das Archiv wurde in eine Datenbank geladen, ein Agent mit Websuche und Anti-Halluzination wurde daraufgesetzt, aber sie stießen an Grenzen bei Support und Kosten. Für die KI-Automatisierung ist das ein nützliches Signal: Ohne hybride Suche und Reranking stößt die Qualität schnell an ihre Grenzen.

Technischer Kontext

Ich liebe solche Geschichten mehr als Pressemitteilungen: Jemand hat tatsächlich eine Suche über Telegram-Chats aufgebaut, Nachrichten in eine Datenbank geladen, einen Agenten mit RAG, Websuche und Anti‑Halluzination drangehängt und dann ehrlich gesagt, wo es anfing zu knirschen. Nicht in der Theorie, sondern im echten Einsatz. Das sieht endlich nach einer richtigen KI‑Implementierung aus, nicht nach einer Demo für Likes.

Wichtig sind hier nicht das Wort RAG, sondern die Details. Das Chat-Archiv erwies sich für die Suche nach Themen und Kontakten als recht nützlich, die Qualität bewertete der Autor als "ziemlich ordentlich", aber erst nach Feintuning. Seine Schlussfolgerung ist mir nah: Auf einem solchen Korpus braucht man hybride Suche, denn reine Embeddings erfassen Spitznamen, Firmennamen, Jargon und exakte Phrasen nur schlecht.

Der zweite wichtige Punkt ist das Reranking. Ich habe dasselbe Problem oft gesehen: Die Vektorsuche bringt scheinbar relevante Teile, aber nicht die, die wirklich die Frage beantworten. Bei kurzen Telegram-Nachrichten fällt das besonders auf, deshalb ist ein ordentlicher Reranker hier keine Option, sondern fast eine Pflichtschicht.

Ein weiterer starker Punkt im Fall: Der Autor hat aufgehört, das ganze Rauschen in den Index zu schleppen, und begann, Diskussionen in eine separate Wissensbasis zu strukturieren. Das ist die richtige Wende. Wenn man das Geschwätz, Weiterleitungen, Antwortfetzen und Duplikate nicht bereinigt, wird jede KI-Integration schnell zum Wahrscheinlichkeits-Antwortgenerator statt zu einem Arbeitswerkzeug.

Was die Kosten angeht, fiel die Zahl von etwa 20 Dollar pro Monat für Supabase. Ich würde das nicht als universellen Preis ansehen, denn die Kosten hängen von der Archivgröße, den Abfragen und dem Speicherschema ab. Aber als Orientierung für einen kleinen Prototyp klingt es plausibel: Man kann günstig starten, ewig darauf ohne Optimierung zu leben, ist jedoch nicht immer möglich.

Auswirkungen auf Business und Automatisierung

Die praktische Schlussfolgerung ist einfach. Wenn Ihr Team in Chats ertrinkt, kann ein solches RAG Stunden an Zeit zurückbringen: Die Suche nach Lösungen, Kontakten, Vereinbarungen und alten technischen Diskussionen hört auf, Archäologie zu sein.

Gewinner sind Teams mit lebendigen Wissensflüssen: Outsourcing, Produkt, Community, Support, Vertrieb. Verlierer sind diejenigen, die einen „Chatbot für Nachrichten“ ohne Datenbereinigung, Metadatenfilter und Reranking bauen wollen. Dort stellt sich schnell Enttäuschung ein.

Ich würde noch eine unangenehme Wahrheit hinzufügen: Eine Nachricht zu finden, ist nicht dasselbe wie die Wahrheit zu finden. LLMs arbeiten immer noch probabilistisch, und genau deshalb ist die Architektur wichtiger als ein schicker Prompt. Wir bei Nahornyi AI Lab lösen solche Aufgaben für Kunden durch KI‑Lösungsentwicklung mit einer sauberen Datenpipeline, nicht durch die Zauberei von „wir schließen mal eben einen Bot an einem Abend an“.

Wenn Sie ähnliche Schmerzen mit Chats, Wissensdatenbanken oder interner Suche haben, lassen Sie uns nüchtern auf Ihren Prozess schauen. Manchmal reicht eine sorgfältige KI‑Automatisierung auf den vorhandenen Daten, und manchmal ist es besser, gleich einen maßgeschneiderten Agenten so zu bauen, dass er Zeit spart, statt neuen Lärm zu erzeugen. Das ist genau der Fall, bei dem es mir als Vadym Nahornyi mehr Spaß macht, erst alles in Tests zu zerlegen und dann zu einem funktionierenden System für das Business zusammenzubauen.

Wir haben zuvor untersucht, wie man die Zuverlässigkeit eines LLM-Richters mit IRT-Metriken misst. Dies hängt direkt mit der Reranking-Phase in unserem Bot zusammen, wo stabile Relevanzbewertungen entscheidend sind.

Diesen Artikel teilen