Wissens-Optimierer: Bot testen & verbessern
Wissens-Optimierer
Der Wissens-Optimierer ist die zentrale Anlaufstelle, um Ihren Chatbot präzise zu halten. Statt eines einzelnen Werkzeugs bündelt er fünf Tabs, die jeweils einen anderen Aspekt der Antwortqualität abdecken, von der Generierung von Testfragen über das Aufspüren von Lücken aus echten Besucher-Konversationen, das Prüfen Ihrer Wissensdatenbank auf Widersprüche und das Umschreiben der Chatbot-Rolle bis hin zum direkten Vergleich von KI-Modellen.
Wählen Sie oben auf der Seite einen Chatbot aus. Diese Auswahl gilt für alle Tabs. Jeder Tab führt eine eigene Analyse durch und legt, sofern relevant, Verbesserungsvorschläge in der gemeinsamen Optimierungs-Inbox ab, damit Sie diese überprüfen und anwenden können.
Die Tabs im Überblick
| Tab | Was er tut | Berührt Ihr Kontingent |
|---|---|---|
| Wissenstest | Generiert automatisch Testfragen, sendet sie an Ihren Bot und bewertet die Antworten per KI. | Ja (Chat-Nachrichten) |
| Optimieren | Findet Wissenslücken aus echten vergangenen Konversationen und unbeantworteten Fragen. | Nein |
| Rolle | Schlägt einen verbesserten System-Prompt vor und belegt den Nutzen per A/B-Test. | Nur A/B-Test |
| Modell-Arena | Sendet dieselben Fragen an 2–3 KI-Modelle und vergleicht Qualität und Geschwindigkeit. | Ja (Chat-Nachrichten) |
| Audit | Prüft die Wissensdatenbank auf Duplikate, Widersprüche und dünnen Inhalt. | Nein |
Tab „Optimieren“ — Lücken aus echten Konversationen aufdecken
Der Tab Optimieren findet heraus, was Ihr Bot tatsächlich nicht beantworten konnte, basierend auf echtem Besucherverlauf statt Vermutungen. Er zieht unbeantwortete und gesammelte Fragen aus dem ausgewählten Zeitraum heran, gruppiert sie nach Themen und generiert bearbeitbare Inhaltsvorschläge, um jede Lücke zu schließen.
So führen Sie die Optimierung durch:
- Wählen Sie einen Zeitraum: Letzte 30 Tage oder Letzte 90 Tage
- Klicken Sie auf Analysieren
- Das Werkzeug sammelt unbeantwortete Fragen, gruppiert sie thematisch, analysiert jede Gruppe und entwirft passende Inhalte
Jeder Durchlauf nutzt bis zu 10 KI-Analysen und verbraucht keine Chat-Nachrichten. Die Ergebnisse landen unten in der Optimierungs-Inbox als Wissenslücke-Vorschläge. Ein Vorschlag, der aus mehreren echten Fragen entstanden ist, zeigt die Anzahl der Vorkommnisse an, sodass Sie die häufigsten Lücken priorisieren können.
Gibt es im ausgewählten Zeitraum keine unbeantworteten Fragen, meldet der Tab, dass es aktuell nichts zu optimieren gibt.
Tab „Audit“ — Probleme in der Wissensdatenbank finden
Der Tab Audit prüft die bereits vorhandenen Inhalte, nicht die fehlenden. Er durchsucht Ihre indexierten Quellen nach drei Problemtypen und schlägt Korrekturen vor:
| Befund | Warum es wichtig ist |
|---|---|
| Widerspruch | Zwei Quellen sagen Unterschiedliches aus, der Bot beantwortet dieselbe Frage möglicherweise jedes Mal anders. Dies ist der kritischste Fall. |
| Duplikat | Fast identische Abschnitte, die Rauschen erzeugen, ohne neue Informationen zu liefern. |
| Dünner Inhalt | Eine Quelle mit zu wenigen Zeichen, um nützliche Antworten zu liefern. |
So führen Sie das Audit durch:
- Klicken Sie auf Audit starten
- Das Werkzeug durchsucht Ihre Wissensdatenbank und lässt auffällige Paare durch einen KI-Prüfer bewerten
- Die Befunde erscheinen in einer Prüfliste mit den betroffenen Auszügen nebeneinander
Überprüfen Sie die Befunde, behalten Sie die relevanten Einträge (jeder Eintrag hat ein Kontrollkästchen) und klicken Sie auf In Inbox speichern. Wenn eine automatische Neufassung möglich ist, wird der Befund mit Auto-Fix verfügbar markiert und Sie können den korrigierten Text direkt aus der Inbox übernehmen. Bei gecrawlten oder synchronisierten Quellen weist der Vorschlag nur auf das Problem hin, die Behebung erfolgt in der Originalquelle. Liegen keine Probleme vor, meldet das Audit eine fehlerfreie Wissensdatenbank.
Tab „Rolle“ — Den System-Prompt des Bots optimieren
Der Tab Rolle verbessert die Rolle Ihres Chatbots (seinen System-Prompt). Er analysiert fehlgeschlagene Testfragen sowie bekannte Wissenslücken und schlägt eine überarbeitete Rolle für bessere Antworten vor.
So führen Sie die Anpassung durch:
- Klicken Sie auf Verbesserte Rolle vorschlagen
- Vergleichen Sie die aktuelle Rolle und die vorgeschlagene Rolle nebeneinander. Der vorgeschlagene Text ist bearbeitbar, und eine Begründung erklärt, was geändert wurde und warum
- Validieren Sie das Ergebnis mit einem A/B-Test: Wählen Sie eine Fragenquelle (5 frische Testfragen generieren oder Fragen aus dem letzten Testdurchlauf wiederverwenden) und klicken Sie auf A/B-Test starten
- Dieselben Fragen werden mit beiden Rollen gestellt, ein KI-Prüfer wählt pro Frage die bessere Antwort aus, und Sie erhalten eine Gewinnrate sowie eine Aufschlüsselung nach einzelnen Fragen
- Gewinnt die neue Rolle, klicken Sie auf Rolle übernehmen, um sie live zu schalten
Der A/B-Test stellt jede Frage zweimal (aktuell vs. vorgeschlagen). Ein Durchlauf mit 10 Fragen verbraucht daher etwa 20 Testnachrichten Ihres monatlichen Kontingents, mehr bei Verwendung eines Premium-Modells, da stärkere Modelle als mehr als eine Nachricht zählen. Das Übernehmen der Rolle erfordert die Berechtigung chatbots.
Tab „Modell-Arena“ — KI-Modelle vergleichen
Die Modell-Arena sendet dieselben Fragen an 2–3 KI-Modelle parallel und vergleicht diese hinsichtlich Antwortqualität (bewertet durch einen KI-Prüfer) und Median-Latenz. So können Sie entscheiden, ob ein schnelleres oder günstigeres Modell für Ihre tatsächlichen Inhalte ausreicht.
So führen Sie den Vergleich durch:
- Wählen Sie 2–3 Modelle für den Vergleich aus (Ihr aktuelles Modell ist markiert)
- Wählen Sie eine Fragenquelle (neue Fragen generieren oder den letzten Durchlauf wiederverwenden)
- Klicken Sie auf Vergleich starten
- Prüfen Sie die Ergebnistabelle: Qualität in Prozent, Median-Latenz und eine Empfehlung für die beste Balance aus beidem
- Klappen Sie eine beliebige Frage auf, um die tatsächliche Antwort jedes Modells zu sehen
- Klicken Sie bei einem Modell auf Für diesen Bot nutzen, um zu diesem Modell zu wechseln
Dieser Tab nutzt Test-Chat-Nachrichten (die auf Ihr monatliches Kontingent angerechnet werden). Das Anwenden eines Modells erfordert die Berechtigung chatbots.
Wissenstest-Tab: Automatische Tests für Ihre Wissensdatenbank
Der Tab Wissenstest ist der klassische Wissenstest. Er generiert automatisch realistische Testfragen, führt sie gegen Ihren Chatbot aus, bewertet die Antworten mittels KI und hilft Ihnen beim Schließen von Lücken.
Testmodi
| Modus | Beschreibung | Fragen |
|---|---|---|
| Auto Test | Die KI generiert Testfragen direkt aus den Inhalten Ihrer Wissensdatenbank. Die Fragen decken verschiedene Themen und Schwierigkeitsgrade ab, mit einer Mischung aus kurzen (3 bis 5 Wörter) und längeren Formulierungen. | 3 bis 15 Fragen |
| Custom Question | Geben Sie eine bestimmte Frage ein, die Sie testen möchten. Die KI generiert alternative Formulierungen (Varianten), um dasselbe Thema aus verschiedenen Blickwinkeln zu prüfen. | Ihre Frage + 2 bis 14 Varianten |
Auto Test eignet sich am besten für eine umfassende Zustandsprüfung Ihrer gesamten Wissensdatenbank. Custom Question ist ideal, um zu prüfen, ob ein bestimmtes Thema oder kürzlich hinzugefügte Inhalte korrekt beantwortet werden.
Test durchführen
- Wählen Sie den Testmodus: Auto Test oder Custom Question
- Legen Sie die Anzahl der Fragen (Auto Test) oder Varianten (Custom Question) fest
- Für den Modus Custom Question: Geben Sie Ihre Frage ein
- Klicken Sie auf Start Test
Das System führt daraufhin drei Schritte automatisch aus:
| Schritt | Ablauf |
|---|---|
| Generieren | Die KI erstellt Testfragen (Auto Test) oder Fragevarianten (Custom Question). |
| Ausführen | Jede Frage wird an Ihren Chatbot gesendet; die Antwort und etwaige Quellenangaben werden erfasst. |
| Auswerten | Die KI vergleicht jede Antwort mit den Inhalten Ihrer Wissensdatenbank und klassifiziert sie. |
Bewertungskriterien
| Klassifizierung | Beschreibung |
|---|---|
| Beantwortet | Korrekt, hilfreich und deckt die Kernfrage ab. Kleinere Auslassungen von Randdetails sind in Ordnung. |
| Teilweise | Thematisch relevant, lässt aber wesentliche Informationen vermissen, die ein Benutzer erwarten würde. |
| Keine Antwort | Keine Antwort, völlig irrelevant oder grundlegend falsch. |
Bei Ergebnissen mit Teilweise und Keine Antwort erklärt die KI, was fehlt oder falsch ist. Nutzen Sie diese Empfehlungen als Orientierung für Ihre Korrekturen.
Ergebnis-Dashboard
Nach Abschluss eines Tests fassen vier Karten das Ergebnis zusammen: Beantwortet, Teilweise, Keine Antwort und ein Gesamtwert (Score, beantwortet ÷ gesamt) mit einem farbcodierten Balken:
- Grün (80%+): Ihre Wissensdatenbank deckt die getesteten Themen gut ab
- Gelb (50 bis 79%): Einige Lücken sollten behoben werden
- Rot (unter 50%): Erhebliche Lücken erfordern Aufmerksamkeit
Jede getestete Frage erscheint als Ergebnis-Karte mit der Frage, einem Bewertungs-Badge, der vollständigen Antwort des Bots, einer Empfehlung (bei Teilweise/Keine Antwort) und Aktionsschaltflächen: Fix with AI, Erneut versuchen und Find Source.
Mit KI beheben (Fix with AI)
Fix with AI ist der Hauptweg, um beim Testen gefundene Lücken zu schließen. Die Funktion analysiert alle fehlgeschlagenen Fragen, durchsucht Ihre bestehende Wissensdatenbank nach Kontext und generiert Inhalte, um die Lücken zu füllen.
- Klicken Sie bei einem Ergebnis mit Teilweise oder Keine Antwort (oder in der Ergebnisübersicht) auf Fix with AI
- Das System sammelt alle fehlgeschlagenen Fragen und ruft passende Inhalte aus Ihrer Wissensdatenbank ab
- Die KI erstellt einen Textentwurf für die fehlenden Informationen und nutzt dabei konkrete Daten aus Ihren Quellen, sofern verfügbar
- Prüfen und bearbeiten Sie den Entwurf; vergeben Sie optional einen Dokumentnamen (bleibt das Feld leer, wird automatisch einer generiert)
- Klicken Sie auf Add as Data Source, um den Text als neue Text-Datenquelle zu speichern
Nach dem Speichern werden Sie aufgefordert, die Korrektur zu überprüfen: Retest all failed, Retest first (eine schnelle Überprüfung anhand einer einzelnen Frage) oder Später. Der generierte Inhalt erscheint im Tab Wissen Ihres Chatbots, wo er weiterhin bearbeitet werden kann.
Quelle finden (Find Source)
Find Source ermittelt, welche bestehenden Datenquellen für eine Frage relevant sind, nützlich, wenn Sie lieber eine bestehende Quelle bearbeiten möchten, anstatt neue Inhalte hinzuzufügen.
- Klicken Sie auf einer Ergebnis-Karte auf Find Source
- Das System durchsucht Ihre Wissensdatenbank mittels Vektorähnlichkeit (mit Textsuche als Ausweichoption)
- Bis zu 10 Treffer werden angezeigt, jeweils mit Quellenname, Typ, einem Relevanzwert und einer 500-Zeichen-Vorschau des Inhalts
Von dort aus können Sie eine Textquelle direkt Bearbeiten oder auf Open in Dashboard klicken, um zu dieser Quelle im Tab Wissen zu springen.
Wiederholungen und Verlauf
- Erneut versuchen führt eine einzelne Frage erneut aus und aktualisiert deren Antwort, Bewertung und den Gesamtwert direkt an Ort und Stelle.
- Retest all failed (nach Fix with AI) führt alle Fragen mit Teilweise und Keine Antwort in einem Durchlauf erneut aus.
- Der Bereich Testverlauf listet Ihre letzten 20 Testläufe pro Chatbot auf: Score, Modus, Chatbot und Datum. Klicken Sie auf einen Eintrag, um dessen vollständige Ergebnisse wieder zu öffnen.
Limits
| Beschränkung | Wert |
|---|---|
| Testversion-Benutzer | Max. 3 Tests pro Chatbot pro Tag |
| Korrektur-Generierung | Max. 20 Anfragen pro Stunde pro Benutzer |
| Fragen-Timeout | 30 Sekunden pro Frage |
| Globaler Test-Timeout | 120 Sekunden pro Testlauf |
| Auto-Test-Fragen | 3 bis 15 |
| Custom-Question-Varianten | 2 bis 14 (plus Ihre Originalfrage) |
| Testverlauf | Letzte 20 Durchläufe gespeichert |
Die Optimierungs-Inbox
Die Optimierungs-Inbox befindet sich unterhalb der Tabs Optimieren und Audit und sammelt die Verbesserungsvorschläge der KI an einem Ort. Jeder Vorschlag hat einen Typ, Wissenslücke, Widerspruch, Duplikat, Dünner Inhalt oder Rollen-Vorschlag, sowie einen Status:
- Offen: wartend auf Ihre Entscheidung
- Übernommen: auf Ihren Chatbot angewendet
- Verworfen: beiseitegelegt (Sie können ihn später wieder öffnen)
Klicken Sie auf einen Vorschlag, um dessen Detailansicht zu öffnen. Je nach Typ sehen Sie die echten Fragen hinter einer Lücke, die betroffenen Quellenauszüge oder einen Vergleich zwischen aktuellem und vorgeschlagenem Stand. Enthält der Vorschlag bearbeitbaren Inhalt, können Sie diesen vor der Übernahme anpassen. Klicken Sie auf In Wissensbasis übernehmen (oder je nach Typ auf Überarbeitung anwenden / Rolle übernehmen), um ihn anzuwenden, oder auf Verwerfen, um ihn zu überspringen.
Best Practices
- Mit Optimieren beginnen: Echte Konversationen zeigen Ihnen die Lücken, die Sie tatsächlich Antworten kosten
- Audit nach großen Importen ausführen: Widersprüche erkennen, bevor Besucher darauf stoßen
- Wissenstest zur Überprüfung nutzen: Nach dem Hinzufügen von Inhalten bestätigen, dass der Bot nun korrekt antwortet
- Rollenänderungen per A/B-Test prüfen: Neues Prompting nicht nach Bauchgefühl einführen; der Rollen-Tab belegt die Verbesserung
- Modell-Arena vor einem Modellwechsel testen: Sicherstellen, dass ein schnelleres Modell mit Ihren Daten weiterhin gut antwortet
- Gegenprüfung mit den Dashboards Fragen und Analysen: Beobachten, wie der Wert Unbeantwortet sinkt, während Sie Lücken schließen
