Zum Inhalt springen
megapromotingLassen Sie uns sprechen

aichat.md — Steuerung von Interaktionen

Was mit einer Nachricht passiert, von der Sekunde an, in der sie bei uns ankommt, bis zu dem Moment, in dem jemand sie als gelöst markiert.

Ein Assistent, der gut antwortet, lässt sich in einer Demo leicht zeigen. Schwer zu zeigen, und tatsächlich entscheidend, ist der Weg: wie die Nachricht ankommt, was getan wird, damit nicht zweimal geantwortet wird, wie lange vor der Antwort gewartet wird, woher die Information genommen wird, welches Werkzeug aufgerufen wird, wo der Agent stoppt und wer stattdessen hinzugezogen wird. Unten ist der echte Ablauf, mit den Zahlen aus dem Code. Einschließlich des Kommentarteils, der sich völlig anders verhält als eine private Nachricht — und sich anders verhalten muss.

Traseul

Neun Schritte, in der Reihenfolge, in der sie passieren

  1. 01

    1. Eingang über den Kanal, auf dem der Mensch geschrieben hat

    Sechs Eingangspfade mit unterschiedlichen Mechanismen. Messenger, Instagram Direct und WhatsApp Cloud API kommen per Webhook über denselben Einstiegspunkt, je nach Objekttyp verzweigt. Das Website-Widget kommt direkt über eine eigene Route herein. Telegram kommt nicht per Webhook, sondern per Polling. Und 999.md hat weder Webhook noch Polling — es hat eine Uhr, die alle zwanzig Sekunden in die Threads schaut.

    Jeder Empfang wird in ein Ereignisprotokoll geschrieben, mit dem Zustand der kryptografischen Signatur und dem Rohinhalt, bevor irgendetwas verarbeitet wird. Der Grund ist einfach: Wenn eine Nachricht „nicht angekommen“ ist, ist die erste Frage, ob sie bei uns angekommen ist oder nicht, und die Antwort muss eine Zeile in einer Tabelle sein, keine Vermutung. Das Routing Kanal → Agent erfolgt über eine Zuordnungstabelle zwischen Seitenkennung und Dienst, sodass dasselbe Konto mehrere Agenten auf verschiedenen Kanälen führen kann.

  2. 02

    2. Deduplizierung, vor allem anderen

    Die Nachrichtenkennung wird in einen Redis-Schlüssel mit bedingtem Schreiben gelegt — wenn der Schlüssel bereits existiert, ist die Nachricht ein Duplikat und wird hier gestoppt. Die Lebensdauer des Schlüssels beträgt 24 Stunden. Wenn Redis nicht antwortet, wird auf einen lokalen Speicher mit einem Bereinigungsschwellenwert von 5.000 Einträgen umgeschaltet, sodass die Deduplizierung nicht verschwindet, sondern nur kürzer im Speicher bleibt.

    Das Fenster betrug bis zum 10. Juli 2026 120 Sekunden, als es nach einem Vorfall mit doppelten Antworten auf 24 Stunden angehoben wurde. Der Kommentar, der die Änderung erklärt, steht direkt neben dem Wert im Code. Hier werden auch Sticker und die „Gefällt mir“-Schaltfläche verworfen, die sonst zu Fragen würden, auf die der Agent zu antworten versuchen würde.

  3. 03

    3. Der Puffer — drei nacheinander geschriebene Nachrichten werden zu einer einzigen Frage

    Menschen schreiben keinen Absatz. Sie schreiben „hallo“, dann „ich habe eine Frage“, dann die Frage. Ein Assistent, der auf jede Zeile einzeln antwortet, ist lästig und wirkt dumm. Deshalb werden Nachrichten in einem Puffer pro Absender-Seiten-Paar gesammelt, und der Timer wird bei jeder neuen Nachricht zurückgesetzt. Wenn der Mensch aufhört zu schreiben, wird einmal auf alles geantwortet.

    Auf Messenger und Instagram beträgt die Standardwartezeit 15 Sekunden; auf WhatsApp 5. Es werden maximal fünf Nachrichten im Puffer akzeptiert — die sechste ersetzt die letzte — und der zusammengefügte Text wird auf 2.000 Zeichen gekürzt. Der Wartewert gilt pro Agent, nicht global: Er wird aus der Konfiguration des Agents gelesen und kann für ein Szenario, in dem Geschwindigkeit wichtiger ist als Kohärenz, auf null gesenkt werden. Unmittelbar vor dem Senden wird in der Datenbank erneut geprüft, ob der Thread inzwischen auf Pause gesetzt wurde — denn in den 15 Sekunden kann ein Mensch eingreifen.

  4. 04

    4. Lesen aus Ihren Quellen

    Die Frage wird in einen Vektor umgewandelt und in den Fragmenten gesucht, die Sie hochgeladen haben. Die Suche ist hybrid: Sie kombiniert die Wortübereinstimmung mit der Vektorähnlichkeit im Verhältnis drei zu sieben. Es werden bis zu 300 Kandidatenfragmente aus der Wissensdatenbank des Agents geladen, für jedes wird der kombinierte Score berechnet, und die besten werden behalten — fünf auf Messaging-Kanälen, zehn im Widget.

    Die Anzahl der Fragmente ist pro Agent konfigurierbar, zwischen 1 und 20. Fragmente werden bei der Indizierung auf 1.200 Zeichen gekürzt. Die endgültige Auswahl erfolgt nach Rang, nicht nach einem absoluten Ähnlichkeitsschwellenwert: Es wird nach dem kombinierten Score sortiert und die ersten werden genommen. Die Konfiguration hat auch ein Feld für einen Schwellenwert, aber im Suchpfad behält der effektive Filter jedes Fragment mit einem Score über null und kürzt nach Position — wir erwähnen das, weil es der Unterschied zwischen dem ist, was im Panel steht, und dem, was der Code macht. Jede Abfrage kann mit den zurückgegebenen Fragmenten und ihren Scores protokolliert werden, damit auf die Frage „warum hat er das gesagt“ geantwortet werden kann.

  5. 05

    5. Die Werkzeuge — wenn der Agent etwas tun muss, nicht nur etwas sagen

    Wenn die Antwort eine Aktion erfordert, ruft das Modell ein Werkzeug auf. Ein Werkzeug gibt es in drei Arten: einen Webhook zu Ihrem System, ein isoliert ausgeführtes Codefragment oder eines, das in die Plattform eingebettet ist. Die Modell–Werkzeug–Modell-Schleife hat in beiden Motoren maximal fünf Runden. Nach fünf stoppt sie und antwortet mit dem, was sie hat.

    Die standardmäßige maximale Laufzeit eines Werkzeugs beträgt 15 Sekunden. Eingebettete Werkzeuge, die es heute gibt: Suche auf einer Webseite, aktuelle Uhrzeit, Rechner, Schreiben in ein Google-Tabellenblatt, Lead-Benachrichtigung in Telegram, SMS-Versand, sechs Werkzeuge für Termine in einem externen Buchungssystem und drei für den Produktkatalog eines Shops — Suche, Abgleich und Produktkarte. Der Katalog liest live, mit einem Zehn-Minuten-Cache, bis zu 30 Seiten und einer maximalen Zeit von 20 Sekunden. Es gibt einen Satz als intern markierter Werkzeuge, deren Ergebnis nie in den für den Kunden sichtbaren Text gelangt.

  6. 06

    6. Die Antwort, mit dem Verlauf im Blick

    Das Modell erhält die Frage, die gefundenen Fragmente, die Werkzeugergebnisse und den Gesprächsverlauf — die letzten 25 Nachrichten auf dem Hauptpfad, 50 auf dem neuen Motor. Der Aufruf hat eine maximale Zeit von 120 Sekunden, mit zwei Wiederholungen; der Aufruf nach den Werkzeugen, 90 Sekunden. Die Antwort geht über denselben Kanal hinaus, über den die Frage eingegangen ist, in der Sprache, in der sie gestellt wurde.

    Der neue Agentenmotor wird per Schalter gestartet, pro Agent, pro Konto oder global — nicht alles auf einmal. So lässt sich das alte Verhalten mit dem neuen beim gleichen Traffic vergleichen, was die einzige ehrliche Weise ist zu sagen, dass etwas besser ist.

  7. 07

    7. Die Übergabe an einen Menschen

    Der Faden hat einen Zustand: Bot oder Mensch. Der Wechsel kann auf vier Arten erfolgen. Über Schlüsselwörter — eine Liste von siebzehn Ausdrücken auf Rumänisch, Englisch und Russisch, einzelne Wörter verglichen an der Wortgrenze, Ausdrücke per Textabgleich. Über Frustration — eine zweite Liste, ebenfalls von siebzehn. Über Wiederholung — dieselbe Frage dreimal in den letzten zehn Nachrichten gestellt, gezählt nur für Nachrichten mit mehr als zehn Zeichen. Oder durch die Entscheidung des Modells, das mit einer speziellen Markierung die Übergabe anfordern kann.

    Der Modus ist pro Agent und standardmäßig ausgeschaltet — gewählt wird zwischen „aus“, „nach Schlüsselwörtern“ und „intelligent“. Wenn er auslöst: Der Faden wechselt auf „warte auf Mensch“, der Zeitpunkt wird gespeichert, der Kunde erhält eine Bestätigungsnachricht in seiner Sprache, und der Agent schweigt. Er antwortet nicht parallel, ergänzt nichts, entschuldigt sich nicht. Er schweigt, und das ist alles. Es gibt auch das offizielle Übergabeprotokoll von Meta, das die Kontrolle des Fadens in das Postfach der Seite verschiebt; der Reservekanal speichert weiterhin Nachrichten selbst dann, wenn die Kontrolle beim Menschen ist, damit der Verlauf kein Loch hat.

  8. 08

    8. Wenn der Operator von der Seite antwortet, stoppt der Agent von selbst

    Wenn ein Mensch dem Kunden direkt aus der Meta-Oberfläche schreibt, sieht die Plattform das Echo dieser Nachricht und setzt den Faden automatisch auf Pause, ohne dass jemand etwas drücken muss. Die Standarddauer beträgt 30 Minuten und ist zwischen fünf Minuten und sieben Tagen konfigurierbar. Es ist der am leichtesten zu übersehende Fall beim Entwerfen eines Assistenten: Niemand drückt eine Übernahmetaste, der Mensch antwortet einfach, und wenn die Plattform das nicht bemerkt, bekommt der Kunde zwei Stimmen zugleich.

    Die Rückkehr hat drei Wege. Automatische Reaktivierung nach 30 Minuten ohne menschliche Antwort — eine Schleife prüft jede Minute und reaktiviert in Chargen von jeweils höchstens 50 Fäden, wobei auch der Gesprächsspeicher bereinigt wird, damit der Agent kein Gespräch fortsetzt, das er nicht geführt hat. Das separate Ablaufen der Pause. Und der Button im Panel: übernehmen, lösen, zum Bot zurückkehren, den Bot vollständig stoppen.

  9. 09

    9. Das Schließen — und was sich nicht von selbst schließt

    Der Faden wird manuell im Panel als gelöst markiert, mit Lösungshinweisen und mit einer im Verlauf geschriebenen Systemnachricht. Es gibt kein automatisches Schließen bei Inaktivität: Ein offener Faden bleibt offen. Wir haben uns entschieden, das so zu sagen, statt den Eindruck zu erwecken, dass sich alles von selbst aufräumt.

    Was sich dennoch von selbst schließt, sind zwei Dinge: die Reaktivierung des Agenten nach 30 Minuten, oben beschrieben, und die an Telegram gesendeten Eskalationen, die nach 30 Minuten ohne Antwort als abgelaufen markiert werden und den Faden mit dem geschriebenen Grund an den Agenten zurückgeben. Darüber läuft ein Antwortzeitindikator: über einer Stunde wird er zur Warnung, über vier Stunden zur Überschreitung. Er färbt, schließt aber nicht.

Der Assistent des LadensPasst es zu meinem Gerät?Nennen Sie mir das Gerätemodell.Ich prüfe die Varianten im Katalog.Verbundenes Katalog · verifizierte InformationDas Team kann die Unterhaltung übernehmen.
Erläuterungsskizze · Nachricht, Kontext, Aktion, Übergabe

Comentarii

Die Kommentare: warum sie keine Nachrichten sind und warum sie nicht wie Nachrichten behandelt werden

Eine private Nachricht hat einen einzigen Leser. Ein Kommentar hat alle Leser der Seite, einschließlich der Konkurrenz, einschließlich jemandem, der einen Skandal sucht. Eine gute Antwort im Privaten kann öffentlich ein Desaster sein — zum Beispiel ein Preis, eine Verfügbarkeit oder die Bestätigung, dass jemand tatsächlich Ihr Kunde ist. Deshalb haben Kommentare einen separaten Ablauf, separate Regeln und einen Standardwert, der auf Diskretion ausgerichtet ist.

Wie ein Kommentar ins System gelangt

Die Seite abonniert auf den beiden Netzwerken unterschiedliche Felder: auf Facebook den Seiten-Feed, auf Instagram ausdrücklich Kommentare und Kommentare in Live-Übertragungen. Sie gelangen an denselben Einstiegspunkt wie Nachrichten, aber auf einen separaten Zweig, erkennbar an der Präsenz einer Liste von Änderungen statt einer Nachrichtenliste. Das Format unterscheidet sich zwischen den Netzwerken und wird für jedes einzeln erkannt. Auch der übergeordnete Kommentar wird gelesen, damit klar ist, ob es eine Antwort auf einen anderen Kommentar ist, sowie der Beitrag oder das Material, auf dem er erschienen ist.

Nur neue Kommentare lösen etwas aus

Meta sendet dasselbe Ereignis für mehrere Aktionen. Nur das Hinzufügen eines Kommentars startet den Agenten. Bearbeiten, Löschen, Ausblenden und Wieder-Einblenden werden protokolliert und dort gestoppt. Die Änderung der Anzahl der Likes wird ohne Spur ignoriert, denn sonst wäre das Protokoll nur Rauschen.

Vier Filter, bevor der Agent den Text sieht

Kommentare der Seite selbst werden verworfen — sonst würde der Agent sich endlos selbst antworten. Bereits verarbeitete Kommentare werden anhand der eindeutigen Kommentar-ID verworfen, die in der Datenbank eine Eindeutigkeitsbeschränkung hat. Leere Kommentare, solche mit höchstens zwei Zeichen und solche, die nur aus Emoji bestehen, werden verworfen. Und Texte, die lange Telefonnummern oder Webadressen enthalten, laufen durch einen Spam-Filter mit vier Mustern und werden entsprechend markiert gestoppt.

Öffentlich oder privat: Der Standardwert ist privat

Jeder Agent hat vier separate Schalter, zwei für Facebook und zwei für Instagram: öffentliche Antwort ein oder aus, private Antwort ein oder aus. Darüber liegt ein allgemeiner Modus mit drei Positionen — aus, automatisch oder mit Freigabe. Wenn die Konfiguration fehlt oder nicht gelesen werden kann, ist der Fallback-Wert im Code nicht „öffentlich antworten“, sondern „nicht öffentlich antworten, privat antworten“. Es ist eine bewusste Entscheidung: Ein Konfigurationsfehler darf keinen Text an die öffentliche Wand von jemandem bringen.

Der Agent aus bedeutet Kommentare aus

Wenn der Assistent archiviert, inaktiv, deaktiviert oder auf Pause gesetzt ist, oder wenn der Bot im Kundenkonto ausgeschaltet ist, wird der Kommentarmodus automatisch auf „aus“ gesetzt, unabhängig davon, was in den Kommentarschaltern steht. Eine einzige Stelle zum Ausschalten, nicht vier, die man sich merken muss.

Worauf nicht öffentlich geantwortet wird, und wie streng die Regel ist

Die dem Modell für eine öffentliche Antwort gegebene Anweisung ist ausdrücklich: maximal zwei Sätze, kurzer und freundlicher Ton, Einladung zu einer privaten Nachricht für Details und das Verbot, in der Öffentlichkeit detaillierte Informationen oder Preise zu geben. Darüber liegt eine harte Grenze: Die öffentliche Antwort wird bei 300 Zeichen abgeschnitten. Über beiden liegt der freie Text, den Sie selbst als eigene Anweisungen schreiben, getrennt für öffentlich und privat. Wir sagen offen, wie streng die Regel ist: Es ist eine Prompt-Anweisung plus eine Längenbegrenzung, kein deterministischer Filter, der garantieren könnte, dass ein Preis niemals erscheint. Wenn die Garantie streng sein muss, wird die öffentliche Antwort ausgeschaltet und nur die private belassen, oder auf den Modus mit Freigabe umgeschaltet.

Nur einmal alle 30 Sekunden, auf demselben Beitrag

Die öffentliche Antwort hat einen Zähler pro Beitrag: höchstens eine alle 30 Sekunden. Der Grund ist das, was passiert, wenn ein Beitrag anzieht — dreißig Kommentare in zwei Minuten, und die Seite füllt sich mit identischen Antworten eines Roboters unter jedem einzelnen. Der Zähler bereinigt sich selbst und behält die letzten tausend verfolgten Beiträge.

Instagram erlaubt keine private Nachricht bei einem Unterkommentar

Das ist eine Regel der Plattform, nicht von uns, und sie wird an drei verschiedenen Stellen im Code geprüft, auf allen drei Wegen, über die man zu einer privaten Nachricht gelangen könnte. Wenn der Kommentar einen Elternkommentar hat und das Netzwerk Instagram ist, wird das Senden in privat übersprungen und der genaue Grund im Protokoll vermerkt. Es wird nicht versucht und auch nicht stillschweigend fehlgeschlagen — es wird ausdrücklich übersprungen.

Vom Kommentar zur Unterhaltung

Der Übergang erfolgt über den offiziellen Mechanismus: Die private Nachricht wird mit der Kommentar-ID als Empfänger gesendet, nicht mit der Personen-ID. Ab diesem Moment gibt es einen normalen Nachrichtenstrang mit allen Regeln von oben — Puffer, Quellen, Werkzeuge, Übergabe an einen Menschen. Der Strang wird als aus Kommentaren stammend markiert, und der empfangene Kommentar wird im Gesprächsverlauf mit einem eigenen Typ gespeichert, damit sichtbar ist, wo alles begonnen hat.

Modus mit Genehmigung: Der Agent schreibt, der Mensch veröffentlicht

Wenn der Modus „mit Genehmigung“ ist, geht die generierte Antwort nicht los. Sie wird als Entwurf gespeichert, in Wartestellung, und erscheint im Panel in einer Warteschlange mit Zähler. Von dort wird sie Stück für Stück genehmigt oder abgelehnt. Die genehmigte Veröffentlichung läuft über eine interne, durch einen Signaturvergleich in konstanter Zeit geschützte Brücke — eine genehmigte Antwort kann nicht von außen eingespeist werden.

Was ein Mensch manuell tun kann

Das Ausblenden eines Kommentars, mit dem passenden Mechanismus für jedes Netzwerk, und das Markieren des Zustands in der Datenbank. Das Löschen, mit Löschmarkierung. Massenweises Ausblenden, höchstens 25 Kommentare in einem Batch. Das Schließen der Kommentare bei einem Instagram-Material. Und das Ausblenden von Kommentaren aus einem Live-Stream, über einen separaten Pfad. Das sind manuelle, keine automatischen Aktionen. Es gibt keine Liste verbotener Wörter, die Kommentare von allein ausblendet, und wir behaupten nicht, dass es eine gibt.

Predarea

Wenn der Agent nichts mehr zu sagen hat

Die Eskalation ist kein Fehlschlag des Agenten. Sie ist seine wichtigste Funktion, denn das Einzige, was noch schlimmer ist als ein Assistent, der nichts weiß, ist ein Assistent, der nichts weiß und trotzdem weiterredet. Was als Nächstes kommt, ist, wie die Übergabe aussieht, wer benachrichtigt wird, was mit der Antwort des Menschen passiert und wie der Agent zurückkommt.

Die Karte, die in die Telegram-Gruppe geht

Ein eingebautes Werkzeug sendet den Fall in eine Gruppe, mit einer Kopfzeile, die sofort sagt, um welche Art von Fall es sich handelt: Notfall, Betreiberanfrage, Missbrauchsmeldung, Eskalation eines unzufriedenen Kunden, neuer Lead oder neue Konversation. Der Typ wird aus dem Text erkannt, mit getrennten Mustern für jeden. Die Nachricht des Kunden wird wortwörtlich auf die Karte angehängt — der Mensch, der übernimmt, sieht genau, was der Kunde geschrieben hat, nicht eine Zusammenfassung.

Die Übernahme ist ein Rennen, und sie wird auch so behandelt

Die Karte hat zwei Zustände: offen und gesperrt. Die Übernahme erfolgt mit einem bedingten Schreibvorgang, der den Zustand nur dann ändert, wenn er noch offen war, und der Code prüft tatsächlich, wie viele Zeilen geändert wurden. Zwei Operatoren, die in derselben Sekunde drücken, übernehmen nicht beide. Der zweite erfährt, dass bereits übernommen wurde, und gelangt nicht dazu, parallel zu schreiben.

Die Antwort des Operators wird in die Sprache des Kunden umgeschrieben

Der Operator schreibt in der Gruppe, in seiner Sprache und in seinem Stil, manchmal telegrafisch. Vor der Auslieferung wird der Text in die Sprache umgeschrieben, die der Kunde spricht, und in den Ton des Agenten, ohne neue Fakten hinzuzufügen. Was der Operator sagt, bleibt das, was übertragen wird; nur die Form ändert sich. Das Routing der Antwort zur passenden Konversation erfolgt anhand der Nachricht, auf die geantwortet wurde, und wenn diese fehlt, anhand des einzigen von diesem Operator gesperrten Falls — und es wird ausdrücklich abgelehnt, wenn er zwei hat, statt zu raten.

Wer benachrichtigt wird und was nicht mehr benachrichtigt wird

Das Panel erhält eine Echtzeit-Benachrichtigung über eine permanente Verbindung. Durch Regeln ausgelöste Pausen senden eine Benachrichtigung per E-Mail oder in Telegram, je nach Wahl — das sind die einzigen beiden im Code akzeptierten Kanäle. Wir sagen auch, was nicht mehr funktioniert: Die E-Mail-Benachrichtigung für einen von einem Menschen übernommenen Faden wurde im Juli 2026 absichtlich deaktiviert, und der interne Pfad blieb als leere Antwort bestehen. Wenn Sie sich auf diese E-Mail verlassen, kommt sie nicht an. Wir ziehen es vor, dass Sie das hier erfahren.

Die Pausenregeln, jenseits von Schlüsselwörtern

Es können Regeln geschrieben werden, die den Faden bei Auftreten einer Telefonnummer, einer E-Mail-Adresse, einer Menge von bis zu hundert Wörtern oder bei einer expliziten Anfrage eines Menschen pausieren. Darüber hinaus gibt es zwei vom Modell ausgewertete Typen: Absicht und Stimmung. Die Dauer der Pause liegt zwischen einer Minute und sieben Tagen; der Wert null bedeutet Pause, bis jemand sie manuell aufhebt.

Jeder Handwechsel wird festgehalten

Es gibt ein Übernahmeprotokoll mit sechs getrennten Aktionen: Übernahme durch Mensch, Übernahme durch Bot, automatische Reaktivierung, Übernahme durch Operator, Freigabe durch Operator und Wiederaufnahme durch den Agenten. Das ist keine überschreibbare Statusspalte — es ist ein Verlauf. Wenn jemand fragt „wer sprach damals mit dem Kunden“, ist die Antwort eine Zeile, keine Rekonstruktion.

Was nicht existiert, damit Sie sich nicht auf das stützen, was es nicht gibt

Es gibt keine automatische Disposition an Kurierdienste oder Außendienstteams; ich habe den gesamten Code durchsucht, und es gibt sie nicht. Es gibt keine automatische Schließung von Gesprächen bei Inaktivität. Es gibt keine globale Liste verbotener Wörter für Kommentare. Was es gibt, sind die vier Übergabe-Trigger, die Eskalation in Telegram mit atomarer Übernahme, die Pausenregeln und die automatische Reaktivierung nach 30 Minuten.

Jede Aussage auf dieser Seite wurde aus dem Code der Plattform gelesen — 66 Zitate mit Datei und Zeile, in unserem Depot aufbewahrt. Wir gehen sie gemeinsam durch, auf Anfrage.