Zum Inhalt springen
megapromotingLassen Sie uns sprechen

Expertise · Sprachagenten

Ein Agent, der spricht — auf Ihrer Seite und am Telefon — und der unterbrochen werden kann.

Wir bauen Sprachagenten auf Kallina: schriftliche Rolle, genehmigte Wissensbasis, Werkzeuge, die sie während des Gesprächs aufrufen, und eine Grenze, ab der sie das Gespräch an einen Menschen übergeben. Rumänisch ist die Standardsprache neuer Agenten.

Bereits gebautTrei implementări proprii, citate mai jos. (1) Platforma Kallina — 472 de funcții edge Deno și 559 de migrări de bază de date, numărate azi în depozit; `https://app.kallina.info` răspunde 200. (2) Componenta de pe acest site, `src/components/agents/KallinaVoiceAgent.tsx`, care implementează traseul corect de sesiune și documentează cele două moduri în care un agent vocal eșuează în tăcere. (3) Puntea `elevenlabs-bridge` și sesiunea `openai-realtime-session`, unde stau parametrii reali de întrerupere și de detecție a vorbirii. Rezerva pe care o spunem: partea de telefon depinde de o gazdă SIP, iar gazda prin care trec liniile noastre de test nu răspunde la data scrierii — vezi pagina de telefonie. Pe web, traseul e verificabil azi.

Ein Sprachagent ist bei uns nicht „ein Bot, der ein Skript vorliest“. Er hat vier Dinge, bevor der erste Anruf erfolgt: eine Rolle, eine von Ihnen freigegebene Wissensbasis, einen Satz von Werkzeugen, die er aufrufen darf, und eine Grenze, jenseits derer er das Gespräch an einen Menschen übergibt. Was aus dem Gespräch herauskommt, ist nicht nur ein Transcript: Der Anruf hat Dauer, nach Anbieter aufgeschlüsselte Kosten, eine Aufzeichnung und eine Analyse, alles mit dem Geschäftskonto verknüpft.

Die Engine ist nicht eine einzige, und das ist eine Entscheidung, kein Zufall. In der Agentenkonfiguration wählen Sie zwischen ElevenLabs Conversational AI, OpenAI Realtime und Gemini Live, oder Sie lassen „auto“ und die Plattform wählt nach Sprache, Last und Verfügbarkeit. Darüber wählen Sie separat das Text-„Gehirn“ aus einem Katalog, in dem jedes Modell die Latenz und die Kosten pro Minute in der Oberfläche angezeigt bekommt. Wenn jemand fragt „warum antwortet es langsam“, hat die Antwort Zahlen, keine Meinungen.

Der Teil, den Menschen am stärksten spüren, ist die Unterbrechung. Bei OpenAI Realtime ist die Spracherkennung semantisch, mit Schwelle 0,5, einem Puffer von 300 ms davor und 500 ms Stille, damit erkannt wird, dass Sie fertig gesprochen haben; der Schalter „Unterbrechungen erlauben“ ist standardmäßig aktiviert. Bei ElevenLabs wird das Unterbrechungsereignis an die Telefonanlage weitergeleitet, damit die Wiedergabe sofort stoppt. Und die Zeit, nach der der Agent Ihre Stille als Antwort betrachtet, ist pro Agent konfigurierbar — bei einem von uns geschriebenen Vertriebsagenten ist sie auf 12 Sekunden gestrafft, gegenüber 15 standardmäßig.

Der Agent lebt an zwei verschiedenen Orten, mit unterschiedlichen Einschränkungen. Auf der Webseite tritt er über eine einzige Skriptzeile oder eine eigene Komponente ein, und die goldene Regel ist, dass die Seite niemals die Agenten-ID und keinen Anbieter-Schlüssel enthält — sie fragt die Plattform nach einer Sitzung und erhält eine signierte, kurzlebige URL. Am Telefon tritt er über einen SIP-Trunk ein, und dort stammen die Einschränkungen vom Betreiber und von der Telefonanlage, nicht vom Agenten; darüber schreiben wir separat auf der Telefonieseite.

Agenți vocali AI în Republica Moldova — cum funcționează, concret · video în română, cu subtitrare și transcriere

Transcrierea completă

Bun, haideți să trecem direct la subiect. Astăzi facem o analiză tehnică extrem de precisă a modului în care agenții vocali funcționează cu adevărat în mediul de afaceri. Ne vom baza exclusiv pe arhitectura platformei Kallina, dezvoltată chiar în Republica Moldova, de MEGA PROMOTING S.R.L.. Fără limbaj de marketing, fără promisiuni umflate, doar fapte, infrastructură pură și, evident, realitatea operațională. Pentru orice echipă care conduce o afacere și se bazează pe procese clare, înțelegerea tehnologiei de sub capotă este, sincer, absolut esențială. Avem un parcurs foarte metodic astăzi. Trecem prin șase puncte. Întâi abordăm problema, apoi mecanismul de funcționare, urmează anatomia unui eșec, secțiunea de motoare și întreruperi, limitele tehnice și, în final, pasul următor. E o privire total transparentă asupra sistemului. Așadar, prima secțiune, problema, timpul și cererile. Să vedem exact de unde pornim. Aceasta este fix întrebarea care nu lasă managerii de operațiuni să doarmă noaptea. Unde se pierde mai exact timpul operațional și, foarte important, câte cereri neverificate dispar zilnic. Într-o companie obișnuită, timpul pur și simplu se evaporă printre apeluri pierdute, solicitări care nu sunt preluate la timp și tot felul de interacțiuni care, ei bine, pur și simplu nu pot fi verificate ulterior. Și nu e doar o mică problemă de disconfort. Vorbim de o resursă operațională uriașă care se pierde zi de zi într-un flux de lucru neoptimizat. Trecem la partea a doua, mecanismul, cum funcționează. Haideți să intrăm în ingineria propriu-zisă a platformei. Uitați-vă puțin la numărul ăsta, 472. Acesta este numărul exact de funcții Edge de nou care țin platforma în picioare în acest moment. Deci, clar, nu vorbim despre un prototip de weekend sau o interfață drăguță de fațadă. Este o infrastructură masivă pe un server real gândită să gestioneze rute și logici de business extrem de complexe. Și, pentru a sublinia nivelul de maturitate, există exact 559 de migrări de bază de date pe infrastructura PostgreSQL, care este găzduită prin Supabase. Aceste cifre ne arată o fundație supersolidă cu politici de securitate implementate la nivel de rând. Practic, este un sistem construit pentru a scala și pentru a ține datele într-o ordine impecabilă. Acum, uitați cum arată ordinea operațiunilor pe un agent web, pentru că detaliul ăsta e absolut genial. La pasul 1, pagina cere acces la microfon. La pasul 2, vizitatorul trebuie să accepte. Și abia la pasul 3 se trimite o cerere către server pentru a deschide o sesiune primind înapoi un URL semnat valabil doar pentru o perioadă scurtă. De ce e asta o mișcare strategică atât de importantă? Simplu, dacă la pasul 2 microfonul este refuzat, sistemul nu merge mai departe. Matematic asta înseamnă 0 minute consumate și 0 bani aruncați pe fereastră pentru sesiuni fantomă. Secțiunea a 3-a este probabil preferata mea. Anatomia unui eșec. Pentru că nimic nu construiește încrederea mai mult decât o transparență totală, nu-i așa? Imaginați-vă situația asta de coșmar. S-a implementat un agent vocal pe o pagină web, dar când apăsai pe buton nu se întâmpla absolut nimic. Fără sunet, fără vreun mesaj de avertizare, fără eroare în consola dezvoltatorului. Liniște completă. Pentru oricine, chiar și pentru un tehnician cu experiență, un astfel de defect părea imposibil de localizat la prima vedere. De ce? Pentru că nu exista niciun jurnal de eroare. Un eșec complet tăcut. Când s-a săpat mai adânc, analiza tehnică a scos la iveală doi inamici complet invizibili. În primul rând, serverul trimitea un antet care interzicea complet utilizarea microfonului. Browserul, fiind obedient, respecta regula și refuza cererea, dar o făcea fără să avertizeze interfața vizuală. În al doilea rând, o componentă de voce era importată static pe pagină. Fișierul pur și simplu nu era găsit, returnând o eroare 404. Din cauza asta, întregul script se prăbușea pe fundal, în tăcere, blocând orice configurare ulterioară. Dar uitați cât de elegantă a fost soluția. Problema, în mod evident, nu era la AI, ci direct la rețea. S-a modificat antetul serverului pentru a permite microfonul din propria sursă, vedeți acolo, la starea reparată, și s-a mutat importul de cod exact în interiorul acțiunii de apăsare a butonului. Defectul a dispărut complet. Acum, dacă cineva apasă butonul și microfonul este blocat de browser, eșecul nu mai este tăcut. Apare instantaneu un mesaj clar în limba română care îți explică exact ce trebuie să schimbi. Asta înseamnă inginerie făcută cu cap, eliminând total surprizele neplăcute. Mergem mai departe la secțiunea a patra, motoare, limbi și întreruperi. Este momentul să examinăm exact de ce este capabil acest sistem. Aici lăsăm la o parte părerile subiective și vorbim doar în milisecunde. Când folosești modelul Flash, de la ElevenLabs, latența este de doar 75 de milisecunde. Ca să vă faceți o idee, pentru urechea umană, asta este practic instantaneu. Pe de altă parte, dacă preferați o calitate vocală absolut premium, cum oferă modelul Turbo, latența ajunge pe la 250 de milisecunde. Într-o convorbire telefonică, fiecare milisecunde este critică, iar platforma îți permite să alegi exact ce motor vrei, strict în funcție de nevoile operaționale ale companiei. O întrebare super frecventă pe care o auzim este Bine, dar pot să întrerup agentul în timp ce vorbește? Răspunsul este un da ferm, doar că mecanismul diferă. De exemplu, pe OpenAI Realtime, detecția este semantică. Are un prag fixat la 0.5 și o pernă de siguranță tehnică de 300 de milisecunde. În schimb, pentru ElevenLabs, în secunda în care intervine o întrerupere, un eveniment pleacă direct către centrala telefonică, sistemul PBX, pentru a tăia instantaneu sunetul. Mai mult, perioada de tăcere pe care agentul o așteaptă înainte să răspunde la rândul lui, poate fi reglată foarte fin. Poate fi, de pildă, strânsă la 12 secunde în loc de valoarea implicită de 15, ceea ce face conversația mult mai naturală și alertă. Din punct de vedere a limbilor suportate, configurația oficială a agentului duce cu succes 32 de limbi diferite. Dar, un aspect operațional de maximă importanță pentru noi aici? Limba română este setată implicit pentru absolut toți agenții noi creați pe această platformă. Am ajuns la secțiunea a cincea, limite tehnice și responsabilități, pentru că, uneori, este la fel de important să știi ce nu poate face un sistem, ca să ai așteptările corecte. Haideți să trasăm o linie foarte clară. Agentul poate executa funcții externe, poate declanșa unelte interne direct pe server și poate transfera apelul către un coleg uman fără nicio problemă. Dar, sistemul interzice agenților să improvizeze în domenii strict reglementate. Gândiți-vă puțin. Un agent care începe să improvizeze acolo unde legislația este extrem de strictă devine un risc uriaș pentru companie, în niciun caz un avantaj. Mai mult, lucruri precum executarea automată a ștergerilor de date la un anumit termen nu sunt pur și simplu niște bife într-un meniu. Ele reprezintă proiecte procedurale separate care trebuie implementate dedicat de către organizație. Securitatea, pe de altă parte, este tratată cu o rigoare absolută. Paginile web care găzduiesc agenții primesc exclusiv acel URL semnat de care vorbeam. Niciodată, dar absolut niciodată, nu primesc un ID de agent sau o cheie API care ar putea fi furată și folosită pe banii companiei. Pe partea de voce, telefonia depinde 100% de un trunk SIP extern funcțional și, ca să fim cât se poate de transparenți privind limitările actuale, liniile externe SIP de test nu răspund în acest moment. Este o abordare extrem de sinceră din partea inginerilor care demonstrează că realitatea tehnică e mereu pe primul loc, dincolo de orice discuție comercială. Și iată-ne la secțiunea a șasea, ultima, de altfel, pasul următor în proces. Ce facem mai departe cu toate informațiile astea? Toată această disecție tehnică ar trebui să ne conducă la o evaluare super obiectivă a fluxurilor voastre de lucru. Asta e adevărata miză. Ce proces operațional din interiorul organizației are nevoie de fapt să funcționeze mai eficient? Nu implementăm inteligență artificială doar de dragul de a fi la modă, corect? Scopul este să identificăm locul ăla exact, logic, unde un agent vocal se poate integra rațional, poate scala și poate funcționa în condiții de maximă siguranță. Ca un punct final, aveți aici coordonatele operaționale ale companiei MEGA PROMOTING S.R.L. din Chișinău, inclusiv IDNO și adresa web? Asta pentru o eventuală discuție strict tehnică, menită să clarifice cum se pot integra aceste structuri complexe în sistemele pe care deja le folosiți în afacerea voastră. Înainte de orice decizie, aș lăsa o întrebare provocatoare la care să reflectăm cu toții. Oare procesele actuale de gestionare a clienților din companiile noastre ar rezista cu adevărat unei analize tehnice la fel de dure și transparente precum cea prin care a trecut acest sistem? Într-o piață definită de inovație constantă, o privire bazată strict pe fapte și cifre rămâne de departe cel mai puternic instrument pe care îl avem la dispoziție. Pe data viitoare!

Was dazugehört

Die Arbeit, nach Bestandteilen

Die Sitzung wird von der Plattform angefordert, nicht vom Sprachanbieter

Die Seite sendet `POST /functions/v1/widget-voice-session` mit der öffentlichen Widget-ID und erhält eine signierte URL zurück. Sie hat niemals die Agenten-ID und keinen Schlüssel. Die falsche Variante — `startSession({ agentId })` direkt in HTML — umgeht vollständig die Sitzungs-, Kredit- und Protokollschicht der Plattform und legt den Agenten jedem offen, der den Quelltext der Seite öffnet. Das ist die erste Prüfung, die wir bei jeder Implementierung durchführen, die wir übernehmen.

Das Mikrofon wird vor der Sitzung angefordert, also kostet eine Ablehnung nichts

Die Reihenfolge ist fest und wichtig: Fordern Sie das Mikrofon mit `getUserMedia({audio:true})` an, und erst wenn die Person zustimmt, fordern Sie die Sitzung an. Wenn der Besucher ablehnt, wird keine signierte URL ausgegeben und keine Minute verbraucht. Die Mikrofonanfrage wird innerhalb des Klicks auf den Button gestellt, vor jeder Wartezeit, die über die Geste hinausgehen könnte — andernfalls ignoriert der Browser die Anfrage.

Der Agent kann unterbrochen werden, und das wird mit Zahlen geregelt

Bei OpenAI Realtime: semantische Spracherkennung, Schwelle 0,5, Puffer 300 ms, 500 ms Stille, Unterbrechung standardmäßig erlaubt. Bei ElevenLabs: Das Ereignis `interruption` wird an die Telefonanlage weitergeleitet, damit die Wiedergabe abgeschnitten wird. Darüber entscheidet `turn_timeout` pro Agent, nach wie vielen Sekunden Stille der Agent glaubt, dass er an der Reihe ist — standardmäßig 15 Sekunden, bei einem Vertriebsagenten auf 12 gestrafft. Und ein von einem Kunden gemeldetes „ich kann ihn nicht unterbrechen“ hat oft eine andere Ursache als die Schwellen: zu lange Antworten. Die lösen wir im Prompt und im Token-Limit, nicht in der Spracherkennung.

Ruft Werkzeuge während des Gesprächs auf

Der Agent ist nicht in dem eingeschlossen, was er weiß. Er kann während des Sprechens Serverfunktionen aufrufen — um eine Verfügbarkeit zu lesen, einen Termin einzutragen, eine SMS zu senden oder einen Katalog abzufragen. Die Werkzeuge werden pro Agent deklariert, mit typisierten Parametern und einer eigenen Ausführungszeit, damit ein langsames Werkzeug die Unterhaltung nicht blockiert.

Die Übergabe an einen Menschen ist Teil des Szenarios, keine Ausnahme

In der Nachrichtenübermittlung hat die Übernahme durch einen Kollegen einen eigenen Zustand im Verlauf — `handoff_status`, Zeitpunkt der Übernahme, Grund, wer zugewiesen ist, Lösungsnotizen — implementiert in einem eigenen Modul mit 619 Zeilen. Am Telefon erfolgt die Weiterleitung durch die Vermittlungsstelle: blinde Weiterleitung über `##` und betreute Weiterleitung über `*2`, wobei der Anruf in einem dafür geschriebenen Dialplan-Kontext landet. Es sind zwei unterschiedliche Mechanismen, weil es zwei unterschiedliche Kanäle sind; wir schreiben beide in das Szenario.

Engine und Stimme werden explizit gewählt, nicht implizit

Vier Anbieterpositionen: `elevenlabs`, `openai-realtime`, `gemini-live` und `auto`. Für die Sprachsynthese in anderen Sprachen als Englisch ist standardmäßig `eleven_flash_v2_5` eingestellt — 32 Sprachen, etwa 75 ms; die qualitativ bessere Variante, `eleven_turbo_v2_5`, liegt bei etwa 250 ms. Bei OpenAI Realtime gibt es zehn Stimmen und Engines bis `gpt-realtime-2.1`. Die Wahl ist ein Feld in der Agentenkonfiguration, keine Annahme von uns.

Limbi

Die Agentenkonfiguration unterstützt 32 Sprachen, die interne Sprachkarte der Plattform hat 41 Einträge, und das Administrationspanel ist in 20 Sprachen übersetzt. Das sind drei Zahlen für drei verschiedene Dinge und sie dürfen nicht vermischt werden. Rumänisch ist die Standardsprache eines neuen Agenten.

Was nach dem Anruf übrig bleibt

Transkript, Audioaufnahme, Dauer, nach Anbieter aufgeschlüsselte Kosten, plus eine Nachanalyse des Anrufs und eine kurze Zusammenfassung der Unterhaltung, generiert für das Gedächtnis des Kunden. Die Analyse ist kein Selbstzweck: Auf ihr stützt sich die Entscheidung, ob der Agent das getan hat, was er sollte, oder ob das Szenario eine Lücke hat.

Der Verbrauch wird vor der Aktion geprüft, nicht auf der Rechnung

Vor jeder kostenpflichtigen Operation prüft die Plattform das verfügbare Guthaben, und der Verbrauch wird nach Anbieter und nach Agent aufgeschlüsselt erfasst. Das Gate steht vor dem Aufruf. Praktisch: Ein Agent, der in einer Schleife festhängt, kann nicht endlos verbrauchen, ohne an eine Grenze zu stoßen.

Wie es aussieht

Der Weg, Schritt für Schritt.

01

Wir wählen einen einzigen Ablauf und schreiben seine Grenzen fest

Ein Szenario mit klarem Eingang und klarem Ausgang: eingehender Anruf an der Rezeption, Bestellbestätigung, Verfügbarkeitsprüfung. Wir schreiben ausdrücklich auf, was der Agent nicht tun darf, was er nicht sagen darf und auf welchem Weg er die Unterhaltung an einen Menschen übergibt. Ein Agent ohne geschriebene Grenzen ist nicht leistungsfähiger, sondern nur unvorhersehbarer.

02

Wir bauen den Agenten: Rolle, Wissen, Werkzeuge, Grenzen

Der Prompt, die von Ihnen genehmigte Wissensbasis, die Werkzeuge, die er aufrufen kann, und die Gesprächsschwellen — Anbieter, Stimme, Textmodell, Schweigezeit, Verhalten bei Unterbrechung. Am Ende haben wir einen konfigurierten Agenten, kein Demo.

03

Wir schalten ihn auf den Kanal und prüfen den Ablauf, ohne Minuten zu verbrauchen

Im Web: eine Skriptzeile oder eine eigene Komponente über die Start- und Stopp-API. Es gibt ein Skript, das genau den Weg eines Browsers abläuft — die Zeile aus der Konfiguration, die Konfiguration des Widgets, die Sitzungsanfrage — und am signierten URL anhält, ohne die Audioverbindung zu öffnen. Es läuft auf einem Widget oder auf allen, gibt einen Exit-Code zurück, also kann es in eine geplante Prüfung eingehen. Am Telefon: Die Nummer geht auf den Trunk, und eingehende sowie ausgehende Anrufe werden getrennt getestet, weil sie getrennt ausfallen.

04

Wir messen, was herausgekommen ist, und korrigieren das Szenario

Nach den ersten echten Gesprächen lesen wir die Transkripte und die Nachanalyse des Anrufs, nicht die Eindrücke. Was wir am häufigsten korrigieren, ist nicht das Modell, sondern die Länge der Antworten und die Grenzen des Szenarios — zwei Dinge, die sich im Prompt am selben Tag ändern.

IntrareVerificareDeciziePublicareNimic nu trece mai departe neverificat.ORDINEA E ARGUMENTUL
Traseul unei conversații: pagina cere microfonul, platforma emite o sesiune semnată, agentul vorbește și poate fi întrerupt, cheamă o unealtă, iar ce depășește rolul lui se predă unui om.

Die Daten

Was wir anfassen, wo die Daten liegen und wie lange sie bleiben

Die Fragen, die jede Person mit einem Datenschutzbeauftragten stellt — hier gestellt, bevor er sie stellt.

Wo die Daten liegen
PostgreSQL über Supabase, gehostet auf eigener Infrastruktur, mit 559 versionierten Migrationen, davon 195 mit Row-Level-Security-Richtlinien. Dateien — Aufzeichnungen, Wissensdokumente, Sprachproben — liegen in getrennten Repositorien, mit einem Pfad, der mit der Arbeitsbereichs-ID beginnt, damit die Isolation in der Struktur liegt, nicht nur in der Abfrage.
Was niemals auf Ihrer Seite landet
Der Schlüssel des Sprachanbieters und die Agenten-ID. Die Seite erhält nur eine signierte, kurzlebige URL, die von der Plattform ausgestellt wird. Die praktische Folge: Jemand, der den Quelltext Ihrer Seite liest, kann Ihren Agenten nicht auf Ihre Kosten verwenden.
Was aus einem Anruf protokolliert wird
Audio, Transkript, Dauer, Rufnummer des Anrufenden, Ergebnis des Anrufs und die Auswertung danach. Für Fälle, in denen sich der Agent zwischen Anrufen an den Kunden erinnert, wird auch eine kurze Zusammenfassung des vorherigen Gesprächs gespeichert. Alles ist einem Arbeitsbereich zugeordnet; es gibt kein gemeinsames Repositorium über alle Kunden hinweg.
Löschung auf Anfrage gibt es; automatische Löschung nach Frist noch nicht
Wir sagen das so, wie es ist, weil es der Unterschied zwischen einem Versprechen und einer Funktion ist. Die Löschung auf Anfrage ist implementiert: Eine dedizierte Funktion löscht die Objekte aus dem Dateirepositorium, ruft die Löschprozedur in der Datenbank auf und macht Sitzungen ungültig; separat gibt es einen Datenexport und eine Funktion für Anrufdaten. Was nicht implementiert ist: konfigurierbare Aufbewahrungsfristen pro Arbeitsbereich. Sie sind in einem internen Dokument aus April vorgesehen, aber die Konfigurationsspalte erscheint in keiner Migration — also erfolgt die Löschung nach Frist heute per Prozedur, nicht per Uhr. Wenn Ihr Projekt automatische Löschung braucht, ist sie als Arbeit enthalten, nicht als Einstellung.
Wer darüber informiert wird, dass er mit einem Agenten spricht
Der Hinweis, dass der Gesprächspartner mit einem automatisierten System spricht, die Rechtsgrundlage der Aufzeichnung des Gesprächs und der Text, der zu Beginn des Anrufs vorgelesen wird, werden gemeinsam mit Ihnen festgelegt und gehen in das Szenario ein. Das ist keine technische Einstellung: Es ist eine Entscheidung des Datenverantwortlichen, also von Ihnen.

Ein Fall

Der Button, der nichts tat — und nicht einmal einen Fehler ausgab

Die Ausgangslage

Ein Sprachagent, in eine Webseite eingebettet. Beim Drücken passierte absolut nichts: kein Ton, keine Meldung, kein Fehler in der Konsole, den ein Laie sehen könnte. Die Art von Defekt, die als „funktioniert nicht“ gemeldet wird und einen Tag lang am falschen Ort gesucht wird.

Was wir gebaut haben

Die Ursachen waren zwei, beide von Natur aus stumm. Erste: Der `Permissions-Policy`-Header des Servers enthielt `microphone=()`, und der Browser verweigert die Mikrofonanfrage, ohne dem Benutzer etwas Sichtbares anzuzeigen. Zweite: Das Sprach-SDK wurde statisch importiert, und ein Modul, das beim statischen Import 404 zurückgibt, reißt das gesamte Skript mit — also starb auch die Anforderung zur Konfiguration mit ihm, wodurch der Fehler genau wie „nichts ist passiert“ aussah. Wir haben den SDK-Import in die Button-Aktion verlegt, die Mikrofonanfrage vor die Sitzungsanfrage gesetzt und den Server-Header als `microphone=(self)` geschrieben, mit der Content-Security-Policy, die das CDN des SDK ausdrücklich erlaubt.

Was dabei herauskam

Heute ist auf dieser Seite der in Produktion ausgelieferte Header `camera=(), microphone=(self), geolocation=(self)`, und die Content-Security-Policy führt die Quelle des SDK ausdrücklich auf. Ein Fehlschlag ist nicht mehr stumm: Die Verweigerung des Mikrofons erzeugt eine Meldung auf Rumänisch, die sagt, was genau geändert werden muss, und die Verweigerung kostet nichts, weil die Sitzung gar nicht erst angefordert wird.

Was der Fall nicht sagt

Die beiden Ursachen liegen in der Infrastruktur, nicht beim Agenten. Wenn Ihre Seite von jemand anderem ausgeliefert wird und die Header nicht unter unserer Kontrolle stehen, wird ihre Prüfung zu einer Anfangsbedingung der Arbeit, nicht zu einer Überraschung am Ende.

Fragen

Was uns die Leute fragen, bevor sie anrufen

Womit spricht es konkret? Welche Engine steckt dahinter?

Sie wählen zwischen ElevenLabs Conversational AI, OpenAI Realtime und Gemini Live, oder lassen „auto“ und die Plattform wählt nach Sprache und Verfügbarkeit. Für die Sprachsynthese in anderen Sprachen als Englisch ist standardmäßig `eleven_flash_v2_5` aktiviert — 32 Sprachen, etwa 75 ms; wenn Sie höhere Qualität wollen und mehr Verzögerung akzeptieren, liegt `eleven_turbo_v2_5` bei etwa 250 ms. Bei OpenAI Realtime gibt es zehn Stimmen, und die Engine reicht bis `gpt-realtime-2.1`. Das textuelle Gehirn wird separat aus einem Katalog gewählt, in dem jedes Modell mit Latenz und Kosten pro Minute daneben aufgeführt ist.

Kann ich ihn unterbrechen, wenn er spricht, oder muss ich warten, bis er fertig ist?

Ja. Bei OpenAI Realtime ist die Spracherkennung semantisch, mit einem Schwellenwert von 0,5, 300 ms Puffer und 500 ms Stille, und der Unterbrechungsschalter ist standardmäßig aktiviert. Bei ElevenLabs wird das Unterbrechungsereignis an die Telefonanlage gesendet, damit sie die Wiedergabe stoppt. Wenn Sie dennoch das Gefühl haben, dass Sie ihn nicht unterbrechen können, liegt die Ursache meistens woanders: Der Agent antwortet in Absätzen, nicht in Sätzen. Das wird im Prompt und im Token-Limit behoben, nicht bei den Schwellenwerten.

In wie vielen Sprachen spricht sie?

Die Agentenkonfiguration unterstützt 32 Sprachen. Die interne Sprachkarte der Plattform hat 41 Einträge, und das Administrationspanel ist in 20 übersetzt — drei Zahlen für drei verschiedene Dinge. Rumänisch ist die Standardsprache eines neuen Agenten. Für eine bestimmte Sprache prüfen wir zuerst, welche Kombination aus Sprachmodell und Anbieter sie tatsächlich abdeckt, denn nicht alle Modelle decken dieselben Sprachen ab.

Wie gelangt sie auf meine Website und was muss ich bei mir ändern?

Eine Skriptzeile mit der öffentlichen Kennung des Widgets oder Ihre eigene Komponente über `start()` / `stop()` / `toggle()`. Zwei Dinge müssen auf Ihrem Server wahr sein, sonst macht der Button nichts und es erscheint kein Fehler: Der Header `Permissions-Policy` muss `microphone=(self)` erlauben — mit `microphone=()` verweigert der Browser das Mikrofon lautlos — und die Content-Security-Policy muss das Laden des SDKs vom verwendeten CDN erlauben. Wir prüfen das vor der Veröffentlichung.

Kann er zuerst anrufen, nicht nur antworten?

Ja, die Plattform hat Stapelwahl mit Kontaktimport, Wiederholungsversuchen und Echtzeitverfolgung. Aber ausgehende Anrufe hängen nicht nur von uns ab: In unserem Fehlerregister ist ein Fall dokumentiert, in dem die Vermittlungsstelle des Anbieters begann, bei allen ausgehenden Anrufen `403 Forbidden` zurückzugeben, mit unveränderter Konfiguration unsererseits und normal funktionierenden eingehenden Anrufen. Deshalb testen wir die ausgehenden Anrufe separat, bevor wir eine Anrufkampagne versprechen, und deshalb verkaufen wir kein Volumen ausgehender Anrufe vor diesem Test.

Was passiert, wenn der Agent die Antwort nicht kennt?

Er übergibt. Jeder Agent hat festgeschriebene Grenzen und einen konfigurierten Übergabeweg. In der Nachrichtenübermittlung wechselt der Thread in den Zustand der menschlichen Übernahme, mit Grund und Zuweisung an einen Kollegen. Am Telefon führt die Vermittlungsstelle die Weiterleitung durch — blind oder assistiert — zu einer Nebenstelle oder einer externen Nummer. Was die Rolle des Agenten überschreitet, wird gestoppt, nicht improvisiert; das ist eine Designentscheidung, denn ein Agent, der in einem regulierten Bereich improvisiert, ist ein Risiko, keine Einsparung.

Werden Gespräche aufgezeichnet? Wie lange werden sie aufbewahrt?

Ja, sie werden aufgezeichnet, transkribiert und analysiert, und alles ist mit Ihrem Arbeitsbereich verknüpft. Wie lange sie aufbewahrt werden, ist Ihre Entscheidung als Datenverantwortlicher, nicht ein Standardwert, den wir Ihnen aufzwingen — und es muss klar gesagt werden, dass die automatische Löschung zum Termin heute keine einfache Einstellung in der Plattform ist: Die Löschung auf Anfrage ist implementiert, die Löschung zum Termin erfolgt per Verfahren. Wenn Sie eine automatische Uhr benötigen, wird sie im Projekt gebaut.

Kostet es Geld, wenn der Besucher auf den Button drückt und dann das Mikrofon verweigert?

Nein. Das Mikrofon wird vor der Sitzung angefordert. Wenn die Person ablehnt, wird die Sitzungsanfrage gar nicht erst gestellt, also wird auch keine signierte URL ausgestellt und nichts verbraucht. Unabhängig davon prüft die Plattform vor jeder kostenpflichtigen Operation das verfügbare Guthaben — die Schranke liegt vor dem Anruf, nicht auf der Rechnung am Monatsende.

Kann ich heute einen Agenten haben, der auf eine Festnetznummer antwortet?

Das hängt von einem Teil ab, der nicht der Agent ist: dem SIP-Host, über den der Anruf hereinkommt. Der Agententeil ist fertig und kann sofort auf der Seite gezeigt werden. Der Telefonteil erfordert einen funktionierenden Trunk vom Anbieter und eine Vermittlungsstelle, die antwortet; zum Zeitpunkt des Schreibens antwortet der Host, über den unsere Testleitungen laufen, nicht, und wir stellen nichts als verfügbar dar, was wir vor Ihnen nicht starten können. Für ein echtes Projekt wird die Telefonie separat dimensioniert — siehe die Seite für Telefonie und Contact Center.

Worauf die obigen Aussagen beruhen (21 Quellen)
  1. app.kallina.info răspunde 200 azi; supabase.kallina.info răspunde la funcțiile edgehttps://app.kallina.info/ · 2026-09-06
  2. Antetele servite azi în producție pe megapromoting.com permit microfonul și sursa SDK-uluihttps://www.megapromoting.com/ · 2026-09-06

19 davon sind Code und Dateien aus unseren Repositories. Wir veröffentlichen weder ihren Namen noch die Zeile: zusammen, auf einer einzigen Seite, würden sie zu genau beschreiben, wie Systeme gebaut sind, die nicht nur uns gehören. Wir gehen sie mit Ihnen durch, im Repository, auf Anfrage — die Überprüfung bleibt möglich, sie findet nur in einem Gespräch statt.

Was sollte bei Ihnen besser laufen?

Erzählen Sie uns von Ihrem Prozess. Gemeinsam legen wir fest, was sich zu bauen lohnt, was wir anbinden können und wie wir das Ergebnis prüfen.

Lassen Sie uns sprechen