Capturează
Erfasst die konfigurierten Streams im Rahmen der Nutzungsrechte.
Analiză audio & media Instrument specializat
Ein Werkzeug für die Erfassung, Transkription und Organisation von Radiowerbung. Es gruppiert wiederkehrende Fragmente und ermöglicht deren Prüfung zusammen mit der Audioquelle.
Monitor Radio
Erfasst die konfigurierten Streams im Rahmen der Nutzungsrechte.
Audio in Text umwandeln und die Gruppierung ähnlicher Fragmente vorschlagen.
Das Team kann die Fragmente erneut anhören und die relevante Information exportieren.
Die Untersuchung von Nachrichten und Wiederholungen in einem verfolgten Zeitraum.
Auffinden der Fragmente, ohne das gesamte Material erneut anzuhören.
Transkripte und Gruppierungen, die von einem Menschen korrigiert werden können.
Die automatische Erkennung und Transkription können Fehler enthalten. Die Verfügbarkeit der Aufnahmen und die Abdeckung werden für jede Quelle geprüft.
Radio-Monitor im Detail
Radio-Monitor beantwortet fünf Fragen zu einer im Radio gehörten Werbung: von welchem Sender sie kam, um wie viel Uhr sie genau begann, wie lange sie dauerte, was darin gesagt wurde und wo der Audio-Nachweis zur Überprüfung ist. Die Hauptoberfläche ist ein operatives Werbeprotokoll, kein Transkriptionsbildschirm.
Die Kette ist lokal und ohne obligatorische Schlüssel: `ffmpeg` erfasst den Stream, Whisper transkribiert, ein Detektor mit transparentem Scoring markiert Segmente, die wie Werbung aussehen, und wiederholte Werbungen werden per Textfingerabdruck gruppiert. Alles landet in einer auditierbaren SQLite-Datenbank, aus der CSV und die Audiodatei jeder Werbung exportiert werden können.
Was vor jeder Demo gesagt werden muss: Die Erkennung erfasst nicht alles. Die eigene Messung auf Basis realer Daten ergibt einen geschätzten Recall von 30–50% der Werbungen, die tatsächlich on air waren, und die Ursachen sind bekannt und aufgelistet. Wer Radio-Monitoring als „wir erfassen alles“ verkauft, hat entweder nicht gemessen oder sagt es Ihnen nicht.
Bis zu 10 parallel mit `ffmpeg` erfasste Sender, in 30-Sekunden-Segmenten, jedes vor dem Eintritt in die Warteschlange als korrektes WAV validiert. Die Warteschlange lebt in der Datenbank, mit 300 Sekunden Leihfrist, Lebenszeichen und maximal 3 Versuchen pro Job — fällt der Prozess aus, werden die Jobs wiederhergestellt, statt verloren zu gehen. Es gibt auch einen kontinuierlichen Modus ohne Lücken, der den Stream direkt aus `ffmpeg` schneidet und ihn per Ordnerüberwachung übernimmt.
Zwei austauschbare Engines: Whisper über das eigene Gateway (standardmäßig in der Konfiguration) oder `faster-whisper` lokal, auf CPU mit int8-Quantisierung, Modell `large-v3-turbo`, mit VAD-Filter und Beam Search mit 5. Die Sprache wird automatisch erkannt, was auf dem moldauischen Markt wichtig ist, wo derselbe Sender innerhalb derselben Stunde Rumänisch und Russisch abwechselt.
Jedes Segment erhält einen Score zwischen 0 und 1, berechnet aus expliziten Signalen: kommerzielle Schlüsselwörter auf Rumänisch und Russisch, das Vorhandensein einer Telefonnummer, einer Website, eines Preises oder eines Call-to-Action, mit einer Strafbewertung, wenn der Text wie eine Nachricht wirkt. Ein Segment mit einer Dauer zwischen 5 und 90 Sekunden erhält einen kleinen Bonus. Der Standard-Schwellenwert ist 0,30, mit Ausdehnung auf benachbarte Segmente über 0,20, damit eine in zwei Stücke geschnittene Werbung nicht verloren geht. Die Gründe für den Score werden neben dem Score gespeichert.
Dieselbe Werbung, die Dutzende Male ausgestrahlt wird, wird über einen Text-Fingerabdruck gruppiert: Die Transkription wird normalisiert, in überlappende Fenster zu je 5 Wörtern geschnitten, die ersten 20 sortiert beibehalten und eine kurze kryptografische Zusammenfassung erstellt. Darüber hinaus gibt es auch einen Audio-Fingerabdruck über `chromaprint`, der dieselbe Werbung gruppiert, die auf verschiedenen Sendern ausgestrahlt wird, wo die Transkriptionen abweichen.
86 Marken aus Moldau im ursprünglichen Katalog — Einzelhandel, Banken, Telekommunikation, Apotheken, Auto, Restaurants — plus automatische Erkennung neuer Marken aus Transkriptionen, mit Hinzufügen, Löschen, Import und Export über die API.
Jede Werbung kann direkt aus der Oberfläche als bestätigt, abgelehnt oder unsicher markiert werden, mit Filter und Zusammenfassung nach diesen Zuständen. Der CSV-Export respektiert den aktuellen Filter, und das Audio jeder Werbung kann im Browser im genauen Zeitintervall erneut angehört werden.
Drei Telegram-Alarmauslöser: ausgefallener Sender, Verzögerung über dem Schwellenwert und Auftreten einer verfolgten Marke. Darüber hinaus Prometheus-Metriken, Deep-Health-Check und ein Verfügbarkeits-Endpunkt.
Daten und Funktionsweise
Von der Erkundung zur Implementierung
Es werden die zu überwachenden Sender ausgewählt, jeder Stream wird mit dem eingebauten Probevorgang (`probe-streams`) geprüft und das überwachte Zeitintervall festgelegt. Ein Sender, der nicht antwortet, bleibt in der Konfiguration deaktiviert, bis er geprüft ist, und wird nicht in Hoffnung hinzugefügt.
Wer das Recht hat, die Sendung aufzuzeichnen, und wie lange sie aufbewahrt werden darf. Das ist der Schritt, der am häufigsten übersprungen wird und der einzige, der sich technisch nicht nachträglich beheben lässt.
Unter 4 Sendern läuft es auf CPU. Ab 4 wird die Transkription zum Flaschenhals: entweder GPU, oder 2–4 Worker, oder längere Segmente. Der Rückstau ist dafür ausgelegt, die Erfassung zu verlangsamen, nicht Audio zu verlieren — aber ein Backlog von 30 Minuten bedeutet Alarme mit 30 Minuten Verzögerung.
Der Standardwert ist 0,30. Niedriger bedeutet mehr erfasste Werbungen und mehr falsch-positive Fälle zum Abhaken; höher bedeutet das Gegenteil. Die Kalibrierung erfolgt anhand der in der ersten Woche manuell bestätigten und abgelehnten Werbungen, nicht aus dem Bauch heraus.
Was genau herauskommen soll: Vorkommen nach Marke, nach Sender, nach Zeitintervall, mit Link zum Audio. Der CSV-Export und der Tagesbericht sind der Ausgangspunkt; die endgültige Form wird entschieden, nachdem sichtbar wird, welche Fragen das Team tatsächlich stellt.
Nein, und die Zahl haben wir auf Basis echter Daten gemessen: geschätzter Recall 30–50 % beim im Audit verwendeten Schwellenwert. Was er verpasst, ist vorhersehbar — Werbespots, die nur aus Marke plus Slogan ohne Telefon, Website oder Preis bestehen; gesungene Jingles, die Whisper als Rauschen transkribiert; Sendungssponsoring; Werbespots unter 5 Sekunden. Was gut erfasst wird, sind Werbespots, die etwas Verifizierbares sagen, also die meisten mit Angebot.
Wir haben noch keine genaue Zahl im strengen Sinn, und es ist ehrlicher, das zu sagen, als eine zu erfinden. Was wir haben, ist eine auf einer realen Basis von 5018 Aufnahmen und 7428 Segmenten gemessene Score-Verteilung, mit 111 identifizierten Werbespots, plus manuelle Überprüfung auf Stichproben. Daraus ergab sich die nützliche Feststellung: 193 Segmente lagen zwischen 0,30 und 0,40 und waren größtenteils übersehene echte Werbespots — weshalb der Schwellenwert auf 0,30 gesenkt wurde. Eine echte Genauigkeits- und Recall-Zahl erfordert 60+ Minuten manuell auf jedem Sender gelabeltes Audio; das ist eine separate Arbeit, mit Kosten und Dauer.
Nein. Eine Audioaufnahme beweist, dass die Botschaft ausgestrahlt wurde, zu welcher Uhrzeit und wie lange sie dauerte. Die Reichweite ist eine völlig andere Messgröße, die von Messinstituten mit Panels erhoben wird — sie lässt sich nicht daraus ableiten, dass ein digitales Mikrofon etwas gehört hat. Was wir liefern, sind die Anzahl der Ausstrahlungen, die Uhrzeit, der Sender und der Audio-Nachweis.
Das ist die Frage, auf die das Projekt noch keine schriftliche Antwort hat — im Repository gibt es kein einziges Rechtsdokument, und das ist ein Mangel, keine Kommunikationslücke. Die überwachten Streams sind zum Anhören öffentlich, aber eine Sendung zur Analyse aufzuzeichnen und zu speichern ist nicht dasselbe wie sie anzuhören. Die rechtliche Grundlage für Erfassung und Speicherung wird für jeden Sender vor der Installation gemeinsam mit dem Juristen des Auftraggebers festgelegt. Technisch können wir die Exposition reduzieren: Das Audio wird automatisch nach 48 Stunden gelöscht, während Text und Metadaten bleiben.
Ja. Die Sprache wird automatisch erkannt, und der Detektor hat getrennte Stichwortsets für Rumänisch und Russisch, jeweils mit eigenen Tests. Der Fall, der das Ergebnis noch verschlechtert: Wenn die Sprache in der Konfiguration zwangsweise auf Rumänisch festgelegt wird, wird ein Werbespot auf Russisch verzerrt transkribiert und der Score fällt unter den Schwellenwert. Die automatische Erkennung ist die richtige Einstellung bei gemischten Sendern.
Die Erfassung unterstützt 10 parallel; die Transkription ist die Grenze. Auf einem Mac, auf CPU, mit einem Worker wird etwa die halbe Echtzeit verarbeitet — also produzieren 4 Sender schneller, als wir transkribieren können, und die Warteschlange wächst. Das System verliert in dieser Situation kein Audio (die Erfassung wird kontrolliert verlangsamt), aber die Ergebnisse verzögern sich. Für 10 Sender in nahezu Echtzeit braucht man GPU oder längere Segmente.
Ja, und genau dafür ist es ausgelegt: Jeder Werbespot hat eine zugehörige Audiodatei, die im Browser über sein exaktes Intervall abspielbar ist, plus Transkription und benachbarte Segmente. Eine Monitoring-Analyse, die sich an der Quelle nicht überprüfen lässt, ist in einem Gespräch mit einem Kunden oder einem Sender nichts wert.
Nicht kontinuierlich. Es ist eine lokale, vollständige und getestete Plattform — 81 automatische Tests bestehen — aber das eigene Audit sagt unverblümt, dass der Monitor nirgends 24/7 läuft. Es gibt eine Autostart-Datei für macOS und eine Docker-Konfiguration mit GPU-Profil; was fehlt, ist der Server, auf dem es laufen soll, und der Abnahmetest auf 10 Sendern über 2 Stunden, für den der Harness bereits geschrieben ist.
Beispiel zur Veranschaulichung
Ein Nutzungsszenario, ohne Kundendaten oder zugeordnete kommerzielle Ergebnisse.
Ein Werbender möchte wissen, wie oft seine Werbung auf vier Sendern ausgestrahlt wurde, an welchen Tagen und zu welchen Uhrzeiten, mit Audio-Nachweis.
Die vier Streams werden in 30-Sekunden-Segmenten erfasst, als korrektes WAV validiert und in eine dauerhafte Warteschlange gestellt. Whisper transkribiert jedes Segment mit der automatisch erkannten Sprache. Der Detektor bewertet jedes Segment anhand der kommerziellen Signale und markiert, was 0,30 überschreitet, wobei er sich auf benachbarte Segmente über 0,20 ausdehnt, damit ein halbierter Werbespot vollständig bleibt. Die markierten Segmente werden über einen Text-Fingerabdruck gruppiert — 5-Wort-Fenster, die ersten 20 sortiert — und, wenn sich der Text zwischen den Sendern unterscheidet, über einen Audio-Fingerabdruck.
Ein Cluster mit allen Vorkommen derselben Werbung, jeweils mit Sender, Datum, genauer Startzeit, Dauer, Transkription und abspielbarer Audiodatei. Eine CSV-Datei mit demselben Inhalt, gefiltert nach Zeitraum und Sender. Die Ausstrahlungszahl ist eine Untergrenze, keine Gesamtsumme: Beim gemessenen Recall werden einige Ausstrahlungen nicht erfasst, vor allem wenn die Werbung gesungen ist oder keine Telefonnummer, Website oder keinen Preis enthält.
Ce este necesar:Un server care rulează continuu în intervalul monitorizat — pe un laptop pornit câteva ore pe zi rezultatul e incomplet și înșelător. Peste 4 posturi, GPU. Și temeiul legal pentru captura și retenția fiecărui post, stabilit înainte de start.
Möglichkeiten der Zusammenarbeit
Transkriptions- und Sprachgenerierungsprojekte auf Materialien, für die Nutzungsrechte und ein dokumentierter Zweck vorliegen.
Wir definieren einen Pilot rund um einen realen Prozess: Nutzer, Daten, Integrationen, Kosten und Abnahmekriterien. Die Erweiterung erfolgt nach der Bewertung des Ergebnisses.
Wir legen die Anforderungen an Zugänglichkeit, Hosting, Datenschutz und Interoperabilität fest. Jede Verbindung mit AGE- oder STISC-Diensten erfordert die Validierung der Berechtigung, des Zugriffs und der Genehmigungen.
Dies sind Anpassungsszenarien, keine Aussagen über bestehende Verträge oder Partnerschaften. Die vorgeschlagenen Funktionen werden im Arbeitsbereich des Projekts bestätigt.
Discută un pilotCronberry bringt autorisierte Quellen, Gespräche und Beziehungen in einem Raum für Forschung und Koordination zusammen.
Dezvoltare & demonstrațiiGrai ist unsere Forschungsrichtung für Sprachsynthese und an die hier verwendeten Sprachen angepasste Modelle.
Cercetare & dezvoltareEin Studio zur Generierung, zum Anhören und Herunterladen von Sprachmaterialien über Text-to-Speech-Modelle.
Instrument specializatErzählen Sie uns von Ihrem Prozess. Gemeinsam legen wir fest, was sich zu bauen lohnt, was wir anbinden können und wie wir das Ergebnis prüfen.