Zum Inhalt springen
megapromotingLassen Sie uns sprechen
Produkte Monitor Radio

Analiză audio & media Instrument specializat

Aus Stunden Audio Fragmente, die Sie wiederfinden können.

Ein Werkzeug für die Erfassung, Transkription und Organisation von Radiowerbung. Es gruppiert wiederkehrende Fragmente und ermöglicht deren Prüfung zusammen mit der Audioquelle.

  1. 1Captură audio
  2. 2Transcriere și grupare
  3. 3Revizuire fragmente
Schemă explicativă ·Monitor Radio

Monitor Radio

Von der Information zur erledigten Arbeit.

01

Capturează

Erfasst die konfigurierten Streams im Rahmen der Nutzungsrechte.

02

Transkribiert und gruppiert

Audio in Text umwandeln und die Gruppierung ähnlicher Fragmente vorschlagen.

03

Ermöglicht die Überprüfung

Das Team kann die Fragmente erneut anhören und die relevante Information exportieren.

Wo es nützlich wird.

Medienforschung

Die Untersuchung von Nachrichten und Wiederholungen in einem verfolgten Zeitraum.

Durchsuchbares Archiv

Auffinden der Fragmente, ohne das gesamte Material erneut anzuhören.

Inhaltsanalyse

Transkripte und Gruppierungen, die von einem Menschen korrigiert werden können.

Die automatische Erkennung und Transkription können Fehler enthalten. Die Verfügbarkeit der Aufnahmen und die Abdeckung werden für jede Quelle geprüft.

Radio-Monitor im Detail

Was Sie mit diesem Projekt tun können.

Radio-Monitor beantwortet fünf Fragen zu einer im Radio gehörten Werbung: von welchem Sender sie kam, um wie viel Uhr sie genau begann, wie lange sie dauerte, was darin gesagt wurde und wo der Audio-Nachweis zur Überprüfung ist. Die Hauptoberfläche ist ein operatives Werbeprotokoll, kein Transkriptionsbildschirm.

Die Kette ist lokal und ohne obligatorische Schlüssel: `ffmpeg` erfasst den Stream, Whisper transkribiert, ein Detektor mit transparentem Scoring markiert Segmente, die wie Werbung aussehen, und wiederholte Werbungen werden per Textfingerabdruck gruppiert. Alles landet in einer auditierbaren SQLite-Datenbank, aus der CSV und die Audiodatei jeder Werbung exportiert werden können.

Was vor jeder Demo gesagt werden muss: Die Erkennung erfasst nicht alles. Die eigene Messung auf Basis realer Daten ergibt einen geschätzten Recall von 30–50% der Werbungen, die tatsächlich on air waren, und die Ursachen sind bekannt und aufgelistet. Wer Radio-Monitoring als „wir erfassen alles“ verkauft, hat entweder nicht gemessen oder sagt es Ihnen nicht.

01

Gleichzeitige Erfassung mit dauerhafter Warteschlange

Bis zu 10 parallel mit `ffmpeg` erfasste Sender, in 30-Sekunden-Segmenten, jedes vor dem Eintritt in die Warteschlange als korrektes WAV validiert. Die Warteschlange lebt in der Datenbank, mit 300 Sekunden Leihfrist, Lebenszeichen und maximal 3 Versuchen pro Job — fällt der Prozess aus, werden die Jobs wiederhergestellt, statt verloren zu gehen. Es gibt auch einen kontinuierlichen Modus ohne Lücken, der den Stream direkt aus `ffmpeg` schneidet und ihn per Ordnerüberwachung übernimmt.

02

RO + RU Transkription

Zwei austauschbare Engines: Whisper über das eigene Gateway (standardmäßig in der Konfiguration) oder `faster-whisper` lokal, auf CPU mit int8-Quantisierung, Modell `large-v3-turbo`, mit VAD-Filter und Beam Search mit 5. Die Sprache wird automatisch erkannt, was auf dem moldauischen Markt wichtig ist, wo derselbe Sender innerhalb derselben Stunde Rumänisch und Russisch abwechselt.

03

Detektor mit sichtbarem Scoring

Jedes Segment erhält einen Score zwischen 0 und 1, berechnet aus expliziten Signalen: kommerzielle Schlüsselwörter auf Rumänisch und Russisch, das Vorhandensein einer Telefonnummer, einer Website, eines Preises oder eines Call-to-Action, mit einer Strafbewertung, wenn der Text wie eine Nachricht wirkt. Ein Segment mit einer Dauer zwischen 5 und 90 Sekunden erhält einen kleinen Bonus. Der Standard-Schwellenwert ist 0,30, mit Ausdehnung auf benachbarte Segmente über 0,20, damit eine in zwei Stücke geschnittene Werbung nicht verloren geht. Die Gründe für den Score werden neben dem Score gespeichert.

04

Gruppierung repetitiver Werbung

Dieselbe Werbung, die Dutzende Male ausgestrahlt wird, wird über einen Text-Fingerabdruck gruppiert: Die Transkription wird normalisiert, in überlappende Fenster zu je 5 Wörtern geschnitten, die ersten 20 sortiert beibehalten und eine kurze kryptografische Zusammenfassung erstellt. Darüber hinaus gibt es auch einen Audio-Fingerabdruck über `chromaprint`, der dieselbe Werbung gruppiert, die auf verschiedenen Sendern ausgestrahlt wird, wo die Transkriptionen abweichen.

05

Markenkatalog

86 Marken aus Moldau im ursprünglichen Katalog — Einzelhandel, Banken, Telekommunikation, Apotheken, Auto, Restaurants — plus automatische Erkennung neuer Marken aus Transkriptionen, mit Hinzufügen, Löschen, Import und Export über die API.

06

Menschliche Prüfung und Export

Jede Werbung kann direkt aus der Oberfläche als bestätigt, abgelehnt oder unsicher markiert werden, mit Filter und Zusammenfassung nach diesen Zuständen. Der CSV-Export respektiert den aktuellen Filter, und das Audio jeder Werbung kann im Browser im genauen Zeitintervall erneut angehört werden.

07

Alarmierung und Beobachtbarkeit

Drei Telegram-Alarmauslöser: ausgefallener Sender, Verzögerung über dem Schwellenwert und Auftreten einer verfolgten Marke. Darüber hinaus Prometheus-Metriken, Deep-Health-Check und ein Verfügbarkeits-Endpunkt.

Daten und Funktionsweise

Was in das System eingeht. Was geprüft werden muss.

Was tatsächlich erkannt wird und was nicht
Gut erkannt werden die Werbungen, die etwas Verifizierbares sagen: ein Telefon, eine Website, einen Preis, einen Call-to-Action. Verfehlt werden, konstruktionsbedingt: Image-Werbungen, die nur Marke plus Slogan sind, Programmsponsoring, Cross-Promotion zwischen Sendern derselben Gruppe, soziale Botschaften, gesungene Jingles (Whisper transkribiert sie als Poesie oder Rauschen), Werbungen unter 5 Sekunden und solche mit durch eine schwache Aufnahme beeinträchtigter Transkription.
Gemessene Genauigkeit auf realen Daten
Das eigene Audit vom 25. Mai 2026 auf der Live-Datenbank mit 5018 Aufnahmen und 7428 Segmenten ergab 111 Werbungen nach der Erweiterung. Die Score-Verteilung: 80 Segmente über 0,50 (eindeutig identifizierte Werbungen), 29 zwischen 0,40 und 0,50, 193 zwischen 0,30 und 0,40 — manuell geprüft und überwiegend als verfehlte echte Werbungen bestätigt — 278 zwischen 0,20 und 0,30, 33 zwischen 0,10 und 0,20 und 6815 unter 0,10, also Musik. Geschätzter Recall beim damaligen Schwellenwert 0,40: 30–50%. Der Schwellenwert wurde später gerade auf Grundlage dieser Messung auf 0,30 gesenkt, was den Recall erhöht und auch die Zahl der zu prüfenden Falsch-Positive erhöht.
Warum dies keine vollständige Präzisionsmessung ist
Um eine Präzisions- und Recall-Zahl im strengen Sinn des Wortes zu veröffentlichen, bräuchten wir 60+ Minuten manuell etikettiertes Audio pro Sender, verglichen mit der Ausgabe des Systems. Die Studie ist geplant, nicht durchgeführt. Was wir haben, ist eine Score-Verteilung auf realen Daten plus manuelle Prüfung von Stichproben — weniger als ein Benchmark, mehr als ein Eindruck, und es ist wichtig, beides nicht zu verwechseln.
Die zeitliche Abdeckung ist die eigentliche Einschränkung
Im geprüften Fenster deckten die Aufnahmen drei Intervalle von ungefähr 80 möglichen Stunden ab — der Rest: Monitor ausgeschaltet. Das, nicht der Detektor, ist der Hauptgrund dafür, dass die Datenbasis 111 Werbungen und nicht Tausende enthielt. Ein nützliches Ergebnis erfordert kontinuierlichen Betrieb auf einem Server, nicht auf einem Laptop. Ein marktbezogenes und korrektes Detail: Zwischen 00:00 und 05:00 ist das Ergebnis von null Werbungen kein Fehler — die moldauischen Radiosender senden in diesem Intervall Musik ohne Werbung.
Die Transkriptionskapazität ist der Flaschenhals
Auf einem Mac mit Apple Silicon läuft `large-v3-turbo` auf der CPU mit nur einem Worker bei etwa der Hälfte der Echtzeit: ungefähr 2 verarbeitete Segmente pro Minute gegenüber 4 erzeugten durch 4 Stationen. Die Warteschlange füllt sich, der Druck breitet sich zurück aus und die Erfassung verlangsamt sich — das richtige Verhalten, weil wir kein Audio verlieren. Für 10 Stationen im Dauerbetrieb sind GPU, 2–4 Worker oder längere Segmente von 60–120 Sekunden nötig.
Was gespeichert wird und wie viel
WAV-Audio auf der Festplatte, mit standardmäßiger Bereinigung von Dateien, die älter als 48 Stunden sind; Transkripte, Segmente, Werbungen und Cluster bleiben in der Datenbank. Das heißt, der Audio-Nachweis einer Werbung ist zwei Tage lang verfügbar, wenn der Zeitraum nicht geändert wird, und der Text bleibt erhalten.
Rechte an den Aufnahmen — nicht festgelegt
Im Projekt gibt es kein Dokument zu Rechten oder Lizenzierung: Die einzige Lizenzangabe ist `license = { text = "Private" }` in der Paketkonfiguration. Die Flows in der Referenzkonfiguration sind öffentliche Hörflüsse von Sendern aus Moldau. Das Aufnehmen und Speichern einer Sendung zur Analyse ist nicht dasselbe wie das Anhören, und wer die Überwachung bezahlt, muss die rechtliche Grundlage für Erfassung und Aufbewahrung haben — für jeden Sender einzeln. Das wird vor der ersten Installation geklärt, nicht danach; wir können kein Recht übertragen, das wir nicht haben.

Von der Erkundung zur Implementierung

Wie wir ein Projekt mit Monitor Radio vorbereiten.

01

1. Wir legen Sender und Zeitfenster fest

Es werden die zu überwachenden Sender ausgewählt, jeder Stream wird mit dem eingebauten Probevorgang (`probe-streams`) geprüft und das überwachte Zeitintervall festgelegt. Ein Sender, der nicht antwortet, bleibt in der Konfiguration deaktiviert, bis er geprüft ist, und wird nicht in Hoffnung hinzugefügt.

02

2. Wir klären die Grundlage für Erfassung und Aufbewahrung

Wer das Recht hat, die Sendung aufzuzeichnen, und wie lange sie aufbewahrt werden darf. Das ist der Schritt, der am häufigsten übersprungen wird und der einzige, der sich technisch nicht nachträglich beheben lässt.

03

3. Wir dimensionieren die Hardware nach der Anzahl der Sender

Unter 4 Sendern läuft es auf CPU. Ab 4 wird die Transkription zum Flaschenhals: entweder GPU, oder 2–4 Worker, oder längere Segmente. Der Rückstau ist dafür ausgelegt, die Erfassung zu verlangsamen, nicht Audio zu verlieren — aber ein Backlog von 30 Minuten bedeutet Alarme mit 30 Minuten Verzögerung.

04

4. Wir kalibrieren den Schwellenwert mit menschlicher Prüfung

Der Standardwert ist 0,30. Niedriger bedeutet mehr erfasste Werbungen und mehr falsch-positive Fälle zum Abhaken; höher bedeutet das Gegenteil. Die Kalibrierung erfolgt anhand der in der ersten Woche manuell bestätigten und abgelehnten Werbungen, nicht aus dem Bauch heraus.

05

5. Wir definieren den Bericht, der zählt

Was genau herauskommen soll: Vorkommen nach Marke, nach Sender, nach Zeitintervall, mit Link zum Audio. Der CSV-Export und der Tagesbericht sind der Ausgangspunkt; die endgültige Form wird entschieden, nachdem sichtbar wird, welche Fragen das Team tatsächlich stellt.

Fragen, die sich lohnen, geklärt zu werden.

Erfasst es alle Werbungen?

Nein, und die Zahl haben wir auf Basis echter Daten gemessen: geschätzter Recall 30–50 % beim im Audit verwendeten Schwellenwert. Was er verpasst, ist vorhersehbar — Werbespots, die nur aus Marke plus Slogan ohne Telefon, Website oder Preis bestehen; gesungene Jingles, die Whisper als Rauschen transkribiert; Sendungssponsoring; Werbespots unter 5 Sekunden. Was gut erfasst wird, sind Werbespots, die etwas Verifizierbares sagen, also die meisten mit Angebot.

Wie genau sind Sie denn, exakt?

Wir haben noch keine genaue Zahl im strengen Sinn, und es ist ehrlicher, das zu sagen, als eine zu erfinden. Was wir haben, ist eine auf einer realen Basis von 5018 Aufnahmen und 7428 Segmenten gemessene Score-Verteilung, mit 111 identifizierten Werbespots, plus manuelle Überprüfung auf Stichproben. Daraus ergab sich die nützliche Feststellung: 193 Segmente lagen zwischen 0,30 und 0,40 und waren größtenteils übersehene echte Werbespots — weshalb der Schwellenwert auf 0,30 gesenkt wurde. Eine echte Genauigkeits- und Recall-Zahl erfordert 60+ Minuten manuell auf jedem Sender gelabeltes Audio; das ist eine separate Arbeit, mit Kosten und Dauer.

Sagt es mir, wie viele Menschen die Werbung gehört haben?

Nein. Eine Audioaufnahme beweist, dass die Botschaft ausgestrahlt wurde, zu welcher Uhrzeit und wie lange sie dauerte. Die Reichweite ist eine völlig andere Messgröße, die von Messinstituten mit Panels erhoben wird — sie lässt sich nicht daraus ableiten, dass ein digitales Mikrofon etwas gehört hat. Was wir liefern, sind die Anzahl der Ausstrahlungen, die Uhrzeit, der Sender und der Audio-Nachweis.

Welche Rechte brauche ich, um die Sender aufzuzeichnen?

Das ist die Frage, auf die das Projekt noch keine schriftliche Antwort hat — im Repository gibt es kein einziges Rechtsdokument, und das ist ein Mangel, keine Kommunikationslücke. Die überwachten Streams sind zum Anhören öffentlich, aber eine Sendung zur Analyse aufzuzeichnen und zu speichern ist nicht dasselbe wie sie anzuhören. Die rechtliche Grundlage für Erfassung und Speicherung wird für jeden Sender vor der Installation gemeinsam mit dem Juristen des Auftraggebers festgelegt. Technisch können wir die Exposition reduzieren: Das Audio wird automatisch nach 48 Stunden gelöscht, während Text und Metadaten bleiben.

Funktioniert es mit der russischen Sprache?

Ja. Die Sprache wird automatisch erkannt, und der Detektor hat getrennte Stichwortsets für Rumänisch und Russisch, jeweils mit eigenen Tests. Der Fall, der das Ergebnis noch verschlechtert: Wenn die Sprache in der Konfiguration zwangsweise auf Rumänisch festgelegt wird, wird ein Werbespot auf Russisch verzerrt transkribiert und der Score fällt unter den Schwellenwert. Die automatische Erkennung ist die richtige Einstellung bei gemischten Sendern.

Wie viele Sender kann es gleichzeitig überwachen?

Die Erfassung unterstützt 10 parallel; die Transkription ist die Grenze. Auf einem Mac, auf CPU, mit einem Worker wird etwa die halbe Echtzeit verarbeitet — also produzieren 4 Sender schneller, als wir transkribieren können, und die Warteschlange wächst. Das System verliert in dieser Situation kein Audio (die Erfassung wird kontrolliert verlangsamt), aber die Ergebnisse verzögern sich. Für 10 Sender in nahezu Echtzeit braucht man GPU oder längere Segmente.

Kann ich die Werbung noch einmal anhören, um sie zu prüfen?

Ja, und genau dafür ist es ausgelegt: Jeder Werbespot hat eine zugehörige Audiodatei, die im Browser über sein exaktes Intervall abspielbar ist, plus Transkription und benachbarte Segmente. Eine Monitoring-Analyse, die sich an der Quelle nicht überprüfen lässt, ist in einem Gespräch mit einem Kunden oder einem Sender nichts wert.

Läuft das gerade irgendwo?

Nicht kontinuierlich. Es ist eine lokale, vollständige und getestete Plattform — 81 automatische Tests bestehen — aber das eigene Audit sagt unverblümt, dass der Monitor nirgends 24/7 läuft. Es gibt eine Autostart-Datei für macOS und eine Docker-Konfiguration mit GPU-Profil; was fehlt, ist der Server, auf dem es laufen soll, und der Abnahmetest auf 10 Sendern über 2 Stunden, für den der Harness bereits geschrieben ist.

Beispiel zur Veranschaulichung

Wie viele Ausstrahlungen hatte eine Kampagne in einer Woche, auf vier Sendern

Ein Nutzungsszenario, ohne Kundendaten oder zugeordnete kommerzielle Ergebnisse.

Ausgangssituation

Ein Werbender möchte wissen, wie oft seine Werbung auf vier Sendern ausgestrahlt wurde, an welchen Tagen und zu welchen Uhrzeiten, mit Audio-Nachweis.

Wie es funktioniert

Die vier Streams werden in 30-Sekunden-Segmenten erfasst, als korrektes WAV validiert und in eine dauerhafte Warteschlange gestellt. Whisper transkribiert jedes Segment mit der automatisch erkannten Sprache. Der Detektor bewertet jedes Segment anhand der kommerziellen Signale und markiert, was 0,30 überschreitet, wobei er sich auf benachbarte Segmente über 0,20 ausdehnt, damit ein halbierter Werbespot vollständig bleibt. Die markierten Segmente werden über einen Text-Fingerabdruck gruppiert — 5-Wort-Fenster, die ersten 20 sortiert — und, wenn sich der Text zwischen den Sendern unterscheidet, über einen Audio-Fingerabdruck.

Rezultatul

Ein Cluster mit allen Vorkommen derselben Werbung, jeweils mit Sender, Datum, genauer Startzeit, Dauer, Transkription und abspielbarer Audiodatei. Eine CSV-Datei mit demselben Inhalt, gefiltert nach Zeitraum und Sender. Die Ausstrahlungszahl ist eine Untergrenze, keine Gesamtsumme: Beim gemessenen Recall werden einige Ausstrahlungen nicht erfasst, vor allem wenn die Werbung gesungen ist oder keine Telefonnummer, Website oder keinen Preis enthält.

Ce este necesar:Un server care rulează continuu în intervalul monitorizat — pe un laptop pornit câteva ore pe zi rezultatul e incomplet și înșelător. Peste 4 posturi, GPU. Și temeiul legal pentru captura și retenția fiecărui post, stabilit înainte de start.

Möglichkeiten der Zusammenarbeit

Radio-Monitor, im Kontext Ihrer Organisation.

Verarbeitung von Audioinhalten

Transkriptions- und Sprachgenerierungsprojekte auf Materialien, für die Nutzungsrechte und ein dokumentierter Zweck vorliegen.

Private Unternehmen

Wir definieren einen Pilot rund um einen realen Prozess: Nutzer, Daten, Integrationen, Kosten und Abnahmekriterien. Die Erweiterung erfolgt nach der Bewertung des Ergebnisses.

Institutionen und staatliche Unternehmen

Wir legen die Anforderungen an Zugänglichkeit, Hosting, Datenschutz und Interoperabilität fest. Jede Verbindung mit AGE- oder STISC-Diensten erfordert die Validierung der Berechtigung, des Zugriffs und der Genehmigungen.

Dies sind Anpassungsszenarien, keine Aussagen über bestehende Verträge oder Partnerschaften. Die vorgeschlagenen Funktionen werden im Arbeitsbereich des Projekts bestätigt.

Discută un pilot

Teil eines Ökosystems.

Was sollte bei Ihnen besser laufen?

Erzählen Sie uns von Ihrem Prozess. Gemeinsam legen wir fest, was sich zu bauen lohnt, was wir anbinden können und wie wir das Ergebnis prüfen.

Lassen Sie uns sprechen