Przejdź do treści
megapromotingPorozmawiajmy
Produkty Monitor Radio

Analiză audio & media Instrument specializat

Z godzin audio, fragmenty, które można odnaleźć.

Narzędzie do przechwytywania, transkrypcji i organizowania reklam radiowych. Grupuje powtarzające się fragmenty i pozwala na ich przegląd wraz ze źródłem audio.

  1. 1Captură audio
  2. 2Transcriere și grupare
  3. 3Revizuire fragmente
Schemă explicativă ·Monitor Radio

Monitor Radio

Od informacji do wykonanej pracy.

01

Capturează

Nagrywaj skonfigurowane strumienie w granicach praw użytkowania.

02

Transkrybuj i grupuj

Przekształca audio w tekst i proponuje grupowanie podobnych fragmentów.

03

Umożliwia weryfikację

Zespół może ponownie odsłuchać fragmenty i wyeksportować istotne informacje.

Gdzie staje się przydatny.

Badania mediów

Analiza wiadomości i powtórzeń w śledzonym okresie.

Archiwum z wyszukiwaniem

Odnajdywanie fragmentów bez ponownego odsłuchiwania całego materiału.

Analiza treści

Transkrypcje i grupowania, które mogą zostać poprawione przez człowieka.

Automatyczna detekcja i transkrypcja mogą się mylić. Dostępność nagrań i pokrycie są sprawdzane dla każdego źródła.

Monitor Radio w szczegółach

Co możesz zrobić z tym projektem.

Monitor Radio odpowiada na pięć pytań o reklamę usłyszaną w radiu: z jakiej stacji pochodziła, o której dokładnie się zaczęła, jak długo trwała, co w niej powiedziano i gdzie jest dowód audio do weryfikacji. Główny interfejs to operacyjny dziennik reklam, a nie ekran transkrypcji.

Łańcuch jest lokalny i bez obowiązkowych kluczy: `ffmpeg` przechwytuje strumień, Whisper transkrybuje, detektor z przejrzystym scoringiem oznacza segmenty wyglądające na reklamę, a powtarzalne reklamy są grupowane przez odcisk tekstu. Wszystko trafia do audytowalnej bazy SQLite, z której można wyeksportować CSV i plik audio każdej reklamy.

Co trzeba powiedzieć przed jakąkolwiek demonstracją: detekcja nie wychwytuje wszystkiego. Własny pomiar na rzeczywistej bazie danych daje szacowany recall 30–50% reklam, które faktycznie były w eterze, a przyczyny są znane i wymienione. Kto sprzedaje monitoring radiowy jako „wychwytujemy wszystko”, albo nie mierzył, albo nie mówi prawdy.

01

Jednoczesne przechwytywanie z trwałą kolejką

Do 10 stacji przechwytywanych równolegle przez `ffmpeg`, w segmentach po 30 sekund, każdy walidowany jako poprawny WAV przed trafieniem do kolejki. Kolejka żyje w bazie danych, z czasem wypożyczenia 300 sekund, sygnałem życia i maksymalnie 3 próbami na job — jeśli proces padnie, joby są odzyskiwane zamiast ginąć. Istnieje też tryb ciągły, bez przerw, który tnie strumień bezpośrednio z `ffmpeg` i przejmuje go przez śledzenie folderu.

02

Transkrypcja RO + RU

Dwa wymienne silniki: Whisper przez własny gateway (domyślnie w konfiguracji) albo lokalny `faster-whisper`, na CPU z kwantyzacją int8, modelem `large-v3-turbo`, z filtrem VAD i wyszukiwaniem z wiązką 5. Język jest wykrywany automatycznie, co ma znaczenie na rynku mołdawskim, gdzie ta sama stacja w tej samej godzinie przeplata rumuński z rosyjskim.

03

Widoczny detektor z scoringiem

Każdy segment otrzymuje wynik od 0 do 1, obliczany z jawnych sygnałów: komercyjnych słów kluczowych po rumuńsku i rosyjsku, obecności numeru telefonu, strony internetowej, ceny albo wezwania do działania, z karą, gdy tekst wygląda jak wiadomość. Segment o długości od 5 do 90 sekund otrzymuje mały bonus. Domyślny próg to 0,30, z rozszerzeniem do sąsiednich segmentów powyżej 0,20, aby reklama przecięta na dwie części nie zniknęła. Powody wyniku są zachowywane obok wyniku.

04

Grupowanie powtarzalnych reklam

Ta sama reklama emitowana dziesiątki razy jest grupowana przez odcisk tekstu: transkrypcja jest normalizowana, cięta na nakładające się okna po 5 słów, zachowywane są pierwsze 20 posortowane i tworzony jest krótki skrót kryptograficzny. Ponadto istnieje też odcisk audio przez `chromaprint`, który grupuje tę samą reklamę emitowaną na różnych stacjach, gdzie transkrypcje się różnią.

05

Katalog marek

86 marek handlowych z Mołdawii w katalogu początkowym — retail, banki, telekomy, apteki, motoryzacja, restauracje — plus automatyczne wykrywanie nowych marek z transkrypcji, z dodawaniem, usuwaniem, importem i eksportem przez API.

06

Ręczna weryfikacja i eksport

Każda reklama może być oznaczona jako potwierdzona, odrzucona albo niepewna bezpośrednio z interfejsu, z filtrem i podsumowaniem według tych stanów. Eksport CSV respektuje bieżący filtr, a audio każdej reklamy można odsłuchać ponownie w przeglądarce w jej dokładnym przedziale.

07

Alertowanie i obserwowalność

Trzy wyzwalacze alertów w Telegramie: padnięta stacja, opóźnienie powyżej progu i pojawienie się śledzonej marki. Ponadto metryki Prometheus, głęboka kontrola zdrowia i endpoint dostępności.

Dane i działanie

Co trafia do systemu. Co trzeba sprawdzić.

Co jest faktycznie wykrywane, a czego nie
Dobrze wykrywane są reklamy, które mówią coś weryfikowalnego: telefon, stronę internetową, cenę, wezwanie do działania. Pomijane są, z założenia: reklamy wizerunkowe, które są tylko marką i sloganem, sponsorowanie audycji, promocja krzyżowa między stacjami tej samej grupy, komunikaty społeczne, śpiewane jingle (Whisper transkrybuje je jako poezję albo szum), reklamy krótsze niż 5 sekund oraz te z transkrypcją zdegradowaną przez słabe nagranie.
Zmierzona dokładność, na rzeczywistych danych
Własny audyt z 25 maja 2026, na żywej bazie danych z 5018 nagraniami i 7428 segmentami, dał 111 reklam po rozszerzeniu. Rozkład wyników: 80 segmentów powyżej 0,50 (reklamy jednoznacznie zidentyfikowane), 29 między 0,40 a 0,50, 193 między 0,30 a 0,40 — ręcznie zweryfikowane jako w większości rzeczywiste pominięte reklamy — 278 między 0,20 a 0,30, 33 między 0,10 a 0,20 oraz 6815 poniżej 0,10, czyli muzyka. Szacowany recall przy ówczesnym progu 0,40: 30–50%. Próg został później obniżony do 0,30 właśnie na podstawie tego pomiaru, co zwiększa recall i zwiększa też liczbę fałszywych pozytywów do przejrzenia.
Dlaczego to nie jest pełny pomiar dokładności
Aby opublikować liczbę dokładności i recall w ścisłym znaczeniu tego słowa, trzeba byłoby 60+ minut ręcznie oznaczonego audio na stację, porównanego z wyjściem systemu. Badanie jest planowane, nie wykonane. To, co mamy, to rozkład wyników na rzeczywistych danych plus ręczna weryfikacja na próbkach — mniej niż benchmark, więcej niż wrażenie, i ważne jest, by tych dwóch rzeczy nie mylić.
Pokrycie czasowe to rzeczywiste ograniczenie
W audytowanym oknie nagrania pokryły trzy przedziały z około 80 możliwych godzin — resztę, monitor wyłączony. To, nie detektor, jest głównym powodem, dla którego baza miała 111 reklam, a nie tysiące. Użyteczny rezultat wymaga ciągłej pracy na serwerze, a nie na laptopie. Jeden szczegół związany z rynkiem i poprawny: między 00:00 a 05:00 wynik zero reklam nie jest błędem — mołdawskie radia puszczają wtedy muzykę bez reklam.
Pojemność transkrypcji jest wąskim gardłem
Na Macu z Apple Silicon, na CPU, `large-v3-turbo` z jednym workerem działa z około połową czasu rzeczywistego: około 2 segmentów na minutę przetwarzanych wobec 4 produkowanych przez 4 stanowiska. Kolejka się zapełnia, presja propaguje się wstecz i przechwytywanie zwalnia — to poprawne zachowanie, bo nie tracimy audio. Dla 10 stanowisk ciągle potrzebny jest GPU, 2–4 workery albo dłuższe segmenty, 60–120 sekund.
Co jest przechowywane i jak długo
Audio WAV na dysku, z domyślnym czyszczeniem plików starszych niż 48 godzin; transkrypcje, segmenty, reklamy i klastry pozostają w bazie danych. To znaczy, że dowód audio reklamy jest dostępny przez dwa dni, jeśli termin nie zostanie zmieniony, a tekst pozostaje.
Prawa do nagrań — nieustalone
W projekcie nie ma żadnego dokumentu dotyczącego praw ani licencjonowania: jedyna wzmianka o licencji to `license = { text = "Private" }` w konfiguracji pakietu. Strumienie w konfiguracji referencyjnej to publiczne strumienie nasłuchowe stacji z Mołdawii. Nagrywanie i przechowywanie emisji do analizy nie jest tym samym co jej słuchanie, a osoba płacąca za monitoring musi mieć podstawę prawną do przechwytywania i retencji — dla każdej stacji. To ustala się przed pierwszą instalacją, nie po niej; nie możemy przekazać prawa, którego nie mamy.

Od eksploracji do wdrożenia

Jak przygotowujemy projekt z Monitor Radio.

01

1. Ustalamy stacje i okno

Wybiera się stacje do monitorowania, sprawdza każdy strumień za pomocą wbudowanego sondowania (`probe-streams`) i ustala monitorowany przedział czasowy. Stacja, która nie odpowiada, pozostaje wyłączona w konfiguracji, dopóki nie zostanie sprawdzona, a nie dodana w nadziei.

02

2. Wyjaśniamy podstawę dla przechwytywania i retencji

Kto ma prawo nagrywać emisję i jak długo może być przechowywana. To krok, który najczęściej jest pomijany, i jedyny, którego nie da się naprawić technicznie później.

03

3. Dobieramy hardware do liczby stacji

Poniżej 4 stacji działa na CPU. Od 4 wzwyż transkrypcja staje się wąskim gardłem: albo GPU, albo 2–4 workery, albo dłuższe segmenty. Presja wsteczna jest zaprojektowana tak, by spowalniać przechwytywanie, a nie tracić audio — ale backlog 30 minut oznacza alerty z opóźnieniem 30 minut.

04

4. Kalibrujemy próg z udziałem człowieka

Domyślny próg to 0,30. Niżej oznacza więcej przechwyconych reklam i więcej fałszywych pozytywów do odznaczenia; wyżej, odwrotnie. Kalibrację wykonuje się na reklamach potwierdzonych i odrzuconych ręcznie w pierwszym tygodniu, a nie z intuicji.

05

5. Definiujemy raport, który ma znaczenie

Co dokładnie ma wyjść: wystąpienia według marki, stacji, przedziału, z linkiem do audio. Eksport CSV i raport dzienny są punktem wyjścia; ostateczna forma jest ustalana po tym, jak zobaczy się, jakie pytania faktycznie zadaje zespół.

Pytania, które warto wyjaśnić.

Czy przechwytuje wszystkie reklamy?

Nie, i tę liczbę mamy zmierzoną na rzeczywistych danych: szacowany recall 30–50% przy progu używanym w audycie. To, co pomija, jest przewidywalne — reklamy będące tylko marką i sloganem, bez telefonu, strony internetowej ani ceny; śpiewane jingle, które Whisper transkrybuje jako szum; sponsoring programów; reklamy poniżej 5 sekund. Dobrze wykrywa reklamy, które mówią coś weryfikowalnego, czyli większość tych z ofertą.

Jaka dokładnie jest wasza precyzja?

Nie mamy jeszcze liczby precyzji w ścisłym sensie i uczciwiej jest to powiedzieć, niż ją wymyślać. Mamy rozkład wyników zmierzony na rzeczywistej bazie 5018 przechwyceń i 7428 segmentów, z 111 zidentyfikowanymi reklamami, plus ręczną weryfikację na próbkach. Z tego wynikła użyteczna obserwacja: 193 segmenty mieściły się między 0,30 a 0,40 i w większości były prawdziwymi przeoczonymi reklamami — dlatego próg obniżono do 0,30. Rzeczywista liczba precyzji i recall wymaga ponad 60 minut ręcznie oznaczonego audio na każdą stację; to osobna praca, z kosztami i czasem trwania.

Czy powie mi, ile osób usłyszało reklamę?

Nie. Przechwycenie audio dowodzi, że komunikat został nadany, o której godzinie i jak długo trwał. Zasięg to zupełnie inny pomiar, wykonywany przez instytuty badawcze z panelem — nie wynika z faktu, że cyfrowy mikrofon coś usłyszał. Oferujemy liczbę emisji, godzinę, stację i dowód audio.

Jakich praw potrzebuję, żeby nagrywać stacje?

To pytanie, na które projekt nie ma jeszcze pisemnej odpowiedzi — w repozytorium nie ma żadnego dokumentu prawnego i to jest brak, a nie pominięcie komunikacyjne. Monitorowane strumienie są publiczne do słuchania, ale nagrywanie i przechowywanie emisji do analizy nie jest tym samym co słuchanie. Podstawa prawna dla przechwytywania i retencji ustalana jest dla każdej stacji przed instalacją, wspólnie z prawnikiem beneficjenta. Technicznie możemy ograniczyć ekspozycję: audio jest automatycznie usuwane po 48 godzinach, a tekst i metadane pozostają.

Działa z językiem rosyjskim?

Tak. Język jest wykrywany automatycznie, a detektor ma oddzielne zestawy słów kluczowych dla rumuńskiego i rosyjskiego, z własnymi testami dla każdego. Przypadek, który nadal psuje wynik: jeśli język jest na sztywno ustawiony na rumuński w konfiguracji, reklama po rosyjsku jest transkrybowana zniekształcone i wynik spada poniżej progu. Automatyczne wykrywanie to właściwe ustawienie na stacjach mieszanych.

Ile stacji można śledzić jednocześnie?

Przechwytywanie obsługuje 10 równolegle; ograniczeniem jest transkrypcja. Na Macu, na CPU, z jednym workerem, przetwarza się mniej więcej połowę czasu rzeczywistego — czyli 4 stacje generują szybciej, niż udaje się je transkrybować, a kolejka rośnie. System nie traci audio w takiej sytuacji (kontrolowanie spowalnia przechwytywanie), ale wyniki się opóźniają. Dla 10 stacji w czasie bliskim rzeczywistemu potrzebny jest GPU albo dłuższe segmenty.

Czy mogę odtworzyć reklamę ponownie, żeby sprawdzić?

Tak, i właśnie do tego jest zaprojektowane: każda reklama ma powiązany plik audio, odtwarzalny w przeglądarce w dokładnym swoim zakresie, plus transkrypcję i sąsiednie segmenty. Analiza monitoringu, której nie da się zweryfikować u źródła, nic nie znaczy w rozmowie z klientem lub ze stacją.

Czy działa gdzieś teraz?

Nie w sposób ciągły. To lokalna, kompletna i przetestowana platforma — 81 testów automatycznych przechodzi — ale własny audyt mówi bez ogródek, że monitor nie działa 24/7 nigdzie. Istnieje plik autostartu dla macOS i konfiguracja Docker z profilem GPU; brakuje serwera, na którym miałby działać, oraz testu akceptacyjnego na 10 stacjach przez 2 godziny, dla którego harness jest już napisany.

Przykład ilustracyjny

Ile emisji miała kampania w ciągu tygodnia, na czterech stacjach

Scenariusz użycia, bez danych klienta ani przypisanych wyników handlowych.

Sytuacja początkowa

Ogłaszający chce wiedzieć, ile razy jego reklama została nadana na czterech stacjach, w jakie dni i o jakich godzinach, z dowodem audio.

Jak to działa

Cztery strumienie są przechwytywane w segmentach po 30 sekund, walidowane jako poprawny WAV i wrzucane do trwałej kolejki. Whisper transkrybuje każdy segment z automatycznie wykrytym językiem. Detektor ocenia każdy segment pod kątem sygnałów komercyjnych i oznacza to, co przechodzi ponad 0,30, rozszerzając na sąsiednie segmenty powyżej 0,20, żeby reklama przecięta na pół pozostała cała. Oznaczone segmenty są grupowane przez odcisk tekstowy — okna po 5 słów, pierwsze 20 posortowanych — oraz, tam gdzie tekst różni się między stacjami, przez odcisk audio.

Rezultatul

Klaster ze wszystkimi wystąpieniami tej samej reklamy, każde z kanałem, datą, dokładną godziną rozpoczęcia, czasem trwania, transkrypcją i odtwarzalnym plikiem audio. Plik CSV z tą samą zawartością, przefiltrowany według przedziału i kanału. Liczba emisji jest dolnym progiem, a nie sumą: przy zmierzonej recall część emisji nie jest uchwycona, zwłaszcza jeśli reklama jest śpiewana albo nie zawiera telefonu, strony internetowej lub ceny.

Ce este necesar:Un server care rulează continuu în intervalul monitorizat — pe un laptop pornit câteva ore pe zi rezultatul e incomplet și înșelător. Peste 4 posturi, GPU. Și temeiul legal pentru captura și retenția fiecărui post, stabilit înainte de start.

Możliwości współpracy

Monitor Radio, w kontekście Twojej organizacji.

Przetwarzanie treści audio

Projekty transkrypcji i generowania głosu na materiałach, do których istnieją prawa użytkowania oraz udokumentowany cel.

Firmy prywatne

Definiujemy pilotaż wokół realnego procesu: użytkownicy, dane, integracje, koszty i kryteria akceptacji. Rozszerzenie następuje po ocenie wyniku.

Instytucje i spółki państwowe

Ustalamy wymagania dotyczące dostępności, hostingu, ochrony danych i interoperacyjności. Każde połączenie z usługami AGE lub STISC wymaga walidacji kwalifikowalności, dostępu i zatwierdzeń.

To są scenariusze adaptacji, a nie oświadczenia o istniejących umowach lub partnerstwach. Proponowane funkcje są potwierdzane w zakresie pracy projektu.

Discută un pilot

Część ekosystemu.

Co chcesz, żeby działało lepiej?

Opowiedz nam o swoim procesie. Wspólnie ustalimy, co warto zbudować, co da się połączyć i jak sprawdzimy wynik.

Porozmawiajmy