Saltar para o conteúdo
megapromotingVamos falar
Produtos Monitor Radio

Análise de áudio e media Instrument specializat

De horas de áudio, fragmentos que você pode reencontrar.

Uma ferramenta para captura, transcrição e organização de anúncios de rádio. Agrupa fragmentos repetitivos e permite a sua revisão em conjunto com a fonte áudio.

  1. 1Captură audio
  2. 2Transcriere și grupare
  3. 3Revizuire fragmente
Schemă explicativă ·Monitor Radio

Monitor Radio

Da informação ao trabalho feito.

01

Capturează

Regista os fluxos configurados dentro dos limites dos direitos de utilização.

02

Transcreve e agrupa

Transforma áudio em texto e propõe o agrupamento dos fragmentos semelhantes.

03

Permite a verificação

A equipa pode voltar a ouvir os fragmentos e exportar a informação relevante.

Onde se torna útil.

Investigação de media

Exploração das mensagens e das repetições num período monitorizado.

Arquivo pesquisável

Localização dos fragmentos sem voltar a ouvir todo o material.

Análise de conteúdo

Transcrições e agrupamentos que podem ser corrigidos por uma pessoa.

A deteção e a transcrição automáticas podem errar. A disponibilidade das capturas e a cobertura são verificadas para cada fonte.

Monitor Radio em detalhe

O que você pode fazer com este projeto.

Monitor Radio responde a cinco perguntas sobre um anúncio ouvido na rádio: de que estação veio, a que hora exata começou, quanto durou, o que foi dito nele e onde está a prova áudio para verificação. A interface principal é um registo operacional de anúncios, não um ecrã de transcrição.

A cadeia é local e sem chaves obrigatórias: `ffmpeg` captura o fluxo, Whisper transcreve, um detetor com scoring transparente assinala segmentos que parecem um anúncio, e os anúncios repetitivos são agrupados por impressão digital de texto. Tudo fica num SQLite auditável, de onde se podem extrair CSV e o ficheiro áudio de cada anúncio.

O que deve ser dito antes de qualquer demonstração: a deteção não apanha tudo. A medição própria com base em dados reais dá um recall estimado de 30–50% dos anúncios que realmente estiveram no ar, e as causas são conhecidas e listadas. Quem vende monitorização de rádio como «apanhamos tudo» ou não mediu, ou não lhe diz.

01

Captura simultânea, com fila duradoura

Até 10 postos capturados em paralelo com `ffmpeg`, em segmentos de 30 de segundos, cada um validado como WAV correcto antes de entrar na fila. A fila vive na base de dados, com empréstimo de 300 de segundos, sinal de vida e máximo de 3 tentativas por job — se o processo cair, os jobs são recuperados em vez de se perderem. Existe também um modo contínuo, sem lacunas, que corta o fluxo directamente de `ffmpeg` e o assume através da monitorização da pasta.

02

Transcrição RO + RU

Dois motores permutáveis: Whisper através do seu próprio gateway (predefinido na configuração) ou `faster-whisper` local, em CPU com quantização int8, modelo `large-v3-turbo`, com filtro VAD e busca em feixe de 5. A língua é detectada automaticamente, o que conta no mercado moldavo, onde o mesmo posto alterna romeno com russo na mesma hora.

03

Detector com scoring visível

Cada segmento recebe um score entre 0 e 1, calculado a partir de sinais explícitos: palavras-chave comerciais em romeno e russo, a presença de um número de telefone, de um site, de um preço ou de uma chamada à acção, com penalização quando o texto parece uma notícia. Um segmento com duração entre 5 e 90 de segundos recebe um pequeno bónus. O limiar predefinido é 0,30, com extensão aos segmentos vizinhos acima de 0,20, para que uma publicidade cortada em duas partes não se perca. Os motivos do score são mantidos ao lado do score.

04

Agrupamento de anúncios repetitivos

A mesma publicidade transmitida dezenas de vezes é agrupada por impressão digital de texto: a transcrição é normalizada, é cortada em janelas sobrepostas de 5 palavras, são mantidas as primeiras 20 ordenadas e é feito um resumo criptográfico curto. Além disso, existe também impressão digital áudio por `chromaprint`, que agrupa a mesma publicidade transmitida em canais diferentes, onde as transcrições diferem.

05

Catálogo de marcas

86 marcas comerciais da Moldávia no catálogo inicial — retalho, bancos, telecomunicações, farmácias, automóvel, restaurantes — mais descoberta automática de novas marcas a partir de transcrições, com adição, eliminação, importação e exportação através da API.

06

Revisão humana e exportação

Cada publicidade pode ser marcada como confirmada, rejeitada ou incerta directamente na interface, com filtro e resumo destas estados. A exportação CSV respeita o filtro actual, e o áudio de cada publicidade pode ser ouvido novamente no browser no seu intervalo exacto.

07

Alertas e observabilidade

Três desencadeadores de alerta no Telegram: posto em baixo, atraso acima do limiar e aparecimento de uma marca acompanhada. Além disso, métricas Prometheus, verificação profunda de saúde e um endpoint de disponibilidade.

Dados e funcionamento

O que entra no sistema. O que deve ser verificado.

O que é efectivamente detectado, e o que não é
São bem detectadas as publicidades que dizem algo verificável: um telefone, um site, um preço, uma chamada à acção. Falham, por construção: as publicidades de imagem que são apenas marca + slogan, os patrocínios de programas, a promoção cruzada entre canais do mesmo grupo, as mensagens sociais, os jingles cantados (Whisper transcreve-os como poesia ou ruído), as publicidades com menos de 5 segundos e as com transcrição degradada por uma captura fraca.
Precisão medida, com dados reais
A auditoria própria de 25 de maio de 2026, na base de dados live com 5018 capturas e 7428 segmentos, deu 111 publicidades após a extensão. A distribuição dos scores: 80 segmentos acima de 0,50 (publicidades claramente identificadas), 29 entre 0,40 e 0,50, 193 entre 0,30 e 0,40 — verificados manualmente como sendo na sua maioria publicidades reais falhadas — 278 entre 0,20 e 0,30, 33 entre 0,10 e 0,20 e 6815 abaixo de 0,10, ou seja, música. Recall estimado no limiar de então, 0,40: 30–50%. O limiar foi depois reduzido para 0,30 precisamente com base nesta medição, o que aumenta o recall e aumenta também o número de falsos positivos a rever.
Porque não é uma medição completa de precisão
Para publicarmos um valor de precisão e de recall no sentido estrito da palavra, seriam necessários mais de 60 minutos de áudio etiquetado manualmente por post, comparado com a saída do sistema. O estudo está planeado, não feito. O que temos é uma distribuição de pontuações em dados reais, mais verificação manual em amostras — menos do que um benchmark, mais do que uma impressão, e é importante não confundir as duas coisas.
A cobertura temporal é a limitação real
Na janela auditada, as capturas cobriram três intervalos de aproximadamente 80 horas possíveis — o resto, o monitor desligado. Isso, e não o detector, é a principal razão pela qual a base tinha 111 anúncios e não milhares. Um resultado útil exige operação contínua num servidor, não num laptop. Um detalhe que diz respeito ao mercado e está correto: entre 00:00 e 05:00, o resultado de zero anúncios não é um erro — as rádios moldavas passam música sem publicidade nesse intervalo.
A capacidade de transcrição é o gargalo
Num Mac com Apple Silicon, em CPU, `large-v3-turbo` com um único worker funciona a cerca de metade do tempo real: cerca de 2 segmentos por minuto processados contra 4 produzidos por 4 estações. A fila enche-se, a pressão propaga-se para trás e a captura abranda — o comportamento correto, porque não perdemos áudio. Para 10 estações contínuas é necessário GPU, 2–4 workers ou segmentos mais longos, de 60–120 segundos.
O que é armazenado e durante quanto tempo
Áudio WAV em disco, com limpeza automática de ficheiros com mais de 48 horas; as transcrições, os segmentos, os anúncios e os clusters permanecem na base de dados. Ou seja, a prova áudio de um anúncio fica disponível durante dois dias se o prazo não for alterado, e o texto permanece.
Direitos sobre as gravações — não estabelecidos
No projeto não existe qualquer documento de direitos ou de licenciamento: a única menção de licença é `license = { text = "Private" }` na configuração do pacote. Os fluxos na configuração de referência são fluxos públicos de escuta de estações da Moldávia. A gravação e a retenção de uma emissão para análise não são o mesmo que ouvi-la, e quem paga a monitorização tem de ter a base legal para captura e retenção — para cada estação. Isso esclarece-se antes da primeira instalação, não depois; nós não podemos transferir um direito que não temos.

Da exploração à implementação

Como preparamos um projeto com Monitor Radio.

01

1. Fixamos as estações e a janela

Escolhem-se as estações a acompanhar, verifica-se cada fluxo com a sondagem incluída (`probe-streams`) e define-se o intervalo horário monitorizado. Uma estação que não responde fica desativada na configuração até ser verificada, não adicionada na esperança.

02

2. Clarificamos a base para captura e retenção

Quem detém o direito de gravar a emissão e durante quanto tempo pode ser guardada. É a etapa que mais frequentemente é omitida e a única que não se pode corrigir tecnicamente depois.

03

3. Dimensionamos o hardware de acordo com o número de estações

Abaixo de 4 estações funciona em CPU. A partir de 4, a transcrição torna-se o gargalo: ou GPU, ou 2–4 workers, ou segmentos mais longos. A pressão inversa é concebida para abrandar a captura, não para perder áudio — mas um backlog de 30 minutos significa alertas com 30 minutos de atraso.

04

4. Calibramos o limiar com revisão humana

O limiar predefinido é 0,30. Mais baixo significa mais anúncios apanhados e mais falsos positivos para assinalar; mais alto, o inverso. A calibração faz-se com os anúncios confirmados e rejeitados manualmente na primeira semana, não por intuição.

05

5. Definimos o relatório que conta

O que é preciso obter: aparições por marca, por programa, por intervalo, com link para o áudio. A exportação CSV e o relatório diário são o ponto de partida; a forma final decide-se depois de se ver que perguntas a equipa efetivamente coloca.

Perguntas que vale a pena esclarecer.

Apanha todos os anúncios?

Não, e o número está medido com dados reais: recall estimado de 30–50% no limiar usado na auditoria. O que falha é previsível — anúncios que são apenas marca mais slogan sem telefone, site ou preço; jingles cantados, que o Whisper transcreve como ruído; patrocínios de programas; anúncios com menos de 5 segundos. O que apanha bem são os anúncios que dizem algo verificável, ou seja, a maioria dos que têm oferta.

Que precisão têm, exatamente?

Ainda não temos um valor de precisão em sentido estrito, e é mais honesto dizê-lo do que inventar um. O que temos é uma distribuição de pontuações medida numa base real de 5018 capturas e 7428 segmentos, com 111 anúncios identificados, mais verificação manual em amostras. Dela resultou a constatação útil: 193 segmentos ficavam entre 0,30 e 0,40 e eram, na maioria, anúncios reais falhados — motivo pelo qual o limiar foi baixado para 0,30. Um valor real de precisão e recall exige 60+ minutos de áudio etiquetado manualmente em cada estação; é um trabalho separado, com custo e duração.

Diz-me quantas pessoas ouviram o anúncio?

Não. Uma captura de áudio prova que a mensagem foi difundida, a que horas e quanto durou. A audiência é uma medição completamente diferente, feita por institutos de medição com painel — não se deduz do facto de um microfone digital ter ouvido algo. O que oferecemos é o número de difusões, a hora, a estação e a prova áudio.

De que direitos preciso para gravar as estações?

É a pergunta a que o projeto ainda não tem resposta escrita — no repositório não existe qualquer documento de direitos, e isso é uma falta, não uma omissão de comunicação. Os fluxos monitorizados são públicos para escuta, mas a gravação e retenção de uma emissão para análise não é a mesma coisa que a escuta. A base legal para captura e retenção é definida para cada estação antes da instalação, juntamente com o jurista do beneficiário. O que podemos fazer tecnicamente é reduzir a exposição: o áudio é apagado automaticamente após 48 horas, e o texto e os metadados ficam.

Funciona com a língua russa?

Sim. A língua é detetada automaticamente, e o detetor tem conjuntos separados de palavras-chave para romeno e russo, com testes próprios para cada um. O caso que ainda estraga o resultado: se a língua for fixada à força para romeno na configuração, um anúncio em russo é transcrito de forma deformada e o score cai abaixo do limiar. A deteção automática é a configuração correta nas estações mistas.

Quantas estações pode seguir em simultâneo?

A captura suporta 10 em paralelo; a transcrição é o limite. Num Mac, em CPU, com um worker, processa-se cerca de metade do tempo real — ou seja, 4 estações produzem mais depressa do que conseguimos transcrever, e a fila cresce. O sistema não perde áudio nessa situação (abranda a captura de forma controlada), mas os resultados atrasam-se. Para 10 estações em tempo quase real é preciso GPU ou segmentos mais longos.

Posso ouvir de novo o anúncio para verificar?

Sim, e foi projetado exatamente para isso: cada anúncio tem um ficheiro de áudio associado, reproduzível no browser no seu intervalo exato, além da transcrição e dos segmentos vizinhos. Uma análise de monitorização que não pode ser verificada na fonte não vale nada numa conversa com um cliente ou com uma estação.

Está a correr algures agora?

Não continuamente. É uma plataforma local, completa e testada — 81 testes automáticos passam — mas a auditoria própria diz sem rodeios que o monitor não corre 24/7 em lado nenhum. Existe ficheiro de arranque automático para macOS e configuração Docker com perfil GPU; o que falta é o servidor onde a colocar e o teste de aceitação em 10 estações durante 2 horas, para o qual o harness já está escrito.

Exemplo ilustrativo

Quantas difusões teve uma campanha numa semana, em quatro estações

Um cenário de utilização, sem dados de cliente nem resultados comerciais atribuídos.

Situação inicial

Um anunciante quer saber quantas vezes o seu anúncio foi difundido em quatro estações, em que dias e a que horas, com prova áudio.

Como funciona

Os quatro fluxos são capturados em segmentos de 30 segundos, validados como WAV correto e colocados numa fila durável. O Whisper transcreve cada segmento com a língua detetada automaticamente. O detector atribui uma pontuação a cada segmento com base nos sinais comerciais e assinala o que ultrapassa 0,30, expandindo para os segmentos vizinhos acima de 0,20 para que um anúncio cortado em dois continue inteiro. Os segmentos assinalados são agrupados por impressão digital de texto — janelas de 5 palavras, as primeiras 20 ordenadas — e, onde o texto difere entre estações, por impressão digital de áudio.

Rezultatul

Um cluster com todas as ocorrências do mesmo anúncio, cada uma com a estação, a data, a hora exata de início, a duração, a transcrição e o ficheiro áudio reproduzível. Um CSV com o mesmo conteúdo, filtrado por intervalo e estação. O número de difusões é um limite inferior, não um total: no recall medido, uma parte das difusões não é apanhada, sobretudo se o anúncio for cantado ou não contiver telefone, site ou preço.

Ce este necesar:Un server care rulează continuu în intervalul monitorizat — pe un laptop pornit câteva ore pe zi rezultatul e incomplet și înșelător. Peste 4 posturi, GPU. Și temeiul legal pentru captura și retenția fiecărui post, stabilit înainte de start.

Possibilidades de colaboração

Monitor Radio, no contexto da sua organização.

Processamento de conteúdo áudio

Projetos de transcrição e geração vocal em materiais para os quais existem direitos de utilização e uma finalidade documentada.

Empresas privadas

Definimos um piloto em torno de um processo real: utilizadores, dados, integrações, custos e critérios de aceitação. A expansão segue após a avaliação do resultado.

Instituições e empresas públicas

Estabelecemos os requisitos de acessibilidade, alojamento, proteção de dados e interoperabilidade. Qualquer ligação a serviços AGE ou STISC requer a validação da elegibilidade, do acesso e das aprovações.

Estes são cenários de adaptação, não declarações sobre contratos ou parcerias existentes. As funções propostas confirmam-se no âmbito de trabalho do projeto.

Fale sobre um piloto

Parte de um ecossistema.

O que gostaria que funcionasse melhor?

Conte-nos o seu processo. Em conjunto decidimos o que vale a pena construir, o que podemos ligar e como verificamos o resultado.

Vamos falar