Pular para o conteúdo principal
Inteligência Artificial AplicadaReconhecimento automático da fala

AnotaAI

Pipeline local e auditável para transcrição e estruturação temporal de registros audiovisuais.

Ambiente computacional funcional que adquire mídias heterogêneas, normaliza o áudio com FFmpeg[1], executa reconhecimento da fala com Whisper[2] e produz texto, legendas e segmentos temporalmente rastreáveis. A arquitetura estabelece a base para uma futura camada de diarização[3], ainda não implementada.

LocalInferência com Whisper
7Modelos Selecionáveis
3Artefatos de Saída
CPUExecução Atual Padrão
Problema e contribuição

Transformar fala em registro verificável

Uma transcrição útil em contexto institucional não deve ser apenas um bloco de texto. Ela precisa preservar temporalidade, origem, possibilidade de revisão e ligação com o conteúdo audiovisual. O desafio se amplia diante de ruído, diferentes formatos, arquivos extensos e múltiplos interlocutores.

Contribuição tecnológica atual

O AnotaAI consolida aquisição, pré-processamento, inferência e materialização dos resultados em um único fluxo executável. Os intervalos de início e fim de cada segmento fornecem a rastreabilidade necessária para revisão humana e para a futura associação entre fala e interlocutor.

Matriz de maturidade tecnológica

Limitações metodológicas e roadmap

Responsável técnico