A Meta apresentou nesta terça-feira (1) o Muse Voice Transcribe, seu primeiro modelo de inteligência artificial (IA) voltado à percepção de áudio em tempo real. A tecnologia consegue transcrever conversas enquanto elas acontecem, distinguir quem está falando e lidar com mais de 20 pessoas simultaneamente.
O modelo foi desenvolvido pelo Meta Superintelligence Labs (MSL) e também consegue trabalhar com diferentes idiomas em uma mesma conversa. Segundo a empresa, ele foi treinado com mais de 70 idiomas, sendo que 25 deles foram amplamente validados para o lançamento.
Uma das características mais interessantes do Muse Voice Transcribe é a capacidade de realizar o chamado code-switching, quando uma pessoa alterna entre idiomas durante uma conversa. A tecnologia consegue reconhecer essa mudança mesmo no meio de uma frase.
Em uma demonstração divulgada pela Meta, oito pessoas conversam simultaneamente e o sistema consegue identificar cada participante e associar corretamente suas falas. A IA também consegue lidar com interrupções, sobreposição de vozes e diferentes sotaques.
A tecnologia combina três funções principais em um único modelo: reconhecimento automático de fala em fluxo contínuo (ASR, na sigla em inglês), identificação dos diferentes participantes da conversa, conhecida como speaker diarization, e identificação dos momentos em que uma fala começa ou termina.
O Muse Voice Transcribe processa o áudio em blocos de 80 milissegundos.
