IA & InovaçãoNews
Tendência

Nvidia lança Nemotron 3 Diarization para identificar até oito vozes em uma mesma gravação

Modelo aberto foi desenvolvido para separar diferentes participantes em conteúdos de áudio e registrou taxa de erro de 14,72% nos testes divulgados.

A Nvidia disponibilizou o Nemotron 3 Diarization, modelo aberto de inteligência artificial desenvolvido para identificar e separar diferentes pessoas falando em uma mesma gravação. A tecnologia consegue trabalhar com áudios que tenham até oito vozes distintas.

A diarização é utilizada para responder à pergunta “quem falou e quando?” em uma gravação. A tecnologia pode facilitar a transcrição de reuniões, entrevistas, podcasts, chamadas e atendimentos, principalmente quando várias pessoas participam da mesma conversa.

Segundo os resultados divulgados, o Nemotron 3 Diarization alcançou uma taxa de erro de 14,72%. A proposta é oferecer uma ferramenta que possa ser incorporada por desenvolvedores a diferentes aplicações de processamento e análise de áudio.

A tecnologia também pode ser combinada com sistemas de reconhecimento de fala, permitindo gerar transcrições nas quais cada trecho seja associado ao participante correto. Com isso, modelos desse tipo ganham espaço em ferramentas de produtividade, centrais de atendimento e sistemas baseados em agentes de IA.

Artigos relacionados

Deixe um comentário

O seu endereço de e-mail não será publicado. Campos obrigatórios são marcados com *

Botão Voltar ao topo