Separador de Faixas

Separação de faixas com IA: o que é e como o Demucs funciona

Publicado em 4 de outubro de 2026

Quando uma música é gravada, cada instrumento costuma ficar numa faixa própria. Na mixagem, todas essas faixas são somadas em um único arquivo estéreo, e essa soma não guarda a informação de quem tocou o quê. Separar as faixas depois, só a partir da música pronta, é um problema que a área de áudio chama de separação de fontes. Até poucos anos atrás, ninguém fazia isso com boa qualidade.

Por que é tão difícil

Instrumentos diferentes ocupam as mesmas frequências ao mesmo tempo. O bumbo e o baixo dividem os graves; a voz, a guitarra e o piano disputam os médios. Truques antigos, como inverter a fase de um canal para cancelar o que está no centro do estéreo, funcionam mal porque muita coisa além da voz também fica no centro.

Como a IA resolve

Modelos de aprendizado de máquina aprendem a separar ouvindo milhares de músicas das quais se conhece a resposta certa, isto é, as faixas originais de cada instrumento. Durante o treino, o modelo tenta separar a mixagem, compara o que produziu com as faixas reais e ajusta seus parâmetros para errar menos. Depois de muito treino, ele aprende padrões: o ataque de uma caixa, os harmônicos de uma voz, o timbre de um baixo.

O que é o Demucs

O Demucs é um modelo de separação de fontes criado pela equipe de pesquisa da Meta e publicado como código aberto, sob licença MIT. A versão usada aqui, a Hybrid Transformer Demucs, combina duas formas de enxergar o som:

Um bloco do tipo transformer, a mesma família de técnica usada em modelos de linguagem, liga as duas visões e permite que o modelo use o contexto de vários segundos de música para decidir a que instrumento cada som pertence.

A variante htdemucs_6s separa seis fontes: vocal, bateria, baixo, guitarra, piano e outros. Ela é um pouco menos precisa que as versões de quatro fontes nas faixas de guitarra e piano, mas permite estudar esses instrumentos isoladamente.

Por que roda no seu navegador

Normalmente esse tipo de modelo roda em servidores com placas de vídeo potentes. Aqui, ele foi convertido para o formato ONNX e roda com o ONNX Runtime diretamente no navegador:

A grande vantagem é a privacidade: o arquivo original nunca sai do seu computador. Só as faixas já separadas, comprimidas, ficam guardadas na sua conta, de forma privada.

Limites da tecnologia

Mesmo os melhores modelos deixam algum vazamento: um resto de voz na faixa instrumental, um pouco de bumbo no baixo. Reverbs longos, mixagens muito densas e arquivos de baixa qualidade aumentam esses artefatos. Para estudo, ensaio e transcrição, o resultado costuma ser excelente; para um lançamento profissional, as faixas originais do estúdio continuam sendo insubstituíveis.

Para saber mais

O código e os artigos científicos do Demucs estão no repositório oficial no GitHub. Para aplicar na prática, comece pelo guia Como tirar a voz de uma música.

Leia também

Próximo guia: Faixas separadas e direitos autorais: o que você pode fazer