22 de maio de 2026
Como extrair vocais de uma música: métodos, passos e o que esperar
Guia completo para extrair vocais de qualquer música no Mac ou iPhone. Métodos com IA, fluxo passo a passo, dicas de qualidade e perguntas frequentes.
Este guia percorre todos os métodos práticos para extrair vocais de uma música, com maior detalhe na abordagem nativa para Mac que mantém os teus ficheiros em privado. No final, vais saber qual método se adequa à tua situação, quais os passos a seguir, o que afeta a qualidade do resultado e o que podes fazer com as faixas (stems) depois de as teres.
Três formas de extrair vocais de uma música
Apps com IA que correm no teu dispositivo
Esta é a melhor opção para utilizadores de Mac em 2026. As apps de IA no dispositivo utilizam um modelo de separação de fontes de áudio treinado que corre completamente na tua máquina. O teu ficheiro nunca abandona o teu Mac, não é necessária nenhuma conta e o processamento é rápido porque os chips Apple Silicon modernos têm hardware dedicado exatamente para este tipo de computação.
A qualidade do resultado da IA no dispositivo iguala ou supera a maioria das ferramentas na nuvem nos seus planos pagos. Obtens duas faixas: uma faixa de vocais e uma faixa instrumental. A qualidade varia consoante a gravação, mas em música comercial moderna os resultados são genuinamente utilizáveis para sampling, remixes, prática e karaoke.
SongSplit AI é a principal app desta categoria para Mac e iPhone. É uma compra única, funciona offline e suporta todos os formatos de áudio sem DRM que o macOS consegue reproduzir.
Ferramentas web na nuvem
Se precisas apenas de um resultado rápido e não estás a trabalhar com material sensível, as ferramentas web são convenientes. As mais utilizadas são vocalremover.org, LALAL.AI e AudioStrip. Transferes um ficheiro, os servidores deles processam-no e transferes as faixas separadas.
As desvantagens são reais: o teu ficheiro de áudio vai para o servidor de outra pessoa, os planos gratuitos têm limites de tamanho e duração, a velocidade de processamento depende da carga nos servidores deles, e a qualidade completa está muitas vezes por trás de uma subscrição. Se trabalhas com música inédita, sessões de clientes ou qualquer coisa que prefiras não partilhar com terceiros, uma ferramenta na nuvem é a escolha errada.
Dito isto, para um trabalho pontual numa música que transferiste do Spotify para testar o conceito, uma ferramenta web resolve sem precisares de instalar nada.
Cancelamento de fase no Audacity
O Audacity inclui um efeito integrado chamado «Vocal Reduction and Isolation» que usa cancelamento de fase. A ideia é que em algumas gravações estéreo, o vocal principal está panoramizado exatamente ao centro, o que significa que aparece de forma idêntica nos canais esquerdo e direito. Se inverteres um dos canais e misturares os dois, o conteúdo centralizado cancela-se.
Esta técnica tem limitações reais. Só funciona se o vocal estiver estritamente centralizado, o que se verifica em algumas gravações mais antigas, mas está longe de ser universal na música moderna. Mesmo quando funciona, o resultado soa oco e artificial: instrumentos que partilham espaço de frequência com o vocal também são atenuados, deixando um som fino com efeito de pente. Vale a pena conhecer o cancelamento de fase, mas a maioria dos utilizadores de Mac obtém resultados notavelmente melhores com ferramentas baseadas em IA. Se tiveres curiosidade, o Audacity é gratuito e o efeito demora 30 segundos a experimentar.
Por que a IA no dispositivo produz melhores resultados no Mac
Cada Mac fabricado desde o final de 2020 inclui um Apple Neural Engine. É o mesmo processador especializado que gere o Face ID, a fotografia computacional e o reconhecimento de voz da Siri. Os modelos de separação de fontes de áudio adaptam-se bem a este hardware: o Neural Engine executa operações matriciais de forma eficiente com baixo consumo, o que significa processamento rápido sem que a ventoinha dispare.
A vantagem de qualidade sobre as ferramentas na nuvem vem do que não acontece durante o processamento. Quando fazes upload de um ficheiro para uma ferramenta web, estás a enviar áudio comprimido ou transcodificado pela rede. A IA do outro lado trabalha com o que recebe. No dispositivo, o modelo processa o teu ficheiro original diretamente, sem qualquer etapa de codificação intermédia. Numa fonte de alta taxa de bits, essa diferença é audível.
Também não há latência de rede. Uma música de 4 minutos num Mac M3 é processada em aproximadamente 30 a 60 segundos consoante o modo de qualidade que escolheres. Ferramentas na nuvem com elevada carga nos servidores podem demorar mais do que isso só na fila de espera.
Como extrair vocais no Mac com o SongSplit AI
Requisitos do sistema: Mac com Apple Silicon (M1 ou mais recente) com macOS 14 Sonoma ou posterior. No iPhone e iPad, iOS 17 ou posterior com chip A12 ou mais recente. Isto abrange todos os iPhones a partir do XS e todos os iPads atuais.
Para transferir: App Store para Mac e iPhone.
Passo 1: Obtém um ficheiro de áudio sem DRM
Sem DRM significa que o ficheiro não está encriptado com proteção contra cópia. Ficheiros MP3, WAV, FLAC, AIFF e M4A que compraste no iTunes, Bandcamp ou Amazon Music não têm DRM. Rips de CD também não têm. Todos estes funcionam.
Os ficheiros de streaming do Spotify e Apple Music têm DRM. Estão encriptados de uma forma que impede qualquer ferramenta, incluindo o SongSplit, de os processar. Se quiseres trabalhar com uma faixa de um serviço de streaming, precisas de encontrar ou comprar uma cópia sem DRM dessa música em específico.
Passo 2: Importa o ficheiro
Arrasta o ficheiro para a janela do SongSplit, ou usa Ficheiro > Abrir. A forma de onda carrega imediatamente. Nada está a ser enviado para lado nenhum, por isso não há tempo de espera ligado à tua ligação à internet.
Passo 3: Escolhe o modo de qualidade
O SongSplit oferece dois modos. O modo rápido dá uma pré-visualização ágil, útil se estás a avaliar várias faixas para descobrir quais separam bem. O modo qualidade faz uma análise mais completa e produz uma separação notavelmente mais limpa, especialmente em arranjos complexos. Para qualquer coisa que planeies usar num DAW ou lançar de qualquer forma, usa o modo qualidade.
Passo 4: Executa a separação
Clica no botão Split. O Apple Neural Engine trata da computação localmente. Em Macs com chips da série M, uma música típica de 3 a 4 minutos termina em bem menos de um minuto no modo rápido, e em 1 a 2 minutos no modo qualidade. Verás a forma de onda a separar numa faixa de vocais e numa faixa instrumental conforme processa.
Passo 5: Pré-visualiza os resultados
Antes de exportar, alterna entre a faixa de vocais e a faixa instrumental e ouve a música toda. Presta atenção à cauda de reverb nos vocais, às secções do refrão se houver harmonias empilhadas, e a passagens instrumentais expostas. É aqui que vais ouvir se existe sangramento significativo que torne as faixas inutilizáveis para o teu propósito.
Passo 6: Exporta
Guarda a faixa de vocais, a faixa instrumental ou ambas. Os ficheiros são exportados como M4A, que é compatível com Logic Pro, GarageBand, Ableton Live, Pro Tools, Final Cut Pro e qualquer outro software que aceite áudio padrão. Também podes converter para WAV ou MP3 a partir de qualquer uma dessas apps se precisares de um formato diferente mais tarde.
App Store (Mac + iPhone)
O que afeta a qualidade da separação
O modelo de IA está a fazer o seu melhor para desenredar dois sinais que foram misturados juntos. Algumas gravações tornam isso mais fácil do que outras. Eis o que realmente faz diferença na qualidade do resultado.
Qualidade do ficheiro fonte. A IA tem mais informação para trabalhar quando lhe forneces um ficheiro sem perdas ou de alta taxa de bits. Um MP3 a 128 kbps já descartou dados de áudio significativos através de compressão com perdas. Podes não notar uma grande diferença a ouvir casualmente, mas o modelo nota. Se tiveres acesso a um FLAC ou a um MP3 a 256 kbps ou mais, usa-o.
Era da gravação. Gravações comerciais de pop e rock aproximadamente a partir de 1990 separam bem. Gravações anteriores a meados dos anos 80 utilizavam frequentemente mixagem analógica que mistura os sinais de formas mais difíceis de reverter. Se trabalhares com soul clássico ou jazz antigo, espera mais sangramento.
Posição do vocal na mixagem. Um vocal principal que se destaca claramente na mixagem, com espaço à sua volta no espectro de frequências, dá ao modelo o sinal mais claro para trabalhar. Vocais que estão enterrados ou a competir intensamente com outros instrumentos no mesmo intervalo de frequências produzem resultados mais turbulentos.
Reverb e delay no vocal. Caudas de reverb longas são a fonte mais comum de artefactos no resultado. O modelo tem de decidir se um reverb em decaimento pertence à faixa vocal ou à faixa instrumental, e nem sempre acerta. Gravações secas separam com mais limpeza. Vocais com muito reverb vão deixar algum resíduo a infiltrar-se no instrumental.
Harmonias de fundo. Um vocal principal a solo é simples. Camadas densas de vocais de fundo são mais difíceis, porque o modelo tem de atribuir múltiplas camadas à faixa «vocal» enquanto mantém a instrumentação limpa. Podes ouvir fragmentos de vocais de fundo a aparecer na faixa instrumental em músicas com harmonias densas.
Padrões de género. Pop, rock, R&B e hip-hop dos últimos 30 anos separam bem na maioria dos casos. Gravações densas de jazz, onde um saxofone ou piano pode ocupar exatamente o mesmo intervalo de frequências que um vocalista, são genuinamente mais difíceis. Hip-hop com samples vocais muito processados ou picados pode ir de qualquer forma dependendo de como o sample está processado na mixagem.
O que podes fazer com os vocais extraídos
Karaoke. A faixa instrumental de uma separação limpa é imediatamente utilizável como faixa de acompanhamento para karaoke. Reproduz a partir do teu telemóvel por um altifalante Bluetooth, transmite para uma televisão, ou importa no GarageBand para criar loops e mudanças de tom. Para um guia detalhado do fluxo de trabalho de karaoke, consulta o guia sobre como fazer uma faixa de karaoke.
Prática vocal. Os cantores usam a faixa instrumental para praticar com a produção real sem o vocal do artista original a interferir. Ouve a banda real atrás de ti em vez de uma maquete MIDI, e podes isolar o fraseado e as escolhas de timing do original sem áudio a competir.
Remixes e sampling. Os produtores extraem faixas vocais para samplear frases, construir novas produções em torno de um a cappella, ou misturar o vocal de uma música sobre um instrumental diferente. A faixa vocal dá acesso a algo mais próximo de um a cappella do que normalmente terias para a maioria das faixas comerciais.
Transcrição. Isolar o vocal torna as letras muito mais fáceis de ouvir, especialmente em faixas onde os vocais estão numa mixagem muito movimentada. Os instrumentos deixam de mascarar as sílabas, e podes abrandar a faixa vocal no teu DAW sem perder a referência de tom.
Educação musical. Os estudantes podem ouvir a faixa vocal isolada para estudar fraseado, vibrato, controlo de respiração e arranjo vocal em isolamento. Retirar os instrumentos permite-te concentrares no que o vocalista está realmente a fazer sem a banda inteira a disputar a tua atenção.
Perguntas frequentes
Consigo extrair vocais de uma música do Spotify?
Não. Os ficheiros do Spotify têm DRM, o que significa que estão encriptados ao nível do ficheiro. Nenhuma ferramenta de extração de vocais consegue processá-los, porque os dados de áudio reais não são legíveis sem a chave de desencriptação do Spotify. Precisas de um ficheiro sem DRM: um MP3, WAV, FLAC ou M4A que compraste ou extraíste de um CD. Se tiveres o CD do álbum, extraí-lo com o iTunes ou uma ferramenta como o XLD fornece um FLAC sem DRM que podes processar.
A extração de vocais funciona em todas as músicas?
Funciona na grande maioria das gravações comerciais modernas, mas os resultados variam. Músicas com um vocal principal claro e destacado e instrumentação bem definida separam limpo. Músicas com muito reverb no vocal, harmonias de fundo densas, ou gravações onde as frequências vocal e instrumental se sobrepõem bastante vão ter mais artefactos e sangramento. Pré-visualiza os resultados antes de exportar para saberes com o que estás a trabalhar.
Qual é a diferença entre uma faixa vocal e um a cappella?
Um a cappella é a gravação vocal original isolada da sessão, capturada antes de ser misturada na faixa. É limpa, sem sangramento instrumental. Uma faixa vocal extraída por IA é uma estimativa: a melhor tentativa do modelo de separar o vocal de uma mixagem finalizada. Para a maioria dos propósitos criativos (sampling, prática, karaoke), essa distinção não importa muito. Para lançamentos profissionais ou qualquer coisa que exija limpeza clínica, um a cappella original da sessão vai sempre soar melhor.
Os vocais extraídos vão soar perfeitos?
Não. Nenhuma ferramenta atual alcança separação perfeita em todas as gravações. Espera algum sangramento na cauda de reverb, fragmentos ocasionais de instrumentos na faixa vocal, ou fragmentos vocais na faixa instrumental. O grau do artefacto depende da gravação. Para karaoke, prática e usos de sampling, a qualidade das ferramentas de IA atuais é mais do que satisfatória. Para trabalhos de nível de lançamento profissional, avalia o resultado específico com cuidado antes de te comprometeres.
Consigo extrair instrumentos individuais como bateria, baixo ou guitarra?
O SongSplit AI foca-se na separação em duas faixas: vocal e instrumental. É aqui que a qualidade da separação por IA é consistentemente alta e útil. A separação completa em múltiplas faixas (stems) que isola instrumentos individuais é mais difícil para o modelo, porque bateria, baixo e guitarra partilham conteúdo de frequência significativo. Outras ferramentas como a LALAL.AI oferecem extração de múltiplas faixas, mas a qualidade por faixa e o sangramento aumentam conforme separas em mais faixas. Para trabalho em duas faixas no Mac com privacidade, o SongSplit é a ferramenta certa.
Funciona no iPhone e iPad?
Sim. O SongSplit AI corre no iPhone e iPad usando a mesma separação no dispositivo, a partir do chip A12 (iPhone XS em diante, e gerações equivalentes de iPad). O fluxo de trabalho é o mesmo: importa da app Ficheiros, escolhe o teu modo de qualidade, processa, exporta. Não é necessária qualquer ligação à internet, e nada abandona o teu dispositivo.
Guias relacionados
Se estás a usar as faixas extraídas para um propósito específico, estes guias aprofundam cada caso de utilização.
Para transformar a faixa instrumental numa faixa de karaoke finalizada com timing adequado e definições de exportação, consulta como fazer uma faixa de karaoke.
Se és novo no conceito de faixas de áudio (stems) e queres perceber o que são antes de trabalhares com elas, o que são faixas de áudio cobre os conceitos básicos.
Para uma comparação lado a lado de apps removedores de vocais disponíveis no Mac, incluindo como o SongSplit se compara às ferramentas na nuvem em qualidade e privacidade, consulta a melhor app removedora de vocais para Mac.
Pronto para separar?
Descarrega o SongSplit AI e começa a separar as tuas músicas favoritas hoje mesmo.