Separar voz e instrumental com IA
Transforme qualquer música em playback ou voz limpa em ~6 min · teste grátis
Como funciona
- Envie — Arraste um MP3 / WAV / M4A — até 100 MB, até 20 minutos
- Aguarde a IA — O pipeline Studio (ensemble BS-Roformer + Mel-Roformer + MDX23C) leva ~5-6 minutos
- Baixe — Você recebe vocals.wav + instrumental.wav (karaokê) separados
Grátis 3 músicas/mês · Pro 6/dia ($30/mês) · ou créditos a $0.50/música · processado em uma GPU dedicada (a GPU fica na Tailândia)
Perguntas frequentes
O AIVoiceSeparator é realmente grátis?
Sim. Experimente 1 música grátis sem cadastro; depois entre com o Google (grátis) para 3 músicas por mês com a qualidade Studio completa (ensemble de 3 modelos de IA + loudnorm). O Patreon Pro aumenta o limite para 6 músicas por dia.
Como o AIVoiceSeparator se compara ao LALAL.AI ou ao vocalremover.org?
Nosso ensemble de 3 modelos (BS-Roformer + Mel-Roformer + MDX23C) mede SDR 12.97 dB, cerca de 3 dB melhor que a referência aberta do Demucs. A saída é normalizada em loudness EBU-R128 para que as faixas se encaixem naturalmente em qualquer mixagem. O áudio é processado em uma GPU privada na Tailândia e nunca é enviado para uma nuvem de terceiros.
Vocês armazenam as músicas que eu envio?
Sem login, cada tarefa (entrada + resultados) é excluída automaticamente após 24 horas; com login, após 7 dias. Nunca usamos o seu áudio para treinar modelos de IA e nunca compartilhamos resultados entre usuários: o acesso é protegido por um job_id opaco.
Quais formatos de áudio são aceitos?
Entrada: MP3, WAV, M4A, FLAC, OGG, WebM, Opus. Máx. 100 MB, máx. 20 minutos. Saída: MP3 320 kbps (padrão), WAV ou FLAC (sem perdas).
Posso separar uma música direto de um link do YouTube?
Sim. Cole um link do YouTube ou SoundCloud e o servidor baixa o áudio para você. Para um clipe do TikTok ou do Instagram, salve o vídeo e envie o arquivo (MP4/MOV). Você é responsável por ter os direitos sobre o conteúdo que processa.
Posso obter a letra / legendas da música?
Sim. Ative a opção 'Gerar letra' antes de processar. Rodamos o Whisper na faixa de voz isolada e entregamos arquivos SRT (legenda), LRC (karaokê) e TXT (texto simples). Isso adiciona cerca de 30 segundos ao processo.