PUBLICIDADE

O Grande Duelo das Vozes: Teste Prático Compara 7 APIs de Clonagem de Voz em 2026 e Revela Vencedoras em Similaridade, Consentimento e Preço

21/09/2026
10 visualizações
5 min de leitura
Imagem principal do post

Teste prático com 7 APIs de clonagem de voz revela diferenças em similaridade, consentimento e preço em 2026

Um teste comparativo divulgado em setembro de 2026 avaliou sete APIs de clonagem de voz disponíveis no mercado, submetendo todas a um mesmo desafio: reproduzir com fidelidade um trecho de referência de apenas dez segundos gravado em ambiente silencioso. O experimento utilizou duas frases como conteúdo de teste, uma conversacional e outra com números e nomes próprios, e aplicou em cada plataforma o caminho de clonagem instantânea com configurações padrão. O objetivo foi medir o desempenho em quatro eixos decisivos para implantações em produção: quantidade de áudio de referência necessário, verificação de consentimento do locutor, licença para uso comercial e número de idiomas suportados.

Imagem complementar

A ElevenLabs oferece dois caminhos. O Instant Voice Cloning recomenda entre um e dois minutos de áudio limpo, enquanto o Professional Voice Cloning exige ao menos 30 minutos, com indicação ideal de duas a três horas, e está disponível a partir do plano Creator. É também a plataforma com o controle de consentimento mais rigoroso entre as avaliadas, pois o dono da voz precisa ler em voz alta um texto exibido na tela por meio do sistema chamado Voice Captcha, recurso que confirma que o falante é realmente o titular. A API cobra US$ 0,10 por mil caracteres nos modelos Eleven v3 e Multilingual v2, e US$ 0,05 nos modelos Flash, Turbo e v3 Conversational. O Eleven v3 suporta mais de 70 idiomas.

PUBLICIDADE

A Cartesia parte de dez segundos de áudio para realizar a clonagem, mas as versões Sonic 3.6 e mais recentes aproveitam até 60 segundos para preservar melhor os sotaques. Os clones profissionais exigem ao menos 30 minutos de áudio e começam no plano Startup de US$ 49. O modelo Sonic é cobrado em um crédito por caractere, com planos que vão de US$ 5 por 100 mil créditos até US$ 299 por 8 milhões, e abrange 44 idiomas. A Inworld trabalha com clonagem instantânea a partir de três segundos de áudio, embora amostras de até 30 segundos aumentem a similaridade. O processo de clonagem em si é gratuito, e o modelo TTS-2 em tempo real custa US$ 25 por milhão de caracteres sob demanda, podendo chegar a US$ 12,50 em planos de US$ 1.500 mensais. A versão TTS-2 Flash parte de US$ 15 e cai para US$ 7. A clonagem profissional está em versão beta, requer dez minutos de áudio e funciona somente em inglês. No total, a Inworld suporta mais de 200 idiomas e localidades.

A Gradium, empresa fundada por criadores da Kyutai, realiza clonagem a partir de dez segundos e oferece um plano gratuito com cinco clones para uso não comercial. Planos pagos começam em US$ 13 por 225 mil créditos, na proporção de um crédito por caractere. O clone profissional exige ao menos 30 minutos de áudio e está disponível a partir do plano M de US$ 340. A cobertura de idiomas é mais restrita, limitada a inglês, francês, alemão, espanhol e português. Já a Fish Audio cobra US$ 15 por milhão de bytes UTF-8 em sua API. Em inglês, um byte equivale a aproximadamente um caractere, mas em chinês, japonês e coreano a proporção é de cerca de três bytes por caractere, o que pode triplicar o custo efetivo. O modelo S2.1 Pro abrange 83 idiomas e a clonagem profissional, que aceita de 10 a 180 minutos de áudio, exige verificação de propriedade ao vivo. O uso comercial começa no plano Plus de US$ 15 mensais.

A Resemble AI oferece clonagem rápida a partir de dez segundos, concluída em menos de um minuto, e a clonagem profissional exige de 10 a 25 minutos de áudio com cerca de 40 minutos de treinamento. A empresa aplica uma tecnologia chamada PerTh, que adiciona marcas d'água digitais em todas as saídas de áudio, recurso útil para identificar áudios gerados artificialmente. O modelo Chatterbox Multilingual cobre 23 idiomas. O detalhe é que o acesso à API de clonagem agora exige plano Business ou superior, e a página de preços não exibe mais valores específicos para o serviço de síntese de voz. Por fim, a Hume trabalha com seu modelo Octave a partir de 15 segundos de áudio, gravados ao vivo ou enviados por upload, e exige que o falante tenha consentido previamente. O Octave 2 cobre 11 idiomas e o uso comercial começa no plano Creator, de US$ 14 mensais. A API de clonagem está disponível apenas no nível Enterprise, enquanto os demais planos permitem criar clones dentro da plataforma.

Os resultados do Voice Replication Leaderboard publicado pela Hume em 10 de setembro de 2026, que testou 11 modelos com 25 vozes de referência e sete prompts avaliados por três ouvintes cegos, ajudam a dimensionar a qualidade. Entre as plataformas avaliadas, a Fish Audio s2-pro liderou em similaridade com a voz original, com nota 4,03, seguida pela Cartesia sonic-3.5 com 3,70 e pela ElevenLabs Multilingual v2 com 3,68. A ElevenLabs Eleven v3 ficou na última posição entre os 11 modelos, com 2,91. O ranking também mostrou que naturalidade e identidade nem sempre caminham juntas, já que a Cartesia sonic-3.6-beta liderou em naturalidade com 4,36, mas ficou em oitavo lugar em identidade, enquanto a Inworld TTS-2 liderou em qualidade de áudio com 4,61.

O comparativo destaca ainda que apenas ElevenLabs, Fish Audio e Resemble AI documentam verificações técnicas de consentimento, e somente para clones profissionais, enquanto as demais plataformas dependem de declarações e termos de uso. Em termos de custo por milhão de caracteres, Inworld e Fish Audio aparecem entre as opções mais acessíveis, com US$ 25 ou menos, enquanto a ElevenLabs v3 lista US$ 100 para esse mesmo volume. O número de idiomas suportados varia de 5, no caso da Gradium, a mais de 200 na Inworld. A escolha da API mais adequada depende, portanto, do equilíbrio entre cada projeto e as prioridades de preço, cobertura linguística, exigência de consentimento e fidelidade à voz original.

PUBLICIDADE

Leitura recomendada

Comentários

Nenhum comentário ainda. Seja o primeiro a comentar!