Hoje estamos lançando AI Voice Generation v2 — um estúdio de texto para fala e clonagem de voz construído sobre a plataforma multiplataforma AI Suite v2. Digite qualquer texto e ouça-o falado com uma voz natural, ou grave um pequeno trecho e crie uma voz personalizada que soe como você, para reutilizá-la a qualquer momento. O objetivo é simples: transformar texto em fala — e clonar sua própria voz — sem enviar seu texto ou suas amostras de voz para a nuvem.

O que ele faz

Cole uma frase, um parágrafo ou um roteiro inteiro; escolha uma voz; pressione gerar; e reproduza uma fala com som natural. A voz integrada Amy funciona totalmente offline na sua máquina assim que seu pequeno modelo for baixado na primeira utilização — desligue a rede e ela continua funcionando. Ajuste a velocidade da fala de 0,5× a 2,0× sem alterar o tom, escolha seu formato de saída e reproduza seu último trecho instantaneamente com um player de forma de onda com busca. Quando gostar do resultado, salve-o como arquivo WAV ou MP3.

Quer uma voz específica? Grave ou insira um pequeno trecho de referência e o aplicativo cria uma voz clonada personalizada — sem etapa de treinamento, sem estúdio. Seus clones aparecem no topo do seletor de voz para reutilização instantânea, garantindo que uma voz consistente acompanhe todos os seus clipes.

Novidades na v2

  • Uma verdadeira biblioteca de vozes. Um seletor pesquisável reúne a voz offline embutida, vozes premium na nuvem, vozes neurais de alta qualidade no dispositivo e seus próprios clones. Um filtro rápido reduz a lista por nome ou idioma enquanto você digita, e um selo de download mostra quais vozes baixam seus arquivos na primeira vez que você as usa.
  • Clonagem de voz, com seu primeiro clone gratuito. Grave de 6 a 15 segundos de fala limpa (ou importe um clipe), nomeie a voz e crie um clone com o motor gratuito Chatterbox. Ele aparece no topo do seletor sem selo Pro — uma voz personalizada real, não uma versão de teste.
  • Motores para todas as situações. O motor offline Piper é o padrão e roda inteiramente no seu dispositivo. O Pro desbloqueia mais vozes Piper, vozes na nuvem compatíveis com OpenAI (traga sua própria chave) e vozes neurais no dispositivo — Kokoro (leve e rápido) e Parler-TTS — que permanecem locais. A opção manter-modelos-carregados faz com que gerações repetidas pulem o tempo de carregamento.
  • Reproduza sem re-sintetizar. Um reprodutor de forma de onda reproduz instantaneamente seu último clipe gerado e seus clipes de referência do clone, para que você nunca precise regenerar só para ouvir novamente. Você decide quantos clipes recentes ficam em cache.
  • Descarregue trabalhos pesados quando quiser. A clonagem exige muito processamento; se esta máquina não tiver GPU rápida, você pode descarregá-la para um AI Server na sua rede. Mesmo assim, seu clipe de referência permanece criptografado no seu dispositivo — uma cópia única é enviada apenas para sintetizar cada solicitação e nunca é armazenada no servidor.
  • Em 16 idiomas. Toda a interface segue o idioma do seu sistema operacional, com uma troca com um clique nas Configurações, e fala e clona em vários idiomas.
  • Scriptável. Uma ferramenta de linha de comando sem interface gera fala a partir do terminal, para locuções em lote e automação na sua própria infraestrutura.

Gratuito vs Pro

O nível gratuito é realmente utilizável por si só — oferece uma voz real e uma voz clonada real. O gratuito inclui a voz offline Amy voz e sua primeira voz clonada, feita com o motor de clonagem gratuito, sem limite de uso e sem cobrança por palavra. O Pro é sobre mais opções: todas as outras vozes integradas, vozes premium na nuvem, vozes neurais de alta qualidade no dispositivo, os motores avançados de clonagem e clones ilimitados além do seu primeiro. A clonagem de voz em si não está bloqueada atrás do Pro — o motor básico é gratuito, e você pode usar um clone no nível gratuito; o Pro simplesmente adiciona mais clones e mais motores.

Por que o processamento no dispositivo é importante

Roteiros, narração, uma voz que soa como você — o texto e as amostras de voz com que as pessoas mais querem trabalhar são frequentemente exatamente o que não pode ser enviado para uma nuvem de terceiros. O AI Voice Generation traz a IA para sua máquina: a voz Amy offline e seus clones no dispositivo não enviam nada para fora do dispositivo, seus clipes de referência do clone e o histórico de geração são criptografados em repouso sob uma chave que somente seus aplicativos AI Suite podem ler, e não há medidor por caractere. Apenas as vozes opcionais na nuvem e o descarregamento opcional de clones enviam algo online, e ambos são opt-ins explícitos. É o mesmo princípio local, com foco na privacidade, por trás de tudo que a Software Tailor desenvolve [1].

Obtenha

O AI Voice Generation v2 está disponível agora na Microsoft Store para Windows como um download gratuito, com o Pro disponível quando você quiser a biblioteca completa de vozes e clones ilimitados [2]. Builds adicionais para outras plataformas não são apresentadas como disponíveis até que tenham um caminho de aquisição pública verificado. Leia o tour completo de recursos na página do produto.