Pular para o conteúdo
DootCentral de Ajuda Suporte
Índice

Vozes e áudios#

A voz sintetizada é usada na URA e nas respostas em áudio. Esta tela é onde se escolhe qual voz fala pela sua empresa — e onde se monta uma voz própria a partir de duas ou três.

Antes de começar#

A voz natural (Kokoro) não vem instalada por padrão: são cerca de 2,5 GB entre a base e o modelo. Ela entra na instalação com a opção --com-voz.

Sem ela, o sistema fala pelo espeak, com som sintetizado simples — inteligível, e claramente artificial. Para uma URA que atende cliente, a diferença é grande.

Veja Requisitos de instalação: a voz natural pede memória, e num servidor mínimo ela não cabe junto com o resto.

Mesclar vozes#

A tela permite combinar duas ou três vozes com pesos e salvar a mistura com nome próprio. Depois disso ela aparece em qualquer lugar que escolhe voz, como se fosse uma voz do modelo — que é o ponto: quem escolhe não precisa saber que por baixo são duas misturadas.

Antes de existir a tela, a mesclagem existia só na API: para usá-la era preciso montar a requisição à mão, e o resultado era anônimo — cada uso reinformava as vozes e os pesos.

Os pesos aparecem em porcentagem#

O que é gravado são pesos crus, e o serviço os normaliza na hora de sintetizar. Mostrar o número cru faria "2 e 1" parecer diferente de "0,66 e 0,33" — e são a mesma voz. A porcentagem mostra o que de fato importa: quanto cada voz pesa na mistura.

Como fazer#

  1. Vá em Configurações → Vozes do sistema.
  2. Ouça as vozes disponíveis.
  3. Para criar uma mescla, escolha duas ou três, ajuste as porcentagens e ouça o resultado.
  4. Salve com um nome que descreva o uso: "URA principal", "Aviso de manutenção".
  5. Escolha essa voz onde ela vai ser usada.

Ouça antes de publicar#

Voz sintetizada erra em pontos específicos e previsíveis: número de telefone, sigla, nome de rua e valor em reais. Uma URA que lê "R$ 129,90" como "erre cifrão cento e vinte e nove vírgula noventa" soa quebrada.

Ouça o texto real, não uma frase de teste. E prefira escrever por extenso o que a voz erra.

Biblioteca de áudios#

Além da voz sintetizada, é possível subir arquivos de áudio gravados. Para a saudação principal da URA, gravação humana costuma soar melhor que qualquer síntese — e ela muda pouco, então o trabalho é pontual.

A voz sintetizada ganha onde o texto muda: nome do cliente, valor da fatura, posição na fila.

Se algo der errado#

A voz soa metálica e simples. A voz natural não está instalada; o sistema está usando o espeak. Reinstale com a opção de voz.

A URA não toca o áudio. Confira o formato do arquivo e se ele foi publicado para o Asterisk. Veja Telefonia/PABX.

O servidor ficou lento depois de instalar a voz. A síntese roda num processo separado e ocupa memória. Confira se o servidor comporta.

A mescla soa diferente do que você ouviu na tela. Confira se a voz salva é a que está escolhida no destino — mesclas antigas com nome parecido confundem.

Números e siglas saem errados. Escreva-os por extenso no texto.

Relacionado