Suno Speech: como gerar vozes e música com IA

Alex da Cruz
Alex da Cruz é desenvolvedor full-stack em São Paulo. Trabalha com React, TypeScript e automação, e usa inteligência artificial no dia a dia para resolver problemas reais de código e de operação — não como demonstração. Já tocou uma operação de e-commerce de ponta a ponta e hoje constrói e mantém o pipeline de automação por trás deste blog. Escreve aqui sobre o que testa de fato.
Segundo apuração do The Verge, o Suno expandiu sua atuação para além da música gerada por inteligência artificial ao lançar o recurso Speech. A ferramenta cria vozes faladas a partir de descrições ou scripts, permitindo produzir narrações acompanhadas de trilha sonora em plataformas web e móveis.
Como funciona a criação de áudio no Suno Speech?
A ferramenta disponibiliza dois modos de operação para atender a diferentes fluxos de trabalho. O modo simples utiliza caixas de texto baseadas em comandos descritivos, enquanto o modo avançado aceita roteiros personalizados para maior controle do texto.
As configurações avançadas também permitem ajustar o gênero da voz sintética, o estilo de fala e o nível de variação. Cada geração comporta uma duração máxima de cerca de oito minutos, atendendo a demandas de narração curta.
É possível remover a música de fundo?
Sim, a inclusão de trilha sonora é opcional. Os usuários podem desativar a música de fundo por meio de um botão de alternância caso precisem apenas de áudio falado limpo.
Jack Brody, diretor de produtos da empresa, afirmou que o modelo foi projetado para gerar voz e música de forma unificada. No entanto, a companhia adverte que a versão beta apresenta limitações temporárias, como variações inesperadas em sotaques e pausas dramáticas acentuadas.
Fontes
- AI music maker Suno now generates spoken words — theverge.com
Perguntas frequentes
- O que é o Suno Speech?
- É um recurso em beta público que gera vozes faladas e música de fundo de forma simultânea a partir de comandos de texto ou scripts.
- Dá para usar apenas a voz sem a música?
- Sim, a música de fundo é opcional e pode ser desativada com uma chave se você precisar apenas da locução limpa.
- Qual é a duração máxima das gerações no Suno Speech?
- O recurso suporta uma duração máxima de aproximadamente oito minutos por faixa gerada.
Comentários
0 comentário
Seja o primeiro a comentar.
Continue Lendo

Flux 3 Image: Edição por Partes e Saída em 4K
A Black Forest Labs lançou o Flux 3 Image com edição em partes específicas, suporte a 10 referências e saída em 4K.

ChatGPT: Prova de Roupas Virtual e Impacto no Varejo
ChatGPT agora permite provar roupas virtualmente com o modelo Images 2.5, alterando a dinâmica de descoberta visual no e-commerce.

Google Guided Vision: leitura de letras miúdas com IA
O Google lançou o recurso Guided Vision para Android, permitindo usar a câmera para ler letras miúdas e analisar objetos por áudio.