Informar de Bug / Pedido de Feature

Gerador de vídeo de sincronização de lipos da AI

Torne uma foto facial e um clipe de áudio em um vídeo de cabeça-chave com sincronização de lábios, poses de cabeça e pisca. Atualmente não está disponível enquanto procuramos um modelo cuja licença permite.

A sincronização de lipos não está disponível neste momento. O modelo SadTalker que usou foi treinado no modelo de Basileia Face, que está licenciado para pesquisa não comercial apenas, então não podemos oferecer-lhe em um serviço pago. Nenhuma substituição com uma licença adequada ainda está instalada.

Carregar face + áudio

1.000 caracteres por segundo

Arraste e largue o seu arquivo aqui, ou navegar

JPG, PNG, or short MP4/WebM. Max 10MB. One clear, well-lit face works best.

file.mp3

0 MB

Arraste e largue o seu arquivo aqui, ou navegar

MP3, WAV, M4A, or FLAC. Max 10MB. Free: up to 30 sec. Pro: up to 5 min.

file.mp3

0 MB

A processar...

Renderização de seu vídeo. Isto geralmente leva 30 segundos a 2 minutos.

O seu vídeo falando-auditório

Baixar MP4

Sobre SadTalker

SadTalker (CVPR 2023, Tencent ARC) é um modelo de palestra de código aberto que anima uma única imagem face para falar qualquer áudio. Ao contrário das variantes Wav2Lip, SadTalker também anima a pose da cabeça, blinks e expressão para um resultado mais natural.

O código de SadTalker é Apache-2.0, mas seus pesos de reconstrução face 3D foram treinados no modelo de Basileia Face, cuja licença permite apenas pesquisa não comercial. TTS.ai é um serviço comercial, assim que a ferramenta foi desligada em 15 de setembro de 2026.

Dicas para os melhores resultados

  • Use um retrato de alta qualidade, bem iluminado — olhos visíveis, boca fechada
  • O rosto centrado, quadrado ou 4:5 rácio de aspecto funciona melhor
  • Limpo áudio de fala (sem música) produz uma sincronização de lábios mais apertada
  • Activar o GFPGAN para tiros de herói — duplos render tempo, mas afia detalhe
  • Use o Predefinido ainda quando quiser uma injeção de avatar constante

Lip Sincronização de Planos de Vídeo

Comece livre, atualização quando você precisa mais

Grátis
  • Limite de áudio de 30 segundos
  • Saída de 256 px
  • "Permanecer" apenas predefinido
  • Sem potenciador facial
Mais Popular
Conta Livre
  • Limite de áudio de 30 segundos
  • Ambos os predefinidos "completos" e "ainda"
  • 256 / 512 saída px
  • Melhorador de face GFPGAN
Inscreva-se gratuitamente
Pro
  • Limite de áudio de 5 minutos
  • Fila GPU prioritária
  • Acesso à API (multipart upload)
  • Webhook callbacks de conclusão
  • Atualmente não disponível (licência de modelo não comercial)
Actualização

Perguntas Frequentes

Subir uma foto facial e um clipe de áudio, e a IA gera um vídeo desse rosto falando o áudio com movimentos de lábios, poses de cabeça e piscamentos. A ferramenta atualmente não está disponível: ele correu SadTalker (CVPR 2023), cujos pesos de reconstrução face 3D foram treinados no Modelo de Face de Basilea, que está licenciado para pesquisa não comercial apenas.

A entrada facial pode ser uma imagem JPG ou PNG (até 10 MB) ou um curto vídeo de condução MP4/WebM (usamos a primeira moldura). O áudio de condução pode ser MP3, WAV, M4A ou FLAC até 10 MB. Reamostramos áudio a 16 kHz internamente.

Contas gratuitas: até 30 segundos por clipe. Utilizadores pagos: até 5 minutos por pedido. áudio mais longo significa tempo de renderização e custo de caráter maior.

O vídeo da sincronização de lipos usa 1.000 caracteres por segundo do vídeo gerado. Um clipe de 30 segundos = 30.000 caracteres. O custo é facturado em frente a partir do seu balanço de caracteres e reembolsado automaticamente se a geração falhar.

Não. A ferramenta é desligada porque a licença de modelo não o permite. O código SadTalker é Apache-2.0, mas sua rede de reconstrução facial em bundle foi treinada no modelo Basel Face 2009, cuja licença permite apenas pesquisa interna e não comercial. Os vídeos gerados com ele antes de 15 de setembro de 2026 não são para uso comercial, planos pagos incluídos. Você é responsável por ter os direitos à imagem face fonte e áudio que você upload.

Quando a ferramenta foi executada, um clipe de 5 segundos levou cerca de 30 segundos, escalando aproximadamente linearmente com comprimento de áudio. Actualmente não está disponível enquanto procuramos um modelo de conversa-head cuja licença permite.

A predefinição completa (por defeito) anima a posição da cabeça, pisca e expressão junto com os lábios, produzindo um vídeo de cabeça de conversa mais natural. Ainda a predefinição fecha a cabeça no lugar e anima apenas a boca — útil quando você quer um tiro de avatar constante.

O GFPGAN é um modelo de restauração facial que afiou os detalhes faciais após a renderização. Não é oferecido: seu StyleGAN2 prévio está sob uma licença NVIDIA não comercial e seu modelo de análise facial é CC BY-NC-SA.

SadTalker rendeu em 256 px por padrão, com 512 px como uma opção mais lenta. A ferramenta atualmente não está disponível; um retrato de alta qualidade e bem iluminado dá o melhor resultado com qualquer modelo de conversa.

Sim. Carregue um MP4 ou WebM como a entrada do rosto e vamos usar o primeiro quadro como a identidade de condução. Para re-dubbing de vídeo completo (por-frame substituição da boca), consulte o próximo Dubbing Studio vídeo oleoducte.

Sim. POST um pedido multiparte para /api/v1/lipsync/ com campos de rosto e áudio, em seguida poll /api/v1/lipsync/result/?uuid= até que o estado seja "completado". A resposta contém uma URL para o MP4 rended. O acesso API requer um plano pago.

SadTalker usa o alinhamento facial para detectar e cultivar o rosto mais proeminente. Para melhores resultados, upload um retrato com uma pessoa centrada, olhos visíveis e oclusão mínima. Fotos de grupo podem produzir resultados imprevisíveis.
5.0/5 (1)

O que podemos melhorar? Seu feedback nos ajuda a resolver problemas.

Pronto para começar?

Inscreva-se gratuitamente e receba 15.000 caracteres. Não é necessário cartão de crédito.