Informar de fallo / Petición de características

AI Lip Sincronizar generador de vídeo

Convierta una foto facial y un clip de audio en un video con cabezal de conversación con sincronización de labios, pose de cabeza y parpadeos. Actualmente no está disponible mientras buscamos un modelo cuya licencia lo permita.

La sincronización de labios no está disponible en este momento. El modelo SadTalker que utilizó fue entrenado en el Modelo de Basel Face, que está autorizado para la investigación no comercial solamente, por lo que no podemos ofrecerlo en un servicio de pago.

Subir cara + audio

1.000 caracteres por segundo

Arrastre y suelte su archivo aquí, o navegar

JPG, PNG, or short MP4/WebM. Max 10MB. One clear, well-lit face works best.

file.mp3

0 MB

Arrastre y suelte su archivo aquí, o navegar

MP3, WAV, M4A, or FLAC. Max 10MB. Free: up to 30 sec. Pro: up to 5 min.

file.mp3

0 MB

Procesando...

Renderizar el vídeo. Esto suele tomar de 30 segundos a 2 minutos.

Tu video de la cabeza de conversación

Descargar MP4

Acerca de SadTalker

SadTalker (CVPR 2023, Tencent ARC) es un modelo de código abierto que anima una imagen de una sola cara para hablar cualquier audio. A diferencia de las variantes de Wav2Lip, SadTalker también anima la pose de la cabeza, los pestañeos y la expresión para obtener un resultado más natural.

El código de SadTalker es Apache-2.0, pero sus pesos de reconstrucción de cara en 3D fueron entrenados en el Modelo de Cara de Basilea, cuya licencia permite la investigación no comercial solamente. TTS.ai es un servicio comercial, por lo que la herramienta fue desactivada el 15 de septiembre de 2026.

Consejos para obtener mejores resultados

  • Utilice un retrato de alta calidad y bien iluminado: ojos visibles, boca cerrada
  • La relación de aspecto de la cara central, cuadrada o 4:5 funciona mejor
  • El audio de voz limpio (sin música) produce una sincronización labial más estrecha
  • Habilitar GFPGAN para tiros de héroe — duplica el tiempo de ejecución pero agudiza el detalle
  • Utilice el preset Still cuando desee una toma de avatar constante

Labios Sincronizar planes de vídeo

Comience gratis, actualice cuando necesite más

Libre
  • Límite de audio de 30 segundos
  • 256 px de salida
  • Sólo preestablecido "todavía"
  • Sin potenciador facial
Más populares
Cuenta gratuita
  • Límite de audio de 30 segundos
  • Ambos presets "completos" y "aún"
  • 256 / 512 px salida
  • Potenciador facial GFPGAN
Regístrate gratis
Pro
  • Límite de audio de 5 minutos
  • Cola de GPU prioritaria
  • Acceso API (carga multiparte)
  • Callbacks de terminación de Webhook
  • Actualmente no está disponible (licencia de modelo no comercial)
Actualizar

Preguntas frecuentes

Sube una foto facial y un clip de audio, y la IA genera un video de esa cara hablando el audio con movimientos de labios, pose de cabeza y parpadeos. La herramienta actualmente no está disponible: se ejecuta SadTalker (CVPR 2023), cuyos pesos de reconstrucción de cara 3D fueron entrenados en el Modelo de Basel Face, que está autorizado para la investigación no comercial solamente.

La entrada facial puede ser una imagen JPG o PNG (hasta 10 MB) o un vídeo de conducción MP4/WebM corto (utilizamos el primer marco). El audio de conducción puede ser MP3, WAV, M4A o FLAC de hasta 10 MB. Remuestramos audio a 16 kHz internamente.

Cuentas gratuitas: hasta 30 segundos por clip. Pagar a los usuarios: hasta 5 minutos por petición. Audio más largo significa más tiempo de renderizado y mayor costo de carácter.

El video de sincronización de labios utiliza 1.000 caracteres por segundo de vídeo generado. Un clip de 30 segundos = 30.000 caracteres. El costo se factura por adelantado de su saldo de caracteres y se reembolsa automáticamente si la generación falla.

No. La herramienta está desactivada porque la licencia de modelo no lo permite. El código SadTalker es Apache-2.0, pero su red de reconstrucción de rostros ha sido entrenada en el Modelo Basel Face 2009, cuya licencia permite solo la investigación interna y no comercial. Los videos generados con él antes del 15 de septiembre de 2026 no son para uso comercial, incluidos los planes de pago. Usted es responsable de tener los derechos de la imagen de la cara fuente y audio que sube.

Cuando la herramienta se ejecuta, un clip de 5 segundos tomó unos 30 segundos, escalando aproximadamente linealmente con la longitud de audio. Actualmente no está disponible mientras buscamos un modelo de cabeza de conversación cuya licencia lo permite.

Completamente preestablecido (predeterminado) anima la postura de la cabeza, parpadea, y la expresión junto con los labios, produciendo un video más natural de cabeza parlante. Todavía preestablecido bloquea la cabeza en su lugar y anima sólo la boca — útil cuando se desea una toma de avatar constante.

GFPGAN es un modelo de restauración facial que aguza los detalles faciales después de la renderización. No se ofrece: su StyleGAN2 previo está bajo una licencia no comercial NVIDIA y su modelo de análisis facial es CC BY-NC-SA.

SadTalker renderizado a 256 px por defecto, con 512 px como opción más lenta. La herramienta no está disponible actualmente; un retrato bien iluminado y de alta calidad da el mejor resultado con cualquier modelo de cabezal de conversación.

Sí. Cargue un MP4 o WebM como la entrada de la cara y utilizaremos el primer marco como la identidad de conducción. Para volver a doblar el vídeo completo (reemplazo de boca por marco), vea la próxima tubería de vídeo de Dubbing Studio.

Sí. Enviar una solicitud multiparte a /api/v1/lipsync/ con campos faciales y de audio, luego encuestar /api/v1/lipsync/result/?uuid= hasta que el estado esté "completado". La respuesta contiene una URL al acceso API MP4. Requiere un plan de pago.

SadTalker utiliza la alineación facial para detectar y recortar la cara más prominente. Para obtener mejores resultados, suba un retrato con una persona centrada, ojos visibles y oclusión mínima. Las fotos de grupo pueden producir resultados impredecibles.
5.0/5 (1)

¿Qué podríamos mejorar? Sus comentarios nos ayudan a solucionar problemas.

¿Listo para empezar?

Regístrese gratis y obtenga 15.000 caracteres. No se requiere tarjeta de crédito.