Generador de vídeo IA Lip, que sincronitza la sincronització de vídeo

Gira una foto cara i un clip d'àudio en un vídeo de punta amb una sincronització de llavis, posa el cap i parpelleja. Actualment no està disponible mentre busquem un model amb llicència de la qual el permet.

Nosaltres no Ven la vostra veu
El model de conversador Sadeker el va fer servir al Model Basel Face, que només és llicència per a recerca no comercial, per tant encara no l' hi podem oferir en un servei pagat. No hi ha cap substitució amb una llicència adequada.

Puja la cara a més d' àudio

1.000 caràcters per segon

Arrossegueu i deixeu anar el vostre fitxer aquí, o Navega

JPG, PNG, or short MP4/WebM. Max 10MB. One clear, well-lit face works best.

fitxer.mp3

0 MB

Arrossegueu i deixeu anar el vostre fitxer aquí, o Navega

MP3, WAV, M4A, or FLAC. Max 10MB. Free: up to 30 sec. Pro: up to 5 min.

fitxer.mp3

0 MB

S' està processant...

Això sol trigar 30 segons a 2 minuts.

El teu vídeo de conversa-Head

Descarrega

Quant a Sadeker

Sadeker (CVPR 2023, Tencent ARC) és un model de codi obert que parla amb un codi obert que anima una imatge cara única a parlar qualsevol so. A diferència de les variants Wav2Lip, l' anima el cap, parpelleja i l' expressió per a un resultat més natural.

SadTalker's code is Apache-2.0, but its 3D face reconstruction weights were trained on the Basel Face Model, whose license allows non-commercial research only. TTS.ai is a commercial service, so the tool was switched off on September 15, 2026.

Consells pels millors resultats

  • Usa una qualitat d' alta qualitat, bé- li vertical visible els ulls Martha, la boca tancada
  • Centrat cara, quadrat o relació d' aspecte 4: 5 funciona millor
  • Neteja l' àudio de veu (no música) dóna una sincronització de llavis ajustats
  • Habilita el GFPGAN pels trets d' herois per a renderitzar el temps però es mostren els detalls de definició
  • Usa l' ambient encara quan voleu una foto avatar constant

Sincronitzeu plans de vídeo

Inicia lliure, actualització quan necessiteu més

Lliure
  • Límit d' àudio de 30 segons
  • Sortida 256 px
  • Només ambient "lill"
  • No millora cap cara
El més popular
Compte lliure
  • Límit d' àudio de 30 segons
  • Els ambients "grans" i "still"
  • 256 / 512 px Sortida
  • millorador de cares GFPGAN
Signa lliure
Pro
  • Límit d' àudio de 5 minuts
  • Cua de la GPU de prioritat
  • Accés a l' API (multipart pujada)
  • Trucades de compleció de l' estructura Web
  • Actualment no està disponible ( llicència de model no comercial)
Actualitza

Preguntes més freqüents

Publica una foto cara i un clip d'àudio, i l'AI genera un vídeo d'aquesta cara parlant de moviments de llavis, imatge i parpelleig. L' eina no està disponible actualment: va córrer el Dr. Xarker (CVPR 2023), el qual els pesos de reconstrucció 3D van ser entrenats en el Model basel Face, el qual només està autoritzat per a recerca no comercials.

L' entrada de cara pot ser una imatge JPG o PNG (fins a 10 MB) o un curt vídeo MP4/WebM (úsem el primer marc). El dispositiu d' àudio pot ser MP3, WAV, M4A, o FLAC fins a 10 MB. Hem tornat a mostrejar l' àudio a 16 kHz internament.

Comptes lliures: fins a 30 segons per clip. Paying users: amunt i cinc minuts per petició. L' àudio Longer vol dir que el temps i el cost més elevat dels caràcters.

El vídeo de la sincronització de Lip, fa servir 1.000 caràcters per segon de vídeo generat. Un clip de 30 segons = 30.000 caràcters. El cost s' ha carregat per davant del balanç de caràcters i ha reemplaçat automàticament si la generació falla.

No. The tool is switched off because the model license does not allow it. SadTalker code is Apache-2.0, but its bundled face reconstruction network was trained on the Basel Face Model 2009, whose license allows internal, non-commercial research only. Videos generated with it before September 15, 2026 are not for commercial use, paid plans included. You are responsible for having the rights to the source face image and audio you upload.

Quan l' eina va córrer, un clip de 5 segons va agafar uns 30 segons, escalat al voltant de linealment amb longitud d' àudio. Actualment no està disponible mentre busquem un model amb el qual la llicència ho permet.

Completa l' ambient (per defecte) anima la posició del cap, parpelleja, i expressió juntament amb els llavis, produint un vídeo més natural de conversa. Tot i que està predefinit tanca el cap en el lloc i anima només la boca si voleu un tret avatar constant.

GFPGAN és un model de restauració de cara que s' amola els detalls facials després de renderitzar- se. No se' l' ofereix: la seva StyleGAN2 anterior és sota una llicència no comercial i el seu model d' anàlisi de cara és CC BY-NC-SA.

Per omissió, el Dr. Sadekker es renderitza a 256 px, amb 512 px com una opció més lenta. L' eina no està disponible actualment; un retrat bennit, d' alta qualitat dóna el millor resultat amb qualsevol model de capçalera.

Sí. Pugeu un MP4 o WebM com a entrada de la cara i utilitzarem el primer marc com a identitat de conduir. Per a una repulsió de vídeo completa (per a la llista de la boca), mireu la continuació de la canonada de vídeo Studio Dubbing.

Sí. POST una petició multipart a / appi/ v1/ lipsync / amb camps d' àudio i àudio, després l' enquesta / ap/v1/ lipsync/reult /? uuid= fins que l' estat sigui "completa". La resposta conté un URL al MP4 renderitzat. L' accés de l' API requereix d' un pla pagat.

Sadeker utilitza la resistència cara a detectar i escapçar la cara més prominent. Per obtenir millors resultats, pujar un retrat amb una persona centrada, ulls visibles i mínims oclusió. Les fotos de grup poden produir resultats impredictibles.
5.0/5 (1)

Les teves reaccions ens ajuden a solucionar problemes.

A punt per començar?

Signa't i aconsegueix 50 crèdits.