Segnala bug / richiesta di funzionalità

Generatore di video di sincronizzazione del labbro di AI

Trasforma una foto facciale e un clip audio in un video con testa parlante con sincronizzazione labbra, posa testa e lampeggia. Attualmente non disponibile mentre cerchiamo un modello la cui licenza lo permette.

La sincronizzazione Lip non è disponibile al momento. Il modello SadTalker utilizzato è stato addestrato sul Basel Face Model, che è concesso in licenza solo per ricerche non commerciali, quindi non possiamo offrirlo su un servizio a pagamento. Non è ancora installato alcun sostituto con una licenza adeguata.

Carica Face + Audio

1.000 caratteri al secondo

Trascinare & rilasciare il file qui, o sfoglia

JPG, PNG, or short MP4/WebM. Max 10MB. One clear, well-lit face works best.

file.mp3

0 MB

Trascinare & rilasciare il file qui, o sfoglia

MP3, WAV, M4A, or FLAC. Max 10MB. Free: up to 30 sec. Pro: up to 5 min.

file.mp3

0 MB

Elaborazione...

Rendering il video. Questo richiede tipicamente 30 secondi a 2 minuti.

Il tuo video con la testa parlante

A proposito di SadTalker

SadTalker (CVPR 2023, Tencent ARC) è un modello di testa parlante open-source che anima una singola immagine faccia per parlare qualsiasi audio. A differenza di Wav2Lip varianti, SadTalker anima anche testa posa, lampeggia, e l'espressione per un risultato più naturale.

Il codice di SadTalker è Apache-2.0, ma i suoi pesi di ricostruzione del viso 3D sono stati addestrati sul Modello di Faccia di Basilea, la cui licenza permette solo ricerche non commerciali. TTS.ai è un servizio commerciale, quindi lo strumento è stato spento il 15 settembre 2026.

Consigli per i migliori risultati

  • Utilizzare un ritratto di alta qualità ben illuminato occhi visibili, bocca chiusa
  • Centrato faccia, quadrato o 4:5 rapporto di aspetto funziona meglio
  • Pulire l'audio vocale (senza musica) rende più stretto il labbro sincronizzato
  • Abilita GFPGAN per scatti da eroe
  • Utilizzare il preset Still quando si desidera un costante avatar shot

Piani video di sincronizzazione di labbro

Avvia gratis, aggiorna quando ne hai bisogno

Libero
  • Limite audio di 30 secondi
  • uscita 256 px
  • Solo preimpostato "ancora"
  • Nessun enhancer facciale
Più popolare
Account gratuito
  • Limite audio di 30 secondi
  • Preimpostazioni sia "piene" che "ancora"
  • 256 / 512 px uscita
  • GFPGAN enhancer facciale
Iscriviti gratis
Pro
  • Limite audio di 5 minuti
  • Coda GPU prioritaria
  • Accesso API (upload multiplo)
  • Callback di completamento di Webhook
  • Attualmente non disponibile (licenza modello non commerciale)
Aggiornamento

Domande frequenti

Carica una foto facciale e un clip audio, e l'AI genera un video di quella faccia parlando l'audio con movimenti labbro, posa testa e lampeggianti. Lo strumento è attualmente non disponibile: è stato eseguito SadTalker (CVPR 2023), i cui pesi di ricostruzione faccia 3D sono stati addestrati sul Modello Faccia di Basilea, che è concesso in licenza solo per la ricerca non commerciale.

L'ingresso facciale può essere un'immagine JPG o PNG (fino a 10 MB) o un breve video di guida MP4/WebM (usiamo il primo frame). L'audio di guida può essere MP3, WAV, M4A, o FLAC fino a 10 MB. Ricampioniamo audio a 16 kHz internamente.

Account gratuiti: fino a 30 secondi per clip. Utenti a pagamento: fino a 5 minuti per richiesta. Audio più lungo significa più tempo di rendering e più alto costo del carattere.

Il video di sincronizzazione Lip utilizza 1.000 caratteri al secondo del video generato. Un clip di 30 secondi = 30.000 caratteri. Il costo viene addebitato davanti al tuo saldo del personaggio e rimborsato automaticamente se la generazione fallisce.

No. Lo strumento è spento perché la licenza modello non lo permette. Il codice SadTalker è Apache-2.0, ma la sua rete di ricostruzione facciale in bundle è stata addestrata sul Basel Face Model 2009, la cui licenza consente solo ricerche interne e non commerciali. I video generati con esso prima del 15 settembre 2026 non sono per uso commerciale, piani a pagamento inclusi. Si è responsabili per i diritti all'immagine facciale sorgente e audio caricati.

Quando lo strumento è stato eseguito, un clip di 5 secondi ha impiegato circa 30 secondi, scalando approssimativamente lineare con lunghezza audio. Al momento non è disponibile mentre cerchiamo un modello a testa parlante la cui licenza lo permette.

Full preset (default) anima la testa posa, lampeggia, e l'espressione insieme alle labbra, producendo un video più naturale talking-head. Ancora preset blocca la testa in posizione e anima solo la bocca utile quando si desidera un costante avatar shot.

GFPGAN è un modello di restauro facciale che ha affinato i dettagli facciali dopo il rendering. Non è offerto: il suo StyleGAN2 prior è sotto una licenza NVIDIA non commerciale e il suo modello di analisi facciale è CC BY-NC-SA.

SadTalker reso a 256 px per impostazione predefinita, con 512 px come opzione più lenta. Lo strumento è attualmente non disponibile; un ritratto ben illuminato e di alta qualità dà il miglior risultato con qualsiasi modello di testa parlante.

Sì. Caricare un MP4 o WebM come ingresso facciale e useremo il primo frame come identità di guida. Per il ri-dubbing video completo (sostituzione bocca per fotogramma), vedere la prossima pipeline video Dubbing Studio.

Sì. POST una richiesta multipart a /api/v1/lipsync/ con campi faccia e audio, quindi sondaggio /api/v1/lipsync/result/?uuid= fino a quando lo stato è "completato." La risposta contiene un URL per il reso MP4. L'accesso API richiede un piano a pagamento.

SadTalker utilizza l'allineamento facciale per rilevare e ritagliare il volto più prominente. Per ottenere i migliori risultati, caricare un ritratto con una persona centrato, occhi visibili e occlusione minima. Le foto di gruppo possono produrre risultati imprevedibili.
5.0/5 (1)

Cosa potremmo migliorare? Il tuo feedback ci aiuta a risolvere i problemi.

Pronto per iniziare?

Iscriviti gratis e ottenere 15.000 caratteri. Non è richiesta la carta di credito.