AI Lip Sync Video Generator

Γυρίστε μια φωτογραφία προσώπου και ένα βίντεο ήχου σε ένα ομιλούν-κεφάλι βίντεο με lip sync, πόζα κεφάλι και ανοιγόκλειστα μάτια.

Το μοντέλο SadTalker που χρησιμοποίησε ήταν εκπαιδευμένο στο μοντέλο προσώπου της Βασιλείας, το οποίο έχει άδεια για μη εμπορική έρευνα μόνο, έτσι δεν μπορούμε να το προσφέρουμε σε μια υπηρεσία πληρωμής. Δεν έχει εγκατασταθεί ακόμα αντικατάσταση με κατάλληλη άδεια.

Ανεβάστε το πρόσωπο + ήχου

1.000 χαρακτήρες ανά δευτερόλεπτο

Σύρετε & αφήστε το αρχείο σας εδώ, ή περιήγηση

JPG, PNG, or short MP4/WebM. Max 10MB. One clear, well-lit face works best.

αρχείο.mp3

0 MB

Σύρετε & αφήστε το αρχείο σας εδώ, ή περιήγηση

MP3, WAV, M4A, or FLAC. Max 10MB. Free: up to 30 sec. Pro: up to 5 min.

αρχείο.mp3

0 MB

Επεξεργασία...

Αυτό συνήθως διαρκεί 30 δευτερόλεπτα έως 2 λεπτά.

Το Βίντεο του Μιλώντας-Κεφάλου σας

Κατεβάστε το MP4

Σχετικά με τον SadTalker

SadTalker (CVPR 2023, Tencent ARC) είναι ένα ανοιχτό-πηγής μοντέλο ομιλούν-κεφαλή που ζωγραφίζει μια εικόνα ενός προσώπου για να μιλήσει οποιοδήποτε ήχο. Σε αντίθεση με Wav2Lip παραλλαγές, SadTalker επίσης κινούμενο κεφάλι πόζα, αναβοσβήνει, και έκφραση για ένα πιο φυσικό αποτέλεσμα.

Ο κώδικας του SadTalker είναι Apache-2.0, αλλά τα 3D βάρη ανακατασκευής προσώπου εκπαιδεύτηκαν στο μοντέλο προσώπου της Βασιλείας, του οποίου η άδεια επιτρέπει μόνο μη εμπορική έρευνα. TTS.ai είναι μια εμπορική υπηρεσία, έτσι το εργαλείο απενεργοποιήθηκε στις 15 Σεπτεμβρίου 2026.

Συμβουλές για Καλύτερα Αποτελέσματα

  • Χρησιμοποιήστε ένα υψηλής ποιότητας, καλά φωτισμένο πορτραίτο, μάτια ορατά, στόμα κλειστό
  • Centered face, square or 4:5 aspect ratio works best
  • Καθαρός ήχος ομιλίας (χωρίς μουσική) αποδίδει πιο σφιχτό συγχρονισμό των χειλιών
  • Ενεργοποίηση GFPGAN για πυροβολισμούς ήρωα Τα διπλά καθιστούν το χρόνο αλλά ακονίζει τις λεπτομέρειες
  • Χρησιμοποιήστε το ακόμα προκαθορισμένο όταν θέλετε μια σταθερή avatar shot

Lip Sync Video Plans

Ξεκινήστε δωρεάν, αναβαθμίστε όταν χρειάζεστε περισσότερα

Ατελώς
  • 30-δευτερόλεπτο όριο ήχου
  • 256 px έξοδος
  • Το "Still" έχει προκαθοριστεί μόνο
  • Χωρίς ενισχυτή προσώπου
Πιο Δημοφιλή
Δωρεάν Λογαριασμός
  • 30-δευτερόλεπτο όριο ήχου
  • Τόσο το "πλήρης" όσο και το "ακόμα" προκαθορισμένα
  • 256 / 512 px έξοδος
  • Ενισχυτής προσώπου GFPGAN
Εγγραφή δωρεάν
Pro
  • 5-λεπτό ηχητικό όριο
  • Σειρά προτεραιότητας GPU
  • Πρόσβαση API (πολλαπλή αποστολή)
  • Webhook returning callbacks
  • Προς το παρόν μη διαθέσιμο (άδεια μη εμπορικού μοντέλου)
Αναβάθμιση

Συχνές Ερωτήσεις

Ανεβάστε μια φωτογραφία προσώπου και ένα ακουστικό κλιπ, και η AI δημιουργεί ένα βίντεο του προσώπου που μιλάει τον ήχο με κινήσεις χειλιών, πόζα κεφάλι και ανοιγόκλειστα μάτια. Το εργαλείο είναι προς το παρόν μη διαθέσιμο: έτρεξε SadTalker (CVPR 2023), του οποίου 3D βάρος ανακατασκευής προσώπου εκπαιδεύτηκαν στο μοντέλο προσώπου της Βασιλείας, το οποίο έχει άδεια μόνο για μη εμπορικές έρευνες.

Η είσοδος προσώπου μπορεί να είναι μια εικόνα JPG ή PNG (μέχρι 10 MB) ή ένα σύντομο βίντεο οδήγησης MP4/WebM (χρησιμοποιούμε το πρώτο πλαίσιο).

Δωρεάν λογαριασμοί: μέχρι 30 δευτερόλεπτα ανά κλιπ. Χρήστες πληρωμής: έως 5 λεπτά ανά αίτημα.

Ένα βίντεο συγχρονισμού χειλιών χρησιμοποιεί 1.000 χαρακτήρες ανά δευτερόλεπτο του βίντεο που παράγεται. Ένα κλιπ 30 δευτερολέπτων = 30.000 χαρακτήρες. Το κόστος χρεώνεται μπροστά από την ισορροπία του χαρακτήρα σας και επιστρέφεται αυτόματα εάν η γενιά αποτύχει.

Όχι. Το εργαλείο είναι κλειστό επειδή η άδεια μοντέλου δεν το επιτρέπει. SadTalker κωδικός είναι Apache-2.0, αλλά το δέμα του δικτύου ανασυγκρότησης προσώπου εκπαιδεύτηκε στο μοντέλο προσώπου της Βασιλείας 2009, του οποίου η άδεια επιτρέπει εσωτερική, μη εμπορική έρευνα μόνο. Τα βίντεο που παράγονται με αυτό πριν από τις 15 Σεπτεμβρίου 2026 δεν είναι για εμπορική χρήση, πληρωμένα σχέδια συμπεριλαμβάνονται. Είστε υπεύθυνοι για την κατοχή των δικαιωμάτων στην εικόνα προσώπου πηγής και ήχου που ανεβάζετε.

Όταν το εργαλείο έτρεξε, ένα 5 δευτερόλεπτα κλιπ πήρε περίπου 30 δευτερόλεπτα, κλιμακώνοντας περίπου γραμμικά με μήκος ήχου.

Πλήρες προκαθορισμένο (προκαθορισμένο) κινούμενο κεφάλι πόζα, αναβοσβήνει, και την έκφραση μαζί με τα χείλη, παράγοντας ένα πιο φυσικό talking-head βίντεο.

Το GFPGAN είναι ένα μοντέλο αποκατάστασης προσώπου που ακονίζει τις λεπτομέρειες του προσώπου μετά την απόδοση. Δεν προσφέρεται: το StyleGAN2 πριν είναι υπό μη εμπορική άδεια NVIDIA και το μοντέλο ανάλυσης προσώπου του είναι CC BY-NC-SA.

SadTalker που αποδίδεται σε 256 px εξ ορισμού, με 512 px ως μια πιο αργή επιλογή. Το εργαλείο είναι προς το παρόν μη διαθέσιμο; ένα καλά φωτισμένο, υψηλής ποιότητας πορτρέτο δίνει το καλύτερο αποτέλεσμα με οποιοδήποτε μοντέλο ομιλούν-κεφάλι.

Ναι. Ανεβάστε ένα MP4 ή WebM ως είσοδο προσώπου και θα χρησιμοποιήσουμε το πρώτο πλαίσιο ως την ταυτότητα οδήγησης. Για πλήρη αλλαγή βίντεο (ανά πλαίσιο αντικατάστασης στο στόμα), δείτε τον επικείμενο αγωγό βίντεο Dubbing Studio.

Ναι. Ποστήστε ένα multipart αίτημα στο /api/v1/lipsync/ με το πρόσωπο και τα ακουστικά πεδία, στη συνέχεια δημοσκόπηση /api/v1/lipsync/αποτέλεσμα/?uid= μέχρι η κατάσταση να "ολοκληρωθεί". Η απάντηση περιέχει ένα URL στο μεταδιδόμενο MP4. API πρόσβαση απαιτεί ένα πληρωμένο σχέδιο.

SadTalker χρησιμοποιεί face-connection για να ανιχνεύσει και να καλλιεργήσει το πιο σημαντικό πρόσωπο. Για τα καλύτερα αποτελέσματα, ανεβάστε ένα πορτρέτο με ένα άτομο στο κέντρο, μάτια ορατά, και minimal acclusion. Ομαδική φωτογραφίες μπορεί να παράγει απρόβλεπτα αποτελέσματα.
5.0/5 (1)

Τι θα μπορούσαμε να βελτιώσουμε; Τα σχόλιά σας μάς βοηθούν να διορθώσουμε τα ζητήματα.

Έτοιμος να ξεκινήσουμε;

Εγγραφείτε δωρεάν και να πάρετε 50 μονάδες. Δεν απαιτείται πιστωτική κάρτα.