AI Lip Sync generator wideo

Zawróć zdjęcie twarzy i klip audio w rozmowne-głowa wideo z synchronizacji ust, pozy i mruga. Obecnie niedostępne podczas poszukiwania modelu, którego licencja pozwala.

Synchronizacja lip nie jest dostępna w tej chwili. Model SadTalker, który używał, został wyszkolony na Basel Face Model, który jest licencjonowany tylko do badań niekomercyjnych, więc nie możemy zaoferować go na usługi płatnej. Nie zainstalowano jeszcze odpowiedniej licencji.

Wyślij twarz + dźwięk

1000 znaków na sekundę

Przeciągnij i upuść plik tutaj, lub przeglądaj

JPG, PNG, or short MP4/WebM. Max 10MB. One clear, well-lit face works best.

file.mp3

0 MB

Przeciągnij i upuść plik tutaj, lub przeglądaj

MP3, WAV, M4A, or FLAC. Max 10MB. Free: up to 30 sec. Pro: up to 5 min.

file.mp3

0 MB

Przetwarzanie...

Odtwarzanie wideo. Zazwyczaj trwa 30 sekund do 2 minut.

Twoja rozmowa-Głowa wideo

Pobierz MP4

O SadTalker

SadTalker (CVPR 2023, Tencent ARC) jest modelem otwartego źródła rozmowy, który animuje pojedynczy obraz twarzy, aby mówić dowolny dźwięk. W przeciwieństwie do wariantów Wav2Lip, SadTalker również animuje pozycję głowy, mruga i wyrażenie dla bardziej naturalnego wyniku.

Kodem SadTalker jest Apache-2.0, ale jego 3D wagi rekonstrukcji twarzy zostały przeszkolone na Basel Face Model, którego licencja pozwala tylko na badania niekomercyjne. TTS.ai jest usługą handlową, więc narzędzie zostało wyłączone w dniu 15 września 2026 roku.

Wskazówki na najlepsze wyniki

  • Użyj wysokiej jakości, dobrze oświetlony portret – oczy widoczne, usta zamknięte
  • Pośrodkowa twarz, kwadrat lub 4:5 stosunek aspektów działa najlepiej
  • Czysty mowy audio (bez muzyki) wydaje ściślejszą synchronizację warg
  • Włącz GFPGAN dla zdjęć bohatera — podwójnie przetwarza czas, ale ostrze szczegóły
  • Użyj ciągle ustawień, gdy chcesz stałego strzału avatara

Plany wideo Sync Lip

Uruchom bezpłatnie, uaktualnij, gdy potrzebujesz więcej

Darmowe
  • 30-sekundowy limit dźwięku
  • Wyjście 256 px
  • Tylko ustawienie "dotychczas"
  • Brak wzmacniacza twarzy
Najpopularniejsze
Darmowe konto
  • 30-sekundowy limit dźwięku
  • Zarówno "full" jak i "dalej" ustawień
  • 256 / 512 px wyjście
  • GFPGAN wzmacniacz twarzy
Zarejestruj się za darmo
Prof.
  • 5-minutowy limit dźwięku
  • Priorytet kolejki GPU
  • Dostęp API (wysyłanie wieloczęściowe)
  • Powrotne połączenia do zakończenia programu Webhook
  • Obecnie niedostępne (niekomercyjne licencje modelu)
Uaktualnij

Często zadawane pytania

Wyślij zdjęcie twarzy i klip audio, a AI generuje film z tej twarzy wypowiadający się dźwięk z ruchami ust, pozyą głowy i mruganiem. Narzędzie jest obecnie niedostępne: uruchomił SadTalker (CVPR 2023), którego 3D wagi odbudowy twarzy zostały przeszkolone na Basile Face Model, który jest licencjonowany tylko do niekomercyjnych badań.

Wejście na twarz może być obrazem JPG lub PNG (do 10 MB) lub krótkim wideo kierowcy MP4/WebM (używamy pierwszej ramki). Audio kierowcy może być MP3, WAV, M4A lub FLAC do 10 MB. Przebieramy dźwięk do 16 kHz wewnętrznie.

Bezpłatne konta: do 30 sekund na klip. Płacenie użytkowników: do 5 minut na żądanie. Długiej audio oznacza dłuższy czas przetwarzania i wyższe koszty charakteru.

Synchronizacja lip wideo wykorzystuje 1000 znaków na sekundę generowanego wideo. 30-sekundowy klip = 30 000 znaków. Koszt jest rozliczany z przodu od salda charakteru i zwraca automatycznie, jeśli generacja nie wyjdzie.

Nie. Narzędzie jest wyłączone, ponieważ licencja modelu tego nie pozwala. Kod SadTalker to Apache-2.0, ale jego pakowana sieć odbudowy twarzy została przeszkolona na modelu Bazylejski face 2009, którego licencja pozwala tylko na badania wewnętrzne, niekomercyjne. Filmy generowane z nim przed wrześniem 15, 2026 nie są przeznaczone do użytku handlowego, włącznie z planami płatnymi. Jesteś odpowiedzialny za posiadanie praw do obrazu źródłowego twarzy i audio, które przesyłasz.

Kiedy narzędzie działa, klip 5 sekund trwał około 30 sekund, skalowanie z liniową długością dźwięku. Obecnie jest niedostępny, gdy szukamy modelu rozmowy, którego licencja pozwala.

Pełne ustawienie (domyślne) animuje pozycję głowy, mruganie i ekspresję wraz z wargami, produkując bardziej naturalne gadanie-głowa wideo. Nadal zamyka głowę na miejscu i animuje tylko usta — przydatne, gdy chcesz stały strzał awatar.

GFPGAN jest modelem restauracji twarzy, który po przetwarzaniu ostrzeł szczegóły twarzy. Nie jest on oferowany: jego StyleGAN2 wcześniej jest pod licencją niekomercyjną NVIDIA, a jego modelem parsowania twarzy jest CC BY-NC-SA.

SadTalker, wyświetlony w 256 px domyślnie, z 512 px jako wolniejsza opcja. Narzędzie jest obecnie niedostępne; dobrze oświetlony, wysokiej jakości portret daje najlepszy wynik w dowolnym gadającym modelu.

Tak. Wyślij MP4 lub WebM jako wejście twarzy i użyjemy pierwszej ramki jako tożsamości kierowcy. W celu ponownego pobierania wideo (zamiana ust na ramkę), patrz nadchodzący rurociąg Dubbing Studio wideo.

Tak. POST multipart request do /api/v1/lipsync/ z polami twarzy i dźwięku, następnie anket /api/v1/lipsync/result/?uuid= do czasu zakończenia statusu. Odpowiedź zawiera URL do wyświetlonego MP4. Dostęp do API wymaga płatnego planu.

SadTalker wykorzystuje złożenie twarzy do wykrywania i obróbki najwybitniejszej twarzy. Dla najlepszych rezultatów, wysyłanie portretu z jedną osobą centrowane, widoczne oczy i minimalne okclusion. Zdjęcia grupowe mogą przynieść nieprzewidywalne wyniki.
5.0/5 (1)

Co moglibyśmy ulepszyć? Twoje zwroty zwrotne pomagają nam rozwiązać problemy.

Gotowy do rozpoczęcia?

Zarejestruj się za darmo i otrzymaj 50 kredytów.