װײַז דורכפֿאַל/פֿעיִקײט־בקשה

AI שפּראַך־אַרײַנשרײַבער

צעשײדן די ווענטיל פֿון די אינסטרומענטן אין װעלכעװײניקער לידער װאָס ניצט קײן

קלײַב אַלץ אױסprocess status

קלײַב אַלץ אױס

קלײַב אַלץ אױסFile בלעטער

Supports MP3, WAV, FLAC, OGG, M4A. Max 500 MB (2 GB on paid plans). Songs up to 10 minutes.

טעקע.mp3

0 MB
— אָדער אָנהײבן פֿון דיין מיקרופֿאָנע —
00:00

קלײַב אַלץ אױס

די צוויי װעגס האָבן די זעלבע נאָמען, די װעג פֿון װײַסרוסלאַנד.
פֿרײַ צו פּרובירן מיט אַ פֿרײַן חשבון

ווי עס אַרבעט

אַרײַנשרײַבן אַ לידער
קלײַב אַלץ אױס
אָפּלאָדירןStock label
קלײַב אַלץ אױסvector-mode

קלײַב אַלץ אױסselect-action

ניצן Mel-Band RoFormer אױף באַװעגונגundo-type קװאַליטעט
װײַז די װײַזער װײַז דער געשיכטע ווען ער איז גרייט
טעקסט פֿאַרבvoice-separation

טעקסט פֿאַרבvector-mode

0:00

אינסטרומענטאַל

0:00
קלײַב אַלץ אױסundo-type 8.2 dB SDR
טעקסט פֿאַרבundo-type < 2%
לידער צײַט 3:42
דורכפֿאַל־צײַט 12.4s

קלײַב אַלץ אױסundo-type

מאָדע Mel-Band RoFormer
אױסגײן טעקסט פֿאַרבtext-tool-action
טעקסט פֿאַרבvoice-mode 11.3 dB
אינסטרומענטאַל SDR 16.0 dB

Measured on 50 MUSDB18 test excerpts. SDR is the signal-to-distortion ratio: higher is cleaner. Our previous engine scored 8.4 dB (vocals) and 13.1 dB (instrumental).

װיפֿל TTS.ai קעגן קאָנקורענטן

פֿרײַע מדרגה אױף דער רשימה

Try it with a free account. Competitors like LALAL.AI, Moises, and PhonicMind charge $5-25/month for basic vocal removal.

מעק אַרױסundo-type

Vocals are separated by a Mel-Band RoFormer model. On 50 MUSDB18 test excerpts it scored 11.3 dB vocal SDR and 16.0 dB instrumental SDR, about 3 dB above our previous engine on both.

קײן װאַסערזײַטל אָדער קװאַליטעט־קאָפּ

אַרײַנשטעלן פֿול־קװאַליטעט־אַרײַנשרײַב אין WAV, MP3, אָדער FLAC. קײן װאַסערמאַפּע, קײן קלײנונג, קײן ביטרײט־באַגרענעצונג אױף קײן הײך

API צוטריט פֿאַר סבֿיבֿה־באַהאַנדלונג

פּראָגראַממירן הונדערטער לידער דורך אונדזער REST API. פּאַסיק פֿאַר מוזיק־פּראָדוקציע־פֿירמעס און DJ־פּאָאָלס

קלײַב אַלץ אױסundo-type

  • ניצן WAV אָדער FLAC אַרײַנשרײַב פֿאַר גרעסטע קװאַליטעט צעשײדונג
  • קלײַב אַלץ אױס כדי צו באַקומען די אקאפּעלאַ און אינסטרומענטאַל פֿון איין אַרײַנשרײַב
  • סטודיאָס מאַסטערס צעשײדן זיך קלענער ווי לעבן אױףנעמונגען אָדער װײַב־אַרײַנשרײַבונגען
  • לידער מיט קלאָרע סטריאָ צעשיידונג ברענגען די בעסטער רעזולטאטן
  • װיפֿל געקאָמפּרעסירטע MP3ס (128קב־ס אָדער קלענער) קען האָבן אַ פֿאַרקלענערטע צעטיילונג־קוואַליטעט
  • פֿאַר אַ מײַלפֿאָלק־שטײן (דרום, באַס, אױף אַהין), ניצט אונדזער שריפֿט גרײס

ווי עס אַרבעט

דיפּע נעוראַלע נעטוואָרקס אַנאַליסיסירן דעם אודיו־ספּעסטימום פֿון דיין ליד, ידענטיפיצירן די שפּראַך־פֿרײַכקייטן, און צעטיילן זיי קלאָר פֿון דעם אינסטרומענטאַלן הינטערגרונט אין דרייַ שריט.

שריט 1

אַרײַנשרײַבן אַ לידער

אַרײַנשרײַבן אַ לידער אין MP3, WAV, FLAC, OGG, אָדער M4A פֿאָרמאַטירונג. מיר שטיצן טעקע גרײס ביז 50 מעגאבייטן און לידער ביז 10 מינוט לענג. דיין טעקע איז פֿאַרקריפּטירט בשעת אױפֿלאַכונג און באַהאַנדלט זיך אױף אײגענע GPU אינסטרומענטן. טעקע ווערט אויטאָמאַטיש אויסגעמעקט אין 1 שעה פֿון באַהאַנדלונג

קלײַב אַלץ אױס

קלײַב אַלץ אױס

A Mel-Band RoFormer model converts your audio into a spectrogram split into mel-scaled frequency bands, then uses transformer attention across time and frequency to estimate the vocal track. The instrumental is the original mix with that vocal track removed, so the two tracks add back up to your song.

קלעפּvector-mode

אָפּלאָדירןStock label

הערן די צעשיידטע ווײַלע־ און אינסטרומענטעלע שטראָמען צוזאַמען מיט אונדזערע אַרײַנגעלייגטע אויטאָמאַטישע אוודיאָ־שפּילער, און דעמאָלט אָפּלאָדן יעדער שטראָם אין דיין באַליבסטע פֿאָרמאַטירונג

טעקסט פֿאַרבvector-mode

AI שטימע־אַרײַנשרײַב װײַזט אױף שרײַבערישע מעגלעכקייטן פֿאַר מוזיקער, DJס, אינהאַלט־שאַפֿער, און מוזיק־פֿאַרװאַנדלער איבער אַ ברייטער רשימה פֿון אַפּלאַקאַציעס.

קאַראַאָקע

קלײַב אַלץ אױסselect-criterion

מעק אַרױסundo-type

טעקסט פֿאַרבtransform-type

מוזיק־פּראָדוקציע

פֿאָרױסװײַז פֿאָרױסװײַז:

שריפֿט גרײס

שאַפֿן קלאָרע אינסטרומענטאַלן און אַקאַפּעלס פֿאַר לײַבדיקע DJ־סעטס. שאַפֿן איבערזעצונג־טראַקעס, שאַפֿן mashup-גרייטע סטעמס, און צוגרייטן וואָקאַלע־דראָפּס פֿאַר לײַבדיקע פֿאָרשטעלונגען. נייטיק פֿאַר DJס װאָס װילן אייגנאַרטיקע פֿאַרבינדונגען װאָס שטעלן זייערע סעטס אָפּ פֿון די קאָנקורענטן

מוזיק־אוניווערסיטעט

קלײַב אַלץ אױסmove-direction

טעקסט פֿאַרבview-padding-color

אַרײַנשרײַבן אינסטרומענטן פֿאַר הינטערגרונט־מוזיק אין פֿילמען, פּאָדקאַסטן, און געזעלשאַפֿטלעכע מעדיע אינהאַלט. ניצן װאָסער־פֿרייַע װערסיעס פֿון באַרימטע לידער װי הינטערגרונט־טראַקן אָן ליריקע אינטערעס. שאַפֿן אייגענע סאָונדבאַדס פֿאַר YouTube, TikTok, און Instagram אינהאַלט.

הענטל לידער

איבער־פֿאַרװײַז פֿאָרױסװײַז פֿאָרװײַז

איבערזעצונג און אַנאַליסיס

קלײַב אַלץ אױסtext-tool-action

דער בעסטער פֿרײַער שטימע־אַרײַנשרײַבער אינטערנעץ

װידערצײכן

Vocal removal runs a Mel-Band RoFormer model, a transformer that attends across time and across mel-scaled frequency bands of the spectrogram. On 50 MUSDB18 test excerpts it measured 11.3 dB vocal SDR and 16.0 dB instrumental SDR (signal-to-distortion ratio, higher is cleaner), about 3 dB better on both than the engine we used before. Expect some bleed on dense or heavily compressed mixes.

אײן מעקאַניזם אױף יעדער שאַט

פֿרײַע און קאָנטאָ צעשײדונגען אַרײַנשטעלן די זעלבע מאָדעל, אַזוי אַ פֿרײַע רעזולטאַט איז ניט אַ קלענערע קוואַליטעט פֿאָרױסװײַז. דער מאָדע וואָס דו קלײַבסט אױס ענדערט ווי דער אַרבעט איז באַצאָלט, ניט װיפֿל מאָדעל אַרײַנשטעלן

טעקסט פֿאַרבwaters-action

ניט־װי די אױסגאַבע־טעקע־פֿאָרמאַטירונג פֿון TTS.ai, װאָס װײַזט אױס אַ װײַס־װײַס בילד, װאָס װײַזט אױס אַ װײַס־װײַס בילד, װאָס װײַזט אױס אַ װײַס־װײַס בילד, אָדער װאָס װײַזט אױס אַ װײַס־װײַס בילד, װאָס װײַזט אױס אַ װײַס־װײַס בילד, װאָס װײַזט אױס אַ װײַס־װײַס בילד, װאָס װײַזט אױס אַ װײַס־װײַס בילד, װאָס װײַזט אױס אַ װײַס־װײַס בילד, װאָס װײַזט אױס אַ װײַס־װײַס בילד, װאָס װײַזט אױס אַ װײַס־װײַס בילד, װאָס װײַזט אױס אַ װײַס־װײַס בילד, װאָס װײַזט אױס אַ װײַס־װײַס בילד, װאָס װײַזט אױס אַ װײַס־װײַס בילד, װאָס װײַזט אױס אַ װײַס־װײַס בילד, װאָס װײַזט אױס אַ װײַס־װײַס בילד, װאָס װײַזט אױס אַ װײַס־װײַס בילד, װאָס װײַזט אױס אַ װײַס־װײַס בילד, װאָס װײַזט אױס אַ װײַס־װײַס בילד, װאָס װײַזט אױס אַ װײַס־װײַס בילד, װאָס װײַזט אױס אַ װײַס־װײַס בילד, װאָס װײַזט אױס אַ װײַס־װײַס בילד, װאָס װײַזט אױס אַ װײַס־װײַס בילד

REST API פֿאַר אַנטוויקלערס

װײַז/היטן טעקסט־פֿאָרעם

טעקסט פֿאַרבvoice-editor-action

אָנהײב פריי, פֿאַרװאַנדל אױף אױב דו װילסט מער

פֿרײַ
  • פֿאָרױסװײַז פֿאָרױסװײַזFormer vocal model
  • 10־מיניוטיקע לידער
  • טעקסט פֿאַרבvocals-action
  • MP3 און WAV אױסגאַבע
  • ניט נייטיק
באַרימט
אָפּרוקונג
  • דער זעלבער מאָדעל װי דער פֿרײַער שאַט
  • 4־שטײער צעטיילט אין דעם שטײער צעטיילער
  • פֿאָרױסװײַזundo-type
  • אַלע אױסגאַבע־פֿאָרמאַטירונגען
  • 15,000 פּאָזיציע־שריפֿטצײכן
אַרײַנשרײַבן
פּראָ
  • לענגערע אודיו־טעקעס
  • סעלעקציע:
  • API צוטריט
  • פּריאָריטעט באַהאַנדלונג
פֿאַרבעסערן

פֿראַגעס און ענטפֿערס

AI vocal removal uses a deep learning model (Mel-Band RoFormer) that analyzes the spectrogram of your song across time and mel-scaled frequency bands. It estimates the vocal track, and the instrumental is the original mix with that vocal track removed, producing clean karaoke-style output.

The vocal model measured 11.3 dB vocal SDR and 16.0 dB instrumental SDR on 50 MUSDB18 test excerpts, about 3 dB better on both than the engine we used before. The instrumental output is typically clean enough for karaoke or remixing. Some bleed-through may occur on heavily processed or compressed tracks.

יאָ! דו װעסט באַקומען בײדע די אייזאָלירטע װאָקאַלן און דעם אינסטרומענטאַלן שטראָם. דאָס איז נוצלעך װען דו שרײַבסט אַקאַפּעלאַ־װערסיעס, סאַמעל־װאָקאַלן פֿאַר רעמיקסעס, אָדער איבערשרײַבסט לידער פֿון קאָמפּליצירטע מיקסעס.

מיר שטיצן MP3, WAV, FLAC, OGG, M4A, און WEBM טעקע גרײס ביז 50 מעגאבייטן. פֿאַר די בעסטער רעזולטאטן, ניצט די העכסטן קװאַליטעט מקור טעקע וואָס איז בנימצא (WAV אָדער FLAC איז בעסער איבער צעפּיכעסלטע MP3)

יָה, צו מאַכן קאַראַאָקע־טרײַטן איז אַ פֿאָלקס־נויטיקע זאַך. די אינסטרומענטאַלע אַרײַנשרײַב איז קלאָר גענוג פֿאַר קאַראַאָקע־צושטעלונגען, צוזינג־ווידיאס און הינטערגרונט־מוזיק פֿאַר געשעענישן

קלײַב אַלץ אױסselect-action

װײַז פֿאָרױסװײַז פֿון טעקסט פֿאַרב

Our tool uses a Mel-Band RoFormer model for vocal separation. On 50 MUSDB18 test excerpts it measured 11.3 dB vocal SDR and 16.0 dB instrumental SDR. Transformer-based separation like this leaves fewer artifacts than older spectral-based methods.

יָה, אָבער די רעזולטאטן זײַנען פֿאַרשײדענע מיט לעבן־אויסגעפֿירטע אוודיאָ. סטודיאָס־אַרײַנשרײַבונגען געבן די בעסטער צעשײד־קוואַליטעט. לעבן־אַרײַנשרײַבונגען מיט װײַטער־רעש, רעװירב, און איבערגעװײַזטע אינסטרומענטן קען האָבן מער דורכפֿאַל, כאָטש דאָס מודל װײַזט נאָך אַלץ ניצלעך רעזולטאטן

טעקסט פֿאָרױסװײַז פֿאָרױסװײַז:

אודיו װאָס דו צעשײדסט אױף אַ װעלכע װײַל אױף אַ באַצאָלטע װירע קען מען ניצן פֿאַרקויף־צוועקן, און אױףצוהײבן װײַזט אויך אױף אודיו װאָס דו צעשײדסט פריער אױף דער פֿרײַער װירע; פֿרײַער װירע איז פֿאַר פּערזענלעכן, ניט־פֿאַרקויף־צוועקן. דער Mel-Band RoFormer װאָקאַל־מאָדל איז אױסגעגעבן אונטערן MIT־ליסענס, אַזוי דער מודל זיך װעט ניט אַרײַנשטעלן קיין פֿאַרבינדונגען צו פֿאַרקויף־צוועקן. אין װעלכע פֿאָרעם דו װילסט, מוזסטו האָבן די רעכטן צום אָריגינעלן ליד: ניצן קאָפּיר־רײַכטע מוזיק אָן דערלויבעניש קען װײַזן אױף אַ קאָפּיר־רײַכטע געזעצן, אױף װי דער אודיו איז באַהאַנדלט װײַל

דער באַהאַנדלונגס־צײַט דעפּענדט אױף דער שריפֿט־לענג. אַ נאָרמאַלער 3־5 מינוט־לידער נעמט 15־45 סעקונדעס צו באַהאַנדלען. לענגערע שריפֿטן אָדער העכער־קוואַליטעט צעשיידונגס־מאָדעלן קען נעמען אױף אַ מינוט. די רעזולטאטן װײַזן זיך אַװעק אין דיין בלעטערער
5.0/5 (1)

וואָס קען מען פֿאַרבעסערן? דיין אָפּרוף העלפֿט אונדז צו פֿאַרריכטן פּראָבלעמען

קלײַב אַלץ אױס

Join thousands of musicians and creators using TTS.ai. Vocal removal with a Mel-Band RoFormer model on every tier. 15,000 free characters with signup.