Sesame CSM

Sesame CSM TTS

A 1B conversational speech model that captures natural dialogue timing, turn-taking, and backchannel responses.

Εγγραφείτε για όριο 5.000 χαρακτήρων

Τυλίξτε το κείμενο σας σε ετικέτες EEML για τον ακριβή έλεγχο:

<speak><prosody rate="slow">Slow speech</prosody></speak>

Ετικέτες το επιλεγμένο μοντέλο καταλαβαίνει □ κάντε κλικ για να ρίξετε ένα στο κείμενο σας όπου συμβαίνει:

Αυτό το μοντέλο διαβάζει απλό κείμενο, έτσι οι ετικέτες inline αγνοούνται. Για tag-based συναίσθημα, μεταβείτε σε ένα εκφραστικό μοντέλο όπως ο Ορφέας ή Bark.

Define custom προφορές (word = εκφώνηση):

-12 +12
0.5x 2.0x
Δωρεάν με Piper, VITS, MeloTTS
Επιλέξτε ένα μοντέλο, εισάγετε το κείμενο και κάντε κλικ στη Δημιουργία.
Ο Ήχος Δημιουργήθηκε Επιτυχώς
0:00
Λήψη ήχου Κατεβάστε.srt Η σύνδεση λήγει σε 24 ώρες
Δωρεάν βαθμίδα: προσωπική χρήση. Εμπορική άδεια από $ 5 /mo
Τρέξιμο χαμηλό σε ελεύθερους χαρακτήρες Πάρτε 200K χαρακτήρες κάθε μήνα ~ $ 5 /mo ή ένα πακέτο 100K για $5
Κάνε αυτό τη δική σου φωνή. Κλώνε μια φωνή σε 30 δευτερόλεπτα
Αγάπη TTS.ai; Πες στους φίλους σου!

Σχετικά Sesame CSM

Sesame CSM (Conversational Speech Model) is a 1-billion-parameter model from Sesame designed specifically for the rhythms of human conversation. Built on a Llama backbone paired with an audio codec, it models turn-taking timing, backchannel responses (the small acknowledgements people make while listening), emotional reactions, and overall conversational flow. The result reads less like read-aloud text and more like a real spoken exchange. It is a natural fit for AI assistants, chatbots, and conversational interfaces where the goal is speech that feels responsive and human. CSM is released under Apache 2.0, and access on TTS.ai requires a Hugging Face token at the model level.

Το καλύτερο για: AI assistants, chatbots, conversational AI applications

Περιήγηση σε όλα Sesame CSM φωνές

Με μια ματιά.

Προγραμματιστής
Sesame
Άδεια
Apache 2.0
Βαθμίδα
premium
Ταχύτητα
slow
Κλωνοποίηση φωνής
Όχι.
Γλώσσες
English
Μεγ. χαρακτήρες
500

Sesame CSM φωνές

Speaker 0

English
Θετική πριμοδότηση Neutral

Speaker 1

English
Θετική πριμοδότηση Neutral

Sesame CSM TTS □ Συχνές ερωτήσεις

Conversational speech. It models the natural patterns of dialogue — turn-taking timing, backchannel responses, and emotional reactions — so generated audio sounds like a real conversation rather than synthetic narration.

It is a 1-billion-parameter model built on a Llama backbone with an audio codec for waveform generation.

AI assistants, chatbots, and other conversational applications where responsive, human-sounding speech matters more than long-form narration.
← Όλες οι φωνές