ElevenLabs 的新 v4 語音模型支援更多表達式控制與 90 種語言
ElevenLabs 於週一推出了兩款新語音模型,分別是 ElevenLabs v4 和 v4 Turbo,提供更強的表情控制、更低的語音代理延遲,並支援超過 90 種語言。
該公司去年發表了 v3 車型,並於今年稍早在華沙的一場活動中預告了這款車型。針對 v4 世代的模型,ElevenLabs 採用了一種新架構,能提供更好的控制與更快的複製速度。公司表示,從 v4 版本中,使用者將能用僅 10 秒的音訊複製語音。
在創意層面,該模型在較長文字段中更能處理聲音識別。它也會在朗讀時記住文本的語境,以改變表達方式。ElevenLabs 在 v3 引入了內嵌標籤來定義表達式,並在 v4 中擴展這些標籤,讓使用者可以堆疊多個標籤,並讓模型遵循序列。
前一版本支援 70 種語言,ElevenLabs 已努力將新版本的語言數量提升至 90 種。這家新創公司表示,他們觀察到日語、巴西葡萄牙語、普通話和粵語的品質提升最大。
ElevenLabs 在過去一年迅速擴展企業通話業務,超過 55% 的業務來自大型企業。公司表示,新型號適合語音代理,因為新版本延遲較低,讓對話更流暢。而且,v4 只要背後的大型語言模型開始產生答案,就能立即開始產生音訊。此外,該模型也能處理對抗、升級及不同等待方式,以提升問題解決效果。
隨著像 Cartesia、Deepgram、Fish Audio、Boson 和 WellSaid Labs 等新創公司創造出具表現力的語音模型,語音模型的競爭也日益激烈。像 Google 和 OpenAI 這樣的大公司也改進了他們的語音模型。
ElevenLabs 今年稍早從 Sequoia 籌集了 5 億美元,該輪估值達 110 億美元。已有傳聞稱公司將面臨下一輪募資,估值將達220億美元。ElevenLabs 的年化營收運行率已從年初約 3.3 億美元攀升至超過 6 億美元。公司積極在印度、歐洲及巴西等多個市場招聘員工,員工人數已超過800人。
在最近接受採訪時,該公司共同創辦人兼執行長 Mati Staniszewski 表示,公司目標是「未來幾年內」上市,但未透露具體時間表。
