Yapay zeka ses teknolojileri devi ElevenLabs, sesli deneyimi kökten değiştirecek yeni nesil modelleri Eleven v4 ve Eleven v4 Turbo'yu piyasaya sürdü. Bu devasa adımla, ElevenLabs, insan sesine en yakın, en doğal ve en duygu dolu sesleri yaratma potansiyelini bir kez daha kanıtlıyor. Şirketin bugüne kadar geliştirdiği tüm ses modelleri arasında zirveye yükselen Eleven v4, tonlamadan karakterinize, bağlamdan duygu yoğunluğuna kadar her detayı hassas bir şekilde kontrol etmenizi sağlıyor.

Eleven v4'ün kalbinde, metnin derinlemesine analiz edilerek seslendirme sürecine aktarılması yatanıyor. Bu sayede, dramatik bir sahne, neşeli bir sohbet, sakin bir anlatım veya heyecan verici bir reklam gibi farklı senaryolar için eşsiz sesler oluşturmak mümkün hale geliyor. Model, geçmiş konuşmalardan elde edilen bilgileri de dikkate alarak, sonraki repliklerin tonunu ve stilini otomatik olarak ayarlayarak, akıcı ve tutarlı bir iletişim deneyimi sunuyor. Bu yenilikçi yaklaşım, Eleven v3'te sunulan satır içi ses etiketleri sistemiyle birleşince, kullanıcıların yaratıcılıklarını daha da serbest bırakmalarını sağlıyor. Kullanıcılar, birden fazla etiketle karmaşık ses efektleri oluşturarak, modelin yeteneklerini daha da genişletebiliyor. Örneğin, ‘kahkaha’ ve ‘telefon titreşimi’ gibi unsurları bir araya getirerek, gerçekçi bir sahne oluşturabilirler.

Eleven v4'ün en dikkat çekici özelliklerinden biri, 10 saniyelik bir ses kaydından oluşturulan bir kişiye ait sesin birebir kopyalanabilmesi. Bu, ElevenLabs'ın Profesyonel Ses Klonlama özelliği, Eleven v3 ile desteklenemiyordu ve şimdi bu özellik yeniden hayata döndürülerek Eleven v4 ile birlikte kullanıcılara sunuluyor. Ayrıca, model, 90'dan fazla dil desteği sunarak, özellikle Japonca, Brezilya Portekizcesi, Mandarin ve Kantonca gibi dillerde olağanüstü kalite artışları sağlıyor. Bu sayede, farklı dillerde oluşturulan ses klonlarının, yerel aksanları kullanarak daha doğal bir şekilde konuşabilmesi mümkün hale geliyor.

Diğer yandan, Eleven v4 Turbo, özellikle gerçek zamanlı uygulamalarda ve çağrı merkezlerinde kullanılan sesli yapay zeka ajanları için tasarlanmış bir model. Model, ‘çift yönlü streaming’ teknolojisi sayesinde, bir cümle tamamlanmadan ses üretmeye başlayabiliyor. Testlere göre, Eleven v4 Turbo'nun ilk sesi üretmeye başlama süresi yaklaşık 150 milisaniye, çıkarım gecikmesi ise 100 milisaniyede bulunuyor. Bu, kullanıcıların anında geri bildirim almasını ve etkileşimli bir deneyim yaşamasını sağlıyor. ElevenLabs, bu modelin müşteri hizmetleri senaryolarında, karşılıklı konuşmaları daha akıcı hale getirmesi ve arka plan gürültüsünü ortadan kaldırması gibi avantajlar sunduğunu belirtiyor. Uzun içerik üretimi konusunda da Eleven v4, 10 bin karakter kadar metni tek seferde işleyebiliyor. Bu özellik, sesli kitap, podcast ve reklam gibi uzun formatlı içeriklerin oluşturulmasında büyük bir kolaylık sağlıyor.