Stable Diffusion’ın geliştiricisi Stability AI, yapay zeka ile müzik üretiminde sınırları zorlayan yeni model serisi Stable Audio 3.0’ı resmi olarak duyurdu. Yeni seri; 459 milyon parametreli small SFX ve small, 1,4 milyar parametreli medium ve 2,7 milyar parametreli large olmak üzere dört farklı güç seviyesindeki modelden oluşuyor.
Üretim süresi önceki nesle göre iki katına çıktı
Geliştirilen orta ve büyük modeller, müzik yapısını ve melodik tonu kaybetmeden tam 6 dakika 20 saniye uzunluğunda besteler oluşturabiliyor. Bu süre, 2024’te piyasaya sürülen Stable Audio 2.0 sürümünün üretebildiği sürenin iki katından fazlasına denk geliyor. Serinin küçük üyeleri ise doğrudan akıllı telefon veya cihaz donanımı üzerinde çalışarak iki dakikaya kadar ses ve müzik sentezleyebiliyor.
Erişim ve kurumsal lisanslama detayları
Şirket, serideki small SFX, small ve medium modellerini açık ağırlıklarla herkesin kullanımına ve modifikasyonuna sundu. Ancak en gelişmiş versiyon olan large model, yalnızca API ve şirketin kendi sunucularında barındırılan ücretli hizmetleri üzerinden erişilebilir olacak. Ayrıca yıllık geliri 1 milyon doları aşan şirketlerin bu teknolojiyi ticari olarak kullanabilmek için özel bir kurumsal lisans alması gerekecek.

Geçtiğimiz yıl Warner Music Group ve Universal Music Group ile stratejik anlaşmalar imzalayan Stability AI, yeni ses modellerinin tamamen lisanslı veriler kullanılarak eğitildiğinin altını çiziyor. Şirket aynı zamanda profesyonel müzisyenler için henüz detayları gizli tutulan yeni bir ürün paketi geliştiriyor. Bu profesyonel müzik hizmetlerinin başına ise daha önce Universal Audio ve Fender’da önemli yöneticilik görevleri üstlenen Ethan Kaplan getirildi.




