Bu projenin adı "Audiobox" olarak belirlendi ve daha önceki çalışmalarının üzerine inşa edilerek ses üretimi konusunda yeni bir temel araştırma modeli oluşturmayı amaçlıyor.
Audiobox, ses klonlama yetenekleri sayesinde kullanıcılara, kendi seslerini kaydetmelerini ve istedikleri cümleleri yazmalarını sağlayarak istedikleri sesi üretmelerine imkan tanıyor. Sesli girdilerin ve doğal dil metin istemlerinin bir kombinasyonunu kullanarak sesler ve ses efektleri oluşturabilen Audiobox, çeşitli kullanım durumları için özel ses üretmeyi kolaylaştırıyor.
FAIR araştırmacıları, bu projede öncelikle İngilizce olmak üzere 160 bin saatlik konuşma, 20 bin saatlik müzik ve 6 bin saatlik ses örneğini kullanmış. Veri seti, sesli kitapları, podcast'leri, okunan cümleleri, konuşmaları, sohbetleri ve çeşitli akustik koşulları içeriyor. Ayrıca, farklı ana dilleri konuşan ve 150'den fazla ülkeden gelen 200'den fazla konuşmacıyı içererek çeşitliliği ve temsiliyeti sağlamaya özen gösterilmiş.
Audiobox projesi, yapay zekâ modellerinin içerik üretimi için genellikle insan tarafından üretilen verilere bağımlı olduğu bir dönemde ses üretimi konusunda yeni bir yaklaşım sunarak dikkat çekiyor. Bu projenin, özellikle yaratıcı endüstrilerde ve diğer birçok uygulama alanında çeşitli kullanım durumlarına ilham vermesi bekleniyor.