Özet
Bu çalışmada görme engelli katılımcıların TTS ile seslendirilmiş betimlemelerdeki ses tercihleri araştırılmıştır. Ses olarak ElevenLabs servisinin sunduğu doğal insan sesine daha yakın sesleri temsilen Belma sesi, Çoğu ekran okuyucusunda ana ses olarak yer alan Nuance Yelda sesi, ve daha mekanik ama tepkimeleri daha hızlı olduğu için tercih edilen Google TTS sesleri kullanılmıştır. Test için Mandalina bahçesi adlı bir filmin 5 dakikalık betimlemesi bu 3 TTS tarafından seslendirilerek katılımcılara Google form aracılığıyla sunulmuştur. Sonuçlar İnsan sesine daha yakın olan TTS Belma sesinin büyük bir çoğunluk tarafından tercih edildiğini göstermiştir.
Veri toplama dönemi: 8–16 Ağustos 2026.
Katılımcı sayısı: 58
Kısa Özet
Bu ankette 58 katılımcı, betimlemeli filmlerde kullanılabilecek üç farklı TTS (metinden-sese) sesini değerlendirdi. En açık bulgu, ElevenLabs Belma sesinin güçlü biçimde öne çıkmasıdır. Katılımcıların 50’si (%86,2) bundan sonraki bir filmin betimlemesinde Belma sesini tercih edeceğini belirtti. Belma’nın ortalama puanı 4,31/5 olurken, Vocalizer Yelda 3,00/5 ve Google TTS 2,22/5 ortalama aldı.
İkinci önemli bulgu, bu tercihin katılımcıların daha önce TTS ile seslendirilmiş betimlemeli film izleme deneyimine bağlı görünmemesidir. TTS deneyimi hiç olmayanlarda Belma tercihi %83,3; nadiren TTS ile film izleyenlerde %87,0; halen zaman zaman TTS ile film izleyenlerde yine %87,0’dır. Başka bir ifadeyle, Belma yalnızca TTS’ye yeni olan kişiler tarafından değil, TTS kullanımına daha aşina kişiler tarafından da benzer ölçüde tercih edilmiştir.
Üç sesin puanları arasındaki fark istatistiksel olarak da çok güçlüdür. Belma > Yelda > Google sıralaması yalnızca ortalamalarda değil, uygulanan istatistiksel testlerde de doğrulanmıştır. Buna karşılık deneyim düzeyinin ne ses tercihi ne de seslere verilen puanlar üzerinde anlamlı bir etkisi bulunmuştur.
Tek cümlede ana sonuç: Yeni nesil ElevenLabs Belma sesi açık ara tercih edilmiş; bu tercih TTS ile betimlemeli film izleme deneyiminin az ya da çok olmasına göre değişmemiştir.
Bir bakışta
| Gösterge | Sonuç |
| Toplam katılımcı | 58 |
| Belma’yı tercih eden | 50 kişi (%86,2) |
| Belma ortalama puanı | 4,31 / 5 |
| Yelda ortalama puanı | 3,00 / 5 |
| Google TTS ortalama puanı | 2,22 / 5 |
| Belma’ya 4 veya 5 veren | 52 kişi (%89,7) |
| Deneyim ile Belma tercihi ilişkisi | Anlamlı ilişki yok (p = 0,949) |
1. Araştırmanın kapsamı ve katılımcılar
Analiz, 8–16 Ağustos 2026 tarihleri arasında toplanan 58 geçerli yanıt üzerinden yapılmıştır. Katılımcılara TTS ile seslendirilmiş betimlemeli film deneyimleri, gelecekte hangi sesi tercih edecekleri ve Google TTS, Vocalizer Expressive Yelda ile ElevenLabs Belma seslerine 1–5 arasında verdikleri kalite/telaffuz puanları sorulmuştur.
Deneyim dağılımı, örneklemin yalnızca TTS’ye yeni kişilerden oluşmadığını göstermektedir. Katılımcıların %79,3’ü daha önce en az bir kez TTS ile seslendirilmiş betimlemeli film izlemiş; %39,7’si ise bu tür filmleri halen zaman zaman izlediğini belirtmiştir.
| TTS ile betimlemeli film deneyimi | n | Oran |
| Hiç deneyimi olmayan | 12 | %20,7 |
| Çok nadir / bir veya birkaç kez izleyen | 23 | %39,7 |
| Halen zaman zaman izleyen | 23 | %39,7 |
| Toplam | 58 | %100 |
2. Genel bulgular
2.1. Gelecekte kullanılacak ses tercihi
Tercih sorusunda ElevenLabs Belma belirgin biçimde öne çıkmıştır. 58 katılımcının 50’si (%86,2) Belma’yı seçmiştir. Vocalizer Yelda 5 kişi (%8,6) tarafından tercih edilirken, Google TTS, “hiçbiri” ve Microsoft Emel/Ahmet seçeneklerinin her biri birer kişi tarafından belirtilmiştir.
| Tercih edilen ses | n | Oran |
| ElevenLabs Belma | 50 | %86,2 |
| Vocalizer Expressive Yelda | 5 | %8,6 |
| Google TTS | 1 | %1,7 |
| Hiçbiri | 1 | %1,7 |
| Microsoft Emel/Ahmet | 1 | %1,7 |
2.2. Seslerin 1–5 puanları
Puanlama sonuçları, doğrudan tercih sorusuyla aynı sıralamayı üretmiştir. Belma 4,31 ortalama ile açık ara en yüksek; Yelda 3,00 ile orta düzeyde; Google TTS ise 2,22 ile en düşük ortalamaya sahiptir.
| Ses | Ortalama | Standart sapma | Medyan | 4–5 puan veren |
| Google TTS | 2,22 | 1,08 | 2 | %10,3 |
| Vocalizer Yelda | 3,00 | 1,03 | 3 | %29,3 |
| ElevenLabs Belma | 4,31 | 0,86 | 4 | %89,7 |
Belma’ya 58 katılımcının 52’si 4 veya 5 puan vermiştir. Bu oran %89,7’dir. Dolayısıyla Belma’nın üstünlüğü yalnızca “hangi sesi seçerdiniz?” sorusuna değil, bağımsız 1–5 değerlendirmelerine de yansımıştır.
3. İstatistiksel analiz ve örüntüler
1–5 puanlar sıralı (ordinal) ölçek niteliğinde olduğundan, sonuçların sağlamlığını kontrol etmek amacıyla hem parametrik testler (ANOVA / t-testi) hem de parametrik olmayan testler (Friedman, Wilcoxon, Kruskal–Wallis, Mann–Whitney) kullanılmıştır. İki test ailesi de aynı temel sonuçlara ulaşmıştır.
3.1. Üç ses arasında anlamlı bir kalite/tercih farkı var mı?
Evet. Aynı katılımcıların üç sesi puanlaması dikkate alınarak yapılan Friedman testi, ses puanlarının birbirinden güçlü biçimde farklılaştığını göstermiştir: χ²(2) = 65,01; p < 0,001; Kendall’s W = 0,56. W = 0,56, pratik açıdan da belirgin/büyük bir etkiye işaret etmektedir.
Parametrik tekrarlı ölçümler ANOVA’sı da aynı sonucu vermiştir: F(2,114) = 67,43; p < 0,001; kısmi η² = 0,542. Bu bulgu, hangi sesin dinlendiğinin puanlarda büyük bir fark yarattığını göstermektedir.
İkili Wilcoxon karşılaştırmalarında da üç karşılaştırmanın tamamı anlamlıdır: Belma > Yelda (p < 0,001), Belma > Google (p < 0,001) ve Yelda > Google (p < 0,001). Ortalama puan farkı Belma–Yelda arasında +1,31; Belma–Google arasında +2,09; Yelda–Google arasında +0,78 puandır.
3.2. TTS deneyimi, Belma tercihini değiştiriyor mu?
Deneyim grupları arasında Belma tercih oranları neredeyse aynıdır:
| Deneyim grubu | Belma tercihi |
| Hiç deneyimi olmayan | 10/12 = %83,3 |
| Nadiren izleyen | 20/23 = %87,0 |
| Halen zaman zaman izleyen | 20/23 = %87,0 |
Belma / Belma dışı tercih ile üç deneyim düzeyi arasındaki ki-kare testi anlamlı değildir: χ²(2) = 0,105; p = 0,949. Hücre sayılarının küçük olabileceği dikkate alınarak, “halen zaman zaman izleyen” grup ile diğer iki deneyim grubunu karşılaştıran Fisher kesin testi de yapılmış ve yine anlamlı bir fark bulunmamıştır (p = 1,00).
Yorum: TTS deneyimi arttıkça Belma’ya yönelme azalmakta ya da artmakta değildir. Belma tercihi üç deneyim grubunda da yaklaşık %83–87 düzeyinde sabittir.
3.3. TTS deneyimi, seslere verilen puanları değiştiriyor mu?
| Deneyim grubu | Yelda | Belma | |
| Hiç deneyimi olmayan | 2,42 | 3,25 | 4,50 |
| Nadiren izleyen | 2,35 | 2,87 | 4,26 |
| Halen zaman zaman izleyen | 2,00 | 3,00 | 4,26 |
Tek yönlü ANOVA sonuçlarında deneyim düzeyinin Google (p = 0,438), Yelda (p = 0,590) veya Belma (p = 0,701) puanları üzerinde anlamlı etkisi görülmemiştir. Kruskal–Wallis testleri de aynı sonuca ulaşmıştır (sırasıyla p = 0,479; p = 0,651; p = 0,698).
Deneyim iki gruba indirildiğinde de sonuç değişmemektedir. Halen zaman zaman TTS ile film izleyenlerin Belma ortalaması 4,26; diğer katılımcıların ortalaması 4,34’tür. Welch t-testinde bu fark anlamlı değildir (p = 0,721). Yelda puan ortalaması iki grupta da 3,00’dır (p = 1,00). Google’da deneyimli grupta daha düşük bir ortalama görülse de fark anlamlı değildir (2,00’a karşı 2,37; p = 0,185).
3.4. Deneyim arttıkça Belma’nın diğer seslere göre avantajı değişiyor mu?
Her katılımcı için Belma puanından Yelda puanı çıkarıldığında Belma’nın avantajı; hiç deneyimi olmayanlarda +1,25, nadiren izleyenlerde +1,39 ve halen zaman zaman izleyenlerde +1,26 puandır. Bu farkların deneyim düzeyine göre değişimi anlamlı değildir (ANOVA p = 0,938). Belma–Google farkında da deneyime bağlı anlamlı bir değişim yoktur (p = 0,706).
Yorum: Belma’nın yalnızca mutlak puanı değil, Yelda ve Google’a karşı göreli üstünlüğü de deneyim gruplarında kararlıdır.
3.5. Tercih sorusu ile puanlama soruları tutarlı mı?
Evet. Katılımcıların verdikleri üç puan içinde tek başına en yüksek puanı alan ses 47 kişide (%81,0) Belma, 5 kişide Yelda’dır; 6 kişide en yüksek puanda eşitlik vardır. Eşitlikler de dahil edildiğinde 52 kişinin (%89,7) en yüksek puan verdiği sesler arasında Belma bulunmaktadır.
Listelenen üç sesten birini doğrudan tercih eden 56 katılımcının 54’ünde (%96,4), ifade edilen tercih kişinin kendi puanlarında en yüksek veya en yükseklerden biri olan sesle örtüşmektedir. Bu yüksek uyum, tercih sorusu ile puanlama sonuçlarının birbirini güçlü biçimde doğruladığını göstermektedir.
4. Bulguların yorumu
Anket sonuçları, üç ses arasında yalnızca küçük bir beğeni farkı değil, belirgin bir tercih yapısı bulunduğunu göstermektedir. ElevenLabs Belma hem doğrudan tercihte hem de 1–5 puanlamada açık ara öndedir. Yelda ikinci sırada ve daha çok orta düzeyde değerlendirilirken, Google TTS en düşük değerlendirmeleri almıştır.
Özellikle dikkat çekici olan, TTS deneyiminin sonuçları değiştirmemesidir. Eğer yeni nesil sese yönelik yüksek puan yalnızca TTS’ye aşina olmayan kişilerden kaynaklansaydı, TTS ile halen zaman zaman film izleyen grupta Belma tercihin daha düşük olması beklenebilirdi. Veride böyle bir örüntü görülmemektedir. Tam tersine, Belma tercihi tüm deneyim düzeylerinde yaklaşık aynı düzeydedir.
Bu nedenle veri, “TTS’ye alışkın kullanıcılar klasik TTS seslerini daha çok tercih eder” varsayımını desteklememektedir. Bunun yerine, daha doğal/akıcı algılanan yeni nesil bir sesin TTS deneyiminden bağımsız biçimde geniş bir kullanıcı grubunda tercih edilebildiğini düşündürmektedir. Bu son ifade bir nedensellik iddiası değil, ankette gözlenen örüntünün yorumudur.
5. Sınırlılıklar
- Örneklem 58 kişidir. Ana tercih farkı çok güçlü olsa da, Belma dışındaki tercih grupları çok küçüktür. Bu nedenle “Yelda’yı tercih edenlerin özellikleri” gibi ayrıntılı alt grup analizleri güvenilir değildir.
- 1–5 puan ölçeği ordinal niteliktedir. Bu nedenle parametrik testlerin yanında parametrik olmayan testler de kullanılmıştır; her iki yaklaşım aynı sonuçları vermiştir.
- Örnekleme yöntemi ve katılımcıların evreni temsil düzeyi bu veri setinden tek başına belirlenememektedir. Sonuçlar öncelikle ankete katılan 58 kişinin değerlendirmelerini yansıtmaktadır.
- Anket tercih ve algı ölçmektedir; tek başına neden-sonuç ilişkisi kurmaz. Örneğin Belma kullanımının izleme deneyimini hangi ölçüde iyileştirdiğini belirlemek için ayrıca deneysel veya uzun dönemli çalışmalar gerekir.
6. Sonuç
58 katılımcıyla gerçekleştirilen bu değerlendirmede ElevenLabs Belma, hem tercih oranı (%86,2) hem de ortalama puanı (4,31/5) bakımından açık ara öne çıkmıştır. Vocalizer Yelda 3,00/5, Google TTS ise 2,22/5 ortalama almıştır. Sesler arasındaki fark istatistiksel olarak güçlüdür ve büyük bir etki büyüklüğü göstermektedir.
Bulguların en önemli ikinci yönü, TTS ile betimlemeli film izleme deneyiminin bu sonucu değiştirmemesidir. Hiç TTS deneyimi olmayan, nadiren TTS ile film izleyen ve halen zaman zaman TTS kullanan katılımcılarda Belma tercih oranı birbirine çok yakındır; deneyim grupları arasında ne tercih ne de puanlar bakımından anlamlı bir farklılık saptanmıştır.
Sonuç olarak bu örneklem, betimlemeli filmlerde yeni nesil TTS kullanımına yönelik güçlü ve deneyim düzeyinden bağımsız bir kullanıcı kabulüne işaret etmektedir. Tercih sorusu ile puanlama sonuçlarının %96,4 düzeyindeki uyumu da bu bulgunun anket içinde yüksek bir iç tutarlılığa sahip olduğunu desteklemektedir.
İstatistiksel not
Anlamlılık düzeyi genel olarak α = 0,05 olarak değerlendirilmiştir. Kullanılan başlıca testler: Friedman tekrarlı ölçüm testi, Wilcoxon eşleştirilmiş sıra testi, tekrarlı ölçümler ANOVA, tek yönlü ANOVA, Kruskal–Wallis testi, Welch t-testi, Mann–Whitney U testi, ki-kare bağımsızlık testi ve Fisher kesin testi. Bulguların yorumunda yalnızca p-değerleri değil, etki büyüklükleri ve gözlenen oran/ortalama farkları da dikkate alınmıştır.