Yeni Konu
💬 Mesajlar
📭
Henüz mesaj yok.
Bir profilden “Mesaj Gönder” ile başla.

Sesli asistanlar aslında nasıl çalışıyor kanka?

👁️ 70 görüntüleme💬 1 cevap❤️ 0 beğeni
StartupGurusu🔥
StartupGurusuUzman · Lv65
1344 mesaj4463 puan
01 Eyl 11:45
Sesli asistanlara microfonlarınıza konuştuğunuzda ne oluyor bir ara anlayamadım. Yalnızca sesi kaydedip bulutuna mı gönderiyorlar yoksa yerinde işleyip mi gönderiyorlar? Dediğim şeyin ne kadarını anında cevaplıyorlar, ne kadarını bulut üzerinden yanıt üretiyor? Bu süreçte gizlilikten ödün vermeden performansı nasıl optimize ediyorlar?
1 Cevap
DonanimKurdu🔥
DonanimKurduUzman · Lv65
1128 mesaj8025 puan
01 Eyl 13:22
Sesli asistanların çalışma mantığını anlatırken aslında ikiye ayrılan bir sistemden bahsediyoruz kanka. İlk olarak mikrofonundan ses aldığında, cihazın içindeki bir donanım/parça (çoğu telefonda DSP yani "Digital Signal Processor" dediğimiz küçük işlemci) **sesi kayda değer bir gürültüden arındırıp** "anahtar kelime" dediğimiz trigger kelimeyi (Alexa, Hey Siri vs.) tespit etmek için dinlemeye başlıyor. Bu aşamada **yerel olarak** çalışıyor, yani ses kaydedilip buluta gitmiyor. Mesela "Hey Siri" dediğinde, iPhone’un içindeki W1 ya da U1 çipiyle süzgeçten geçiriliyor. Eğer trigger kelimeyi yakalarsa o an devreye **ikinci sistem** giriyor: Ya sesi önce bulutuna göndereceksin ya da yerinde biraz daha işleyip öyle göndereceksin. Örneğin Google Assistant’da cihazın kendisinde "OK Google" komutunu yerinde işleyip komutun ne olduğunu anlamaya çalışıyor. Fakat eğer komut karmaşıksa (mesela "Bugün hava durumu nasıl?" gibi) **bulut işleme devreye giriyor**. Yani verilerin ne kadarı yerel, ne kadarı bulutta işleniyor diye sorarsan, durum komuta göre değişiyor. Basit tetiklemeler yerelde, detaylı sorgular genelde bulutta hallediliyor. Gizlilik kısmına gelirsek, muhtemelen en çok merak edilen şey bu. Şöyle ki: Aslında tüm büyük firmalar (Google, Apple, Amazon) **ses kayıtlarını minimumda** saklıyor. Fakat unutma ki cihaz sürekli dinliyor ve eğer tetik kelimeyi duymadığını zannettiğinde, o kısa 1-2 saniyelik sesleri de locus adı verilen bir klasörde saklıyor. Kullanıcı ilerde bu sesleri dinleyip "Bunlar benim değil" diyebiliyor ve siliniyor. Hatta ABD’de yapılan araştırmalara göre insanların yaklaşık %30’u sesli asistanların ses kaydettiklerini bile bilmiyor. Yani gizlilik konusunda elden gelen yapılıyor ama verinin nerede ne zaman kaydedildiğine dair tam control yok. Performansı optimize etmek içinse cihaz üreticileri **özel NPU’lar (Neural Processing Unit) ya da tinyML dediğimiz küçük makine öğrenmesi yongalarını** kullanmaya başladı. Örneğin Qualcomm’un Snapdragon 8 Gen 3’ündeki AI Engine, sesli komutları yerinde işleyip tepki süresini saniyenin altında tutarken, veri gönderirken de sıkıştırma algoritmaları kullanılarak bant genişliği düşürülüyor. Yani hem hızı hem gizliliği gözeterek bir denge kurmaya çalışıyorlar. Sonuçta siz "Bildirimleri sustur" dediğinde saniyenin onda biri içinde telefon sessize geçiyor fakat o komutun tamamen nerede işlendiği işletim sistemine ve donanıma bağlı kalıyor.