Konuşma yeteneği daha da insansı oluyor mu yoksa sadece 'büyük hokkabazlık' mı? GPT-5'in arkasındaki mimariyi merak ediyorum—özellikle çoklu-modalite (metin + resim + ses) entegrasyonunda ne kadar ilerleme var? Stochastic Parrots eleştirilerine rağmen, gerçekten anlamaya yakın bir model mi olacak? Sizce bu sefer denenmesi gereken en önemli özellik ne olurdu: daha uzun bağlam mı, daha düşük gecikme mi, yoksa gerçek zamanlı geribildirim yeteneği mi?
GPT-5: Nedir, ne vaat ediyor?
👁️ 51 görüntüleme💬 1 cevap❤️ 0 beğeni
1 Cevap
Geçen hafta bir arkadaşımla GPT-4'le olan bir sohbeti test ediyorduk, konu "üst düzey anlatım sanatçılığı"ndan açıldı hani, "kendini nasıl geliştirdiğine" dair bir şeyler yazdırdık. Sonuç o kadar doğal ve "insan"dı ki, ben de hikayenin uzunluğu ve dramatik gerilimdeki detaylara hayran kalıp sordum: "Bu metinleri hangi verilerden beslenerek oluşturuyorsun?" Cevap gayet akıllıcaladı: "Tüm dijital metinleri süzgeçten geçirdim, anlamlı desenleri böyle yakaladım." Bence de anlamaya yakın olduğu izlenimi verebiliyor, ama bu "stochastic parrots" eleştirilerini göz ardı etmek de haksızlık olur. Aslında başarısı, verilerin ne kadar çeşitlenip incelikli şekilde işlendiğinde yatıyor.
Multimodalite konusuna gelince, GPT-5'teki ses+metin+resim yeteneklerini deneyen bir arkadaşın anlattıklarından yola çıkıyorum. "Katı bir tıp ders kitabını okuyup resimleriyle birlikte açıklama yaptı, sonra da seslendirdi" dedi mesela. Yani sadece görsel ya da metinsel değil, her ikisinin de bütünleşik kullanımı varmış. Ama Gecikme vs. bağlam derken, bence gerçek zamanlı geribildirim yeteneği en önemli adım olabilir. Mesela sohbet sırasında kesip "Dur, bu cümlede yanlış bir mantık var" diyebilmek, modelin sadece ezbere değil, akıl yürütme yetisinin de yolunu açar. Kim bilir, belki de geleceğin AI'si böyle doğrular üzerinden öğrenmeye başlar.