Rakiplerini kalite testinde yerle bir etti: Gemini 3.8 Live yapay zeka dünyasında taşları yerinden oynattı

Rakiplerini kalite testinde yerle bir etti: Gemini 3.8 Live yapay zeka dünyasında taşları yerinden oynattı

Google, sesli yapay zeka alanında gecikmeleri sıfıra indiren yeni Gemini 3.8 Live ve Extended Thinking modellerini kullanıma sundu. Sistem, kullanıcıyla kesintisiz sohbet ederken arka planda araç çağrıları ve karmaşık akıl yürütme süreçlerini eş zamanlı işleterek çok adımlı görevleri yerine getiriyor.

Yazılım ve teknoloji devi Google, sesli yapay zeka sistemlerindeki gecikmeleri en aza indiren Gemini 3.8 Live ile Gemini 3.8 Live Extended Thinking modellerini 15 Eylül 2026 tarihinde kamuoyuna tanıttı.

Amerika Birleşik Devletleri (ABD) merkezli şirketin resmi geliştirici blogu üzerinden paylaştığı yeni nesil teknoloji, kullanıcılarla sesli iletişim kurarken eş zamanlı şekilde arka planda araç ve Uygulama Programlama Arayüzü (API) çağrıları yürütüyor.

Sistem, konuşma akışını hiçbir noktada kesintiye uğratmadan verilen görevleri tamamlıyor ve böylece günlük insan konuşmasına çok daha yakın bir deneyim sağlıyor.

google-gemini-3-8-neler-sunuyor.jpg

EŞ ZAMANLI AKIL YÜRÜTME VE MALİYET ODAKLI ÇİFTE YOL HARİTASI

Google bünyesindeki mühendisler, tanıtılan iki farklı sürümün kullanım alanlarını ve hedeflerini detaylandırdı.

Şirketin Kıdemli Mühendisi Tom Ouyang ve Malini Jaganathan tarafından yapılan açıklamaya göre standart Gemini 3.8 Live sürümü, geniş kitlelere ulaşma kabiliyeti ile maliyet verimliliğine odaklanıyor.

Buna karşın serinin güçlü seçeneği olan Extended Thinking sürümü, yüksek işlem karmaşıklığı barındıran durumlar ve çok adımlı akıl yürütme ihtiyaçları için güç kazandı.

Söz konusu gelişmiş sürüm, konuşma esnasında zihinsel akıl yürütmeyi paralel biçimde sürdürüyor ve arka planda işleyen süreçlerin gidişatını kullanıcıya sesli aktarıyor.

97 DİLDE ANINDA ÇEVİRİ VE GERÇEK ZAMANLI GÖRSEL İŞLEME

Çok dilli iletişim kabiliyetini zirveye taşıyan modeller, tam 97 farklı dilde konuşulanları eksiksiz anlama ve doğrudan ses üretme kapasitesi barındırıyor.

Konuşulan dili kendiliğinden tespit eden sistem, diyalog akarken diller arasında hiçbir takılma yaşamadan anlık geçişler yapabiliyor.

Modeller yalnızca sesle sınırlı kalmayıp, çevreye dair görsel verileri de gerçek zamana yakın hızla analiz ediyor.

Kameralardan veya ekranlardan gelen görsel bağlam doğrudan konuşma sürecine dahil oluyor ve yapay zeka verdiği yanıtları bu anlık bilgilerle zenginleştiriyor.

KOD YAZIMINDAN SATRANCA KADAR UZANAN ÇARPICI DEMOLAR

Teknoloji dünyasıyla paylaşılan canlı test demoları, yeni modellerin pratik hayattaki gücünü somut örneklerle gözler önüne serdi.

Standart model, görsel bağlamı değerlendirerek kurumsal şirketlerde işe yeni başlayan personelin oryantasyon sorularını cevaplıyor ve görsel tahta üzerinden satranç oynuyor.

Extended Thinking sürümü ise kağıt üzerine çizilen basit arayüz taslaklarını ve sesli yönlendirmeleri anında çalışan React yazılım bileşenlerine dönüştürüyor.

Model ayrıca arka planda birden fazla aşama barındıran otel ve restoran rezervasyon işlemlerini sesli sohbeti kesmeden yönetiyor.

BENCHMARK TESTLERİNDE RAKİPLERİNİ GERİDE BIRAKTI

Bağımsız yapay zeka kıyaslama platformu Artificial Analysis tarafından gerçekleştirilen değerlendirmeler, modellerin ses kalitesindeki üstünlüğünü kanıtladı.

Konuşmadan Konuşmaya Kalite Endeksi (Speech to Speech Quality Index) testlerinde 82,6 puan elde eden Extended Thinking, sektördeki en büyük rakipleri GPT-Live-1-Astra ve Grok Voice Think Fast 2.0 modellerini geride bıraktı.

Serinin standart modeli ise dünya genelindeki sesli asistanları sıralayan Speech Agent Arena tablosunda ikinci basamağa yerleşti.

Tom Ouyang duyuruda, "Zeka ve paralel akıl yürütme alanındaki büyük yükseltmeler, modellerle iş birliği yapmayı ve karmaşık görevleri sesle yerine getirmeyi daha sezgisel kılıyor" ifadesine yer verdi.

UYGULAMA VE ABONELİK SİSTEMLERİNE KADEMELİ DAĞITIM

Her iki yenilikçi model, Gemini API ile Google AI Studio platformları üzerinden geliştiricilerin kullanımına açıldı.

Kurumsal alanda ise Gemini Enterprise paketini tercih eden kurumlar özel ön izleme sürümüyle modellere ulaşıyor.

Arama motorundaki Search Live özelliği standart modelle güç kazanırken, Gemini Live uygulaması Extended Thinking altyapısına geçiş yapıyor.

Workspace ekosisteminde Docs uygulaması Google AI Pro ve Ultra abonelerine sunulurken; Gmail ile Keep servisleri tüm Google AI kullanıcılarına açılıyor.

Güvenlik tarafında ise üretilen tüm ses içeriklerine yapay zeka tespiti sağlayan SynthID dijital filigranı ekleniyor.

DAKİKA BAŞINA KULLANIM ÜCRETLERİ NETLİK KAZANDI

Geliştiricilerin merakla beklediği faturalandırma tarifesi de resmiyet kazandı.

Standart modelde sisteme gönderilen ses girdisinin dakikası 0,005 dolar, sistemden alınan ses çıktısının dakikası ise 0,018 dolar seviyesinde işlem görüyor.

Çok adımlı mantık yürüten Extended Thinking sürümünde ise akıl yürütme belirteçleri (token) ile sisteme yüklenen video ve belge türündeki ek girdiler ayrı bir tarife üzerinden ücretlendiriliyor.

Yeni fiyatlandırma politikasıyla Google, yüksek zekalı sesli asistanları hem bireysel geliştiriciler hem de büyük ölçekli şirketler için erişilebilir kılmayı amaçlıyor.

YORUMLAR
YORUM YAZ
İÇERİK VE ONAY KURALLARI: KARAR Gazetesi yorum sütunları ifade hürriyetinin kullanımı için vardır. Sayfalarımız, temel insan haklarına, hukuka, inanca ve farklı fikirlere saygı temelinde ve demokratik değerler çerçevesinde yazılan yorumlara açıktır. Yorumların içerik ve imla kalitesi gazete kadar okurların da sorumluluğundadır. Hakaret, küfür, rencide edici cümleler veya imalar, imla kuralları ile yazılmamış, Türkçe karakter kullanılmayan ve büyük harflerle yazılmış yorumlar içeriğine bakılmaksızın onaylanmamaktadır. Özensizce belirlenmiş kullanıcı adlarıyla gönderilen veya haber ve yazının bağlamının dışında yazılan yorumlar da içeriğine bakılmaksızın onaylanmamaktadır.
Diğer Haberler
Son Dakika Haberleri
KARAR.COM’DAN