Saturn'un 10.000 Cevaplık Testi Yapay Zekayı Para Sorularında Yüzde 57 Oranında Batırıyor — Bittensor (TAO) Odakta

Saturn'un 18 yapay zeka modeliyle yaptığı test, kişisel finans sorularında yüzde 57 hata oranı buldu; zor sorularda oran yüzde 88'e çıktı.

(16:03 UTC)
4 dakika okuma süresi
AI ÖzetiAI
  • Saturn testinde 18 yapay zeka modeli kişisel finans sorularının yüzde 57'sine hatalı yanıt verdi.
  • Zor çok adımlı sorularda hata oranı yüzde 88'e, ücretsiz modellerde yüzde 93'e çıktı.
  • Saturn testinde 121 soru 18 modele soruldu, toplam 10 binden fazla cevap toplandı.
  • Claude Opus 5 liderliğindeki model bile yanıtların yüzde 39'unda hata yaptı.
k7rq2fdm

10.000 cevap, yüzde 57'si hatalı

Bir chatbota (sohbet robotu) biriktirdiğiniz parayı nereye koyacağınızı sorduysanız, karşınızda rahatsız edici bir tablo var: İngiliz finans teknolojisi şirketi Saturn'un hazırladığı bir testte, ana akım yapay zeka modelleri kişisel finans sorularının yüzde 57'sine hatalı ya da eksik yanıtlar verdi. Zorlayıcı, çok adımlı sorularda — yani gerçek hanelerin gündelik hayatta karşılaştığı türden sorularda — hata oranı yüzde 88'e tırmandı. Test, ChatGPT, Alphabet'in Gemini'si, Claude ve Copilot dahil olmak üzere ücretli ve ücretsiz 18 modele 121 soruyu soruldu; tutarlılığı ölçmek için her soru beşe kadar tekrarlandı ve toplamda 10 binin üzerinde cevap toplandı. Bir yanıt, içinde olgusal bir hata barındırdığında, maddi bir unsuru atladığında ya da zorunlu bir uyarıyı eksik bıraktığında başarısız sayıldı. Ücretsiz sürümler en kötü performansı gösterdi: yanıtların yüzde 63'ü hatalıydı, bu ücretli sürümlerdeki yüzde 49'luk orana karşılık. En zor sorularda ücretsiz modeller yüzde 93 oranında yanlış cevap verdi. Akıl yürütme (reasoning) modundaki Claude Opus 5 tablonun zirvesindeydi; buna rağmen yanıtların yüzde 39'ında hata yaptı ve hatalar bozuk aritmetikten, gözden kaçan vergi değişikliklerine, hatta hiç var olmayan kurallara kadar uzandı. Emeklilik vergisi üzerine verilen bir yanıt, bir tasarruf sahibini İngiliz vergi dairesi HM Revenue and Customs nezdinde 17.500 sterlinlik bir cezaya açık hale getirebilirdi. "Milyonlarca insan parasal tavsiye için yapay zeka modellerine güveniyor, ama onları para kaybettirebilecek yanlış cevaplar alıyorlar" diyen Saturn'un genel direktörü Amal Jolly'nin sözleri durumun özünü özetliyor. Zamanlama da mesaji keskinleştiriyor: tüketicilerin parasal kararlar için sohbet robotlarına olan bağımlılığı hızla büyüyor; bu da yüzde 57'lik hata oranını laboratuvar merakından çıkıp güncel bir tüketici koruması sorununa dönüştürüyor. Sorun, yatırımcıların düzenli yapay zeka araçlarına yasal tavsiye katmanı olmadan yaslandığı kripto alanına doğrudan uzanıyor — bizim COINOTAG masasında da okuduğumuz tablo aynen bu.

Güven yine de tırmanıyor

Verinin en çarpıcı gerilimi şu: bu araçların doğruluğu sarsılırken güvenleri sürekli artıyor. Dünyada 18 bin tüketiciyi kapsayan bir EY araştırması, katılımcıların yüzde 49'unun tasarruf ve yatırım kararlarını desteklemek için halihazırda yapay zekadan yararlandığını ortaya koydu. İngiltere'nin finansal regülatörü Ağustos ayında, tecrübesiz yatırımcıların beşte dördünün yatırım konusunda yapay zekadan yardım istediğini bildirdi; ankete katılanların yüzde 56'sı bu araçlara güvendiklerini söyledi — ki bu oran, televizyon ve radyo için aynı cevabı verenlerin yüzde 47'sinin üzerinde. Aynı araştırma daha endişe verici bir yanılgıyı da işaret ediyor: katılımcıların yüzde 44'ü, yapay zeka tarafından üretilen finansal bilginin regüle olduğuna yanlış biçimde inanıyor. 1.000 ABD'li yetişkinle yapılan ayrı bir PensionBee anketi ise katılımcıların yaklaşık onda altısının parasal tavsiyeyi bağımsız olarak doğrulamadan uygulamaya hazır olduğunu, neredeyse dörtte birinin ise bir sohbet robotunun kendi mali durumlarıyla ilgili yanlış bilgi vermiş olduğunu söylediğini gösterdi. Maruziyet artık bir masaüstü tarayıcı da gerektirmiyor: Apple'ın Siri'sinden Android'deki Gemini'ye, asistanlar işletim sistemi düzeyinde gömülü durumda; yani her yaş grubu bu riskin kapsamında. Jolly'nin yapısal tespiti geçerliliğini koruyor: yapay zekaya dayalı finansal tavsiye regülasyon çemberinin dışında kalıyor, kullanıcılar insan danışmanla gelen tazminat haklarından yoksun kalıyor ve Jolly, FCA'yı hızlı davranmaya çağırdı. Piyasayı anlık izlemek isteyen okurlar, spot ve vadeli fiyatları Binance üzerinden canlı takip edebilir.

Bittensor (TAO) ve güven boşluğu

Bizim COINOTAG okuması şudur: Saturn'un bulguları, kriptodaki en çok makine zekâsı üzerine pazarlanan köşesine en ağır düşer. Makine öğrenimi modellerine katkı sağlayanları ödüllendiren merkeziyetsiz ağ Bittensor (TAO), testin yeni vurduğu güven eğrisiyle aynı makasta işlem görüyor — sohbet robotlarının parasal soruların yüzde 57'sinde başarısız olduğunu keşfeden bir perakendeci kitle, kapalı kaynaklı asistanlarla birlikte yapay zeka token anlatılarını da iskonto edebilir. Asıl mesele doğrulama meselesidir: blokzincir kâhini (blockchain oracle), güvenilir olmayan girdilerin otomatik parayı bozmasına tam da bu yüzden karşı durur; finansal sohbet robotlarında bu dengeleyici hiç yoktur. Model güvenilirliği iyileşene ve tavsiye boşluğu regüle edilene dek merkeziyetsiz yapay zeka, önce bir güven hikâyesi, sonra bir işlem gücü hikâyesi olarak kalır.

COINOTAG News Desk
COINOTAG News Desk

COINOTAG'in editöryal ve araştırma ekibi.

AI Destekli

Yapay zekâ destekli üretildi, AI ile incelendi ve COINOTAG editöryal gözetiminde yayımlandı.