DeepSeek V4.1 Flash, GPT-6'nın Yetmişte Biri Fiyata 81,2 Puan Aldı; Sahara AI (SAHARA) Anlatısı Zorlanıyor

DeepSeek V4.1 Flash OpenDesign Arena'da 81,2 puan aldı, GPT-6 Astra'nın 1,5 puan gerisinde kaldı; görev başına 0,023 dolara karşı 1,61 dolarla 70 kat maliyet…

(03:19 UTC)
4 dakika okuma süresi
AI ÖzetiAI
  • DeepSeek V4.1 Flash, OpenDesign Arena'da 81,2 puan aldı.
  • GPT-6 Astra, 82,7 puanla 13 modellik listeyi lider tamamladı.
  • V4.1 Flash ortalama işi 5,3 dakikada, Astra 11,1 dakikada tamamladı.
  • Model, toplam 552 milyar parametrenin yaklaşık 16 milyarını çıktı için aktifleştiriyor.
k7rq2fdm

81,2'ye karşı 82,7: Kıyaslamadaki Fark

DeepSeek'in V4.1 Flash modeli, OpenDesign Arena'nın web tasarımı değerlendirmesinde ortalama 81,2 puan topladı; sonuçlar 11 Eylül'de yayımlandı ve model, 13 modellik listede 82,7 ile zirvede yer alan OpenAI'ın GPT-6 Astra'sına farkı 1,5 puana indirdi. Liderlik tablosunun en tepesindeki yetenek farkı, neredeyse ölçüm hatası düzeyine indi — ama iki model arasındaki maliyet farkı hiç daralmadı. İşte bu asimetri, yapay zeka sektörünün gündemini bugün belirleyen şey.

OpenDesign Arena, modelleri pratik tasarım işleri üzerinden puanlıyor: web uygulamaları, yönetim panoları, mobil ekranlar ve açılış sayfaları; her teslimat gereksinim karşılama, yerleşim, görsel hiyerarşi, renk kullanımı ve genel bütünlük bakımından değerlendiriliyor. Bu ölçütte V4.1 Flash, 81,2 puanla ikinci sırayı aldı ve aynı değerlendirmede 80,3 puan toplayan Anthropic'in Claude Fable 5.1 modelinin önüne geçti.

Asıl ayrışma ekonomide yaşanıyor. Tek bir tasarım görevinin ortalama maliyeti V4.1 Flash için 0,023 dolar, GPT-6 Astra içinse 1,61 dolar seviyesinde kaldı — kabaca yetmişte bir fiyat. Claude Fable 5.1, görev başına 3,66 dolarla daha da yukarıda konumlanıyor. Hız tarafında da benzer bir tablo var: V4.1 Flash ortalama bir işi 5,3 dakikada tamamlarken, Astra 11,1 dakikada, Claude Fable 5.1 ise 12,8 dakikada yetişebildi.

Kalite marjları ise daha temkinli bir tablo çiziyor. Hiçbir revizyona gerek kalmadan kullanılabilir bulunan teslimat oranı GPT-6 Astra'da yüzde 60, V4.1 Flash'ta yüzde 57,7, Claude Fable 5.1'de yüzde 56,7 oldu; ilk ikisi arasındaki fark yalnızca 2,3 puan. Bu nüans önemli, çünkü OpenDesign Arena tek bir dikeyi ölçüyor. Web tasarımında yakalanan bu denge, GPT-6 Astra ile kod yazma, akıl yürütme veya bilimsel araştırma alanlarında genel bir eşdeğerlik kurulduğu anlamına gelmiyor — ve DeepSeek de böyle bir iddiada bulunmadı. Rakamların asıl ortaya koyduğu şu: kurumsal tarafın üretken tasarıma gerçekten para harcadığı görev kategorisinde, ham yetenek artık belirleyici değişken değil; görev başına fiyat ve iş hacmi belirleyici hâline geldi.

552 Milyar Parametre, 16 Milyar Aktif

V4.1 Flash'ın maliyet avantajı sübvansiyona değil, mimariye dayanıyor ve ölçülebilir durumda. Model toplam 552 milyar parametre taşıyor ama hepsini aynı anda çalıştırmıyor: girdiyi işlemek için yaklaşık 8 milyar, çıktı üretmek için yaklaşık 16 milyar parametre devreye giriyor. DeepSeek bu düzeni asimetrik mimari olarak tanımlıyor — uzman karışımı (mixture-of-experts) tasarımı, çok büyük bir modelin bilgi kapasitesini korurken istek başına tüketilen hesaplama gücünü kırpıyor. Bu mantık, blokzincir altyapısındaki alternatif sanal makine (AltVM) yaklaşımını anımsatıyor: orada da bir işlem için gereken modüller çalıştırılır, tam bir çalışma zamanı değil.

Model, DeepSeek'in önceden sinyal verdiği takvime uygun biçimde 10 Eylül'de resmî olarak yayına alındı. Şirketin iç testlerinde çıktı hızı daha önce saniyede 420 token olarak ölçülmüştü; ancak ölçüm koşulları rakip modellerde kullanılanlarla tam olarak aynı olmadığından doğrudan hız karşılaştırmaları kesinlik taşıyor değil. Lansmanda DeepSeek, daha verimli mimarisi sayesinde daha fazla kullanıcıya daha düşük maliyetle hizmet verebildiğini ve tasarrufun kullanıcılara yansıtıldığını belirtti.

Kıyaslama verileri bizim okumamız şöyle: verimlilik iddiası bağımsız bir değerlendirmeyle sınandığında ayakta kalıyor — en azından bu dikeyde. Gerçek dünya servis maliyetleri ve hızları; girdi uzunluğuna, istek desenine ve sunucu koşullarına göre değişecek, ayrıca API fiyatlandırması sağlayıcıdan sağlayıcıya farklılık gösteriyor. Dolayısıyla görev başına başlıktaki rakamların sözleşmesel değil, yön gösterici olarak okunması gerekiyor. Artık yön gösterici olmayan tek şey trend: görev başına 0,023 dolara ön safta (frontier) üretilen bir çıktı, çıkarımın (inference) ne kadara mal olması gerektiğine dair beklentileri sıfırlıyor. Piyasayı anlık izlemek isteyen okurlar, spot ve vadeli fiyatları Bitget üzerinden canlı takip edebilir.

Görev Başına Maliyet, Yapay Zeka Metriği Hâline Geliyor

Rakamlar birlikte okunduğunda, dengeye yakın skor ile yetmiş katlık maliyet farkı tek bir yay oluşturuyor: yapay zeka rekabeti yetenek kıyaslamalarından birim ekonomiye kayıyor. Bu kayma, yapay zekaya bağlı kripto varlıklarını doğrudan vuruyor. Sahara AI (SAHARA) gibi tokenlar, merkeziyetsiz makine öğrenimi altyapısının maliyette merkezi laboratuvarları geride bırakabileceği tezine prim yapıyor; merkezi bir ön saf laboratuvarı en yakın rakibinin yetmişte birine fiyat sergilediğinde bu tezin satması zorlaşıyor ve olası bir yeniden fiyatlamanın ilk izi, yapay zeka token kesimindeki işlem hacmi verilerinde okunmalı. Verimlilik kazanımları, israf edilen döngüleri en aza indirme üzerine kurulu blokzincir tabanlı işlem gücü ağları için de iki ucu keskin bir bıçak. Bundan sonra izlenecek metrik, OpenDesign Arena ve benzeri değerlendiricilerin maliyet düzeltmeli sıralamalar yayımlamaya başlayıp başlamayacağı — başlarlarsa DeepSeek'in az önce tırmandırdığı fiyat savaşı, sektörün resmî skor tablosu hâline gelir.

COINOTAG News Desk
COINOTAG News Desk

COINOTAG'in editöryal ve araştırma ekibi.

AI Destekli

Yapay zekâ destekli üretildi, AI ile incelendi ve COINOTAG editöryal gözetiminde yayımlandı.