Çinli yapay zekâ şirketi DeepSeek, Aralık 2024'ün sonunda açık kaynaklı DeepSeek-V3 modelini yayımlayarak sektörde geniş yankı uyandırdı. Model, hem ölçeği hem de dikkat çekici düşük eğitim maliyetiyle konuşuldu.
Ne oldu?
DeepSeek-V3, toplam 671 milyar parametreye sahip bir Uzmanlar Karışımı modeli. Bu mimari sayesinde her bir token için yalnızca yaklaşık 37 milyar parametre etkinleşiyor. Model, birçok kıyaslama testinde GPT-4o ve Claude 3.5 Sonnet gibi önde gelen kapalı modellerle rekabet edebiliyor. Şirketin açıklamalarına göre model, Nvidia H800 GPU'ları kullanılarak yaklaşık 5,6 milyon dolara eğitildi.
Neden önemli?
V3, güçlü yapay zekâ modellerinin yalnızca dev bütçelere sahip birkaç şirketin tekelinde olmadığını gösterdi. Düşük maliyetli eğitim yaklaşımı, ihracat kısıtlarıyla sınırlanan Çin'in yapay zekâda rekabet gücünü koruduğunun kanıtı oldu.