Anthropic, birkaç hafta önce Google'ın Gemini 3 ile ele geçirdiği kodlama liderliğini geri almak için Claude Opus 4.5'i sahaya sürdü. Sonuç, benchmarklarda net bir üstünlük oldu.
Ne oldu?
24 Kasım 2025'te duyurulan Opus 4.5, gerçek dünya yazılım görevlerini ölçen SWE-bench Verified testinde sektör lideri skora ulaştı ve SWE-bench Multilingual'da 8 programlama dilinin 7'sinde başı çekti. Model, Vending-Bench'te önceki sürüm Sonnet 4.5'e göre yüzde 29 iyileşme gösterirken, milyon token başına 5/25 dolarlık fiyatıyla erişilebilirliği de artırdı.
Neden önemli?
Opus 4.5, ajan tabanlı uygulamalarda ve uzun soluklu otonom görevlerde çıtayı yükseltti. Token verimliliğindeki kazanım, aynı işi daha az maliyetle yapabilen modellerin kurumsal benimsenmesini hızlandıracak nitelikte.