Google'ın Gemini 3 ailesinin en güçlü akıl yürütme modu olan Deep Think, aldığı güncellemeyle yapay genel zeka tartışmalarını yeniden gündeme taşıdı.
Ne oldu?
Başlangıçta ARC-AGI-2 testinde yüzde 45 seviyesinde skor veren Gemini 3 Deep Think, Şubat 2026'da yayımlanan güncellenmiş sürümüyle bu testte yüzde 84,6'ya çıktı ve Humanity's Last Exam gibi en zorlu değerlendirmelerde de öne fırladı. Bu, soyut örüntü çözme yeteneğini ölçen ARC-AGI-2'de daha önce görülmemiş bir sıçramaydı.
Neden önemli?
ARC-AGI-2, modellerin ezberden çok gerçek genelleme yeteneğini ölçtüğü için kritik kabul ediliyor. Deep Think'in bu skoru, uzun 'düşünme' süresine yatırım yapan modellerin insan seviyesine ne kadar yaklaştığını tartışmaya açtı.