OpenAI, 2024'ün son günlerinde akıl yürütme modeli o3'ü tanıtarak, uzun süredir yapay zeka için aşılamaz sanılan bir benchmark'ta çığır açtı.

Ne oldu?

20 Aralık 2024'te duyurulan o3, soyut örüntü çözme yeteneğini ölçen ARC-AGI testinde yüzde 87,5 gibi rekor bir skora ulaştı; bu, insan performans eşiğine yakın bir seviyeydi. Model ayrıca AIME matematik yarışmasında yüzde 96,7, Codeforces programlama arenasında 2727 Elo ve zorlu FrontierMath testinde önemli bir sıçrama kaydetti.

Neden önemli?

ARC-AGI'deki bu skor, akıl yürütme sürelerine yapılan yatırımın gerçek bir kapasite sıçraması yarattığını kanıtladı. o3, 'düşünen modeller' çağının önünü açan dönüm noktalarından biri oldu.