GPT-6.1Sol
Beşte bir fiyatına Astra'ya yakın zeka
Astra'nın standart girdi ve çıktı token fiyatlarının beşte birine, ajan tabanlı kodlama, bilgisayar kullanımı ve profesyonel işlerde GPT-6 Astra'nın zekasına neredeyse ulaşan GPT-6 Sol'un yeni versiyonu GPT-6.1 Sol'u tanıtıyoruz. Önbelleğe alınmış girdi, milyon token başına yalnızca 0,10 $ tutuyor. Bu fiyat, standart girdi fiyatından %95, GPT-6 Sol'un önbelleğe alınmış girdi fiyatından ise %50 daha düşük. Böylece geliştiriciler, farklı isteklerde aynı bağlamı yeniden kullanan yetenekli ajanlar oluşturup çalıştırmak için daha fazla esnekliğe sahip oluyor.
GPT-6Astra
En iyi sonuçlar için en zeki modelimiz.
- girdi
- $10,00
- çıktı
- $50,00
- önbelleğe alınmış girdi
- $1,00
GPT-6.1Sol
Beşte bir fiyatına Astra’ya yakın zekâ düzeyi.
- girdi
- $2,00
- çıktı
- $10,00
- önbelleğe alınmış girdi
- $0,10
GPT-6Luna
Büyük ölçekte günlük işler için hızlı ve verimli.
- girdi
- $0,10
- çıktı
- $0,50
- önbelleğe alınmış girdi
- $0,01
Farklı görevlerde daha yetenekli bir Sol
GPT-6.1 Sol, günlük hayattaki önemli işler için yetenek ve maliyet arasında yeni bir denge sunuyor. Kod yazıp hata ayıklamak, belgeleri anlamak ve çok adımlı iş süreçlerini yürütmek gibi karmaşık profesyonel görevlerde GPT-6 Sol'a kıyasla önemli gelişmeler sağlıyor. Bu değerlendirmelerin birkaçında, çok daha düşük maliyetle GPT-6 Astra'nın performansına yaklaşıyor.
Kodlama
Gerçek kod tabanlarındaki karmaşık yazılım mühendisliği görevlerini değerlendiren DeepSWE v1.1 testinde GPT-6.1 Sol, yaklaşık beşte bir maliyetle GPT-6 Astra ile aynı puanı alıyor. Üstelik daha düşük akıl yürütme düzeyi ve maliyetle GPT-6 Sol'un en iyi puanını 6,4 yüzde puan aşıyor.
Yapay zeka ajanları, DeepSWE 1.1(yeni bir pencerede açılır) değerlendirmesinde özgün ve uzun soluklu yazılım mühendisliği görevlerini çözer.
Profesyonel işler
GDP.pdf, modellerin tablolar, grafikler, diyagramlar ve küçük puntolu ayrıntılar içeren karmaşık PDF belgelerini kullanarak mesleki soruları ne kadar doğru yanıtladığını ölçüyor. Bu testte GPT-6.1 Sol, test edilen akıl yürütme ayarlarında yedek modellerle çalışan Opus 5.5'ten daha yüksek puan alırken görev başına maliyeti yarıdan az. Ayrıca görev başına yaklaşık beşte bir maliyetle GPT-6 Astra'nın alanında lider performansına yaklaşıyor.
GDP.pdf(yeni bir pencerede açılır) değerlendirmesinde modellerin, finans, sağlık, hukuk ve diğer yedi mesleki alandaki iş akışlarından alınan karmaşık PDF'lerle ilgili gerçek hayatta kullanılan promptları yanıtlaması gerekir.
Ajanların çok adımlı iş akışlarını doğru tamamlayıp tamamlamadığını ölçen AutomationBench testinde GPT-6.1 Sol, orta akıl yürütme düzeyinde yaklaşık üçte bir maliyetle Opus 5.5'ten 2,2 yüzde puan daha yüksek puan alıyor. Bu puan, aynı ayardaki GPT-6 Sol'un puanından da 4,8 yüzde puan daha yüksek.
Yapay zeka ajanları, AutomationBench 1.0.6(yeni bir pencerede açılır) değerlendirmesinde satış, pazarlama, operasyon, destek, finans ve insan kaynakları alanlarında 47 araç kullanarak uçtan uca iş akışlarını yürütme becerileri açısından test edilir. Claude Fable 5.1'in veri noktası, görevlerin yaklaşık %40'ında başvurulan alternatif yöntemlerin maliyetini içermediği için gerçek maliyeti olduğundan düşük gösterir.
Bilgisayar kullanımı
GPT-6.1 Sol, bilgisayar uygulamalarıyla etkileşim gerektiren görevlerde de önemli ilerleme kaydediyor. Ajanları zorlu bilgisayar kullanımı iş akışlarında değerlendiren OSWorld 2.0 testinin offline veri setinde GPT-6.1 Sol, en yüksek akıl yürütme düzeyinde GPT-6 Sol'u yedi yüzde puan geçerken maliyeti yarıdan az. En yüksek akıl yürütme düzeyinde, görev başına yaklaşık yedide bir maliyetle Astra'nın puanına 2,1 yüzde puan kadar yaklaşıyor.
Yapay zeka ajanları, OSWorld 2.0(yeni bir pencerede açılır) değerlendirmesinde günlük ve profesyonel görevleri kapsayan uzun soluklu bilgisayar kullanımı iş akışlarını tamamlamaya çalışır. v2026.08.08 sürümündeki offline veri seti için kısmi ödül puanını raporluyoruz.
Bilimsel araştırma
Veri analizi, simülasyon ve teorem ispatı gibi bilimsel iş akışlarını değerlendiren Terminal-Bench Science 0.1 testinde GPT-6.1 Sol, en yüksek akıl yürütme düzeyinde GPT-6 Sol'un puanının iki katından fazlasına ulaşıyor. Görev başına maliyeti ise yarıdan az. En yüksek akıl yürütme düzeyinde GPT-6.1 Sol'un görev başına ortalama maliyeti 5,47 $ iken Opus 5.5'in maliyeti 23,21 $, Astra'nınki ise 23,80 $. Böylece her iki modele kıyasla %75'in üzerinde daha düşük maliyetle güçlü bilimsel yetenekler sunuyor.
GPT-6 Astra, %68,1 ile test edilen modeller arasında en yüksek puana sahip olmaya devam ediyor ve en zor bilimsel araştırma görevlerinde tercih edilmesi gerekiyor.
Terminal-Bench Science 0.1(yeni bir pencerede açılır) değerlendirmesinde ajanlar, kod ve terminal araçlarını kullanarak veri analizi, simülasyon çalıştırma ve modelleri veriye uydurma gibi bilimsel araştırma iş akışlarını tamamlar.
Olgusal doğruluk
GPT-6.1 Sol, zorlu promptlarda da bilgilerin doğruluğunu artırıyor. GPT-6 Sol'a kıyasla bu alandaki en büyük gelişmeyi düşük akıl yürütme düzeyinde sağlıyor: bilgi hatası içeren yanıtların oranını %11,4'ten %7,7'ye düşürüyor. Bu, yaklaşık %32'lik bir azalma anlamına geliyor. Test edilen tüm akıl yürütme ayarlarında hata oranı ile GPT-6 Astra'nın hata oranı arasındaki fark 1,9 yüzde puanı aşmıyor. Görev başına maliyet ise GPT-6 Astra'nın beşte birinden daha düşük.
Bu değerlendirme, kullanıcıların önceki bir modelin hatasını bildirdiği, kimlik bilgileri kaldırılmış konuşmalarda en az bir olgusal hata içeren yanıtların oranını ölçüyor. Özellikle zor olacak şekilde seçilen bu promptlar, tipik kullanımı temsil etmiyor.
Olgusal doğruluğu, kullanıcıların önceki bir modelin olgusal hatasını bildirdiği, kimlik bilgileri kaldırılmış ChatGPT konuşmaları üzerinden değerlendiriyoruz. Hataya yol açan bu konuşmalar, olgusal hataların daha nadir görüldüğü tipik kullanımı temsil etmez.
GPT-6.1 Sol'un güvenle kullanıma sunulması
GPT-6.1 Sol, uyumlanma değerlendirmelerimizde GPT-6 Sol'a kıyasla önemli iyileşmeler göstererek GPT-6 Astra'ya yaklaşıyor.
GPT-6.1 Sol, sınırları konusunda daha şeffaf; kullanıcı niyetine ve güvenlik kısıtlamalarına uyma konusunda da daha güvenilir. Zorlu değerlendirmelerde, çalışmayan arama araçları hakkında açık bilgi verme, açıkça belirtilen kısıtlamalara uyma ve ajan tabanlı görevlerde yetki dışı sonuçlardan kaçınma konularında GPT-6 Sol'a kıyasla daha düşük başarısızlık oranları sergiliyor. GPT-6 Astra ve GPT-6 Sol'da olduğu gibi, otomatik güvenlik denetleyicisini atlatmaya yönelik hiçbir girişim gözlemlemedik. Tüm ayrıntılara GPT-6.1 Sol sistem kartı ekinde(yeni bir pencerede açılır) ulaşabilirsiniz.
Aşağıdaki değerlendirmeler özellikle zorlu durumları test ediyor; tipik kullanımdaki hata oranlarını ölçmüyor.
Fiyatlandırma ve erişim
GPT-6.1 Sol, bugünden itibaren ChatGPT Çalışma ve Codex'te tüm Plus, Pro, Business, Enterprise ve Edu kullanıcılarının erişimine açılıyor. Model henüz Sohbet'te kullanılamıyor. Geliştiriciler modele OpenAI API üzerinden gpt-6.1-sol adıyla da erişebilir. Standart API fiyatları, bir milyon girdi token'ı için 2 $, bir milyon önbelleğe alınmış girdi token'ı için 0,10 $ ve bir milyon çıktı token'ı için 10 $. Önümüzdeki günlerde, Codex'te standart hızına göre sekiz kata kadar daha hızlı token üreten GPT-6.1 Sol Ultra Hızlı versiyonunu da sunacağız.
Yazar
GPT değerlendirmeleri araştırma ortamımızda veya API'miz üzerinden yapıldı. Sistem promptları, kullanılabilir araçlar, akıl yürütme düzeyi gibi unsurlardaki farklılıklar nedeniyle bu ortamlardaki çıktılar, kullanıma sunulan ChatGPT'nin çıktılarından biraz farklı olabilir. Rakip modellerin değerlendirmeleri kamuya açık raporlardan alınmıştır.

