Пређите на главни садржај
OpenAI

GPT-6.1Sol

Интелигенција блиска моделу Astra за петину цене

Представљамо GPT-6.1 Sol, надоградњу модела GPT-6 Sol која се по интелигенцији у програмирању од стране агента, коришћењу рачунара и професионалном раду готово подудара са моделом GPT-6 Astra, уз петину стандардне цене улазних и излазних токена модела Astra. Кеширани улаз кошта само 0,10 $ на милион токена– 95% мање од стандардне цене улаза и 50% мање од цене кешираног улаза модела GPT-6 Sol – што програмерима пружа више простора да развијају и покрећу способне заступнике који поново користе контекст у различитим захтевима.

  • GPT-6Astra

    Наш најинтелигентнији модел за најбоље резултате.

    улаз
    10,00 US$
    излаз
    50,00 US$
    кеширани улаз
    1,00 US$
  • GPT-6.1Sol

    Интелигенција готово на нивоу модела Astra за петину цене.

    улаз
    2,00 US$
    излаз
    10,00 US$
    кеширани улаз
    0,10 US$
  • GPT-6Luna

    Брз и ефикасан свакодневни рад у великом обиму.

    улаз
    0,10 US$
    излаз
    0,50 US$
    кеширани улаз
    0,01 US$

Способнији Sol за различите задатке

GPT-6.1 Sol нуди нов однос могућности и трошкова за важне свакодневне послове. Доноси значајна побољшања у односу на GPT-6 Sol у сложеним професионалним пословима, од писања кода и отклањања грешака до разумевања докумената и извршавања пословних токова рада са више корака. На неколико ових евалуација приближава се перформансама модела GPT-6 Astra уз знатно ниже трошкове.

Програмирање

На тесту DeepSWE v1.1, који процењује сложене задатке софтверског инжењерства у стварним базама кода, GPT-6.1 Sol изједначава се са моделом GPT-6 Astra уз приближно петину трошкова, а најбољи резултат модела GPT-6 Sol надмашује за 6,4 процентна поена уз мањи напор резоновања и ниже трошкове.

У тесту DeepSWE 1.1⁠⁠(отвара се у новом прозору), агенти вештачке интелигенције решавају оригиналне, дуготрајне задатке софтверског инжењерства.

Професионални рад

На тесту GDP.pdf, који мери колико тачно модели одговарају на стручна питања користећи сложене PDF документе са табелама, графиконима, дијаграмима и детаљима у ситном тексту, GPT-6.1 Sol постиже боље резултате од модела Opus 5.5 са резервним опцијама, уз мање од половине трошка по задатку на тестираним подешавањима резоновања. Такође се приближава водећим перформансама модела GPT-6 Astra уз приближно петину трошка по задатку.

У документу GDP.pdf⁠(отвара се у новом прозору), модели морају да одговарају на инструкције из стварног света о сложеним PDF документима преузетим из професионалних радних процеса у финансијама, здравству, праву и седам других професионалних области.

На тесту AutomationBench, који мери да ли агенти правилно извршавају пословне токове рада са више корака, GPT-6.1 Sol постиже резултат за 2,2 процентна поена виши од модела Opus 5.5 при средњем напору резоновања, уз приближно трећину трошкова. Тај резултат је уједно за 4,8 процентних поена виши од резултата модела GPT-6 Sol при истом подешавању.

У тесту AutomationBench 1.0.6⁠⁠(отвара се у новом прозору), агенти вештачке интелигенције се тестирају на токовима рада од почетка до краја, уз коришћење 47 алата у продаји, маркетингу, оперативним пословима, подршци, финансијама и људским ресурсима. Приказани податак за Claude Fable 5.1 потцењује стварни трошак, јер изоставља трошкове резервних опција, које су коришћене у око 40% задатака.

Коришћење рачунара

GPT-6.1 Sol такође доноси значајан напредак у задацима који захтевају интеракцију са рачунарским апликацијама. На офлајн скупу теста OSWorld 2.0, који процењује агенте у захтевним токовима рада на рачунару, GPT-6.1 Sol надмашује GPT-6 Sol за седам процентних поена при максималном напору резоновања, уз мање од половине трошкова. При максималном напору резоновања заостаје само 2,1 процентни поен за резултатом модела Astra, уз приближно седмину трошка по задатку.

У тесту OSWorld 2.0⁠⁠(отвара се у новом прозору), агенти вештачке интелигенције покушавају да изврше дуготрајне токове рада на рачунару који обухватају свакодневне и професионалне задатке. Приказујемо делимичну награду на офлајн скупу из издања v2026.08.08.

Научно истраживање

На тесту Terminal-Bench Science 0.1, који процењује научне токове рада, укључујући анализу података, симулације и доказивање теорема, GPT-6.1 Sol постиже више него двоструко бољи резултат од модела GPT-6 Sol при максималном напору резоновања, уз мање од половине трошка по задатку. При максималном напору, GPT-6.1 Sol у просеку кошта 5,47 $ по задатку, у поређењу са 23,21 $ за Opus 5.5 и 23,80 $ за Astra, пружајући значајне могућности за научни рад уз преко 75% ниже трошкове у односу на оба модела.

GPT-6 Astra и даље постиже највиши резултат међу тестираним моделима, 68,1%, и треба га користити за најтеже научноистраживачке задатке.

У оквиру Terminal-Bench Science 0.1⁠(отвара се у новом прозору), агенти обављају радне токове научних истраживања помоћу кода и алата терминала, укључујући анализу података, покретање симулација и прилагођавање модела.

Чињенична тачност

GPT-6.1 Sol такође побољшава чињеничну тачност одговора на тешке упите. Његово највеће побољшање чињеничне тачности у односу на GPT-6 Sol постиже се при ниском напору резоновања, где смањује удео одговора који садрже чињеничну грешку са 11,4% на 7,7% – што је смањење од приближно 32%. У свим тестираним подешавањима резоновања, стопа грешака остаје унутар 1,9 процентних поена у односу на GPT-6 Astra, уз мање од петине трошка по задатку.

Ова евалуација мери удео одговора са бар једном чињеничном грешком на основу разговора из којих су уклоњени идентификациони подаци, а у којима су корисници пријавили грешку ранијег модела. Ови намерно тешки упити нису репрезентативни за уобичајену употребу.

Чињеничну тачност процењујемо на основу разговора у производу ChatGPT из којих су уклоњени идентификациони подаци, а у којима су корисници пријавили чињеничну грешку претходног модела. Ови разговори који изазивају грешке нису репрезентативни за уобичајену употребу, у којој су чињеничне грешке ређе.

Безбедно увођење модела GPT-6.1 Sol у употребу

GPT-6.1 Sol показује значајна побољшања у односу на GPT-6 Sol у нашим евалуацијама усклађености понашања, чиме се приближава моделу GPT-6 Astra.

GPT-6.1 Sol отвореније саопштава своја ограничења и поузданије поштује намеру корисника и безбедносна ограничења. У захтевним евалуацијама бележи ниже стопе пропуста од модела GPT-6 Sol када је реч о пријављивању неисправних алата за претрагу, поштовању изричитих ограничења и избегавању неовлашћених исхода током агентских задатака. Нисмо уочили ниједан покушај заобилажења аутоматизованог безбедносног контролора, као ни код модела GPT-6 Astra и GPT-6 Sol. Све појединости доступне су у додатку системске картице GPT-6.1 Sol⁠(отвара се у новом прозору).

Евалуације у наставку намерно испитују захтевне ситуације и не мере стопе пропуста у уобичајеној употреби.

Цене и доступност

GPT-6.1 Sol је од данас доступан свим корисницима планова Plus, Pro, Business, Enterprise и Edu у ChatGPT Work-у и Codex-у. GPT-6.1 Sol још није доступан у Ћаскању. Програмери му могу приступити и преко OpenAI API-ја као gpt-6.1-sol. Његове стандардне API цене су 2 $ по милиону улазних токена, 0,10 $ по милиону кешираних улазних токена и 10 $ по милиону излазних токена. У наредним данима понудићемо и GPT-6.1 Sol Ултрабрзи⁠, са до 8x бржим генерисањем токена у поређењу са његовом стандардном брзином у Codex-у.

Аутор

OpenAI

Евалуације модела GPT спроведене су у нашем истраживачком окружењу или преко нашег API-ја, где одговори могу бити нешто другачији него у продукцијској верзији производа ChatGPT због разлика у системским упитима, доступним алатима, нивоима напора и слично. Евалуације конкурентских модела преузете су из јавно доступних извештаја.