Ruka hadi kwenye maudhui kuu
OpenAI

GPT-6.1Sol

Kiwango cha ufikiri kinachokaribia Astra kwa moja ya tano ya bei

Tunatambulisha GPT-6.1 Sol, toleo lililoboreshwa la GPT-6 Sol linalokaribia kufikia kiwango cha ufikiri cha GPT-6 Astra katika usimbaji wa kiwakala, matumizi ya kompyuta na kazi za kitaalamu, kwa moja ya tano ya bei za kawaida za tokeni za ingizo na tokeo za Astra. Ingizo lililohifadhiwa kwenye akiba hugharimu $0.10 per million tokenstu—kwa 95% chini ya bei ya kawaida ya ingizo na kwa 50% chini ya bei ya ingizo lililohifadhiwa kwenye akiba ya GPT-6 Sol—na kuwapa wasanidi nafasi zaidi ya kuunda na kuendesha mawakala wenye uwezo wanaotumia tena muktadha katika maombi mbalimbali.

  • GPT-6Astra

    Muundo wetu wenye akili zaidi kwa matokeo bora zaidi.

    ingizo
    $ 10.00
    matokeo
    $ 50.00
    ingizo lililohifadhiwa kwenye akiba
    $ 1.00
  • GPT-6.1Sol

    Uwezo wa kufikiri unaokaribia wa Astra kwa moja ya tano ya bei yake.

    ingizo
    $ 2.00
    matokeo
    $ 10.00
    ingizo lililohifadhiwa kwenye akiba
    $ 0.10
  • GPT-6Luna

    Kazi nyingi za kila siku kwa haraka na ufanisi.

    ingizo
    $ 0.10
    matokeo
    $ 0.50
    ingizo lililohifadhiwa kwenye akiba
    $ 0.01

Sol yenye uwezo zaidi katika kazi mbalimbali

GPT-6.1 Sol hutoa uwiano mpya wa uwezo na gharama kwa kazi muhimu za kila siku. Imeboreshwa kwa kiasi kikubwa ikilinganishwa na GPT-6 Sol katika kazi changamano za kitaalamu, kuanzia kuandika msimbo na kuondoa hitilafu hadi kuelewa hati na kutekeleza taratibu za biashara zenye hatua nyingi. Katika tathmini kadhaa kati ya hizi, inakaribia utendaji wa GPT-6 Astra kwa gharama ya chini sana.

Usimbaji

Katika DeepSWE v1.1, inayotathmini kazi changamano za uhandisi wa programu kwenye hazina halisi za msimbo, GPT-6.1 Sol inalingana na GPT-6 Astra kwa takriban moja ya tano ya gharama. Pia inazidi alama bora zaidi ya GPT-6 Sol kwa pointi 6.4 za asilimia kwa juhudi chache za uwazaji na gharama ndogo.

Katika DeepSWE 1.1⁠⁠(fungua katika dirisha jipya), mawakala wa AI hutatua majukumu asili ya muda mrefu ya uhandisi wa programu.

Kazi za kitaalamu

Katika GDP.pdf, inayopima usahihi wa miundo katika kujibu maswali ya kitaalamu kwa kutumia hati changamano za PDF zenye majedwali, chati, michoro na maelezo ya maandishi madogo, GPT-6.1 Sol inapata alama ya juu kuliko Opus 5.5 yenye mbinu mbadala. Gharama yake kwa kila kazi ni chini ya nusu katika mipangilio yote ya uwazaji iliyojaribiwa. Pia inakaribia utendaji wa hali ya juu zaidi wa GPT-6 Astra kwa takriban moja ya tano ya gharama kwa kila kazi.

Katika GDP.pdf⁠(fungua katika dirisha jipya), miundo lazima ijibu dokeza za ulimwengu halisi kuhusu PDF changamano zinazotokana na michakato ya kitaalamu katika fedha, huduma za afya, sheria, na nyanja nyingine saba za kitaalamu.

Katika AutomationBench, inayopima kama mawakala hukamilisha kwa usahihi taratibu za biashara zenye hatua nyingi, GPT-6.1 Sol inaizidi Opus 5.5 kwa pointi 2.2 za asilimia kwa juhudi za uwazaji za kiwango cha Wastani, kwa takriban theluthi moja ya gharama. Alama hiyo pia inazidi ile ya GPT-6 Sol kwa pointi 4.8 za asilimia katika mpangilio huo huo.

Katika AutomationBench 1.0.6⁠⁠(fungua katika dirisha jipya), mawakala wa AI hujaribiwa kwenye taratibu za kazi kuanzia mwanzo hadi mwisho kwa kutumia zana 47 katika mauzo, uuzaji, uendeshaji, usaidizi, fedha na rasilimali watu. Thamani iliyoonyeshwa kwa Claude Fable 5.1 iko chini ya gharama yake halisi, kwa sababu haijumuishi gharama za kutumia mbinu mbadala, zilizotumika katika takriban 40% ya kazi.

Matumizi ya kompyuta

GPT-6.1 Sol pia imepiga hatua kubwa katika kazi zinazohitaji kutumia programu za kompyuta. Katika seti ya nje ya mtandao ya OSWorld 2.0, inayotathmini mawakala kwenye taratibu ngumu za matumizi ya kompyuta, GPT-6.1 Sol inaizidi GPT-6 Sol kwa pointi saba za asilimia kwa juhudi za uwazaji za kiwango cha juu kabisa, kwa chini ya nusu ya gharama. Inakaribia alama ya Astra kwa tofauti ya pointi 2.1 za asilimia kwa juhudi za uwazaji za kiwango cha juu kabisa, kwa takriban moja ya saba ya gharama kwa kila kazi.

Katika OSWorld 2.0⁠⁠(fungua katika dirisha jipya), mawakala wa AI hujaribu mitiririko ya muda mrefu ya matumizi ya kompyuta inayohusisha majukumu ya kila siku na ya kitaalamu. Tunaripoti zawadi ya sehemu kwenye seti ya nje ya mtandao kutoka toleo la v2026.08.08.

Utafiti wa kisayansi

Katika Terminal-Bench Science 0.1, inayotathmini taratibu za kisayansi zikiwemo uchanganuzi wa data, uigaji na uthibitishaji wa nadharia, GPT-6.1 Sol inapata zaidi ya mara mbili ya alama ya GPT-6 Sol kwa juhudi za uwazaji za kiwango cha juu kabisa, kwa chini ya nusu ya gharama kwa kila kazi. Kwa juhudi za kiwango cha juu kabisa, GPT-6.1 Sol hugharimu wastani wa $5.47 kwa kila kazi, ikilinganishwa na $23.21 kwa Opus 5.5 na $23.80 kwa Astra. Hutoa uwezo mkubwa wa kisayansi kwa gharama iliyo chini kwa zaidi ya 75% kuliko kila mmoja wa miundo hiyo.

GPT-6 Astra bado inapata alama ya juu zaidi kati ya miundo iliyojaribiwa, ikiwa na 68.1%, na inapaswa kutumiwa kwa kazi ngumu zaidi za utafiti wa kisayansi.

Katika Terminal-Bench Science 0.1⁠(fungua katika dirisha jipya), mawakala hukamilisha taratibu za kazi za utafiti wa kisayansi kwa kutumia msimbo na zana za taminali, ikijumuisha kuchanganua data, kuendesha uigaji, na kufanya ulinganifu wa miundo.

Usahihi wa ukweli

GPT-6.1 Sol pia inaboresha usahihi wa ukweli inapojibu maagizo magumu. Uboreshaji wake mkubwa zaidi wa usahihi wa ukweli kuliko GPT-6 Sol hutokea kwa juhudi ndogo za uwazaji, ambapo inapunguza uwiano wa majibu yenye kosa la ukweli kutoka 11.4% hadi 7.7%—upungufu wa takriban 32%. Katika mipangilio ya uwazaji iliyojaribiwa, kiwango chake cha makosa hubaki ndani ya pointi 1.9 za asilimia ikilinganishwa na GPT-6 Astra, kwa chini ya moja ya tano ya gharama kwa kila kazi.

Tathmini hii hupima sehemu ya majibu yenye angalau kosa moja la ukweli katika mazungumzo yaliyoondolewa taarifa za utambulisho, ambapo watumiaji waliripoti kosa la muundo wa awali. Maagizo haya yaliyofanywa kuwa magumu kimakusudi hayawakilishi matumizi ya kawaida.

Tunatathmini usahihi wa ukweli kwa kutumia mazungumzo ya ChatGPT yaliyoondolewa taarifa za utambulisho, ambapo watumiaji walikuwa wameripoti kosa la ukweli kutoka kwa muundo wa awali. Mazungumzo haya yanayochochea makosa hayawakilishi matumizi ya kawaida, ambapo makosa ya ukweli hutokea mara chache zaidi.

Kuweka GPT-6.1 Sol katika matumizi kwa usalama

GPT-6.1 Sol inaonyesha maboresho makubwa dhidi ya GPT-6 Sol katika tathmini zetu za kuendana na matarajio, na kuikaribisha zaidi kwa GPT-6 Astra.

GPT-6.1 Sol ina uwazi zaidi kuhusu mipaka ya uwezo wake na inategemewa zaidi katika kuheshimu nia ya mtumiaji na masharti ya usalama. Katika tathmini ngumu, ina viwango vya chini vya kushindwa kuliko GPT-6 Sol kuhusu uwazi wa hitilafu za zana za utafutaji, kuheshimu vizuizi vilivyowekwa wazi na kuepuka matokeo yasiyoidhinishwa wakati wa kazi za kiwakala. Hatukuona majaribio yoyote ya kukwepa mkaguzi wa usalama wa kiotomatiki, sawa na GPT-6 Astra na GPT-6 Sol. Maelezo kamili yanaweza kupatikana katika kiambatisho cha kasi ya mfumo cha GPT-6.1 Sol⁠(fungua katika dirisha jipya).

Tathmini zilizo hapa chini hujaribu hali ngumu kimakusudi na hazipimi viwango vya kushindwa katika matumizi ya kawaida.

Bei na upatikanaji

Kuanzia leo, GPT-6.1 Sol inapatikana kwa watumiaji wote wa Plus, Pro, Business, Enterprise na Edu katika ChatGPT Work na Codex. GPT-6.1 Sol bado haipatikani katika Chat. Wasanidi programu wanaweza pia kuifikia kupitia OpenAI API kama gpt-6.1-sol. Bei zake za kawaida za API ni $2 kwa tokeni milioni moja za ingizo, $0.10 kwa tokeni milioni moja za ingizo lililohifadhiwa kwenye akiba na $10 kwa tokeni milioni moja za tokeo. Katika siku zijazo, pia tutatoa GPT-6.1 Sol Ultrafast⁠, yenye uzalishaji wa tokeni wa hadi mara 8 zaidi kwa kasi ikilinganishwa na kasi yake ya kawaida katika Codex.

Mwandishi

OpenAI

Tathmini za GPT zilifanywa katika mazingira yetu ya utafiti au kupitia API yetu. Matokeo yanaweza kutofautiana kidogo na yale ya ChatGPT inayotumiwa na umma kutokana na tofauti za maagizo ya mfumo, zana zinazopatikana, viwango vya juhudi na kadhalika. Tathmini za miundo ya washindani zilitolewa katika ripoti zinazopatikana kwa umma.