GPT-6.1Sol
Үнийн тавны нэгээр Astra-тай ойролцоо оюун ухаан
Агент шинжтэй кодчилол, компьютер ашиглалт болон мэргэжлийн ажилд GPT-6 Astra-гийн оюун ухаантай бараг дүйцэхүйц чадвартай, GPT-6 Sol-ийн сайжруулсан хувилбар болох GPT-6.1 Sol-ийг танилцуулж байна. Энэ нь Astra-гийн оролт, гаралтын токены стандарт үнийн тавны нэгээр үйлчилнэ. Кэшэлсэн оролтын нэг сая токен ердөө $0.10 per million tokensбөгөөд энэ нь оролтын стандарт үнээс 95%, GPT-6 Sol-ийн кэшэлсэн оролтын үнээс 50% бага юм. Ингэснээр хөгжүүлэгчид хүсэлтүүдийн хооронд контекстийг дахин ашигладаг чадварлаг агентуудыг бүтээж, ажиллуулах илүү өргөн боломжтой болно.
GPT-6Astra
Хамгийн сайн үр дүнд хүргэх манай хамгийн ухаалаг загвар.
- оролт
- $ 10.00
- гаралт
- $ 50.00
- кэшлэгдсэн оролт
- $ 1.00
GPT-6.1Sol
Astra-д дөхөх оюуны чадамж, тав дахин хямд үнээр.
- оролт
- $ 2.00
- гаралт
- $ 10.00
- кэшлэгдсэн оролт
- $ 0.10
GPT-6Luna
Өдөр тутмын их хэмжээний ажлыг хурдан, үр ашигтай гүйцэтгэнэ.
- оролт
- $ 0.10
- гаралт
- $ 0.50
- кэшлэгдсэн оролт
- $ 0.01
Төрөл бүрийн даалгаварт илүү чадварлаг Sol
GPT-6.1 Sol нь өдөр тутмын чухал ажилд чадвар, зардлын шинэ тэнцвэрийг санал болгож байна. Код бичиж, алдааг нь засахаас эхлээд баримт бичгийг ойлгож, бизнесийн олон алхамт ажлын урсгалыг гүйцэтгэх хүртэлх мэргэжлийн нарийн төвөгтэй ажилд GPT-6 Sol-оос мэдэгдэхүйц сайжирсан. Эдгээр үнэлгээний хэд хэдэд нь GPT-6 Astra-гийн гүйцэтгэлд хавьгүй бага зардлаар ойртож байна.
Кодчилол
Бодит кодын сан дахь программ хангамжийн инженерчлэлийн нарийн төвөгтэй даалгаврыг үнэлдэг DeepSWE v1.1 дээр GPT-6.1 Sol нь GPT-6 Astra-тай ойролцоогоор тавны нэг зардлаар дүйцсэн. Мөн сэтгэн бодох ачаалал, зардал багатай атлаа GPT-6 Sol-ийн хамгийн өндөр оноог 6.4 нэгж хувиар давсан.
DeepSWE 1.1(шинэ цонхонд нээгдэнэ)-д AI агентууд программ хангамжийн инженерчлэлийн анхны, урт хугацааны ажлуудыг шийддэг.
Мэргэжлийн ажил
Хүснэгт, график, диаграмм, жижиг үсгээр бичсэн нарийн мэдээлэл агуулсан төвөгтэй PDF баримтад тулгуурлан мэргэжлийн асуултад хэр зөв хариулдгийг GDP.pdf үнэлгээ хэмждэг. Сэтгэн бодох ачааллын туршсан тохиргоонуудад GPT-6.1 Sol нь нөөц хувилбарт шилжих боломжтой Opus 5.5-аас өндөр оноо авч, нэг даалгаврын зардал нь талаас ч бага байв. Мөн нэг даалгаврын зардал нь ойролцоогоор тавны нэг байхад GPT-6 Astra-гийн тэргүүлэх гүйцэтгэлд ойртож байна.
GDP.pdf(шинэ цонхонд нээгдэнэ)-д загварууд санхүү, эрүүл мэнд, хууль эрх зүй болон бусад 7 мэргэжлийн салбарын ажлын урсгалаас авсан нарийн төвөгтэй PDF-үүдийн талаар бодит ертөнцийн өгөгдлүүдэд хариулах ёстой.
Агентууд бизнесийн олон алхамт ажлын урсгалыг зөв гүйцэтгэж байгаа эсэхийг хэмждэг AutomationBench дээр GPT-6.1 Sol нь сэтгэн бодох ачааллын дунд түвшинд Opus 5.5-аас 2.2 нэгж хувиар өндөр оноо авч, зардал нь ойролцоогоор гуравны нэг байв. Энэ оноо нь мөн ижил тохиргоотой GPT-6 Sol-ийнхоос 4.8 нэгж хувиар өндөр байна.
Энэхүү AutomationBench 1.0.6(шинэ цонхонд нээгдэнэ) үнэлгээнд AI агентуудыг борлуулалт, маркетинг, үйл ажиллагаа, тусламж үйлчилгээ, санхүү, хүний нөөцийн 47 хэрэгсэл ашигладаг эхнээс нь дуусталх ажлын урсгалыг гүйцэтгүүлэх замаар шалгадаг. Claude Fable 5.1-ийн өгөгдлийн цэгт даалгаврын ~40%-д тохиолдсон нөөц хувилбаруудын зардлыг оруулаагүй тул бодит зардлыг дутуу харуулсан.
Компьютер ашиглалт
GPT-6.1 Sol нь компьютерын аппликэйшнтэй харьцаж ажиллах шаардлагатай даалгавруудад ч мэдэгдэхүйц ахиц гаргасан. Компьютер ашиглах нарийн төвөгтэй ажлын урсгалаар агентуудыг үнэлдэг OSWorld 2.0-ийн офлайн багц дээр GPT-6.1 Sol нь сэтгэн бодох ачааллын дээд түвшинд GPT-6 Sol-оос долоон нэгж хувиар илүү оноо авсан бөгөөд зардал нь талаас ч бага байв. Сэтгэн бодох ачааллын дээд түвшинд Astra-гийн оноонд 2.1 нэгж хувийн зөрүүтэй ойртсон бөгөөд нэг даалгаврын зардал нь ойролцоогоор долооны нэг байв.
Энэхүү OSWorld 2.0(шинэ цонхонд нээгдэнэ) үнэлгээнд AI агентууд өдөр тутмын болон мэргэжлийн ажлыг хамарсан, олон дараалсан үйлдэл шаарддаг компьютер ашиглах ажлын урсгалыг гүйцэтгэхийг оролддог. Бид v2026.08.08 хувилбарын офлайн багц дээрх хэсэгчилсэн гүйцэтгэлийн оноог тайлагнаж байна.
Шинжлэх ухааны судалгаа
Өгөгдлийн шинжилгээ, симуляци, теорем батлах зэрэг шинжлэх ухааны ажлын урсгалыг үнэлдэг Terminal-Bench Science 0.1 дээр GPT-6.1 Sol нь сэтгэн бодох ачааллын дээд түвшинд GPT-6 Sol-ийн оноог хоёр дахинаас илүү давсан бөгөөд нэг даалгаврын зардал нь талаас ч бага байв. Сэтгэн бодох ачааллын дээд түвшинд GPT-6.1 Sol-ийн нэг даалгаврын дундаж зардал $5.47 байхад Opus 5.5-ийнх $23.21, Astra-гийнх $23.80 байна. Ингэснээр эдгээр хоёр загвараас тус бүр 75%-иас илүү бага зардлаар шинжлэх ухааны өндөр чадварыг санал болгож байна.
GPT-6 Astra нь 68.1%-ийн оноогоор туршсан загваруудыг тэргүүлсэн хэвээр бөгөөд шинжлэх ухааны судалгааны хамгийн хүнд даалгаварт энэ загварыг ашиглах нь зүйтэй.
Terminal-Bench Science 0.1(шинэ цонхонд нээгдэнэ)-д агентууд код болон терминалын хэрэгслүүдийг ашиглан өгөгдөл шинжлэх, симуляц ажиллуулах, загвар тааруулах зэрэг шинжлэх ухааны судалгааны ажлын урсгалыг гүйцэтгэдэг.
Баримтын үнэн зөв байдал
GPT-6.1 Sol нь хүнд асуулт, зааварт хариулахдаа баримтын үнэн зөв байдлыг мөн сайжруулсан. GPT-6 Sol-той харьцуулахад баримтын үнэн зөв байдлын хамгийн том сайжрал нь сэтгэн бодох ачааллын бага түвшинд гарсан бөгөөд баримтын алдаа агуулсан хариултын хувийг 11.4%-иас 7.7% болгон бууруулсан нь ойролцоогоор 32%-ийн бууралт юм. Туршсан сэтгэн бодох тохиргоонуудын туршид алдааны хувь нь нэг даалгаврын зардал нь тавны нэгээс бага байх нөхцөлд GPT-6 Astra-гийнхаас 1.9 нэгж хувийн дотор байв.
Энэ үнэлгээнд хэрэглэгчид өмнөх загварын алдааг тэмдэглэсэн, хувийн мэдээллийг нь арилгасан харилцан яриаг ашиглан дор хаяж нэг баримтын алдаа агуулсан хариултын хувийг хэмждэг. Зориуд сонгосон эдгээр хүнд асуулт, заавар нь ердийн хэрэглээг төлөөлөхгүй.
Бид өмнөх загварын баримтын алдааг хэрэглэгчид тэмдэглэсэн ChatGPT харилцан яриануудын хувийн мэдээллийг арилгаж, тэдгээрээр баримтын үнэн зөв байдлыг үнэлдэг. Алдаа гаргахад хүргэдэг эдгээр харилцан яриа нь баримтын алдаа илүү ховор гардаг ердийн хэрэглээг төлөөлөхгүй.
GPT-6.1 Sol-ийг аюулгүй нэвтрүүлэх нь
Зорилго, шаардлагад нийцэж буй эсэхийг шалгах манай үнэлгээнүүдэд GPT-6.1 Sol нь GPT-6 Sol-оос мэдэгдэхүйц сайжирч, GPT-6 Astra-д ойртсон.
GPT-6.1 Sol нь өөрийн хязгаарлагдмал чадварыг илүү ил тод мэдэгдэж, хэрэглэгчийн зорилго болон аюулгүй байдлын хязгаарлалтыг илүү найдвартай дагаж мөрддөг. Хүнд нөхцөлтэй үнэлгээнүүдэд хайлтын хэрэгсэл ажиллахгүй байгааг ил тод мэдэгдэх, шууд заасан хязгаарлалтыг дагах, агентын даалгаврын явцад зөвшөөрөлгүй үр дүн гаргахаас зайлсхийх тал дээр GPT-6 Sol-оос бага алдаа гаргасан. GPT-6 Astra болон GPT-6 Sol-ийн нэгэн адил аюулгүй байдлын автомат хяналтыг тойрох оролдлого ажиглагдаагүй. Дэлгэрэнгүй мэдээллийг GPT-6.1 Sol системийн картын нэмэлтээс(шинэ цонхонд нээгдэнэ) авах боломжтой.
Доорх үнэлгээнүүд нь зориуд хүнд нөхцөлийг шалгадаг бөгөөд ердийн хэрэглээнд гардаг алдааны хувийг хэмжихгүй.
Үнэ ба ашиглах боломж
Өнөөдрөөс эхлэн Plus, Pro, Business, Enterprise болон Edu-ийн бүх хэрэглэгч GPT-6.1 Sol-ийг ChatGPT Ажил болон Codex-д ашиглах боломжтой. GPT-6.1 Sol-ийг Чатад хараахан ашиглах боломжгүй. Хөгжүүлэгчид мөн OpenAI API-аар gpt-6.1-sol нэрээр ашиглаж болно. API-ийн ердийн үнэ нь нэг сая оролтын токенд $2, нэг сая кэшэлсэн оролтын токенд $0.10, нэг сая гаралтын токенд $10 байна. Ойрын өдрүүдэд Codex дахь ердийн хурдаасаа токен үүсгэх хурд нь 8 дахин хүртэл хурдан GPT-6.1 Sol Ultrafast-ийг мөн санал болгоно.
Зохиогч
GPT-ийн үнэлгээг судалгааны орчинд эсвэл манай API-аар хийсэн. Системийн заавар, ашиглах боломжтой хэрэгслүүд, сэтгэн бодох ачаалал зэрэг нь ялгаатай тул үр дүн нь хэрэглэгчдэд хүрч буй ChatGPT-ийнхээс бага зэрэг зөрж болно. Өрсөлдөгчдийн загварын үнэлгээг нийтэд нээлттэй тайлангаас авсан.

