Przejdź do treści głównej
OpenAI

GPT-6.1Sol

Inteligencja zbliżona do modelu Astra za jedną piątą ceny

Przedstawiamy GPT-6.1 Sol, ulepszoną wersję GPT-6 Sol, która pod względem inteligencji niemal dorównuje GPT-6 Astra w kodowaniu agentowym, obsłudze komputera i pracy zawodowej, przy cenach tokenów wejściowych i wyjściowych wynoszących jedną piątą standardowych cen Astry. Dane wejściowe z pamięci podręcznej kosztują zaledwie 0,10 USD za milion tokenów — o 95% mniej niż standardowa cena danych wejściowych i o 50% mniej niż cena danych wejściowych z pamięci podręcznej GPT-6 Sol. Daje to programistom więcej możliwości tworzenia i uruchamiania skutecznych agentów wykorzystujących ponownie kontekst w kolejnych żądaniach.

  • GPT-6Astra

    Nasz najinteligentniejszy model zapewniający najlepsze wyniki.

    dane wejściowe
    10,00 USD
    dane wyjściowe
    50,00 USD
    dane wejściowe w pamięci podręcznej
    1,00 USD
  • GPT-6.1Sol

    Inteligencja zbliżona do modelu Astra za jedną piątą ceny.

    dane wejściowe
    2,00 USD
    dane wyjściowe
    10,00 USD
    dane wejściowe w pamięci podręcznej
    0,10 USD
  • GPT-6Luna

    Szybka i wydajna codzienna praca na dużą skalę.

    dane wejściowe
    0,10 USD
    dane wyjściowe
    0,50 USD
    dane wejściowe w pamięci podręcznej
    0,01 USD

Sol o większych możliwościach w różnych zadaniach

GPT-6.1 Sol oferuje nową równowagę między możliwościami a kosztami w ważnych codziennych zadaniach. Znacznie przewyższa GPT-6 Sol w wykonywaniu złożonych zadań zawodowych — od pisania kodu i usuwania z niego błędów po rozumienie dokumentów i realizację wieloetapowych procesów biznesowych. W kilku z tych testów zbliża się do wyników GPT-6 Astra przy znacznie niższych kosztach.

Programowanie

W DeepSWE v1.1, który ocenia złożone zadania z zakresu inżynierii oprogramowania w rzeczywistych bazach kodu, GPT-6.1 Sol dorównuje GPT-6 Astra za około jedną piątą kosztu. Jednocześnie przewyższa najlepszy wynik GPT-6 Sol o 6,4 punktu procentowego przy mniejszym wysiłku rozumowania i niższym koszcie.

W benchmarku DeepSWE 1.1⁠⁠(otwiera nowe okno) agenci AI wykonują autorskie zadania z zakresu inżynierii oprogramowania wymagające wielu etapów pracy.

Praca zawodowa

Test GDP.pdf mierzy, jak trafnie modele odpowiadają na pytania zawodowe na podstawie złożonych dokumentów PDF zawierających tabele, wykresy, diagramy i szczegóły zapisane drobnym drukiem. GPT-6.1 Sol uzyskuje w nim lepsze wyniki niż Opus 5.5 z modelami rezerwowymi przy koszcie zadania niższym o ponad połowę we wszystkich testowanych ustawieniach rozumowania. Zbliża się też do najlepszych w branży wyników GPT-6 Astra przy około pięciokrotnie niższym koszcie zadania.

W benchmarku GDP.pdf⁠(otwiera nowe okno) modele muszą odpowiadać na polecenia z praktyki zawodowej dotyczące złożonych plików PDF wykorzystywanych w finansach, ochronie zdrowia, prawie i siedmiu innych dziedzinach.

W AutomationBench, który sprawdza, czy agenty poprawnie realizują wieloetapowe procesy biznesowe, GPT-6.1 Sol przy średnim wysiłku rozumowania uzyskuje wynik o 2,2 punktu procentowego wyższy niż Opus 5.5 za około jedną trzecią kosztu. To również wynik o 4,8 punktu procentowego lepszy niż GPT-6 Sol przy tym samym ustawieniu.

W teście AutomationBench 1.0.6⁠⁠(otwiera nowe okno) agenci AI wykonują kompletne procesy z użyciem 47 narzędzi z obszarów sprzedaży, marketingu, operacji, obsługi klienta, finansów i HR. Punkt danych dla modelu Claude Fable 5.1 zaniża rzeczywisty koszt jego użycia, ponieważ pomija koszty korzystania z modeli zapasowych, po które sięgano w około 40% zadań.

Obsługa komputera

GPT-6.1 Sol robi też znaczne postępy w zadaniach wymagających interakcji z aplikacjami komputerowymi. Na zestawie offline testu OSWorld 2.0, który ocenia agenty w wymagających procesach obsługi komputera, GPT-6.1 Sol przewyższa GPT-6 Sol o siedem punktów procentowych przy maksymalnym wysiłku rozumowania i koszcie niższym o ponad połowę. Przy maksymalnym wysiłku rozumowania ustępuje Astrze zaledwie o 2,1 punktu procentowego, a koszt zadania wynosi około jednej siódmej kosztu Astry.

W teście OSWorld 2.0⁠⁠(otwiera nowe okno) agenci AI próbują realizować długie, wieloetapowe procesy na komputerze, obejmujące zadania codzienne i zawodowe. Podajemy wartość nagrody częściowej na zbiorze offline z wydania v2026.08.08.

Badania naukowe

W Terminal-Bench Science 0.1, który ocenia procesy naukowe obejmujące analizę danych, symulacje i dowodzenie twierdzeń, GPT-6.1 Sol ponad dwukrotnie poprawia wynik GPT-6 Sol przy maksymalnym wysiłku rozumowania i koszcie zadania niższym o ponad połowę. Przy maksymalnym wysiłku średni koszt zadania dla GPT-6.1 Sol wynosi 5,47 USD, w porównaniu z 23,21 USD dla Opus 5.5 i 23,80 USD dla Astry. Zapewnia to duże możliwości w badaniach naukowych przy koszcie o ponad 75% niższym niż w przypadku każdego z tych modeli.

GPT-6 Astra nadal osiąga najwyższy wynik wśród testowanych modeli — 68,1% — i to jego należy używać do najtrudniejszych zadań badawczych.

W benchmarku Terminal-Bench Science 0.1⁠(otwiera nowe okno) agenci realizują procesy badań naukowych za pomocą kodu i narzędzi terminalowych, m.in. analizują dane, przeprowadzają symulacje i dopasowują modele.

Poprawność merytoryczna

GPT-6.1 Sol zwiększa też poprawność merytoryczną odpowiedzi na trudne polecenia. Największą poprawę względem GPT-6 Sol osiąga przy niskim wysiłku rozumowania: odsetek odpowiedzi zawierających błąd merytoryczny spada z 11,4% do 7,7%, czyli o około 32%. We wszystkich testowanych ustawieniach wysiłku rozumowania jego odsetek błędów różni się od odsetka błędów GPT-6 Astra o nie więcej niż 1,9 punktu procentowego, przy koszcie pojedynczego zadania wynoszącym mniej niż jedną piątą kosztu GPT-6 Astra.

Test mierzy odsetek odpowiedzi zawierających co najmniej jeden błąd merytoryczny w rozmowach, z których usunięto dane identyfikujące, a w których użytkownicy zgłosili błąd wcześniejszego modelu. Te celowo trudne polecenia nie odzwierciedlają typowego użytkowania.

Oceniamy poprawność merytoryczną na podstawie rozmów w ChatGPT, z których usunięto dane identyfikujące, a w których użytkownicy zgłosili błąd merytoryczny wcześniejszego modelu. Te rozmowy prowokujące błędy nie odzwierciedlają typowego użytkowania, podczas którego błędy merytoryczne zdarzają się rzadziej.

Bezpieczne wdrażanie GPT-6.1 Sol

W naszych testach zgodności działania z ludzkimi intencjami GPT-6.1 Sol wypada znacznie lepiej niż GPT-6 Sol, zbliżając się do GPT-6 Astra.

GPT-6.1 Sol bardziej otwarcie informuje o swoich ograniczeniach i skuteczniej respektuje intencje użytkownika oraz ograniczenia bezpieczeństwa. W wymagających testach popełnia mniej błędów niż GPT-6 Sol w zakresie informowania o awarii narzędzi wyszukiwania, przestrzegania wyraźnych ograniczeń i unikania nieautoryzowanych skutków podczas zadań agentowych. Nie zaobserwowaliśmy żadnych prób obejścia automatycznego systemu kontroli bezpieczeństwa, podobnie jak w przypadku GPT-6 Astra i GPT-6 Sol. Pełne informacje znajdziesz w dodatku do karty systemu GPT-6.1 Sol⁠(otwiera nowe okno).

Poniższe testy celowo sprawdzają trudne sytuacje i nie mierzą częstości błędów podczas typowego użytkowania.

Ceny i dostępność

GPT-6.1 Sol jest od dziś dostępny w ChatGPT Work i Codex dla wszystkich użytkowników planów Plus, Pro, Business, Enterprise i Edu. GPT-6.1 Sol nie jest jeszcze dostępny w trybie Chat. Programiści mogą też korzystać z niego przez API OpenAI pod nazwą gpt-6.1-sol. Standardowe ceny w API wynoszą 2 USD za milion tokenów wejściowych, 0,10 USD za milion tokenów wejściowych z pamięci podręcznej i 10 USD za milion tokenów wyjściowych. W nadchodzących dniach zaoferujemy też GPT-6.1 Sol Ultrafast⁠, który w Codex będzie generować tokeny nawet 8 razy szybciej niż przy standardowej szybkości.

Autorzy

OpenAI

Testy GPT przeprowadzono w naszym środowisku badawczym lub za pośrednictwem naszego API. Wyniki mogą się nieznacznie różnić od uzyskiwanych w produkcyjnej wersji ChatGPT ze względu na różnice w poleceniach systemowych, dostępnych narzędziach, poziomach wysiłku itp. Wyniki testów modeli konkurencji zaczerpnięto z publicznie dostępnych raportów.