Anthropic zaprezentował Claude Sonnet 5.5. Jest bardziej efektywny, szybszy i często dorównuje nawet Opusowi 5.5

  • Anthropic zaprezentował Claude Sonnet 5.5, drugi model z serii 5.5
  • W wielu testach dorównuje dwukrotnie droższemu Opusowi 5.5
  • Ma wykonać tę samą pracę szybciej i do 30% taniej niż Sonnet 5

Sdílejte:
Adam Kurfürst
Adam Kurfürst
28. 9. 2026 22:35

Niecały tydzień po wydaniu Opusa 5.5, Anthropic uzupełnia nową serię o jego tańszego i szybszego brata. Claude Sonnet 5.5 jest przeznaczony do dobrze zdefiniowanych codziennych zadań, takich jak naprawa błędów w kodzie czy tworzenie dokumentów, prezentacji i arkuszy kalkulacyjnych. Jeśli używasz Claude’a przez API, za tokeny zapłacisz tyle samo co za Sonnet 5, ale nowy model zużyje ich mniej do tego samego zadania.

W testach często dorównuje Opusowi 5.5

Anthropic w swoim ogłoszeniu pisze, że model poprawił się we wszystkich obszarach w porównaniu do poprzednika, w niektórych dramatycznie. Największy skok odnotowano w teście Terminal-Bench 4.0, który sprawdza złożone zadania w wierszu poleceń. Sonnet 5.5 osiągnął w nim według tabeli firmy 70,6%, podczas gdy Sonnet 5 tylko 10,3%. Nawet nieznacznie wyprzedza Opusa 5.5 z wynikiem 66,4%.

W teście GDPval-AA, gdzie modele wykonują rzeczywiste zadania z 44 zawodów, ustępuje Opusowi 5.5 o zaledwie dwa punkty (1844 do 1846) i wyprzedza Sonnet 5 o około 400 punktów. Konkurencyjny GPT-6 Sol od OpenAI ma w tabeli 1487 punktów. Nowy model pozostaje tuż za Opusem 5.5 również w sterowaniu komputerem i czytaniu wykresów. Ponadto, jako pierwszy Sonnet ukończył grę Pokémon Red wyłącznie na podstawie zrzutów ekranu. Mimo to firma przyznaje, że do złożonych i otwartych zadań, które wymagają długoterminowego rozumowania, Opus 5.5 jest nadal wyraźnie silniejszy, co jest jednak logiczne, biorąc pod uwagę długoterminowe pozycjonowanie serii modeli Claude.

Według firmy, największą poprawę widać w programowaniu. W teście FrontierCode, Sonnet 5.5 przy tych samych ustawieniach ma o 10 punktów wyższy wynik niż Sonnet 5 za około jedną piętnastą kosztów. Testerom podobało się, jak szybko orientuje się w obcym kodzie i że częściej łączy wywołania narzędzi, dzięki czemu zadanie wykonuje w mniejszej liczbie kroków. Dyrektor operacyjny Epic Games, Daniel Vogel, stwierdza, że model poradził sobie z dziesiątkami tysięcy linii kodu architektury gry oraz z zadaniami trwającymi kilka godzin.

Firma podkreśla również wyczucie designu. Nowy Sonnet ma zapewniać lepsze dopracowanie wyglądu aplikacji i tworzyć prezentacje na podstawie szablonu, które wymagają jedynie niewielkich poprawek. W wewnętrznym teście otrzymał kwartalne wyniki publicznie notowanej firmy wraz z transkrypcjami rozmów z inwestorami i miał przygotować prezentację składającą się z dziesięciu slajdów na podstawie szablonu. Dwóch ekspertów uznało jego pierwszą wersję za gotową do wysłania.

Sonnet 5.5 jest znacznie bardziej efektywny przy tej samej cenie

Deweloperzy zapłacą około 43 CZK (2 dolary) za milion tokenów wejściowych i 214 CZK (10 dolarów) za milion tokenów wyjściowych, czyli połowę tego, co w przypadku Opusa 5.5. Odczyt z pamięci podręcznej kosztuje około 4 CZK za milion tokenów. Oszczędność nie wynika zatem z niższego cennika, ale z efektywności: według Anthropicu model potrzebuje mniej tokenów do wykonania tej samej pracy, a zadanie kosztuje do 30% mniej niż w przypadku Sonnetu 5. Slack na przykład zmierzył około 14% mniej tokenów wyjściowych dla swojego Slackbota.

Ponadto, tekst generuje o ponad 30% szybciej, co czyni go najszybszym Sonnetem w historii. Szybkość i cenę można zrównoważyć, wybierając poziom wysiłku. W aplikacjach Claude i Claude Code domyślny jest poziom średni, na platformie deweloperskiej – wysoki. Co więcej, przy średnim poziomie Sonnet 5.5 w Terminal-Bench, według firmy, znacznie przewyższył najlepszy wynik Sonnetu 5, i to za mniej niż jedną dziesiątą kosztów.

Model jest już dostępny na wszystkich platformach, w tym w chmurach Amazon Web Services, Google Cloud i Microsoft Azure, również w trybie bez przechowywania danych. Serię 5.5 w najbliższych tygodniach zamknie Haiku 5.5, przeznaczony do taniego wdrożenia na dużą skalę.

Nowy Sonnet po raz pierwszy otrzymał silniejsze zabezpieczenia

Według Anthropicu, możliwości w zakresie cyberbezpieczeństwa dorównują Opusowi 5, co czyni go pierwszym Sonnetem, który otrzymał podobne zabezpieczenia jak najwydajniejsze modele firmy. Wyszukiwanie i naprawianie błędów we własnym kodzie będzie nadal możliwe, ale bardziej ryzykowne zadania związane z bezpieczeństwem wyraźnie przejdą na starszy Sonnet 5. Ochrona w dziedzinie biologii pozostaje taka sama jak u poprzednika, ale według firmy może przypadkowo przechwycić również niektóre zapytania z mikrobiologii i wirusologii.

Nowy Sonnet broni się również przed tak zwaną destylacją, w której atakujący za pomocą tysięcy fałszywych kont wyciągają możliwości modelu dla własnej sztucznej inteligencji bez ograniczeń bezpieczeństwa. Dlatego jako pierwszy Sonnet otrzymał klasyfikatory, które zapobiegają wydobywaniu jego rozumowania. Sposób myślenia modelu jest teraz powiązany z kontem, które go utworzyło, co odczujesz, jeśli przenosisz rozmowy między kontami, na przykład podczas przełączania konta w trakcie pracy w Claude Code. W zautomatyzowanym audycie zachowania z około 1850 scenariuszami, według firmy, radzi sobie tak samo lub lepiej niż Sonnet 5 i ze wszystkich jej modeli najmniej testuje granice środowiska, w którym działa.

Czy Sonnet 5.5 wystarczy do codziennej pracy, czy wolisz dopłacić za Opus?

Źródło: Anthropic

O autorze

Adam Kurfürst

Adam studuje na gymnáziu a technologické žurnalistice se věnuje od svých 14 let. Pakliže pomineme jeho vášeň pro chytré telefony, tablety a příslušenství, rád se… Więcej o autorze

Adam Kurfürst
Sdílejte: