Anthropic wypuścił Claude Sonnet 5.5 dnia 28 września, w tej samej cenie co Sonnet 5. Firma twierdzi, że model działa o ponad 30% szybciej i kosztuje do 30% mniej za zadanie.
Niezależna firma zajmująca się testami miała inne wnioski dotyczące kosztów, gdy przetestowała model do granic możliwości.
Obserwuj nas na X, aby otrzymywać najnowsze wiadomości na bieżąco
Drugi model 5.5 od Anthropic pojawia się kilka dni po Opus
Sonnet 5.5 to drugi model z rodziny Claude 5.5. Anthropic wypuścił Opus 5.5 22 września. W tym samym dniu OpenAI ogłosił premierę GPT-6 Sol i Luna.
Nowy model zachował ceny Sonnet 5: 2 USD za milion tokenów wejściowych i 10 USD za milion tokenów wyjściowych. Anthropic podał wynik 70,6% w teście Terminal-Bench 4.0, który sprawdza kodowanie. Sonnet 5 uzyskał tylko 10,3%, a Opus 5.5 osiągnął 66,4%.
„Podczas gdy Opus 5.5 nadaje się do złożonych zadań wymagających starannej oceny, Sonnet 5.5 najlepiej sprawdza się przy dobrze określonych codziennych czynnościach, poprawianiu błędów oraz tworzeniu dopracowanych dokumentów, prezentacji i arkuszy kalkulacyjnych.”
Anthropic wyjaśnił, że Sonnet 5.5 nie przesuwa swojego zakresu możliwości. Dlatego podczas przeglądu skupiono się na zagrożeniach, takich jak wprowadzanie użytkowników w błąd i pomoc w ryzykownych nadużyciach.
Sonnet 5.5 jest też zabezpieczony przed cyberzagrożeniami i ma klasyfikatory antydestylacyjne. Chronią one przed próbami wyciągnięcia z modelu logiki, którą można by trenować konkurencyjne systemy. Wkrótce pojawi się także Claude Haiku 5.5.
W międzyczasie OpenAI wstrzymał premierę nadchodzącego modelu GPT-6.1 Astra ze względów bezpieczeństwa. CNBC potwierdziło w poniedziałek, że model nie spełnił standardów firmy.
Artificial Analysis: więcej tokenów przy maksymalnym wysiłku
Artificial Analysis, firma która przyznała Grok 4.7 czwarte miejsce, oceniła Sonnet 5.5 na 56 punktów w swoim indeksie inteligencji. To drugie miejsce ogólnie, tylko 2 punkty mniej niż Opus 5.5 przy maksymalnym wysiłku.
Firma zanotowała 64% dla Sonnet 5.5 w teście Terminal-Bench 4.0, przy 60% dla Opus 5.5 i GPT-6 Astra. W testach wiedzy, takich jak GDPval-AA, Sonnet 5.5 był na podobnym poziomie co Opus 5.5.
Firma stwierdziła, że Sonnet 5.5 potrzebował znacznie więcej tokenów, by osiągnąć te wyniki.
„Przy maksymalnym wysiłku, kiedy osiąga wyniki zbliżone do Opus 5.5, Claude Sonnet 5.5 zużył ok. 193 000 tokenów wyjściowych na jedno zadanie indeksu inteligencji.”
To jest około 60% więcej niż Opus 5.5 i Sonnet 5 przy maksymalnym wysiłku. To także ok. 7 razy więcej niż liczba tokenów GPT-6 Astra w podobnych warunkach.
Klienci z wcześniejszym dostępem, których cytuje Anthropic, zanotowali odwrotne wyniki w porównaniu do Sonnet 5, lecz na innych zadaniach. Balyasny Asset Management zużył znacznie mniej tokenów przy zadaniach finansowych.
„W naszym pakiecie 2441 zadań finansowych, obejmujących pytania i odpowiedzi, ekstrakcję, analizę oraz prognozy, Claude Sonnet 5.5 przewyższył Sonnet 5 i zużył ok. 121 000 tokenów na odpowiedź, gdzie Sonnet 5 zużył 497 000.”
Artificial Analysis testował wersję przedpremierową z błędem dotyczącym wyjść strukturalnych, który Anthropic już poprawił. Firma zamierza wkrótce powtórzyć kluczowe testy.
Zasubskrybuj nasz kanał YouTube, aby oglądać opinie ekspertów i dziennikarzy









