Powiązane z tym tematemRada Technologii Przyszłości i AI

Nowy model Sonnet firmy Anthropic zbliża się do wydajności Opus, ale zużywa więcej tokenów

  • Anthropic wydało Claude Sonnet 5.5, twierdząc, że działa ponad 30% szybciej niż Sonnet 5.
  • Sztuczna analiza plasuje ją na drugim miejscu w swoim indeksie inteligencji, tuż za Opus 5,5.
  • Przy maksymalnym wysiłku, Sonnet 5.5 użył około 60% więcej tokenów wyjściowych niż Opus 5.5.
Promo

Anthropic wypuścił Claude Sonnet 5.5 dnia 28 września, w tej samej cenie co Sonnet 5. Firma twierdzi, że model działa o ponad 30% szybciej i kosztuje do 30% mniej za zadanie.

Niezależna firma zajmująca się testami miała inne wnioski dotyczące kosztów, gdy przetestowała model do granic możliwości.

Obserwuj nas na X, aby otrzymywać najnowsze wiadomości na bieżąco

Sponsorowane
Sponsorowane

Drugi model 5.5 od Anthropic pojawia się kilka dni po Opus

Sonnet 5.5 to drugi model z rodziny Claude 5.5. Anthropic wypuścił Opus 5.5 22 września. W tym samym dniu OpenAI ogłosił premierę GPT-6 Sol i Luna.

Nowy model zachował ceny Sonnet 5: 2 USD za milion tokenów wejściowych i 10 USD za milion tokenów wyjściowych. Anthropic podał wynik 70,6% w teście Terminal-Bench 4.0, który sprawdza kodowanie. Sonnet 5 uzyskał tylko 10,3%, a Opus 5.5 osiągnął 66,4%.

„Podczas gdy Opus 5.5 nadaje się do złożonych zadań wymagających starannej oceny, Sonnet 5.5 najlepiej sprawdza się przy dobrze określonych codziennych czynnościach, poprawianiu błędów oraz tworzeniu dopracowanych dokumentów, prezentacji i arkuszy kalkulacyjnych.”

Sponsorowane
Sponsorowane

Anthropic wyjaśnił, że Sonnet 5.5 nie przesuwa swojego zakresu możliwości. Dlatego podczas przeglądu skupiono się na zagrożeniach, takich jak wprowadzanie użytkowników w błąd i pomoc w ryzykownych nadużyciach.

Sonnet 5.5 jest też zabezpieczony przed cyberzagrożeniami i ma klasyfikatory antydestylacyjne. Chronią one przed próbami wyciągnięcia z modelu logiki, którą można by trenować konkurencyjne systemy. Wkrótce pojawi się także Claude Haiku 5.5.

W międzyczasie OpenAI wstrzymał premierę nadchodzącego modelu GPT-6.1 Astra ze względów bezpieczeństwa. CNBC potwierdziło w poniedziałek, że model nie spełnił standardów firmy.

Artificial Analysis: więcej tokenów przy maksymalnym wysiłku

Artificial Analysis, firma która przyznała Grok 4.7 czwarte miejsce, oceniła Sonnet 5.5 na 56 punktów w swoim indeksie inteligencji. To drugie miejsce ogólnie, tylko 2 punkty mniej niż Opus 5.5 przy maksymalnym wysiłku.

Firma zanotowała 64% dla Sonnet 5.5 w teście Terminal-Bench 4.0, przy 60% dla Opus 5.5 i GPT-6 Astra. W testach wiedzy, takich jak GDPval-AA, Sonnet 5.5 był na podobnym poziomie co Opus 5.5.

Firma stwierdziła, że Sonnet 5.5 potrzebował znacznie więcej tokenów, by osiągnąć te wyniki.

„Przy maksymalnym wysiłku, kiedy osiąga wyniki zbliżone do Opus 5.5, Claude Sonnet 5.5 zużył ok. 193 000 tokenów wyjściowych na jedno zadanie indeksu inteligencji.”

To jest około 60% więcej niż Opus 5.5 i Sonnet 5 przy maksymalnym wysiłku. To także ok. 7 razy więcej niż liczba tokenów GPT-6 Astra w podobnych warunkach.

Klienci z wcześniejszym dostępem, których cytuje Anthropic, zanotowali odwrotne wyniki w porównaniu do Sonnet 5, lecz na innych zadaniach. Balyasny Asset Management zużył znacznie mniej tokenów przy zadaniach finansowych.

„W naszym pakiecie 2441 zadań finansowych, obejmujących pytania i odpowiedzi, ekstrakcję, analizę oraz prognozy, Claude Sonnet 5.5 przewyższył Sonnet 5 i zużył ok. 121 000 tokenów na odpowiedź, gdzie Sonnet 5 zużył 497 000.”

Artificial Analysis testował wersję przedpremierową z błędem dotyczącym wyjść strukturalnych, który Anthropic już poprawił. Firma zamierza wkrótce powtórzyć kluczowe testy.

Zasubskrybuj nasz kanał YouTube, aby oglądać opinie ekspertów i dziennikarzy

Zastrzeżenie

BeInCrypto dokłada wszelkich starań, aby zapewnić bezstronne i przejrzyste relacjonowanie. Niniejszy artykuł informacyjny ma na celu dostarczenie dokładnych i aktualnych informacji. Zaleca się jednak, aby czytelnicy samodzielnie weryfikowali fakty i konsultowali się ze specjalistą przed podjęciem jakichkolwiek decyzji na podstawie niniejszych treści. Informujemy, że nasz Regulamin, nasza Polityka prywatności oraz nasze Zastrzeżenia prawne zostały zaktualizowane.

Sponsorowane
Sponsorowane