Kod Muse Zuckerberga przegrywa z Anthropic na własnych wykresach porównawczych Meta

  • Zuckerberg uruchomił Muse Code, a własne wykresy Meta umieszczają Claude Opus 5 na pierwszym miejscu.
  • Meta pominęła najlepszy model kodowania OpenAI w swoich porównaniach benchmarkowych.
  • Niezależne testy pokazują, że rzeczywisty lider osiąga wynik 89,5%, co przewyższa każdy wynik Meta.
Promo

Mark Zuckerberg uruchomił w środę Muse Code w wersji beta, pierwszego agenta kodującego AI od Meta. Claude Opus 5 od Anthropic pokonał go we wszystkich czterech porównaniach, które Meta opublikowała na starcie.

Mimo to Meta opublikowała te wykresy. Firma sprzedaje tańsze narzędzie, zamiast lepszego. Niezależne dane testowe sugerują, że różnica jest większa, niż pokazała Meta.

Sponsorowane
Sponsorowane

Obserwuj nas na X, by otrzymywać najnowsze wiadomości na bieżąco

Wykresy Meta pokazują wygraną Anthropic w każdej rundzie

Muse Spark 1.2 to model używany w Muse Code. Uzyskał 82,9% w Terminal-Bench 2.1.

Claude Opus 5 zdobył 86,7% w tym samym teście. Terminal-Bench pochodzi z Laude Institute i uczelni Stanford. Zawiera 89 realnych zadań: naprawy systemów, przetwarzania danych i bezpieczeństwa.

Drugie miejsce to dobry wynik. Muse Code pokonał Codex od OpenAI – 81,8% oraz Grok Build – 81,6%.

Wykres porównawczy wydajności Muse Spark 1.2
Wykres porównawczy wydajności Muse Spark 1.2, źródło: Zuckerberg

Kolejny wykres był surowszy. DeepSWE 1.1 stawia 113 zadań programistycznych bez dostępu do internetu podczas oceny. Muse Spark 1.2 spadł na trzecie miejsce z wynikiem 59,3%.

Meta opublikowała potem swój własny test. Bazuje on na 440 rzeczywistych pull requestach programistów Meta. Muse Spark 1.2 zdobył 70,6%, o około dziewięć punktów mniej niż Opus 5.

Sponsorowane
Sponsorowane
Muse Spark 1.2 realizował przez 24 godziny zadanie optymalizacji kernela na NVIDIA Hopper — ponad 1000 wywołań narzędzi — i nadal znajdował rzeczywiste przyspieszenia długo po początkowej eksploracji.
Muse Spark 1.2 realizował przez 24 godziny zadanie optymalizacji kernela na NVIDIA Hopper — ponad 1000 wywołań narzędzi — i nadal znajdował rzeczywiste przyspieszenia długo po początkowej eksploracji.

Ten wynik to tylko 2,3 punkta powyżej Muse Spark 1.1, modelu, który Meta wypuściła w lipcu.

Model, którego Meta pominęła na swoich wykresach

Meta porównywała się do GPT-5.6 Terra. OpenAI oferuje mocniejszy model o nazwie Sol, którego Meta nie ujęła na żadnym z trzech wykresów kodujących.

Sol prowadzi na niezależnej liście Terminal-Bench 2.1 [ranking] z wynikiem 89,5%. Opus 5 jest drugi z 89,1%.

Obie liczby przewyższają 86,7%, które Meta podała dla Opus 5. Meta wybrała słabszą wersję najsilniejszego konkurenta i nawet wtedy była za nim.

W porównaniu z Sol, faktycznym liderem, Muse Spark 1.2 traci 6,6 punktu, nie 3,8.

Meta uwzględniła Sol tylko w jednym miejscu. W zadaniu na kernel GPU obejmującym ponad 1000 wywołań narzędzi, Sol poprawił wynik bazowy o 71,2%. Muse Spark 1.2 osiągnął 68,7% i zajął czwarte miejsce wśród sześciu modeli.

Jest też jeden istotny wyjątek. Muse Spark 1.2 nie widnieje jeszcze na tej publicznej liście, gdzie przetestowano dopiero 26 ze 183 modeli. Wynik 82,9% pochodzi więc tylko z danych Meta.

“Muse Spark 1.2 to nasz kolejny krok w kierunku przełomu, a większe i bardziej zaawansowane modele są już w drodze.”

Zuckerberg może wkrótce udostępnić model, który pokonuje jego własny

Podobno Meta prowadzi rozmowy, by wynająć moc obliczeniową firmie Anthropic. Umowa może sięgnąć 10 mld USD przez dwa lata. Centra danych Meta pomagałyby wtedy obsługiwać modele Claude, z którymi Muse Code miał konkurować.

Zarządzanie rozwojem Muse Code było kosztowne. W czerwcu 2025 roku Zuckerberg zapłacił 14,3 mld USD za Scale AI i jej założyciela Alexandra Wanga, który obecnie prowadzi Meta Superintelligence Labs.

Cena to jedyny atut Wanga. Cennik odpowiada temu z lipcowego debiutu pierwszego płatnego API Meta: 1,25 USD za mln tokenów wejściowych i 4,25 USD za mln tokenów wyjściowych.

Poziom contributor jest ponad 10 razy tańszy. Programiści kwalifikują się, gdy zezwolą Meta na trenowanie na ich kodzie. Wang odmówił podania liczby użytkowników Muse Spark.

Wyjaśnienie rabatu pokazują dane Meta. Przychód wzrósł o 28% do 60,8 mld USD w ostatnim kwartale, ale zysk operacyjny spadł o 8% do 18,8 mld USD.

Marża operacyjna spadła do 31% z 43% rok wcześniej. W samym kwartale Meta wydała 31,08 mld USD na inwestycje i wskazuje nawet 145 mld USD na cały rok.

Muse Code oferuje inżynierię, której brakuje Claude Code. Agenci w tle utrzymują kontekst całej sesji. Podagenci pracują w osobnych kopiach repozytoriów.

Meta zbudowała solidnego kodera na drugie miejsce i wyceniła jak wersję budżetową. Wersja beta pokaże, czy deweloperzy zdecydują się wymienić kilka punktów dokładności na rachunek dziesięć razy niższy.


Aby przeczytać najnowsze analizy rynku kryptowalut od BeInCrypto, kliknij tutaj.

Zastrzeżenie

Wszystkie informacje zawarte na naszej stronie internetowej są publikowane w dobrej wierze i wyłącznie w ogólnych celach informacyjnych. Wszelkie działania podejmowane przez czytelnika w związku z informacjami znajdującymi się na naszej stronie internetowej odbywają się wyłącznie na jego własne ryzyko.

Sponsorowane
Sponsorowane