Nowy model Anthropic ustanawia rekordy w programowaniu i zadaniach wiedzy, kosztując połowę ceny Fable 5 przy podobnej wydajności.

Źródło zdjęcia: The Decoder
Anthropic wprowadza Claude Opus 5, nowy flagowy model sztucznej inteligencji, który ma konkurować z droższym Claude Fable 5, oferując podobną wydajność przy dwukrotnie niższych kosztach tokenów. Według oficjalnych danych firmy, nowy model ustanawia rekordy w programowaniu i zadaniach związanych z przetwarzaniem wiedzy.
Opus 5 staje się domyślnym modelem w planie Claude Max i najbardziej zaawansowanym dostępnym w Claude Pro. Firma odpowiada w ten sposób na presję cenową ze strony GPT-5.6 Sol oraz chińskich konkurentów, dążąc do zmniejszenia luki między ceną a wydajnością w porównaniu do znacznie droższego Fable 5.
Opus 5 wykazuje zróżnicowaną wydajność w zależności od typu zadań. W programowaniu agentowym przez terminal model osiąga najwyższe wyniki z 43,3% na benchmarku Frontier-Bench v0.1. W zadaniach związanych z przetwarzaniem wiedzy (GDPval-AA v2) prowadzi z wynikiem Elo 1,861, wyprzedzając Fable 5 (1,747) i GPT-5.6 Sol (1,736).
Jednak nie wszędzie Opus 5 dominuje. W programowaniu agentowym przez DeepSWE v1.1 przegrywa z GPT-5.6 Sol (72,7%) i Fable 5 (69,7%), osiągając 68,8%. W zadaniach medycznych i prawnych ustępuje odpowiednio modelom Fable 5 i Mythos 5.
Szczególnie zaskakujący jest wynik w teście ARC-AGI-3, który mierzy rozwiązywanie nowych problemów bez opierania się na zapamiętanych wzorcach. Opus 5 osiągnął 30,2%, podczas gdy jego poprzednik Opus 4.8 zaledwie 1,5%. To prawie czterokrotna przewaga nad następnym w kolejności GPT-5.6 Sol.
Anthropic wprowadził system pięciu poziomów wysiłku: low, medium, high, xhigh i max, pozwalający użytkownikom balansować wydajność z kosztami tokenów. Firma zaleca szerokie wykorzystanie ustawień „low” i „medium” dla większości zadań, rezerwując „xhigh” dla programowania i zadań agentowych.
Interesujący paradoks ujawnił się w dwóch benchmarkach — Frontier-Bench v0.1 i Artificial Analysis Coding Agent Index — gdzie Opus 5 osiąga gorsze wyniki przy najwyższym ustawieniu „max” mimo wyższych kosztów. Według dewelopera FrontierCode Cheng-Yuan Lee, to zachowanie wynika z tego, że przy wyższych poziomach wysiłku model ma tendencję do refaktoryzowania otaczającego kodu nawet gdy potrzebna jest tylko drobna poprawka. Benchmark traktuje takie niesolicitowane zmiany jako błędy, chociaż kod pozostaje poprawny.
Model zachowuje okno kontekstowe 1 miliona tokenów i te same stawki co poprzednik — jednak rzeczywiste koszty mogą się różnić w zależności od efektywności tokenów. Historia pokazuje, że Opus 4.7 kosztował o 30–40% więcej za zadanie niż Opus 4.8 przy tych samych bazowych stawkach.

Naukowcy przebadali siedem zaawansowanych modeli AI w 2800 zadaniach administracji Linux. Wyniki pokazują skłonność do poszukiwania władzy na poziomie 0–5%.

Nowy procesor Google'a ma być 6–10 razy bardziej wydajny od TPU dzięki wbudowanej architekturze Gemini bezpośrednio w krzem. Wdrożenie planowane od 2028 roku.

Firma znana z generowania obrazów AI kupuje aplikację horoscopów Co-Star. Założycielka zostanie dyrektorem ds. designu i pomoże tworzyć pierwsze aplikacje.