Chiński model Kimi K3 zajął pierwsze miejsce w benchmarku programistycznym, ale osiąga tylko 39% dokładności w zaawansowanych zadaniach matematycznych.

Źródło zdjęcia: The Decoder
Chiński model Kimi K3 od firmy Moonshot zyskuje coraz większą uwagę w zachodniej społeczności AI. Według najnowszych testów opublikowanych przez The Decoder, model prezentuje mieszane wyniki w porównaniu z najlepszymi zachodnimi rozwiązaniami.
W benchmarku Code Arena: Frontend, który ocenia modele na podstawie preferencji użytkowników, Kimi K3 osiągnął wynik 1679 punktów, wyprzedzając Claude Fable 5 (1631 punktów), GPT-5.6 Sol (1618 punktów) i wszystkie inne testowane modele ze znaczną przewagą. To pierwszy przypadek, gdy chiński model zajął pierwsze miejsce w tym benchmarku.
Sukces Kimi K3 w benchmarku Code Arena: Frontend stanowi znaczący moment dla chińskiej branży AI. Benchmark ten ocenia modele na podstawie ludzkich preferencji, co czyni go szczególnie wiarygodnym miernikiem praktycznej użyteczności. Przewaga 48 punktów nad Claude Fable 5 i 61 punktów nad GPT-5.6 Sol to wyraźny sygnał, że chińskie modele mogą konkurować z najlepszymi zachodnimi rozwiązaniami w określonych zastosowaniach.
Dane z Epoch AI ujawniają jednak poważne ograniczenia Kimi K3 w bardziej wymagających zadaniach. W najtrudniejszym poziomie FrontierMath Tier 4, który testuje zdolności w rozwiązywaniu eksperckich problemów matematycznych, chiński model osiąga jedynie 39% dokładności. To drastyczna różnica w porównaniu z modelami OpenAI i Anthropic, które w niektórych przypadkach zbliżają się do 90% skuteczności.
Ta rozbieżność w wynikach ilustruje nierównomierny rozwój chińskich modeli AI, które mogą doskonalić się w określonych dziedzinach, ale wciąż pozostają w tyle za zachodnimi konkurentami w najbardziej wymagających zadaniach analitycznych.
Kimi K3 pokazuje, że chiński sektor AI rozwija się w kierunku specjalizacji w praktycznych zastosowaniach programistycznych, choć wciąż wymaga znacznych ulepszeń w obszarach wymagających zaawansowanego rozumowania matematycznego.

Google DeepMind przedstawił Gemini 3.6 Flash, 3.5 Flash-Lite i 3.5 Flash Cyber, ale flagowy model Pro nadal czeka na aktualizację od lutego.

Superkomputer DGX GB300 z NVIDIA obsłuży 1500 studentów wojskowych, umożliwiając trenowanie modeli AI i symulacje w cyberbezpieczeństwie oraz prognozowaniu.

Giganty AI walczą o przyszłość robotyki. Anthropic rzeczywiście rozmawiał z Physical Intelligence o przejęciu, mimo że CEO firmy zaprzeczył plotkom.