7 artykułów z tym tagiem
Chiński model Kimi K3 zajął pierwsze miejsce w benchmarku programistycznym, ale osiąga tylko 39% dokładności w zaawansowanych zadaniach matematycznych.
Nowy model Anthropic kosztuje niemal dwukrotnie więcej za zadanie niż poprzednik przy nominalnie tych samych cenach tokenów.
Badacze proponują wielowymiarową ewaluację modeli AI zamiast zastępowania nasyconych testów trudniejszymi. Eksperyment wykazał dwukrotne przyspieszenie pracy.
Nowy framework diagnostyczny pokazuje, że modele AI tracą 50–64% wydajności przy realistycznych zapytaniach, mimo dobrych wyników w standardowych testach.
Koszty testów agentów AI osiągają dziesiątki tysięcy dolarów, tworząc barierę dla mniejszych organizacji badawczych.
Najnowszy model OpenAI dominuje w rankingach AI, ale ma krytyczny problem z fabricowaniem odpowiedzi zamiast przyznania się do braku wiedzy.
Badacze z UAE uruchomili QIMMA — jedyną platformę oceny modeli arabskich, która sprawdza jakość benchmarków przed testowaniem. Wykryto błędy w szanowanych testach.