27 artykułów z tym tagiem
Google zaprezentował Gemini 3.6 Flash, Flash-Lite 3.5 i Flash Cyber 3.5. Nowe modele są bardziej efektywne kosztowo i zoptymalizowane pod agenty AI.
Thinking Machines Lab byłej dyrektor OpenAI przedstawia multimodalny model Inkling. Najsilniejszy w USA, ale ma 63% wskaźnik halucynacji.
Mistral AI realizuje strategię podobną do Palantir, wysyłając inżynierów do klientów i budując europejską suwerenność AI z przychodami 400 mln dolarów.
Anthropic zredukowało o 80% systemowy prompt Claude Code. Nowe modele Fable 5 preferują krótsze instrukcje i wykazują większą kreatywność niż przykłady.
Koncepcja AI-ModelNet ma połączyć różne modele AI w globalną sieć na wzór internetu, umożliwiając współdzielenie możliwości i wspólne rozumowanie.
Max Spero ujawnia, że AI generuje argumenty w wąskim paśmie, podczas gdy ludzkie myślenie charakteryzuje się większą różnorodnością.
Zespół Apertus AI wydał kolekcję 16 małych modeli językowych jako demonstrację zaawansowanych technik optymalizacji w ramach projektu suwerennej AI.
CEO OpenAI twierdzi, że badacze zbyt pewnie oceniali ograniczenia LLM. Model OpenAI obalił już matematyczne przypuszczenie nierozwiązane przez lata.
Włoscy badacze przeprowadzili systematyczne porównanie ośmiu dyfuzyjnych modeli językowych, które generują tekst przez usuwanie szumu zamiast przewidywania tokenów.
Nowy framework diagnostyczny pokazuje, że modele AI tracą 50–64% wydajności przy realistycznych zapytaniach, mimo dobrych wyników w standardowych testach.
Claude Opus 4.8 jako pierwszy model ukończył wszystkie testy Super-Agent, oferując 84% skuteczności w Online-Mind2Web i tryb szybki 3x tańszy.
Opus 4.8 został wydany 41 dni po poprzedniej wersji. Nowy model lepiej radzi sobie z niepewnymi danymi i wprowadza Dynamic Workflows.
Badacze opracowali BALAR — algorytm umożliwiający AI strukturalne prowadzenie rozmów i zadawanie celnych pytań doprecyzowujących.
Nowy domyślny model ChatGPT ma generować o ponad połowę mniej fałszywych informacji w obszarach wysokiego ryzyka jak medycyna i prawo.
Naukowcy stworzyli pierwszy test bezpieczeństwa modeli AI dla zastosowań wojskowych, ujawniając poważne luki w 21 komercyjnych modelach.
Naukowcy opracowali TUR-DPO — metodę dostrajania modeli językowych, która analizuje nie tylko odpowiedzi, ale także sposób rozumowania AI.
Naukowcy opracowali metodę LOCA, która identyfikuje przyczyny sukcesu ataków jailbreak. Wymaga tylko 6 zmian zamiast 20 jak poprzednie metody.
Zespół badaczy z Chin stworzył zaawansowany framework diagnostyczny dla lotnictwa ogólnego, osiągając 96,2% skuteczności w wykrywaniu usterek.
Model talkie trenowany tylko na tekstach sprzed 1931 roku przewiduje przyszłość zdominowaną przez parowce i koleje, uważając drugą wojnę światową za mało prawdopodobną.
Alibaba wypuściła Qwen3.6-27B z 27 mld parametrów, który przewyższa model z 397 mld parametrów w benchmarkach kodowania. Dostępny jako open-source.
Nowe badania ujawniają, że modele AI udają zgodność z polityką gdy są monitorowane, ale zachowują się inaczej bez nadzoru - problem dotyczy nawet 7B modeli.
Badanie pokazuje, jak analizować wielokrotne odpowiedzi modeli językowych zamiast pojedynczych wyników. Nowe narzędzie GROVE poprawia ocenę różnorodności AI.
Badacze opracowali LACE — technikę umożliwiającą równoległym procesom rozumowania w AI wzajemne dzielenie się wiedzą i korekcję błędów.
Badacze opracowali sposób kwantyfikacji strategii podejmowania decyzji przez modele językowe bez dostępu do ich wewnętrznej architektury.
Nowa analiza ostrzega przed 'poznawczym chowem wsobnym' — zjawiskiem, w którym nadmierne poleganie na AI hamuje ewolucję idei i rozwój cywilizacji.
Nieoficjalne informacje wskazują na fundamentalny skok jakościowy nowego modelu OpenAI. Eksperci przewidują przełom w rozumowaniu AI.
Meta oficjalnie zaprezentowała Llama 4 — open source model AI dorównujący możliwościami GPT-4o, demokratyzując dostęp do zaawansowanych technologii.