Naukowcy opracowali metodę, która oferuje weryfikowalne ścieżki wnioskowania przyczynowego w AI, przewyższając tradycyjne podejścia LLM.

Źródło zdjęcia: arXiv.org
Naukowcy z uniwersytetów opracowali nową metodę przyczynowego rozumowania dla dużych modeli językowych, która oferuje przejrzyste i weryfikowalne ścieżki wnioskowania. Framework Causal-Audit, opisany w artykule naukowym opublikowanym na platformie arXiv, ma zostać zaprezentowany na 64. corocznym spotkaniu Association for Computational Linguistics w 2026 roku.
Tradycyjne metody oparte na dużych modelach językowych często polegają na ukrytym rozumowaniu językowym, co prowadzi do nieprzejrzystych założeń przyczynowych i niestabilnych predykcji, szczególnie w złożonych scenariuszach interwencyjnych.
Autorzy badania — Su Lan, Xuefei Yin, Yanming Zhu i Alan Wee-Chung Liew — zidentyfikowali fundamentalny problem w obecnych podejściach do odpowiadania na pytania oparte na przyczynowości i interwencjach. Istniejące metody LLM często generują nieprzejrzyste założenia przyczynowe, które trudno zweryfikować, co prowadzi do niestabilnych predykcji w kontekstach pozbawionych dodatkowych informacji.
Nowy framework adresuje te problemy poprzez wprowadzenie jawnego i audytowalnego systemu rozumowania przyczynowego. Zamiast polegać na ukrytym przetwarzaniu językowym, metoda strukturyzuje proces wnioskowania w czterech wyraźnie zdefiniowanych etapach modułowych.
Centralną innowacją w Causal-Audit jest strategia konstrukcji grafu przyczynowego świadoma celu. Podejście to traktuje zmienną docelową jako kluczowe ograniczenie podczas procesu rozszerzania grafu, co skutecznie eliminuje nieistotne zmienne, fałszywe relacje przyczynowe i szum w rozumowaniu.
Framework wprowadza również zaawansowany mechanizm agregacji dowodów przyczynowych na poziomie ścieżek. System ten wykracza poza tradycyjne rozumowanie jednołańcuchowe, łącząc informacje z wielu ścieżek przyczynowych i modelując zarówno efekty wzmacniające, jak i przeciwdziałające. Takie podejście umożliwia bardziej solidne podejmowanie decyzji w złożonych scenariuszach.
Badanie obejmowało kompleksowe testy na trzech różnych benchmarkach, które potwierdziły skuteczność nowego podejścia. Framework Causal-Audit konsystentnie osiągał lepsze wyniki niż konkurencyjne metody oparte na dużych modelach językowych. Kluczową przewagą systemu jest nie tylko lepsza wydajność, ale przede wszystkim zdolność do generowania interpretowalnych i audytowalnych śladów rozumowania przyczynowego.
Ta przejrzystość ma szczególne znaczenie dla zastosowań, gdzie zrozumienie procesu decyzyjnego AI jest równie ważne jak sama jakość predykcji. Framework może znaleźć zastosowanie w dziedzinach wymagających wyjaśnialnej sztucznej inteligencji, takich jak medycyna, prawo czy analiza polityk publicznych.

Chiński model Kimi K3 zajął pierwsze miejsce w benchmarku programistycznym, ale osiąga tylko 39% dokładności w zaawansowanych zadaniach matematycznych.

Naukowcy przebadali siedem zaawansowanych modeli AI w 2800 zadaniach administracji Linux. Wyniki pokazują skłonność do poszukiwania władzy na poziomie 0–5%.

Sąd zatwierdził rekordową ugodę Anthropic z autorami i wydawcami. Każde dzieło otrzyma 3000 dolarów odszkodowania za nielegalne pozyskiwanie książek.