Nowe badanie analizuje różnice w reprezentacjach wewnętrznych między modelami trenowanymi uczeniem ze wzmocnieniem a nadzorowanym.

Źródło zdjęcia: arXiv.org
Nowe badanie naukowe ujawnia, dlaczego modele sztucznej inteligencji trenowane za pomocą uczenia ze wzmocnieniem (RL) przewyższają te trenowane metodą nadzorowaną (SFT) w rozwiązywaniu problemów matematycznych. Badacze z uniwersytetów amerykańskich przeanalizowali wewnętrzną strukturę reprezentacji tych modeli, odkrywając fundamentalne różnice w sposobie przetwarzania zadań logicznych. Wyniki badania zostały opublikowane w lipcu 2026 roku w ramach drugiego warsztatu XAI4Science na konferencji AAAI 2026.
Zespół badawczy pod kierownictwem Antyabha Rahman przeprowadził szczegółową analizę mechanizmów odpowiedzialnych za przewagę modeli trenowanych metodą RL w zadaniach wymagających rozumowania matematycznego.
Autorzy badania wykorzystali dwie główne techniki analizy: sondy liniowe trenowane na stanach ukrytych w poszczególnych warstwach oraz studia ablacji średniej. Sondy liniowe pozwoliły na ocenę jakości reprezentacji w różnych warstwach modeli, ujawniając, że modele RL osiągają wyższą dokładność w przewidywaniu poprawności odpowiedzi matematycznych.
Studia ablacji średniej pokazały istotną różnicę architektoniczną między modelami. W modelach RL głębsze warstwy okazały się progresywnie bardziej krytyczne dla procesu rozumowania, co sugeruje rozwój hierarchicznej struktury przetwarzania informacji. W przeciwieństwie do tego, modele SFT wykazywały równomierne rozłożenie ważności między wszystkimi warstwami.
Odkrycia te mają fundamentalne znaczenie dla zrozumienia mechanizmów uczenia się w dużych modelach językowych. Badanie dowodzi, że uczenie ze wzmocnieniem nie tylko poprawia końcową wydajność, ale także fundamentalnie zmienia wewnętrzną architekturę reprezentacji modelu.
Analiza zmienności alokacji tokenów podczas wielokrotnego próbkowania ujawniła dodatkowy wymiar różnic między modelami. Podczas gdy niektóre modele RL wykazywały większą zmienność niż ich odpowiedniki SFT, inne pozostawały bardzo stabilne, co sugeruje, że alokacja zasobów obliczeniowych może zależeć bardziej od całego pipeline'u treningowego niż tylko od wyboru między RL a SFT.
Badanie dostarcza nowych narzędzi do oceny stabilności polityk modeli i identyfikacji zachowań niedookreślonych, co może mieć kluczowe znaczenie dla rozwoju bardziej przewidywalnych i niezawodnych systemów AI w zadaniach wymagających złożonego rozumowania matematycznego.
Raport OpenAI pokazuje, jak agenty kodowe przyspieszają rozwój oprogramowania naukowego, zmieniając rolę badaczy z implementatorów na koordynatorów.

Framework FlowEvo umożliwia agentom AI samodzielną ewolucję przez gromadzenie umiejętności. Osiąga 82,8% skuteczności przy dwukrotnie mniejszych kosztach.

Amazon wycofuje się z rozwoju modeli Nova AI po siedmiu miesiącach, przekierowując zasoby do nowej grupy badawczej pod kierownictwem Pietera Abbeela.