Badanie ujawnia, jak stan psychiczny annotatorów wpływa na jakość danych RLHF i propaguje błędy systematyczne w modelach sztucznej inteligencji.

Źródło zdjęcia: arXiv.org
Naukowcy z uniwersytetów Elena Kopteva i Vitaliy Hlynianyi-Zhuk opublikowali w kwietniu 2026 roku przełomowe badanie identyfikujące nowe źródło błędów systematycznych w procesie uczenia ze wzmocnieniem z ludzkim feedbackiem (RLHF). Ich praca, dostępna w serwisie arXiv, ujawnia, jak stan psychiczny annotatorów może wpływać na jakość danych preferencji używanych do trenowania modeli AI.
Tradycyjne podejście do RLHF zakłada, że etykiety preferencji parowanych odzwierciedlają wyłącznie jakość porównywanych wyników modeli. Jednak autorzy identyfikują strukturalny czynnik zakłócający — etykiety mogą również odzwierciedlać stan annotatora podczas procesu oceny. W warunkach długotrwałego stresu lub cierpienia preferencje oceniających mogą się zmieniać w czasie.
Te przesunięcia różnią się od zwykłych niezgodności między annotatorami czy losowego szumu w etykietach. Są zależne od stanu psychicznego, mogą być wspólne dla annotatorów pracujących w podobnych warunkach i mogą propagować się przez modelowanie nagród oraz optymalizację polityki.
Badacze wprowadzili precyzyjne definicje kluczowych pojęć: przesunięcie stanu annotatora (rater state shift), zakłócenie stanu annotatora (rater state confound) oraz skorelowany błąd stanu annotatora (correlated rater state bias). Zdefiniowali również „survival level emotional authenticity” jako mierzalny wzorzec odpowiedzi wykorzystujący cechy leksykalne, pragmatyczne, dyskursywne i związane z bezpieczeństwem.
Analiza pokazuje, jak skorelowane błędy stanu annotatora mogą przetrwać proces agregacji danych i wprowadzić błędy do sygnałów nagród używanych w treningu modeli. Autorzy wyprowadzili pięć falsyfikowalnych przewidywań wraz z progami wielkości efektu dla wstępnego audytu.
Przedstawiony protokół audytu oraz plan badania pilotażowego można zastosować do publicznie dostępnych modeli dostrojonych za pomocą instrukcji. Autorzy podkreślają, że nie wnioskują o historii treningu żadnego konkretnego wdrożonego modelu — ich celem jest wyizolowanie prawdopodobnego i testowalnego źródła błędów systematycznych w danych preferencji RLHF.
Praca ta otwiera nowe perspektywy badawcze w obszarze jakości danych treningowych i może przyczynić się do poprawy metodologii RLHF poprzez uwzględnienie czynników psychologicznych wpływających na proces annotacji.

Sąd zatwierdził rekordową ugodę Anthropic z autorami i wydawcami. Każde dzieło otrzyma 3000 dolarów odszkodowania za nielegalne pozyskiwanie książek.

Xi Jinping ogłosił powstanie WIKO z siedzibą w Szanghaju. Rosja, Brazylia i RPA wśród członków założycielskich nowej struktury zarządzania AI.

Moonshot AI i Alibaba zaprezentowały zaawansowane modele AI dorównujące OpenAI i Anthropic, oferując je jako otwarto-źródłowe za ułamek kosztów.