Sudoku – popularna łamigłówka liczbowa
Sudoku to gra logiczna, polegająca na wypełnieniu pustych pól w kwadratowej planszy 9x9 cyframi od 1 do 9 tak, by każda cyfra pojawiła się tylko raz w każdym wierszu, kolumnie i bloku 3x3. Pierwsze sudoku wydrukowano w 1986 roku w japońskim czasopiśmie „Nicoli”. Od tamtej pory stało się jedną z najsłynniejszych i najczęściej rozwiązywanych łamigłówek na świecie, z około 200 milionami użytkowników aplikacji mobilnych z nią związanych.
Sudoku to nie lada wyzwanie dla sztucznej inteligencji
Naukowcy z Uniwersytetu Kolorado w Boulder przeprowadzili badania, w których sztuczna inteligencja została poproszona o rozwiązanie 2300 plansz sudoku w wersji 6x6 o różnym stopniu trudności. Eksperyment wykazał, że wszystkie testowane modele językowe (LLM), takie jak o1, Llama-3.1, Gemma-2 i Mistral, rozwiązały jedynie 0,4% plansz.
Główną przyczyną niepowodzeń AI jest jej brak logicznego rozumowania. Modele te określają rozwiązania na podstawie prawdopodobieństwa, nie analizując krok po kroku ograniczeń i reguł Sudoku.
„Trzeba postępować krok po kroku, ciągle na nowo oceniać pola liczbowe i konsekwentnie przestrzegać zasad. Łamigłówki tego typu to dobra zabawa, ale stanowią też idealny mikrokosmos do badania procesu podejmowania decyzji w uczeniu maszynowym” — Anirudh Maiya, ekspert w dziedzinie informatyki i uczenia maszynowego
Problemy z wyjaśnianiem rozwiązań
Jeszcze większe trudności AI miała z uzasadnieniem swoich odpowiedzi. W zaledwie 5% przypadków potrafiła poprawnie wyjaśnić, dlaczego dana liczba została wpisana do planszy.
Często podawane przez nią tłumaczenia były błędne lub niejasne, a czasami wręcz absurdalne. W jednym z przykładów model AI pomylił się, twierdząc błędnie, że w danym wierszu jest już liczba 2, a nawet nagle podał prognozę pogody podczas rozmowy o Sudoku.
„Modele sztucznej inteligencji mają problemy z braniem pod uwagę jednocześnie wszystkich ograniczających czynników w siatce liczbowej” — dr Ashutosh Trivedi, współautor badania
Ograniczenia sztucznej inteligencji – wnioski z badania
Mimo imponujących osiągnięć w innych dziedzinach (jak generowanie tekstów, tłumaczenia, rozpoznawanie obrazów), sztuczna inteligencja nie radzi sobie skutecznie z precyzyjnym rozumowaniem i regułami w łamigłówkach liczbowych.
Wyniki badania pokazują, że w zadaniach wymagających krokowego, ścisłego myślenia AI nadal pozostaje daleko w tyle za człowiekiem. Nawet najsilniejszy testowany model o1, mimo że rozwiązał około 65% plansz w najłatwiejszych zadaniach, tracił skuteczność wraz ze wzrostem ich trudności.
„Wiele osób mówi o nowych umiejętnościach modeli AI, których nie można by się po nich spodziewać. Jednak jednocześnie nie jest zaskakujące, że w wielu zadaniach nadal radzi sobie słabo” — Anirudh Maiya