Učenje modela akcija

Izvor: Hrvatska internetska enciklopedija
Prijeđi na navigaciju Prijeđi na pretraživanje

Učenje modela akcija (engl. action model learning), ponekad skraćeno učenje akcija, područje je strojnog učenja koje se bavi stvaranjem i izmjenom znanja softverskog agenta o učincima i preduvjetima akcija koje se mogu izvesti u njegovoj okolini. To se znanje obično zapisuje jezikom za opis akcija utemeljenim na logici te služi kao ulazni podatak automatskim planerima.

Učenje modela akcija važno je kada se ciljevi mijenjaju. Nakon što je agent neko vrijeme djelovao, može se poslužiti prikupljenim znanjem o akcijama u domeni kako bi donosio bolje odluke. Po tome se učenje modela akcija razlikuje od podržanog učenja jer omogućuje zaključivanje o akcijama umjesto skupih pokušaja u stvarnom svijetu.[1] Riječ je o obliku induktivnog zaključivanja, u kojem novo znanje nastaje na temelju agentovih opažanja.

Uobičajen razlog za bavljenje učenjem modela akcija činjenica je da je ručno određivanje modela akcija za planere često težak i dugotrajan posao sklon pogreškama, osobito u složenim okolinama.

Modeli akcija

Neka je zadan skup za učenje koji se sastoji od primjera , pri čemu su i opažanja stanja svijeta u dvama uzastopnim vremenskim koracima i , a je primjerak akcije opažen u koraku . Cilj je učenja modela akcija općenito izgraditi model akcija , u kojem je opis dinamike domene zapisan nekim formalizmom za opis akcija, primjerice STRIPS-om, ADL-om ili PDDL-om, a funkcija vjerojatnosti definirana nad elementima od .[2]

Mnoge suvremene metode učenja akcija ipak pretpostavljaju determinizam i ne uče funkciju . Osim po toj pretpostavci, pojedine se metode razlikuju i po tome kako se nose s ostalim svojstvima domene, primjerice s djelomičnom opservabilnošću ili sa šumom u osjetilnim podacima.

Metode učenja akcija

Suvremeni pristupi

Novije metode učenja akcija primjenjuju različite pristupe i širok raspon alata iz raznih područja umjetne inteligencije i računalne logike. Kao primjer metode utemeljene na logici sudova može se navesti algoritam SLAF (engl. Simultaneous Learning and Filtering), koji iz agentovih opažanja tijekom vremena gradi dugu logičku formulu, a zatim je tumači s pomoću rješavača problema zadovoljivosti (engl. SAT solver).[1] Tehnika u kojoj se učenje također pretvara u problem zadovoljivosti, u ovom slučaju u težinski MAX-SAT, i u kojoj se rabe isti rješavači, ostvarena je u sustavu ARMS (engl. Action-Relation Modeling System).[3]

Dva međusobno slična i posve deklarativna pristupa učenju akcija utemeljena su na paradigmi logičkog programiranja answer set programming (ASP)[4] te na njezinu proširenju, reaktivnom ASP-u.[5] U jednom je radu primijenjen pristup induktivnoga logičkog programiranja odozdo prema gore.[6] Nekoliko rješenja nije izravno utemeljeno na logici, primjerice učenje modela akcija s pomoću algoritma perceptrona[7] ili višerazinsko pohlepno pretraživanje prostora mogućih modela akcija.[8] U starijem radu iz 1992. učenje modela akcija proučavano je kao proširenje podržanog učenja.[9]

Postoje i algoritmi koji rade uz drukčije pretpostavke. FAMA djeluje i kada dio opažanja nedostaje te daje općenit (engl. lifted) model planiranja; učenje modela akcija tretira kao problem planiranja, pazeći da naučeni model odgovara zadanim opažanjima.[10] NOLAM može naučiti općenite modele akcija i iz zašumljenih ili nepotpunih podataka.[11] LOCM se oslanja isključivo na redoslijed akcija u podacima i zanemaruje pojedinosti o stanjima između njih.[12] Obitelj metoda za sigurno učenje modela akcija (SAM, engl. safe action model) stvara modele koji jamče da će planovi izrađeni s pomoću njih doista biti provedivi u stvarnom svijetu.[13] Njezino proširenje N-SAM može učiti modele akcija s numeričkim uvjetima i učincima.[14]

Numerički modeli akcija poput N-SAM-a mogu se upotrijebiti i za poboljšanje uspješnosti podržanog učenja, i to algoritmom RAMP.[15]

Literatura

Većina se radova o učenju akcija objavljuje u časopisima i na konferencijama posvećenima umjetnoj inteligenciji općenito, primjerice u časopisima Journal of Artificial Intelligence Research (JAIR), Artificial Intelligence i Applied Artificial Intelligence (AAI) te na konferencijama udruge AAAI. Unatoč srodnosti tema, učenje modela akcija obično se ne obrađuje na konferencijama posvećenima planiranju, kao što je Međunarodna konferencija o automatskom planiranju i raspoređivanju (ICAPS).

Poveznice

Izvori

  1. 1,0 1,1
    • Nepoznat parametar: issn
    • Nepoznat parametar: doi-access
    • Nepoznat parametar: arxiv
    • Parametar access-date nije dopušten u klasi journal
    • Parametar date nije dopušten u klasi journal
    • Parametar url nije dopušten u klasi journal
    • Parametar type nije dopušten u klasi journal
  2. • Nepoznat parametar: doi-access
    • Nepoznat parametar: issue
    • Parametar type nije dopušten u klasi journal
    • Parametar date nije dopušten u klasi journal
  3. • Nepoznat parametar: issue
    • Nepoznat parametar: doi-access
    • Parametar date nije dopušten u klasi journal
    • Parametar type nije dopušten u klasi journal
  4. • Nepoznat parametar: chapter-url
    • Parametar chapter nije dopušten u klasi book
    • Parametar access-date nije dopušten u klasi book
  5. • Nepoznat parametar: chapter-url
    • Parametar chapter nije dopušten u klasi book
    • Parametar access-date nije dopušten u klasi book
  6. • Parametar chapter nije dopušten u klasi book
  7. • Nepoznat parametar: hdl-access
    • Nepoznat parametar: hdl
    • Parametar access-date nije dopušten u klasi journal
    • Parametar date nije dopušten u klasi journal
    • Parametar url nije dopušten u klasi journal
    • Parametar type nije dopušten u klasi journal
  8. • Nepoznat parametar: chapter-url
    • Parametar chapter nije dopušten u klasi book
    • Parametar access-date nije dopušten u klasi book
    • Parametar url-status nije dopušten u klasi book
    • Parametar archive-date nije dopušten u klasi book
    • Parametar archive-url nije dopušten u klasi book
  9. • Nepoznat parametar: doi-access
    • Nepoznat parametar: issue
    • Parametar type nije dopušten u klasi journal
    • Parametar date nije dopušten u klasi journal
  10. • Nepoznat parametar: doi-access
    • Parametar type nije dopušten u klasi journal
    • Parametar date nije dopušten u klasi journal
  11. • Nepoznat parametar: doi-access
    • Parametar type nije dopušten u klasi journal
    • Parametar date nije dopušten u klasi journal
  12. • Nepoznat parametar: issue
    • Parametar type nije dopušten u klasi journal
    • Parametar date nije dopušten u klasi journal
  13. Juba, Brendan; Le, Hai S.; Stern, Roni. 2021. Safe Learning of Lifted Action Models (PDF). Proceedings of the 18th International Conference on Principles of Knowledge Representation and Reasoning (KR 2021) (engleski). str. 379–389. DOI:10.24963/kr.2021/36 . Pristupljeno 21. kolovoza 2026.
  14. • Nepoznat parametar: issue
    • Nepoznat parametar: doi-access
    • Parametar date nije dopušten u klasi journal
    • Parametar type nije dopušten u klasi journal
  15. Integrating Reinforcement Learning, Action Model Learning, and Numeric Planning for Tackling Complex Tasks. arXiv 0. 18. veljače 2025. Pristupljeno 2026-08-21.