Jaguar: Uma Abordagem de Aprendizado por Reforco Profundo Hierarquica com Transfer Learning para StarCraft II
Aprendizado por Reforço Profundo; StarCraft II; Transfer Learning; Arquitetura Hierárquica.
Jogos de Estratégia em Tempo Real são ambientes que geralmente simulam situações militares reais e apresentam uma série de desafios para o campo da Inteligência Artificial, como a alta complexidade e grande espaço de ações e estados, mapas parcialmente observáveis e o fato de lidarem com múltiplos agentes ao mesmo tempo, além das tarefas poderem ser realizadas no âmbito do microgerenciamento ou do macrogerenciamento. Em especial, o Aprendizado por Reforço tem se destacado na aplicação e evolução de técnicas capazes de lidar com esses desafios. Foi realizada, então, uma revisão sistemática da literatura com o objetivo de compreender o estado da arte do Aprendizado por Reforço Profundo nos jogos de Estratégia em Tempo Real. Algumas das informações mais relevantes levantadas foram o uso do StarCraft II como principal ambiente de simulação, a necessidade de mais estudos tratando do macrogerenciamento, o bom desempenho de arquiteturas hierárquicas e a importância do uso de técnicas de mascaramento de ações e transfer learning, que podem reduzir a complexidade do problema e o custo computacional. Diante disso e dos desafios existentes neste campo, este trabalho propõe Jaguar, uma arquitetura hierárquica capaz de lidar com o macro e microgerenciamento ao mesmo tempo, necessitando de poucos recursos durante o treinamento. Jaguar implementa técnicas de modelagem de ações e estados, mascaramento de ações inválidas através do estado e da comunicação entre níveis hierárquicos, diferentes tipos de recompensa e usa os modelos DQN para decisões micro e DDQN para decisões estratégicas. O agente foi treinado em um cenário base e o transfer learning foi aplicado para outros dois cenários. Os resultados mostram que o agente conseguiu atuar tanto no microgerenciamento quanto no macrogerenciamento, apresentando um bom aprendizado no cenário base e resultados promissores nos cenários subsequentes, demonstrando que a abordagem proposta foi capaz de lidar significativamente bem com a complexidade dos cenários do StarCraft II utilizando poucos recursos computacionais, abrindo margem para futuras melhorias.