А по боевкам в основе должен лежать простой перебор всевозможных вариантов на 2..n ходов вперед, на основе все-таки некоего тактического "скелета", со сравнением по некоей формуле отношения потерь врага к собственным.
Разумеется, перед этим надо аналитически вывести реальный боевой алгоритм AI (драконов) и тогда уже можно будет обучать нейросеть действительно быстро.
Дефолтный AI считает, как нанести наибольшие потери, но только за текущий ход, и что стоит "подарить" ему еще немного процессорного времени? Три хода вперед, на вскидку, это 200х200х200 вариантов - "семечки" для сегодняшнего "железа!"
вы не боитесь таким образом случайно "убить" игру онлайн
