Keywords
KMI, aprendizaje por refuerzo profundo, robot humanoide, SAC, D4PG, DDPG, MPO, locomoción bípeda, diseño de función de recompensa, MuJoCo, deep reinforcement learning, humanoid robot, SAC, D4PG, DDPG, MPO, bipedal locomotion, reward function design, MuJoCo