Stop Regressing: Training Value Functions via Classification for Scalable Deep RL
Jesse Farebrother, Jordi Orbay, Quan Vuong +9 authors
Using categorical cross-entropy for value function training in deep reinforcement learning improves scalability and performance across various tasks compared to traditional regression methods.