M2 Mathématiques et Intelligence Artificielle
… Temporal-Difference Learning Value function approximation Planning and models Policy Gradient Actor-critic methods … (or online) manner, hoping to maximise their cumulated reward. It has been popularised in the last decade due to its … modèles génératifs (autorégressifs, variationnels, adversariaux, basés sur les flux, basés sur l'énergie, etc.) et …
Published on: