diff --git a/Running Start/CSB320 - Machine Learning Concepts/Class 6-4 (Reinforcement Learning).md b/Running Start/CSB320 - Machine Learning Concepts/Class 6-4 (Reinforcement Learning).md index f7fbed2..aca12d3 100644 --- a/Running Start/CSB320 - Machine Learning Concepts/Class 6-4 (Reinforcement Learning).md +++ b/Running Start/CSB320 - Machine Learning Concepts/Class 6-4 (Reinforcement Learning).md @@ -20,4 +20,9 @@ - monte-carlo - updates model after every episode - temporal difference - - learns after every step, not every episode \ No newline at end of file + - learns after every step, not every episode +- q-learning + - assembles all possible q values on the way to end reward + - updates q values to find best path + - $$Q^{new}(s_{t}, a_{t}) \leftarrow (1 - a) * Q(s_{t}, a_{t}) + a * (r_{t} + \gamma * max_{a} Q(s_{t+1}, a))$$ + - \ No newline at end of file