From 3bccadc8737941f34602b13539fd66283585d376 Mon Sep 17 00:00:00 2001 From: ben-jaynes <1btjaynes@gmail.com> Date: Thu, 4 Jun 2026 19:49:35 -0700 Subject: [PATCH] vault backup: 2026-06-04 19:49:35 --- Excalidraw/BellmanEquation.excalidraw.md | 6 +++--- .../Class 6-4 (Reinforcement Learning).md | 4 +++- 2 files changed, 6 insertions(+), 4 deletions(-) diff --git a/Excalidraw/BellmanEquation.excalidraw.md b/Excalidraw/BellmanEquation.excalidraw.md index 9363060..bac7728 100644 --- a/Excalidraw/BellmanEquation.excalidraw.md +++ b/Excalidraw/BellmanEquation.excalidraw.md @@ -281,10 +281,10 @@ g4bt3gEC1L91AFY3Cd3I64379vjaf39V0o5p3bVz/aqOGqvLTk3tTyTYMPlNkA8522jiTg9W+dqA56Pk tM9RPa99E8b2f17E5sPPNPE872CTp7ZCGS4vvfwA4ocAE8hVOOADgB2QR47QBUIaAFuAMgcoCTBSAUcH6AGAQgAQAKABGOEGijm/ZRAKgU87POsQCs5EBaOesBTB9AdkDRgidlU+3PYILiBhgbz9IAPPCj5WOKONT6nYKBLz186yB3z/QFyh39io+MOAL689vP7z6o/1P/zl86gv0gGC5hAWds1cgu3z287fWTTlo+fOrzjC/SBjKtTYtOSgBC/w -uQL4s6kOvj+C7wugL289yh6tjE8LOSLmi6gBgLjjVrOKzv46rPIAUi9oukLziDnWuINgAoBbgXAChPmLwC9YvbzrsGJArBoS5EuQgJdlpBuIC894upL9IDkvuILcCJj2DwWFUuWL4C9yg5OLC/lB/YgUGwBIQFkBE0JtIj24TcyNInmRzLyy/wAaV7gBHI3Ms50jDxbbc6MA2AAwBQhRtI7ZY2zqdA//70Lvi/0AsL7rVDXjT4GAvOCQEgDD3RD/ +uQL4s6kOvj+C7wugL289yh6tjE8LOSLmi6gBgLjjVrOKzv46rPIAUi9oukLziDnWuINgAoBbgXAChPmLwC9YvbzrsGJArBoS5EuQgJdlpBuIC894upL9IDkvuILcCJj2DwWFUuWL4C9yg5OLC/lB/YgUGwBIQFkBE0JtYojQMTyRTHgJtzuyEsv8AGle4AxHbuGWQ5bFSm3OjANgAMAUIUbSO2WNrpVZN/+9C74v9ALC+61Q140+BgLzgkBIAw90 -84SviAdkAQBooKi5KBUrjKDYAfIGS9wBNAYIETOUrxbf43cOBdgRiUz8oFIBlAHEGIgXyGiEaveAfMAVPJgSyEWAP15QE7YEtWq/qvRoJq6+BBr0EDauJgSyDCu1L5C4QBCL9dc4AXT8uLqhjLzIB8hFtx6ACu4wTIEKvirt/qxOSLogEyvMTjIeW21zvFYyHhAKAGHALD3a8gAegTc6YAgwNmB2uMh265hBSAAq6KvTYFjTCu7AayoQAq95gFZB +Q//PEr4gHZAEAaKCouSgNK4yg2AHyBkvcATQGCBEz1K8W3+N3DgXYEYlM/KBSAZQBxBiIF8hogmr3gHzAFTyYEshFgD9eUBO2BLTquGr0aGauvgIa9BB2riYEshwrtS+QuEAQi/XXOAF0/Li6oYy8yAfIRbcehAruMEyAirkq7f6sTki6IAsrzE4yHlttc7xWMh4QCgBhwCw72vIAHoE3OmAIMDZhdrjIbuuYQUgEKvir02BY1wruwGsqEAKveYB -ltuAFyv8r5bY+uSrkw6r3CARgC3A/L/AHWvWDnS4VA0gKG69AJtuCF3X9AbS6B2pdpg+t2K12TgMBWQFG9muI4ok+XXQgOdahuYbuG+04wrh3a2vsOfrfHYMoTIGQ3nD7ze8hwoBjQqAmATIBs4MAMG+2vtzwsARiubx6Hevtr065FvmADKBIBa4gdaBu4AcKElvPryw+zXMAYm+CBUbjgBBvaocE8PArIMAHig6oZkAxXgAQiBABCIIAA== +WQZbbgA8rgq+W3Pr0q5MOq9wgEYAtwfy/wANr1g50uFQNIGhuvQCbbghd1/QG0ugdqXaYPrditdk4DAVkFRu5riOKJPl10IDnXob2G/hvtOcK4d3tr7Dn63x2DKEyBkN5w+83vIcKAY0KgJgEyAbODAHBudr7c8LAEY7m8egPrna7OvRb5gAygSAWuIHXgbuAHCgpbr68sPs1zABJvggNG44BQb2qHBPDwKyDAB4oOqGZAMV4AEIgQAQiCAA ``` %% \ No newline at end of file diff --git a/Running Start/CSB320 - Machine Learning Concepts/Class 6-4 (Reinforcement Learning).md b/Running Start/CSB320 - Machine Learning Concepts/Class 6-4 (Reinforcement Learning).md index 3e289fe..4990a02 100644 --- a/Running Start/CSB320 - Machine Learning Concepts/Class 6-4 (Reinforcement Learning).md +++ b/Running Start/CSB320 - Machine Learning Concepts/Class 6-4 (Reinforcement Learning).md @@ -36,4 +36,6 @@ - This is what prioritizes future rewards vs immediate rewards - future rewards (the $max$ part) are deprioritized in relation to immediate rewards - $maxQ(s_{t+1}, a)$ is the best q value from the next state (future reward) - - this is what backpropagates future rewards \ No newline at end of file + - this is what backpropagates future rewards + - during exploration phase paths are usually explored randomly to attempt to find the q values for each path + - \ No newline at end of file