f(θ) = ½ θᵀHθ
θ⋆
κ(H) ≫ 1
gradient descent
momentum
∇θ L(θ)
x ∈ ℝⁿ
hθ
Mθ = { hθ(x) : x ∈ X }
∂hθ / ∂z₁
∂hθ / ∂z₂
hθ(x₀)
Home
Work
Blog
Note
Research
Projects
reinforcement_learning
1 entries
Tags
reinforcement_learning
Note on Sutton & Barto — Chapter 3: Finite Markov Decision Process (MDP)
Jul 22, 2026
Stable
Nearly slop