f(θ) = ½ θᵀHθ
θ⋆
κ(H) ≫ 1
gradient descent
momentum
∇θ L(θ)
x ∈ ℝⁿ
hθ
Mθ = { hθ(x) : x ∈ X }
∂hθ / ∂z₁
∂hθ / ∂z₂
hθ(x₀)
Home
Work
Blog
Note
Research
Projects
Tags
llm
vi
deep_learning
en
mechanistic_interpretability
biology
c++
computer science
mathematics
programming language
reinforcement_learning