强化学习#04 Dynamic Programming 本文将讨论 动态规划(Dynamic Programming, DP),一类用于在给定完美环境模型的 MDP 中计算最优策略的 model-based 方法。虽然 DP 对完美环境模型(即状态转移)和大量计算量的要求使得其在 RL 问题中的实际用处有限,但它在理论上为 RL 后续方法打下了重要的基础。 DP 的关键思想是利用价值函数来组织和结构化对更好策略的搜索。它把贝尔曼方程变成我们对价值函数的 2026-09-13 笔记 > 强化学习 #AI #强化学习 #动态规划
给自己看的 Python Type Inference Research Proposal Working Title:PyActype: Learning to Actively Acquire Type-Relevant Evidence for Repository-Level Python Type Inference 研究状态:早期设想。先验证主动获取证据是否有效,再研究与静态分析的结合和能力迁移。 1. 我想研究什么 上一阶段的工作已经初步验证:在过程间静态分析准备好的上下文 2026-09-06 想法 > AI #AI #强化学习 #Python #类型推断
强化学习#03 Finite Markov Decision Processes 本文将讨论有限马尔可夫决策过程(Finite Markov Decision Processes, Finite MDPs),作为更一般的强化学习问题的形式化定义。Finite MDPs 描述了一个具有 evaluative feedback,同时是 associative 的情形。MDPs 是序列决策问题的经典形式,其中动作不仅影响即时奖励,还影响后续的状态及未来的奖励。因此 MDPs 同样涉及 2026-09-03 笔记 > 强化学习 #AI #强化学习 #马尔可夫决策过程
'SysML Distilled' Distilled 一份针对 SysML Distilled: A Brief Guide to the Systems Modeling Language、面向 MBSE 初学者(我自己)的压缩笔记。目标是建立足够清晰的概念框架,理解 MBSE 与 SysML 在做什么,以及 SysML 模型究竟是什么。具体符号、完整语法和工程工具的细节不在本文考虑之列,留待真正需要时再查。本文大量内容来自手写笔记并由 GPT 2026-09-01 笔记 > MBSE #系统工程 #SysML
强化学习#02 Multi-armed Bandits 我们从本文开始正式进入 RL 的领域。我们将从一系列足够阐明 RL 的全部核心思想、但又足够简单的问题入手。它们的状态和动作空间足够小,小到可以用表格来表示近似估计的 value functions 并通常能求出精确的解,即,能找出它们最优的 value function 和最优的 policy。 本文将讨论 RL 的经典问题:多臂老虎机(Multi-armed Bandits)。它只有一个状态, 2026-08-31 笔记 > 强化学习 #AI #强化学习 #多臂老虎机
强化学习#01 Entry of Us into Reinforcement Learning Reinforcement learning is learning what to do—how to map situations to actions—so as to maximize a numerical reward signal. Richard S. Sutton & Andrew G. Barto, Reinforcement Learning: An Introdu 2026-08-25 笔记 > 强化学习 #AI #强化学习