在线学习 共 3 篇文章

在线学习的遗憾界分析:Follow the Regularized Leader算法
2026-07-25 06:43:13
在线学习的遗憾界分析:Follow the Regularized Leader算法 在线学习是一种逐步决策的框架:在第 t 轮,你选择一个动作(如预测值),然后看到损失,目标是最小化累计损失。遗憾衡量你的累计损失与最佳固定动作(事后看)的累计损失之差。Follow the Regularized
在线学习 遗憾界 FTRL算法
32 0
多臂老虎机UCB算法的置信上界推导与后悔界
2026-07-24 02:49:07
多臂老虎机 UCB 算法的置信上界推导与后悔界 1. 定义多臂老虎机问题 明确 问题设定:你有 K 个老虎机(臂),每个臂 i 有一个未知的奖励分布,均值为 μi。你每次选择拉一个臂,获得一个奖励。目标是在 T 轮后最大化累计奖励,或者说最小化累计遗憾(后悔)。 形式化 后悔(Regret)定义为:
多臂老虎机 UCB算法 置信上界
34 0
对抗多臂老虎机Exp3算法的指数加权策略
2026-07-08 22:51:36
对抗多臂老虎机Exp3算法的指数加权策略 在对抗性多臂老虎机问题中,环境会主动让你的选择变差。你需要一个即使对手(环境)不断调整,也能持续优化决策的策略。Exp3(Exponentialweight algorithm for Exploration and Exploitation)算法正是为此设
对抗多臂老虎机 Exp3算法 指数加权策略
56 0