首页
文章列表
标签墙
返回找工具啦
在线学习
共 3 篇文章
在线学习的遗憾界分析:Follow the Regularized Leader算法
2026-07-25 06:43:13
在线学习的遗憾界分析:Follow the Regularized Leader算法 在线学习是一种逐步决策的框架:在第 t 轮,你选择一个动作(如预测值),然后看到损失,目标是最小化累计损失。遗憾衡量你的累计损失与最佳固定动作(事后看)的累计损失之差。Follow the Regularized
在线学习
遗憾界
FTRL算法
32
0
多臂老虎机UCB算法的置信上界推导与后悔界
2026-07-24 02:49:07
多臂老虎机 UCB 算法的置信上界推导与后悔界 1. 定义多臂老虎机问题 明确 问题设定:你有 K 个老虎机(臂),每个臂 i 有一个未知的奖励分布,均值为 μi。你每次选择拉一个臂,获得一个奖励。目标是在 T 轮后最大化累计奖励,或者说最小化累计遗憾(后悔)。 形式化 后悔(Regret)定义为:
多臂老虎机
UCB算法
置信上界
34
0
对抗多臂老虎机Exp3算法的指数加权策略
2026-07-08 22:51:36
对抗多臂老虎机Exp3算法的指数加权策略 在对抗性多臂老虎机问题中,环境会主动让你的选择变差。你需要一个即使对手(环境)不断调整,也能持续优化决策的策略。Exp3(Exponentialweight algorithm for Exploration and Exploitation)算法正是为此设
对抗多臂老虎机
Exp3算法
指数加权策略
56
0