首页
文章列表
标签墙
返回找工具啦
UCB算法
共 1 篇文章
多臂老虎机UCB算法的置信上界推导与后悔界
2026-07-24 02:49:07
多臂老虎机 UCB 算法的置信上界推导与后悔界 1. 定义多臂老虎机问题 明确 问题设定:你有 K 个老虎机(臂),每个臂 i 有一个未知的奖励分布,均值为 μi。你每次选择拉一个臂,获得一个奖励。目标是在 T 轮后最大化累计奖励,或者说最小化累计遗憾(后悔)。 形式化 后悔(Regret)定义为:
多臂老虎机
UCB算法
置信上界
32
0