首页
文章列表
标签墙
返回找工具啦
置信上界
共 2 篇文章
多臂老虎机UCB算法的置信上界推导与后悔界
2026-07-24 02:49:07
多臂老虎机 UCB 算法的置信上界推导与后悔界 1. 定义多臂老虎机问题 明确 问题设定:你有 K 个老虎机(臂),每个臂 i 有一个未知的奖励分布,均值为 μi。你每次选择拉一个臂,获得一个奖励。目标是在 T 轮后最大化累计奖励,或者说最小化累计遗憾(后悔)。 形式化 后悔(Regret)定义为:
多臂老虎机
UCB算法
置信上界
33
0
贝叶斯优化中高斯过程代理模型与采集函数EI/UCB
2026-07-16 22:39:04
贝叶斯优化中高斯过程代理模型与采集函数EI/UCB 当需要寻找一个“黑箱”函数(即内部机理未知,只知道输入和输出)的最大值或最小值时,贝叶斯优化是一种极其高效的策略。它特别适用于评估一次实验或一次计算成本非常高的场景(例如训练一个大型机器学习模型、进行一次物理实验)。 贝叶斯优化的核心思想是:建立一
贝叶斯优化
高斯过程
代理模型
74
0