FANDEX
-Index
返回顶部
首页
/
...
/
标签
/
PPO
PPO
3 篇文档 | 3 个模块
AI伦理与安全
1
指令遵循作为对齐信号
大语言模型
1
RLHF人类反馈强化学习
机器学习
1
PPO近端策略优化
相关标签
RLHF
指令遵循
InstructGPT
SFT
奖励模型
首页
搜索
AI
全屏
专注模式
Esc 退出