FANDEX-Index
首页/.../标签/对齐

对齐

6 篇文档 | 3 个模块

大语言模型4

  • Constitutional AI与自我改进
  • DPO直接偏好优化
  • RLHF人类反馈强化学习
  • 指令微调SFT

机器学习1

  • 奖励建模与RLHF

自然语言处理1

  • 注意力机制
首页