Hotdry.

Category

ai-systems

共 7658 篇文章。

在 Verl 中为 PPO 集成自定义采样器

探讨 Verl 框架中 PPO 策略更新的自定义采样器集成,优化 LLM 对齐轨迹并降低奖励信号方差,提供工程参数与监控要点。

2025-11-16ai-systems2025-11

在 Verl 中使用 Bandit 反馈实现在线 RL 微调 LLM

探讨在 Verl 框架中实现在线强化学习循环,利用 bandit 反馈进行实时 LLM 适应,包括低延迟奖励模型和安全探索策略,实现连续偏好更新而无需完整重训练。

2025-11-16ai-systems2025-11
上一页第 67 / 96 页下一页