阿里通义实验室智能计算团队推出新算法FIPO

4月7日,阿里通义实验室智能计算团队宣布推出新算法FIPO(Future-KL Influenced Policy Optimization),引入Future-KL机制,奖励关键Token,解决纯强化学习(Pure RL)训练中“推理长度停滞”难题。据该团队介绍,在32B规模的纯RL设定下,率先实现对o1-mini与同规模DeepSeek-Zero-MATH的性能反超。

未经正式授权严禁转载本文,侵权必究。

阿里巴巴

7.3k
  • 清明假期收官:此前燃油附加费上调预期催生当下“精明出游”,有娃家庭“精打细算花大钱”
  • 这个假期 山西旅游市场好“热”

评论

暂无评论哦,快来评价一下吧!