李飞飞团队最新s1模型,基于阿里云Qwen基模监督微调而成

近日,李飞飞团队提出了一种模型训练新方法引发热议,他们以阿里通义千问Qwen2.5-32B-Instruct开源模型为底座,在16块H100 GPU上监督微调26分钟,训练出新模型s1-32B, 取得了与OpenAI的o1和DeepSeek的R1等尖端推理模型数学及编码能力相当的效果,甚至在竞赛数学问题上的表现比 o1-preview 高出27%。

更早之前,DeepSeek官方曾透露,将DeepSeek-R1的推理能力蒸馏6个模型开源给社区,其中4个模型来自Qwen:基于Qwen-32B蒸馏的模型,在多项能力上实现了对标OpenAI o1-mini的效果。

未经正式授权严禁转载本文,侵权必究。

OpenAI

  • 阿里一度涨超5%,千问下载量破千万成增长最快AI应用
  • OpenAI正式推出ChatGPT群聊功能

评论

暂无评论哦,快来评价一下吧!