网界
网络资讯 网界财经 科技人物 数据洞察 行业动态 智能出行 智能手机 数码极客 商业资讯
快手团队攻克大模型训练关键难题:平衡探索与收敛的CE-GPPO算法登场
研究团队发现,在强化学习训练大型语言模型的过程中,存在一个被称为"策略熵"的关键指标,它反映了模型在面对问题时的探索与利用平衡。更重要的是,这种优势随着模型规模的增大而放大:在1.5B参数的模型上,CE-G…

2025-10-16

« 上一页 6706/11814 下一页 »