📱 MiMo-V2.6 进行大规模 RL 训练,细节将陆续开源热心网友2小时前发布关注私信0339📱 MiMo-V2.6 进行大规模 RL 训练,细节将陆续开源Fuli Luo 在 X 上透露,经过近半年研究,团队正对 MiMo-V2.6 进行大规模 RL 训练,扩展了计算量(每步约 20 亿 tokens)、环境(多任务 agentic RL)和裁判计算三方面,细节将陆续开源。X | mimo rl🌸 科技圈· 茶馆 · 投稿© 版权声明文章版权归作者所有,未经允许请勿转载。THE ENDAI新闻资讯喜欢就支持一下吧点赞9 分享QQ空间微博QQ好友海报分享复制链接收藏
暂无评论内容