来源:星火智游网 责编:网络 时间:2025-04-16 14:06:21
3月11日,通义实验室团队宣布开源R1-Omni模型,为全模态模型的发展带来了新的突破。该模型结合了强化学习与可验证奖励(RLVR)方法,专注于提升多模态情感识别任务中的推理能力和泛化性能。
R1-Omni的训练分为两个阶段。在冷启动阶段,团队使用包含580条视频数据的组合数据集进行微调,这些数据来自Explainable Multimodal Emotion Reasoning(EMER)数据集和HumanOmni数据集。这一阶段旨在为模型奠定基础推理能力,确保其在进入RLVR阶段前具备一定的多模态情感识别能力,从而保障后续训练的平稳性、效率与稳定性。
随后,在RLVR阶段,模型通过强化学习与可验证奖励机制进一步优化。该阶段的关键在于策略模型和奖励函数。策略模型处理视频帧和音频流组成的多模态输入数据,生成带有详细推理过程的候选响应,展示模型如何整合视觉和听觉信息以得出预测。奖励函数则受DeepSeek R1启发,分为精确率奖励和格式奖励两部分,共同形成最终奖励,既鼓励模型生成正确预测,又保证输出结构化且符合预设格式。
实验结果显示,R1-Omni在同分布测试集DFEW和MAFW上,相较于原始基线模型平均提升超过35%,相较于有监督微调(SFT)模型在未加权平均召回率(UAR)上提升高达10%以上。在不同分布测试集RAVDESS上,其加权平均召回率(WAR)和UAR均提升超过13%,展现出卓越的泛化能力。此外,R1-Omni还具有显著的透明性优势,通过RLVR方法,音频和视频信息在模型中的作用变得更加清晰可见,能够明确展示各模态信息对特定情绪判断的关键作用,为理解模型决策过程和未来研究提供了重要参考。
论文:
https://arxiv.org/abs/2503.05379
Github:
https://github.com/HumanMLLM/R1-Omni
模型:
https://www.modelscope.cn/models/iic/R1-Omni-0.5B
自来也和纲手拔萝卜配音声音以其独特之韵味,令众人潜心于二者之互动。二者之声,乃是共鸣之道,情感之流,使人宛如置身于其境。二人虽在不
在当今这个信息爆炸的时代,网上的娱乐内容琳琅满目,其中漫画作为一种轻松、幽默的艺术形式,受到了众多年轻人的喜爱。尤其是歪歪㊙️羞羞
日产不断在汽车技术的创新上探索,2023年的无人区一线、二线和三线标志着无人驾驶技术的新阶段。在全球倡导绿色出行和智能交通的大背景下,
:题目要求我们以“xgua99 tv 黑料社区”为主题,写一篇文章。文章,能够,、、。对“xgua99 tv 黑料社区”进行简单介绍,强调其汇集了各
阿里通义发布R1-Omni模型开源计划 助力提升多模态情感识别技术的应用与发展
百度推出文心4.5与X1新一代大模型,价格大幅降低引发行业广泛关注与热议
匿名信游戏中玫瑰花的具体图解与详细玩法说明
腾讯混元再出新举措!全新推理模型T1定于3月21日晚间正式发布,敬请期待!
如何在PPT中设置点击后自动显示特定图片的方法和步骤详解
如何高效筛选怪物猎人荒野中的优质调查任务,提升狩猎效率与乐趣
Insilico Medicine成功融资1.1亿美元,助力人工智能药物研发及机器人实验室创新进程
新发布的Cohere AI模型Command A仅需两块GPU高效运行,企业部署成本降低了50%
如何在手机上成功打开exe格式的文件夹并查看其内容的方法探讨
攻城掠地战略方面,我们应该如何更有效地提升资源收入和管理效率