「多模态融合」共找到 1367 篇相关文章
英伟达&MIT等推出Long-RL,长视频训练速度翻倍
英伟达联合MIT等推出Long - RL,它是面向长序列推理和多模态强化学习的全栈训练框架,能提升RL训练数据长度上限,让训练速度翻倍。其核心MR - SP并行框架可降低训练耗时和显存,LongVILA - R1是其明星应用。
这个新生图模型有点夯:4K直出的,国产的,开源的!
商汤新开源的生图模型SenseNova U1.5-Lite-Preview亮点十足,它是国产、4K直出、轻量且可指哪儿改哪儿的原生统一多模态模型。能应对复杂创作和编辑任务,技术源于NEO-Unify架构,评测成绩佳,不过还是早期预览版。
准确回答视频细节!11B模型挑战视频理解「证据级」任务,开源可商用
近日,复旦大学邱锡鹏教授领衔的OpenMOSS团队联合模思智能开源11B参数的多模态视觉理解模型MOSS-VL。它能准确回答视频里可被验证的细节、时间、过程和空间关系,有六项证据级能力,架构设计独特,采用Apache2.0开源许可。
从「降本增效」到「智能中枢」:低代码在 AI 浪潮中的价值重估——专访金现代赵鹏程谈企业数字化转型新引擎
LowCode低码时代专访金现代轻骑兵低代码PaaS平台产品经理赵鹏程,探讨AI与低代码融合对软件工程范式革新和企业数字化转型的影响。介绍了低代码价值重估、应对新兴技术、企业实践、跨越工程化鸿沟路径、核心竞争力及未来展望等内容。
文心X1.1三大能力狂飙,海内外实测还挺惊艳!
9日WAVE SUMMIT深度学习开发者2025大会上,文心大模型X1.1发布,事实性、指令遵循、智能体能力显著提升,多项测试表现佳。它能做到知识一致,精准遵循指令,智能体解决问题出色,代码、数学、多模态能力也有进化,得益于迭代式混合强化学习训练框架。
浙大&港理工等提出InfiGUI-R1:利用强化学习,让GUI智能体学会规划任务、反思错误
多模态大模型驱动的GUI智能体有潜力,但现有智能体面对复杂任务力不从心。浙大等机构提出InfiGUI-R1及Actor2Reasoner框架,通过两阶段训练提升智能体能力,InfiGUI-R1-3B在多基准测试中性能卓越,为GUI自动化工具开辟新道路。
新一代AI教师是什么样?学而思让它从L2「助手」跃迁至L3「老师」
在AI应用落地成关键的当下,教育成AI融合创新前沿。好未来CTO田密提出「AI教师L1 - L5分级」理论,指出当前AI老师达L2水平,L3正演进。学而思学习机的「小思AI一对一」迈向L3,依托硬件和自研大模型,结合优质内容,从可用走向可信。