「多模态深度调研」共找到 1661 篇相关文章
用多模态LLM超越YOLOv3!强化学习突破多模态感知极限|开源
华中科技大学、北京邮电大学等多所高校研究团队共同推出纯多模态开源LLM——Perception-R1,该模型用强化学习优化视觉感知,目前论文和代码均已开源,其在视觉任务上表现出色,为后续研究提供强大baseline。
Discrete Tokenization:多模态大模型的关键基石,首个系统化综述发布
近年来,人们关注将LLM能力扩展至非文本模态,Discrete Tokenization成关键方案。但现有研究缺系统总结,香港科技大学等团队发布首个相关系统化综述,梳理技术脉络、方法及挑战,给出未来研究方向。
AI开源狂飙,OpenAI们慌了!GenAI大洗牌,2025趋势深度解读
2025年,ChatGPT仍领跑,但DeepSeek、Qwen等开源模型加速追赶。独立机构报告总结六大趋势,涵盖技术突破与市场格局演变,如推理模型实用化、MoE架构普及等,开源势力挑战闭源巨头。
被低估的ChatGPT新功能,10分钟搞定DeepSeek代码库深度研究
ChatGPT悄悄上线直连Github新功能,能自动读取、解析并总结整个GitHub仓库,可快速输出专业研究报告,应用场景广,还能避免“幻觉”,Plus用户即可用,开启全新研究模式。
答对了却没看图?EASE给多模态RLVR装上「视线校正器」
强化学习与可验证奖励提升视觉语言模型推理能力,但存在答案奖励只知对错、不知证据区域问题。哈工大等团队提出EASE,把标注证据区转为目标分布,监督空间注意力,推理无额外标注,实验成绩优异。
多模态推理新范式!DiffThinker:用扩散模型「画」出推理和答案
上海人工智能实验室等团队提出全新生成式多模态推理范式,发布模型 DiffThinker。它打破传统定式,以图像到图像生成任务重构推理过程,在多项复杂任务中表现优于顶尖闭源模型,有四大核心特性。
给大模型装上「思维分段引擎」:浙大InftyThink解锁无限深度推理
如今大模型长上下文推理面临计算成本高、推理易中断问题。浙大联合北大团队提出InftyThink新范式,将传统推理拆成短片段并总结,突破推理长度限制,在多基座模型实验中表现优异。
深度实测「豆包工作」+飞书:目前最接近企业Agent终局的答案
「豆包工作」作为面向生产力场景的Agent产品正式发布,与飞书深度打通,给出了目前Agent进入组织的最佳答案。主流办公Agent基础能力趋同,企业上下文正成办公Agent分水岭,豆包工作+飞书优势明显。
当我深度体验完这个AI社交产品之后,我悟了。
作者深度体验小众AI社交产品Second Me,介绍玩法,包括建AI分身、设置形象、输入记忆等,还能让AI分身聊天破冰。它做减法,帮用户固定自我,让社交更有价值,是I人社交利器。
Jina 第4版:多模态向量检索,统一适配,挑战3大任务
Jina第4版基于Qwen2.5 - VL模型扩展,支持单向量和多向量输出。它经对比学习和任务特化训练,推理时可按需选LoRA适配器,能利用多模态处理能力优化不同任务性能。