「双向多模态表征模型」共找到 1020 篇相关文章
“神经-符号”融合规划器性能显著超越o1:借鉴人类运动学习机制|中国科学院磐石研发团队
中国科学院磐石研发团队提出新型“神经 - 符号”融合规划器,融合神经与符号规划系统优势,借鉴人类运动学习机制构建双向规划机制,在规划覆盖率和效率上显著超越OpenAI o1,已加入“磐石·科学基础大模型”。
半年复盘,AI迎来预训练后的新瓶颈。
2025年上半年AI领域发展加速,编码和多模态能力提升。但模型在综合能力上遇到第二轮瓶颈,编码能力强时通用认知能力‘拉胯’,或与RL阶段使用编程数据有关,红杉新基准或推动模型均衡发展。
Meta 143亿挖角后的首个作品:Alexandr Wang 推出闭源模型,杨立坤点赞
沉寂9个月后,Alexandr Wang带队的Meta发布新一代模型Muse Spark。它是原生多模态推理模型,性能媲美Gemini Pro和GPT 5.4,在多领域有应用潜力。不过闭源引争议,且在部分领域有短板。
面向业务落地的AI产品评测体系设计与平台实现
文章聚焦淘宝闪购技术部AI产品评测,先介绍AI业务应用场景与评测挑战,接着阐述评测体系从多方面思考的要点,包括评价维度、评测方式等,还提及平台建设成果,最后展望未来多模态评测等规划。
邱锡鹏团队新作:让机器人学会「察言观色」
复旦大学邱锡鹏团队等发布全新操作框架 RoboOmni,突破传统 VLA 依赖显式指令局限。它融合多模态信号,构建数据集,在成功率等方面超基线,以跨模态指令让机器人主动推断意图,开启具身智能‘共情时代’。
DeepSeek刚解决了AI视觉最后一块拼图:极低成本+精准视觉定位,AI接管电脑已无死角
DeepSeek放出新论文《Thinking with Visual Primitives》,解决多模态大模型中长期被忽视的“说不清位置”问题。提出将空间标记作为“最小思维单元”插入推理链条的方案,在多个任务上达前沿水平,但也存在精度、触发机制和泛化能力等局限。
编程进入「对讲机」时代!Claude抢发语音写代码,转录Token全免费
Anthropic给Claude Code加语音模式,输入 /voice,长按空格说话即可输入,转录Token全免。OpenAI的Codex也更新类似功能。语音编程在Debug、架构讨论等场景好用,但识别变量名等仍有短板,未来编程将多模态。
去掉 VAE 之后,商汤用 8B 参数重新定义了开源生图的上限
商汤SenseNova U1开源后引发开发者社区关注,它基于NEO - unify架构,摒弃VAE,实现多模态理解与生成原生统一。在多项基准测试中表现出色,还针对企业办公场景优化,成为生产级任务新选择。
2G 内存跑 Gemma 3n 完整版!全球首个 10B 内模型杀疯 LMArena:1300 分碾压记录
当地时间6月26日,谷歌正式发布Gemma 3n完整版,可在本地硬件运行。它是开源大模型,具多模态能力,最低2GB内存设备就能跑,E4B模型LMArena测评表现佳,还有MatFormer架构等多项创新。
治好多模态近视和走神!上海大学去偏干预显著提升模型性能
多模态大模型存在“近视”和“走神”问题,总是过度关注图像底部而忽略核心内容。上海大学与南开大学研究团队用两条数学公式去偏干预,无需增加计算成本,却能显著提升主流模型视觉理解能力。