「多模态记忆系统」共找到 2897 篇相关文章
GUI 精准定位新 SoTA:LASER 让模型从“看全图”走向“锁重点”
多模态大模型在高分辨率、元素密集的 GUI 场景易误判。苏州大学 OpenNLG 团队提出 LASER 方法,让模型学会主动推理,通过关键区域聚焦等提升定位精度,在基准测试中表现出色。
人类秒懂,AI崩溃:一个简单测试,就让GPT-5、Gemini等顶级模型集体“翻车”
来自多机构研究团队发现,OpenAI的GPT-5等顶级AI模型,面对‘看得见但读不懂’文字时表现极差。VYU团队实验显示,人类能轻松读懂的切分拼接文字,AI却全军覆没,原因是其靠模式匹配,不懂文字结构。
直播预约 | Transformer 模型能否通过连接训练数据中的离散知识进行推理?
为研究Transformer是否具备组合式推理能力,提出FTCT合成任务。实验发现Few - shot CoT提示可激发推理能力,训练与测试相似度、模型复杂度影响推理能力。还分析了其内在机制,展示其泛化推理潜力。
抄作业了!让AI产品告别“上线就崩”的CC/CD框架,6步搞定,拿走不谢。
文章指出AI产品因大模型不确定性,易上线翻车。介绍海外流行的CC/CD开发框架,阐述AI产品不确定性原因,强调自主与控制平衡,还给出该框架落地的6步工作流。
用“蒸汽机”生成视频,还能音视频一体化交付?
8月21日百度营销发布百度蒸汽机2.0,含多版本,有声版可音视频一体化交付。经测试,其生成视频细节佳、运动规律合理。它能解决影视业诸多痛点,成本低,还可免费使用。
谷歌Pixel发布汇总:硬件与软件全面AI化,那谁你就学叭
谷歌2025年硬件发布会展示众多AI能力,如Gemini驱动的健康教练、拍摄指导、智能大屏设备等。Pixel 10手机搭载芯片可本地运行模型,还有多项实用AI功能,凸显硬件与软件全面AI化趋势。
2025 WAIC落幕,深谋科技异军突起,以技术与落地破局具身智能赛道
2025 WAIC落幕,深谋科技作为精英合作伙伴首次亮相,未随波逐流,而是切入脑控、动态视觉伺服和康养场景三大底层能力领域,开拓创新赛道。其产品已商用部署,吸引众多媒体关注。
“神经-符号”融合规划器性能显著超越o1:借鉴人类运动学习机制|中国科学院磐石研发团队
中国科学院磐石研发团队提出新型“神经 - 符号”融合规划器,融合神经与符号规划系统优势,借鉴人类运动学习机制构建双向规划机制,在规划覆盖率和效率上显著超越OpenAI o1,已加入“磐石·科学基础大模型”。
“老中间件”自救:昔日并发王者、十五年开源老将全力押注Agentic AI找活路,转型做 Java 版 LangChain
7月14日,老牌开源中间件Akka发布Agentic Platform,向AI驱动型系统转型。其运营曾面临挑战,现全力押注Agentic AI,认为这是第五次计算浪潮,将构建比Langchain更丰富的功能集。
演讲生成黑科技,PresentAgent从文本到演讲视频
联合团队提出 PresentAgent,能将长篇文档转化为带解说演示视频。采用模块化流程,还引入 PresentEval 评估框架。实验显示其接近人类表现,优于现有方案,展现了多模态智能体潜力。