「多模态能力」共找到 3773 篇相关文章
姚顺雨腾讯首篇论文:给AI下半场指路“上下文学习”
姚顺雨入职腾讯后首个成果CL - bench,用来测试大模型“从上下文中学习”能力。研究指出当下模型多依赖“过去”知识,无法适应“当下”学习。评测中,十个前沿模型表现不佳,揭示其真实场景应用缺陷。
Nano Banana 2突然现身!能画公式解数学题,监控画面都能伪造
Nano Banana 2代以预览版现身第三方网站,后被移除。其能力远超1代,能处理复杂提示,可生成复杂UI、解数学题甚至伪造监控画面。谷歌正将Nano Banana整合进核心产品生态。
面向长时语音与声音克隆的全模态开源万能聊天机器人MGM-Omni
文章介绍了全模态开源聊天机器人MGM - Omni,它基于MiniGemini,支持多模态输入输出,具备长语音理解、生成、流式生成、零样本语音克隆等特性,还给出安装、使用方法,展示评估结果。
别再“演智能”了,MiniMax Agent 才是真特工
2024 年有不少‘伪 Agent’项目,2025 年 AI Agent 开始在解决真实问题上落地。MiniMax Agent 在深度研究、网页生成、PPT 生成及多模态输入输出上超越竞品,其优势源于多方面,已从众多 Agent 产品中脱颖而出。
字节Seed新方法!开源8B代码模型:自己筛数据训练自己,同量级SoTA,还能超越百亿级对手
传统code大模型依赖人工筛选数据,成本高、效率低。而Seed - Coder团队让LLM自己筛选数据训练自己,打造8B参数轻量级开源代码模型,性能超百亿级对手,不过也存在通用和数学能力短板。
ChatGPT最强网络安全模型,逼谷歌紧急修漏洞!
OpenAI推出安全专用模型GPT-5.6-Cyber,用于处理信息安全任务。它战绩斐然,发现诸多内核漏洞。Daybreak计划为安全人员提供工具。该模型虽有不足,但展现出强大的网络安全能力。
斯坦福2026 AI指数报告!中美差距已实质性抹平
斯坦福HAI发布2026年度人工智能指数报告,显示中美在顶级大模型性能上差距已实质性抹平。报告还呈现了AI能力进化、算力格局、智能边界、安全监管、人才流动等多方面情况。
夜间感知新突破!北航等提出红外主导的高效目标检测方案 | ECCV'26
在复杂视觉场景中,传统RGB - IR多模态检测方法在低照度等场景下因RGB退化影响检测效果。北航等团队提出的InfraNet,以红外为主,用质量感知机制控制RGB引导,在多数据集取得强竞争力结果。
双榜SOTA!微软ACL2026新作重新定义AI长记忆
大语言模型落地中,AI长期记忆能力成瓶颈,传统RAG方案有局限。微软研究团队提出AI记忆框架Mnemis,受认识论与认知科学启发,在两大权威长期记忆基准达SOTA性能,工作被ACL2026主会议接收。
Agent 开发范式演进:从环境工程出发,“简化”多源实时上下文
本文整理自阿里云沈林在2026中国生成式AI大会分享。探讨企业级Agent落地瓶颈,指出关键在上下文供给能力,围绕信息完备性等五维度,介绍EventHouse如何让Agent接入业务环境,强调构建上下文体系重要性。