「多模态Agent模型」共找到 9400 篇相关文章
杨立昆亲自指导开源世界大模型,为AI Agent打造超级大脑
今天凌晨,Meta开源世界大模型V - JEPA 2,它用超大规模数据集训练,能让AI Agent理解物理世界。图灵奖得主杨立昆参与开发并推荐。模型经多方面改进,还拓展用于机器人规划和视频问答,效果良好。
多模态思维链如何重塑 AI 与短视频的未来
传统多模态模型在动态视频理解与复杂推理场景面临挑战,快手开源的 Keye-VL 模型在多模态思维链技术实现突破。文章解析其核心技术,分享在快手短视频社区的落地应用,还探讨了未来“Think with Video”的技术方向。
基于Agent的SGLang Diffusion Kernel优化实践:Qwen-Image、FLUX.2和视频模型
本文记录基于Agent完成Qwen-Image、FLUX.2、Wan和SANA Video优化的过程,包括定位问题、写Kernel及遇到的坑。介绍SGLang Diffusion Kernel结构,分析数值敏感原因,展示各模型优化实践、无收益实验及验证流程。
数据邪修大法好:仅用文本数据就能预训练多模态大模型
多模态大模型研发中,行业认为无图文对就无多模态能力。但ReVision研究表明,预训练阶段昂贵配对关系非必需,利用非配对数据统计信息修正文本表征,能实现跨模态互换,降低成本。
首个多模态工业信号基座模型FISHER,权重已开源,来自清华&上交等
清华、上交等团队联合发布首个多模态工业信号基座模型 FISHER,用搭积木法对异质工业信号统一建模。技术报告和权重已开源,还提出 RMIS 基准评估性能,实验显示其泛化能力强。
如何选择最佳多模态大模型压缩方案?哈工大、度小满开源EFFIVLM-BENCH基准测试框架
金融科技智能化转型中,LVLM部署受算力瓶颈制约。哈工大与度小满联合开源EFFIVLM - BENCH基准测试框架,能为多模态大模型压缩方案出具‘体检报告’,还揭示LVLM加速复杂性,推动技术发展。
北大王选所彭宇新团队:让多模态大模型学会「看懂物种关系」丨CVPR 2026
北大王选所彭宇新团队在论文中提出TARA方法,引入生物分类学知识与多模态模型中间表征对齐。实验显示,TARA能提升模型层级识别和未知类别识别能力,还可加速训练收敛,计算开销小。
媲美DeepSeek!腾讯开源新版混元模型:AI Agent强化,超30种智能体指令
腾讯开源混元大模型最新版本Hunyuan - A13B,为专家混合模型,有800亿参数,130亿激活。支持快慢思考模式,针对AI Agent强化,设计超30种智能体指令。测试成绩超DeepSeek - R1等,架构和训练有优化。
50个Agent分工干活,Kimi K2.5的Agent“军团”把我看呆了。。。
Kimi K2.5今日下午发布并开源,具备多模态能力。它能根据视频、链接等复刻网站,有Visual Edit功能且自动部署上线。还有Agent Swarm场景,多Agent协作解决复杂问题,应用体验佳。
“养虾”热潮下,专家帮你拆解Agent如何重写软件逻辑 | 奇点智能技术大会首日精彩回顾
2026 奇点智能技术大会聚焦 AI 发展新趋势,探讨 Agent 对软件与互联网产业的重构。会上发布白皮书、评测榜单,成立开发者社区,多位专家分享见解,涉及 AI 研发、模型协同、大模型演进及科学多模态模型等内容。