「多模态Agent模型」共找到 9639 篇相关文章
ICML 2026|如何对Multi-Agent系统进行过程评估?重新认识多智能体系统中的Orchestrator
来自南京大学NLP实验室的ICML 2026论文指出,当前主流多智能体架构中,系统失败常源于负责全局调度的Orchestrator失去对任务的掌控。论文提出相关框架和方法对其进行分析与评估。
52KB 的奇迹!NovaSR 开源:16kHz 秒变 48kHz,快出天际的音频超分模型!
在AI“巨物崇拜”盛行时,NovaSR开源带来“微型震撼”。它仅52KB,能将16kHz音频提至48kHz,单张A100达3600倍实时。可端侧运行,效率提升显著,有诸多应用场景。
ICLR 2026|原生多模态推理新范式ThinkMorph ,让文字与图像在统一架构中共同演化
NUS、ZJU 等联合提出「ThinkMorph」,主张文字与图像在统一架构「原生协作」。仅用 2.4 万条数据微调 7B 统一模型,视觉推理平均提升 34.74%,多项任务比肩或超 GPT - 4o 和 Gemini 2.5 Flash,还涌现新能力。
最强开源机器人大脑!蚂蚁两万小时真机数据开启物理AI缩放定律
蚂蚁集团开源具身智能基座模型LingBot-VLA,用两万小时真机数据证明机器人学习有缩放定律且未达瓶颈。该模型优势显著,在多平台表现出色,团队还从数据、架构、工程等方面进行优化,并开源代码等加速行业探索。
30分钟轻松掌握Cursor,快速提升开发效率和体验
本文通过在WebX老项目实践,验证Cursor用AI大模型能高效生成符合老旧项目规范的代码框架,显著提升开发效率与体验。还介绍其页面区域、AI聊天区功能,通过实战演示展示提效过程,最后提及可与MCP结合及OpenAI开源模型部署方案。
人手一个数据库,Kimi背后这套AI基建到底有多能扛?
Kimi K2.6的Agent模式可帮用户搭建全套齐备的网站,但工程算力挑战大。传统数据库难以承接其需求,Kimi后端选TiDB Cloud,做了三个关键决策。这不是孤立事件,反映行业趋势,TiDB还为Agent补齐运行时基础设施。
人民想念DeepSeek
文章探讨AI时代Token相关问题。指出其消耗大、价格贵,存储价格上涨使Token降价缺杠杆,虽模型能力提升、MFU优化可降本,但传导到C端取决于商业考量。还回顾大模型价格战,介绍本地部署及芯片创新方案。
GLM-4.6 vs Claude 4.5:当AI编程模型能力趋同,会用比选什么更重要
文章对比GLM - 4.6和Claude 4.5在AI编程中的表现。用两套提示词测试,发现二者能力接近,GLM - 4.6性价比高,还给出Claude Code + GLM - 4.6的组合使用方法,建议聚焦做产品而非纠结工具。
扩散模型路线之争可以停了?Latent‑Pixel混合扩散生成新范式上线 | ECCV'26
中科大与智象HiDream.ai团队提出混合潜空间-像素空间扩散新模型Hi-DiT,解决了两类传统扩散路线各自的瓶颈,论文被ECCV 2026接收,在多个主流图像生成任务上取得优异性能,仅小幅增加计算开销。
与Generalist顶峰相见,30天狂吸30亿,千寻智能做对了什么?
2026年4月7日,千寻智能完成新一轮10亿融资,30天内累计融资30亿,由雷军、马云旗下资本领投。其开源具身模型Spirit v1.5展现泛化能力,技术路径获认可。千寻构建多源数据引擎,还通过现实场景数据反哺模型。