「多模态提示框架」共找到 2838 篇相关文章
让大模型指哪打哪的Multi-Agent路由新范式
随着MCP生态兴起,一个Assistant背后可能挂数百工具/子Agent,传统检索方式有成本高、埋没工具等问题。作者提出Tool-to-Agent Retrieval新范式,实验显示指标全面提升,证明工具细节能补足语义。
Feed-Forward 3D综述:三维视觉如何「一步到位」
这篇由12所机构联合撰写的综述论文,总结2021 - 2025年间数百项创新工作,建立Feed - Forward 3D方法谱系与时间线,介绍五大技术分支、应用场景、评测指标与结果,还指出未来挑战与方向。
Meta 新成立超级智能实验室,让大模型RAG推理速度飙升30倍
Meta新成立超级智能实验室(MSL),首篇论文REFRAG将RAG推理速度提升30倍以上。它先把上下文压缩成摘要再解码,减少计算量和延迟,在多任务测试中表现出色,为大模型部署提供实用方案。
2篇最新论文,把Deep Research讲透了~
阿里开源Tongyi DeepResearch热度高,文章分享两篇相关技术综述。介绍Deep Research是代理研究新范式,阐述其四大核心模块、优化方法、数据处理、奖励机制,还提及开源系统亮点及相关论文。
手机操控革命!开源手机AI Agent,自然语言操控Android/iOS!
传统移动设备自动化工具难实现自然语言控制和跨应用交互,开源项目Mobile - Use提供解决方案。它由Minitap AI开发,能通过自然语言指令实现设备UI感知自动化,功能丰富,应用场景广。
美国航天局与谷歌合作,打造AI医疗助手,以保证宇航员健康
Techcrunch消息,美国宇航局NASA和谷歌合作开发AI医疗助手CMO - DA,保障前往火星的宇航员健康。它有多种模态功能,在谷歌云运行。经测试诊断准确性较高,未来还会增加数据源和情境感知能力。
我收到了「GPT Agent操作的」第一封来自AI的邮件,这是第一个超级智能Agent。
作者实测GPT Agent,用PPT实测和与Manus对比等方式展示其强大。指出AI功能强弱要实测,GPT Agent像人一样操作页面、解决问题,是最强通用Agent,呼吁大家实测,不要盲目拉踩。
ACL 2025|自我怀疑还是自我纠正?清华团队揭示LLMs反思技术的暗面
本文指出反思技术虽简单有效,但在多种LLMs和任务中会失败。清华团队剖析其在开源和闭源LLMs、四种任务上失败原因,提出轻量级缓解方案,为反思技术可解释性研究奠基。
每一幕皆可控!字节发布多主体视频生成神器,人人皆主角
字节发布多主体视频生成神器MAGREF,基于一张参考图像,能生成主体高度一致的视频,多人同台也不串脸。它采用三阶段数据处理流程,构建在DiT架构上,实现复杂视频生成任务。
AI开源狂飙,OpenAI们慌了!GenAI大洗牌,2025趋势深度解读
2025年,ChatGPT仍领跑,但DeepSeek、Qwen等开源模型加速追赶。独立机构报告总结六大趋势,涵盖技术突破与市场格局演变,如推理模型实用化、MoE架构普及等,开源势力挑战闭源巨头。